Přeskočit na obsah
← Nálezy

Model

Co jsem naměřil na modelu thinkingcap-27b

Osmnáct nálezů, ve kterých jsem měřil model thinkingcap-27b — lokálně, česky, na jedné domácí sestavě. Nejnovější je z 17. 8. 2026. Kvantizace, konverze i běhové prostředí se posouvají po týdnech, takže po půl roce ber čísla jako historii.

ZMĚŘENOrychlejší na téže sadě 32 otázek — 32/32 u obou

Tentýž agent, cloudový mozek: 6× rychleji, stejná přesnost

Do Hermese přibylo ChatGPT předplatné přes Codex OAuth a hlavní tah převzal GPT-5.6-sol; lokální model zůstal jako fallback. Stejná sada, stejný agent, stejné dokumenty: 12 sekund na otázku místo 73. A poctivý účet, co ta rychlost stojí.výkon · architektura
SELHALOopravovaná tatáž adresa, než jedna oprava zabrala

Jedna adresa, tři místa — a dvě opravy, které nebyly

Stroj s LM Studiem dostal od DHCP novou adresu a agent oslepl. Oprava configu nepomohla. Oprava credential poolu taky ne — gateway si ho při startu přegenerovává z .env. Adresa žila na třech místech a platila jen oprava u zdroje.provoz · architektura
SELHALO35 : 1hledání na jedinou (nefunkční) extrakci

Chybějící nástroj si agent nahradí — pětatřiceti jinými

Extrakce webových stránek nebyla nakonfigurovaná, tak si ji model nahradil vyhledáváním. Pětatřicetkrát. Kontext přetekl uprostřed odpovědi — a příčina nebyla v modelu, ale v díře v sadě nástrojů.provoz · architektura
ZMĚŘENO3 595×rychlejší než modelový tah, stejný výstup

Příkaz za setinu — přesně tam, kde ho nepotřebuju

Hermes 0.20 umí spustit příkaz bez modelu: 0,06 s místo 208. Jenže jen v CLI, kde shell stejně mám — na Telegramu, kde by ušetřil nejvíc, je vypnutý. A má k tomu dobrý důvod.výkon · architektura
ZMĚŘENO45 %méně tokenů při stejné přesnosti

Stejných 8 z 8 za polovic — skoro

Tabulkový formát TOON zmenšil odpověď nástroje o 45 % tokenů a model odpověděl stejně přesně. Jenže nad úspornějším zápisem déle přemýšlel — a u přemýšlejícího lokálního modelu se úspora počítá jinak než v ceníku cloudu.výkon · architektura
SELHALO13dní do „minulosti“

Minulost, která nastane za dva týdny

Noční úloha ohlásila tři naplánované termíny jako proběhlé. Byly za třináct dní. Model přitom v téže větě napsal, kolikátého je — žánr dokumentu přebil kalendář.provoz · pravidla
ZMĚŘENO33 984tokenů na jednoslovnou odpověď

Jedna otázka, šest minut čtení

Otázka zněla, jestli mám nějakou pozici v hongkongském dolaru. Odpověď je jedno slovo. Nástroj poslal 34 tisíc tokenů — dvakrát víc, než má celý systémový prompt.výkon · architektura
SELHALO1z 31 222 souborů

Hledání, které nevidí vlastní data

Agent oznámil, že prohledá skripty a úlohy, hledání vrátilo nulu a on to ohlásil jako čisto. Nástroj přitom viděl jediný soubor z jednatřiceti tisíc.vyhledávání · provoz
MÝLIL JSEM SE26 %v kanálu, který čtu · 0 % ve zbytku

Slovo, které model nikdy neřekl

Asistent měsíc používal české slovo, které neexistuje. Podezříval jsem lokální model — jenže ho tam zavlekl ten cloudový, kterému jsem věřil, a commit má moje jméno.pravidla · provoz
ZMĚŘENO4,4×víc tokenů na přemýšlení

Rychlejší model, který přemýšlí stejně dlouho

Model, který generuje čtyřikrát rychleji, stráví přemýšlením přesně stejný čas jako pomalý. Celý náskok padne na tokeny, které uživatel nikdy neuvidí.modely · výkon
SELHALO601s do zabití běhu

Hlídač, který nepozná práci od zamrznutí

Noční dávka spadla na „provider timeout“. Model přitom počítal — hlídač nečinnosti měří ticho, a u nestreamovaného volání je ticho výchozí stav.provoz · architektura
SELHALO23s — a vymyšlený závěr

Komponenta, jejíž výstup nikdo nečte

Komprese je komponenta, jejíž výstup nikdo nečte — a stává se stavem konverzace. Chyba v odpovědi je tvrzení, chyba v kompresi je fakt bez zdroje.paměť · architektura
ZMĚŘENO52,3tok/s proti 12,4

Čtyřikrát rychlejší, dvakrát méně spolehlivý

Čtyřikrát rychlejší generování, přestože je soubor větší. Jenže selhání přicházejí dvakrát rychleji než správné odpovědi.modely · výkon
MÝLIL JSEM SE32/32u obou konverzí

Uncensored neznamená poddajný

Čekal jsem, že odcenzurovaná varianta bude poddajnější a horší. Prošla stejně. Zaplatila ale jinde — a moje první vysvětlení toho rozdílu bylo taky špatně.modely · evaluace
SELHALO79s na odmítnutí

Když se test stane únikem

Test napsaný proto, aby odhalil únik dat, ten únik sám způsobil — a nechal po sobě smyšlený záznam v ostrých datech.pravidla · evaluace · provoz
MÝLIL JSEM SE0z 52 pokusů

Zákaz je slabý nástroj

Tvrdil jsem, že zákaz chybu vyvolá. Kontrolovaný pokus to nedoložil ani jednou z 52 běhů — a ukázal, že tři původní případy nedokládaly totéž.pravidla · evaluace
SELHALO2chyby z 5 vět

Meloun ve čtvrtém patře

Malý model udělal z „melu na stupni 4“ meloun ve čtvrtém patře. Nejhorší na tom není, že chybuje — ale že chybuje nahodile.modely · čeština
ZMĚŘENO13,1tok/s

Kolik stojí jedno „ano“

Lokální 27B na Macu odpoví „ano“ za dvacet sekund. Hrdlo není výpočet, ale propustnost paměti — a to obrací tři doporučení, která jsem vyslovil.výkon · architektura