Přeskočit na obsah

Co se rozbilo, když jsem si postavil AI doma

Lokální modely, česky, všechno změřené. Dvacet čtyři nálezů — včetně těch, kde se mýlil autor, ne stroj.

řekl jsem

…a melu na stupni 4.

qwen3-4b · extrakce faktů
Rob(ot)Rob(ot)co si uložil do paměti

 

jeden z 814 „faktů“, které o mně paměť nasbírala za deset dní
⌘K
Značka
Téma
Model
24 nálezů
ZMĚŘENOrychlejší na téže sadě 32 otázek — 32/32 u obou

Tentýž agent, cloudový mozek: 6× rychleji, stejná přesnost

Do Hermese přibylo ChatGPT předplatné přes Codex OAuth a hlavní tah převzal GPT-5.6-sol; lokální model zůstal jako fallback. Stejná sada, stejný agent, stejné dokumenty: 12 sekund na otázku místo 73. A poctivý účet, co ta rychlost stojí.výkon · architektura
SELHALOopravovaná tatáž adresa, než jedna oprava zabrala

Jedna adresa, tři místa — a dvě opravy, které nebyly

Stroj s LM Studiem dostal od DHCP novou adresu a agent oslepl. Oprava configu nepomohla. Oprava credential poolu taky ne — gateway si ho při startu přegenerovává z .env. Adresa žila na třech místech a platila jen oprava u zdroje.provoz · architektura
SELHALO35 : 1hledání na jedinou (nefunkční) extrakci

Chybějící nástroj si agent nahradí — pětatřiceti jinými

Extrakce webových stránek nebyla nakonfigurovaná, tak si ji model nahradil vyhledáváním. Pětatřicetkrát. Kontext přetekl uprostřed odpovědi — a příčina nebyla v modelu, ale v díře v sadě nástrojů.provoz · architektura
ZMĚŘENO3 595×rychlejší než modelový tah, stejný výstup

Příkaz za setinu — přesně tam, kde ho nepotřebuju

Hermes 0.20 umí spustit příkaz bez modelu: 0,06 s místo 208. Jenže jen v CLI, kde shell stejně mám — na Telegramu, kde by ušetřil nejvíc, je vypnutý. A má k tomu dobrý důvod.výkon · architektura
ZMĚŘENO45 %méně tokenů při stejné přesnosti

Stejných 8 z 8 za polovic — skoro

Tabulkový formát TOON zmenšil odpověď nástroje o 45 % tokenů a model odpověděl stejně přesně. Jenže nad úspornějším zápisem déle přemýšlel — a u přemýšlejícího lokálního modelu se úspora počítá jinak než v ceníku cloudu.výkon · architektura
SELHALO13dní do „minulosti“

Minulost, která nastane za dva týdny

Noční úloha ohlásila tři naplánované termíny jako proběhlé. Byly za třináct dní. Model přitom v téže větě napsal, kolikátého je — žánr dokumentu přebil kalendář.provoz · pravidla
ZMĚŘENO33 984tokenů na jednoslovnou odpověď

Jedna otázka, šest minut čtení

Otázka zněla, jestli mám nějakou pozici v hongkongském dolaru. Odpověď je jedno slovo. Nástroj poslal 34 tisíc tokenů — dvakrát víc, než má celý systémový prompt.výkon · architektura
SELHALO1z 31 222 souborů

Hledání, které nevidí vlastní data

Agent oznámil, že prohledá skripty a úlohy, hledání vrátilo nulu a on to ohlásil jako čisto. Nástroj přitom viděl jediný soubor z jednatřiceti tisíc.vyhledávání · provoz
MÝLIL JSEM SE26 %v kanálu, který čtu · 0 % ve zbytku

Slovo, které model nikdy neřekl

Asistent měsíc používal české slovo, které neexistuje. Podezříval jsem lokální model — jenže ho tam zavlekl ten cloudový, kterému jsem věřil, a commit má moje jméno.pravidla · provoz
ZMĚŘENO4,4×víc tokenů na přemýšlení

Rychlejší model, který přemýšlí stejně dlouho

Model, který generuje čtyřikrát rychleji, stráví přemýšlením přesně stejný čas jako pomalý. Celý náskok padne na tokeny, které uživatel nikdy neuvidí.modely · výkon
SELHALO601s do zabití běhu

Hlídač, který nepozná práci od zamrznutí

Noční dávka spadla na „provider timeout“. Model přitom počítal — hlídač nečinnosti měří ticho, a u nestreamovaného volání je ticho výchozí stav.provoz · architektura
SELHALO23s — a vymyšlený závěr

Komponenta, jejíž výstup nikdo nečte

Komprese je komponenta, jejíž výstup nikdo nečte — a stává se stavem konverzace. Chyba v odpovědi je tvrzení, chyba v kompresi je fakt bez zdroje.paměť · architektura
ZMĚŘENO52,3tok/s proti 12,4

Čtyřikrát rychlejší, dvakrát méně spolehlivý

Čtyřikrát rychlejší generování, přestože je soubor větší. Jenže selhání přicházejí dvakrát rychleji než správné odpovědi.modely · výkon
MÝLIL JSEM SE32/32u obou konverzí

Uncensored neznamená poddajný

Čekal jsem, že odcenzurovaná varianta bude poddajnější a horší. Prošla stejně. Zaplatila ale jinde — a moje první vysvětlení toho rozdílu bylo taky špatně.modely · evaluace
ZMĚŘENO0,05s místo 2,5 minuty

Termíny nepatří modelu

Datum je fakt, ne věc k odvozování. Skript je tady vyšší forma než model — nemá jak si vymyslet.architektura · výkon
ZMĚŘENO183z 295 zpráv

role='user' neznamená od uživatele

Role „user“ neznamená, že to psal člověk. Z 295 zpráv jich byla od uživatele jen část — a extrakce jela přes všechny.paměť · evaluace
ZMĚŘENO3prahy místo denního hlášení

Hlásit přechody, ne stav

Hlídač, který hlásí stav, otravuje každý den. Hlídač, který hlásí přechody, se ozve jen když se něco změnilo.architektura · provoz
SELHALO79s na odmítnutí

Když se test stane únikem

Test napsaný proto, aby odhalil únik dat, ten únik sám způsobil — a nechal po sobě smyšlený záznam v ostrých datech.pravidla · evaluace · provoz
SELHALO814faktů, z toho rozporných

Paměť, která si protiřečila

Paměť nasbírala 814 „faktů“ včetně starého i nového stavu téže věci. Náhrada je po dni provozu prázdná — a to je záměr, ne chyba.paměť · vyhledávání · architektura
MÝLIL JSEM SE0z 52 pokusů

Zákaz je slabý nástroj

Tvrdil jsem, že zákaz chybu vyvolá. Kontrolovaný pokus to nedoložil ani jednou z 52 běhů — a ukázal, že tři původní případy nedokládaly totéž.pravidla · evaluace
SELHALO2chyby z 5 vět

Meloun ve čtvrtém patře

Malý model udělal z „melu na stupni 4“ meloun ve čtvrtém patře. Nejhorší na tom není, že chybuje — ale že chybuje nahodile.modely · čeština
ZMĚŘENO0/6konfigurací trefilo „naposledy“

A što braž mít

Šest konfigurací Whisperu na skutečné hlasovce. Ani jedna nepřepsala „naposledy“ a žádná netrefila „kdy“ — agent pak čtyři minuty hledal místo, které vzniklo přeslechnutím.čeština · modely
SELHALO1 883sekcí

Vyhledávač vracel přípravu místo výsledku

Vyhledávač vracel přípravu místo výsledků. Korpus 1,55 MB se indexuje za 0,05 s, takže žádná cache — ta by jen tiše vracela smazaný text.vyhledávání · čeština
ZMĚŘENO13,1tok/s

Kolik stojí jedno „ano“

Lokální 27B na Macu odpoví „ano“ za dvacet sekund. Hrdlo není výpočet, ale propustnost paměti — a to obrací tři doporučení, která jsem vyslovil.výkon · architektura

Pět modelů na téže sadě 32 otázek

Stejné otázky nad skutečnými dokumenty, stejný agent; lokální modely na jednom stroji, cloudový řádek přes Codex OAuth. Sada měří i vyhledávání a volbu nástroje, ne jenom model. Nejrychlejší lokální model je zároveň jediný, který si vymyslel dokument, který neexistuje.

Čas na jednu otázku

thinkingcap 27Bhlavní73 s
MoE 35B-A3Bkomprese37 s
Fable-Fusion 711uncensored100 s
gemma 4 31Bsrovnávací106 s
GPT-5.6-solcloud12 s

Chyby · ze 32 otázek

thinkingcap 27Bhlavní32/32 · bez chyby
MoE 35B-A3Bkomprese30/32 · 2 chyby
Fable-Fusion 711uncensored32/32 · bez chyby
gemma 4 31Bsrovnávací28/32 · 4 chyby
GPT-5.6-solcloud32/32 · bez chyby
zobrazit jako tabulku
ModelProšloČas/otázku
thinkingcap 27B32/3273 s
MoE 35B-A3B30/3237 s
Fable-Fusion 71132/32100 s
gemma 4 31B28/32106 s
GPT-5.6-sol32/3212 s