Co tu vlastně měřím
Asistent, který běží u mě doma a čte moje dokumenty — ty zůstávají na místě. Od 17. 8. vede hlavní slovo cloudový model, takže konverzace už síť opouštějí; dokumenty, nástroje a paměť ne (nález 24). Tahle stránka říká, na čem to stojí, jak vznikají čísla v článcích — a hlavně kde jsou jejich hranice.
- Nálezů
- 24z toho 13 o selhání
- Dokumentů
- 280+zhruba 1,5 MB textu
- Otázek v sadě
- 32napříč pěti doménami
- Porovnaných modelů
- 5lokální Q4 (27–35B) + cloud
ArchitekturaDva stroje, jedna místnost
Agent běží v kontejneru na domácím serveru, lokální model na Macu vedle něj. Rozdělené to je proto, že Mac má paměťovou propustnost a server běží pořád a zálohuje se. Od 17. 8. odpovídá hlavně cloudový model přes Codex OAuth; ten na Macu drží zálohu a přepis hlasu — schéma níž popisuje lokální jádro, které tím nezmizelo.
↑ Ven z toho rámečku jde jen záloha zašifrovaná před odesláním a tenhle web, kde jsou jména nahrazená.
- Stroj
- Mac miniM4 Pro
- CPU
- 14 jader10 výkonných + 4
- GPU
- 20 jaderMetal 4
- Paměť
- 64 GBsdílená, 273 GB/s
Ta propustnost je jediný údaj, který jsem neměřil — je z katalogu. Ověřit se ale dá vlastními daty: model o velikosti 17,7 GB generuje 13,1 tokenu za sekundu, a protože každý token přečte všechny váhy, dělá to 232 GB/s, tedy 85 % katalogového maxima. Na tomhle stroji tedy rozhoduje propustnost paměti, ne výpočetní výkon.
SoftwareAgent se jmenuje Hermes
Nepsal jsem si vlastního agenta. Všechno tady běží na Hermes Agent od Nous Research — hotovém open source runtimu, který řeší smyčku nástrojů, kanály, plánovač i kompresi kontextu. Moje práce je volba modelů, dokumenty, evaluační sada a nastavení; runtime je cizí.
Píšu to sem proto, že to mění, jak číst zbytek webu. Většina nálezů není o modelech, ale o tom, jak se model chová uvnitř konkrétního systému — a ten systém si můžete nainstalovat taky. Několik nálezů se navíc týká jeho výchozího nastavení, ne mého: přepis hlasu jede z krabice na modelu, který v češtině selhává, a hlídač úloh nepozná pracující model od zaseknutého, protože streamování je vypnuté a limit je deset minut.
- Runtime
- Hermesv0.20.0 · 2026.8.3
- Instalace
- gitPython 3.11
- Modely
- LM Studiolokálně, GGUF Q4
Z bundlovaných pluginů běží tři. Hledání a čtení webu jedou schválně přes dva různé free tiery — jedna rešerše umí spálit desítky volání (nález 22) a sdílený rozpočet by se vyčerpal dvakrát rychleji:
web-brave-free
Fulltextové hledání přes Brave Data-for-Search. Vrací úryvky výsledků — na rychlou orientaci stačí, na čtení stránek ne.
web-tavily
Čtení celých stránek se stropem 15 tisíc znaků na kus. Nasazeno po nálezu 22 — bez extraktoru si model čtení nahrazoval desítkami hledání, až přetekl kontext.
Co je proti výchozímu stavu jinak — bez tohohle seznamu se čísla v článcích nedají zopakovat:
| Nastavení | Výchozí | Tady | Proč |
|---|---|---|---|
| přepis hlasu | base | small · cs · int8 | base je v češtině nepoužitelný |
| limit komprese | 120 s | 300 s | lokální model to za dvě minuty nestihne |
| limit názvu sezení | 30 s | 60 s | totéž, jen míň bolí |
| hlídač úloh | 600 s | 1 800 s | jeden tah nad velkým kontextem trvá déle |
| strop tahů | 500 | 150 | pojistka proti zacyklení, které stojí hodiny |
| paměťová vrstva | žádná | holographic | bez LLM v cestě, fakta zapisuje agent |
| reset sezení | — | denně ve 4:00 | ať se kontext nevleče přes dny |
Hodnoty odpovídají Hermes v0.19.1 (2026.7.30); po updatu na v0.20.0 (7. 8.) přeověřeno proti hermes_cli/config_defaults.py: přepis hlasu (base), limit komprese (120 s) i hlídač úloh (600 s) mají v 0.20 stejné výchozí hodnoty.
Kdo co dělalV téhle laboratoři jsou dva agenti
Snadno se to plete, tak to říkám hned na začátku: Hermes je ten měřený — asistent, který mi běží doma, čte moje dokumenty a odpovídá na Telegramu. Claude Code je ten měřící — cloudový nástroj, se kterým Hermese stavím, píšu k němu skripty a pouštím evaluace.
V nálezech se to rozlišuje záměrně. Kde stojí „já“, je to moje rozhodnutí, moje data nebo moje zkušenost s tím, jak se asistent chová. Kde stojí „Claude Code“, je to měření, skript nebo hypotéza, kterou vyslovil on — včetně těch, které se ukázaly jako špatné. Nálezy označené „mýlil jsem se“ většinou nepatří lokálnímu modelu, ale jednomu z nás dvou.
Proč to rozlišuju: bez toho by se z laboratorního deníku stal životopis. Za výsledky si stojím, ale nepsal jsem každý řádek kódu sám a nechci vzbuzovat dojem, že ano.
ModelyCo tady běží a proč zrovna to
Lokální modely jsou otevřené, stažené z Hugging Face a puštěné v kvantizaci Q4; od 17. 8. vede hlavní tah cloudový model přes Codex OAuth a lokál slouží jako fallback (nález 24). Výběr není hitparáda — každý sem přišel kvůli konkrétní otázce.
GPT-5.6-sol
Od 17. 8. hlavní mozek agenta, přes ChatGPT předplatné. Na téže sadě 32 otázek stejná přesnost jako lokální model a 6× rychlejší odpověď — rozdíl není chytrost, ale čekání na tokeny. Konverzace tím opouštějí domácí síť; dokumenty, nástroje, přepis hlasu i paměť zůstávají doma.
ThinkingCap Qwen3.6-27B
Doladěná varianta Qwenu od pražské BottleCap AI, kterou spoluzaložil Tomáš Mikolov — autor word2vec — spolu s Jaroslavem Beckem (Beat Saber) a Davidem Herelem. Cílem fine-tuningu není chytřejší model, ale kratší přemýšlení: podle jejich měření o 46 % méně tokenů na uvažování při rozdílu přesnosti kolem 0,7 procentního bodu.
Proto rok vedl hlavní tah. Na stroji, kde je hrdlem propustnost paměti, se platí za každý vygenerovaný token — a polovina z nich padne na přemýšlení, které uživatel nikdy neuvidí. Dnes drží zálohu: když cloud vypadne, agent se vrátí k němu a jede dál, pomaleji, ale doma.
Qwen3.6-35B-A3B
Oficiální model týmu Qwen (Alibaba), Apache 2.0. Mixture-of-Experts: 35 miliard parametrů celkem, ale jen zhruba tři aktivní na token. Zkoušel jsem, jestli se ta čtyřnásobná rychlost dá využít. Na odpovědi ne — začal si vymýšlet dokumenty. Na kompresi ano, tam se osvědčil. Od 17. 8. jede komprese primárně na gpt-5.4-mini v cloudu; tenhle zůstává lokální záloha.
Gemma 4 31B
Otevřený model od Google DeepMind — jediný tady, který nestojí na Qwenu. Je tu právě proto: bez druhé rodiny nejde poznat, co je vlastnost Qwenu a co obecná vlastnost modelů téhle velikosti.
Fable-Fusion 711 Uncensored
Týž základ jako hlavní model, ale konverze od jiného autora s odstraněným odmítáním. Stáhl jsem ho kvůli jediné otázce: jestli model, který neodmítne napsat cokoliv, přestane oponovat i mně. Nepřestal — obě konverze prošly sadou 32/32. Tahle je ale o čtvrtinu větší a v sadě o 37 % pomalejší; čisté generování v tokenech za sekundu u ní zatím naměřené nemám.
Qwen3 4B
Malý model na drobnou práci — názvy sezení, dřív i extrakce faktů a komprese. Právě on udělal z „melu na stupni 4“ meloun ve čtvrtém patře, takže od obojího odešel.
Whisper small
Výchozí base dělá z české věty nesmysl. smallje pomalejší, ale rozumí — a na půlminutovou hlasovku je i tak rychlejší než odpověď agenta.
Meze platnostiCo ta čísla neunesou
Tohle je nejdůležitější sekce na celém webu. Čísla v článcích jsou skutečná, ale indicie z jednoho nasazení — ne obecně platné výsledky.
Jak se měříOtázka, hledání, kontrola
Sada jede proti skutečným dokumentům, ne proti připravenému vzorku — měří tedy i vyhledávání a volbu nástroje, ne jenom model.
Pátá doména je jiná. V chování je správnou odpovědí odmítnutí — podepsat pod svým minimem, spolehnout se na ústní slib, poslat zdravotní údaj do firemního kanálu. Poslušný model tady propadne.
ZnačkyTři druhy nálezu
Ten poslední druh je důvod, proč web vznikl. Vyslovit odhad, změřit ho a publikovat i to, že byl špatně, je jediný způsob, jak se dá takové sbírce věřit.
ProvozCo běží bez dozoru
Část asistenta neběží na vyžádání, ale sama dokola. Odtud pochází většina nálezů: věci bez dohledu selhávají jinak než ty, u kterých sedíte — a hlavně to není hned vidět.
Konsolidace hledá, co je v zápiscích a chybí v dokumentech, a navrhuje doplnění —nikdy nezapisuje sama. Hlídače sledují termíny a portfolio a hlásí jen přechody přes práh. Pracovní sumář má filtr, který z něj drží osobní věci venku.
RedakceCo se v článcích mění a co ne
Jak to vypadá v praxi: nález o přepisu hlasu tu nějakou dobu chyběl schválně. Jeho důkazem byl způsob, jakým model přeslechl konkrétní slova, a referenční věta obsahovala zdravotní údaj a jméno osoby — nahradit to zpětně nejde, aniž bych si vymyslel i to zkomolení. Vyšel teprve po přeměření na skutečné hlasovce, jejíž obsah je běžná otázka; původní měření na syntéze je z něj odstraněné celé, ne přepsané.
SoukromíCo o vás tenhle web ví
Návštěvnost měřím Plausible běžícím na mém vlastním serveru — žádná cookie, žádný profil napříč weby, žádná třetí strana v cestě. Sbírá se adresa stránky, odkud jste přišli, země a hrubý druh zařízení, operačního systému a prohlížeče. Návštěvník se z toho neskládá zpátky a data zůstávají na mém stroji.
Je to zároveň jediný požadavek mimo tenhle web, který stránka posílá: písma jsou uložená tady, žádné CDN, žádné vložené přehrávače ani tlačítka sítí. Kdo měřen být nechce, zablokuje doménu plausible.jirkovynavody.cz — na obsahu se tím nezmění nic.
KontaktKdyž máte co dodat
Diskuse tady není. Nálezy stojí na měření a nejužitečnější reakce bývá proto protiměření — jiný hardware, jiný jazyk, jiná sada otázek. To se do komentáře pod článkem stejně nevejde.
Takže: napište mi. Zajímá mě hlavně, když vám něco vyjde jinak — a taky když v některém nálezu najdete chybu. Několik jsem si jich za jediný den našel sám a je pravděpodobné, že tam další jsou.