Přeskočit na obsah
← NálezyO projektu

Co tu vlastně měřím

Asistent, který běží u mě doma a čte moje dokumenty — ty zůstávají na místě. Od 17. 8. vede hlavní slovo cloudový model, takže konverzace už síť opouštějí; dokumenty, nástroje a paměť ne (nález 24). Tahle stránka říká, na čem to stojí, jak vznikají čísla v článcích — a hlavně kde jsou jejich hranice.

Nálezů
24z toho 13 o selhání
Dokumentů
280+zhruba 1,5 MB textu
Otázek v sadě
32napříč pěti doménami
Porovnaných modelů
5lokální Q4 (27–35B) + cloud

ArchitekturaDva stroje, jedna místnost

Agent běží v kontejneru na domácím serveru, lokální model na Macu vedle něj. Rozdělené to je proto, že Mac má paměťovou propustnost a server běží pořád a zálohuje se. Od 17. 8. odpovídá hlavně cloudový model přes Codex OAuth; ten na Macu drží zálohu a přepis hlasu — schéma níž popisuje lokální jádro, které tím nezmizelo.

DOMÁCÍ SÍŤ — DOKUMENTY JI NEOPOUŠTĚJÍVSTUPYChatTerminálPlánovačSERVERAgentdokumenty · fulltextstav · paměť · přepis hlasuběží pořád, zálohuje sePROMPTTOKENYMAC — INFERENCEModel 27B / 35B64 GB sdílené paměti

↑ Ven z toho rámečku jde jen záloha zašifrovaná před odesláním a tenhle web, kde jsou jména nahrazená.

Stroj
Mac miniM4 Pro
CPU
14 jader10 výkonných + 4
GPU
20 jaderMetal 4
Paměť
64 GBsdílená, 273 GB/s

Ta propustnost je jediný údaj, který jsem neměřil — je z katalogu. Ověřit se ale dá vlastními daty: model o velikosti 17,7 GB generuje 13,1 tokenu za sekundu, a protože každý token přečte všechny váhy, dělá to 232 GB/s, tedy 85 % katalogového maxima. Na tomhle stroji tedy rozhoduje propustnost paměti, ne výpočetní výkon.

SoftwareAgent se jmenuje Hermes

Nepsal jsem si vlastního agenta. Všechno tady běží na Hermes Agent od Nous Research — hotovém open source runtimu, který řeší smyčku nástrojů, kanály, plánovač i kompresi kontextu. Moje práce je volba modelů, dokumenty, evaluační sada a nastavení; runtime je cizí.

Píšu to sem proto, že to mění, jak číst zbytek webu. Většina nálezů není o modelech, ale o tom, jak se model chová uvnitř konkrétního systému — a ten systém si můžete nainstalovat taky. Několik nálezů se navíc týká jeho výchozího nastavení, ne mého: přepis hlasu jede z krabice na modelu, který v češtině selhává, a hlídač úloh nepozná pracující model od zaseknutého, protože streamování je vypnuté a limit je deset minut.

Runtime
Hermesv0.20.0 · 2026.8.3
Instalace
gitPython 3.11
Modely
LM Studiolokálně, GGUF Q4

Z bundlovaných pluginů běží tři. Hledání a čtení webu jedou schválně přes dva různé free tiery — jedna rešerše umí spálit desítky volání (nález 22) a sdílený rozpočet by se vyčerpal dvakrát rychleji:

Hledání

web-brave-free

2 000 dotazů/měs. zdarma

Fulltextové hledání přes Brave Data-for-Search. Vrací úryvky výsledků — na rychlou orientaci stačí, na čtení stránek ne.

Extrakce stránek

web-tavily

1 000 kreditů/měs. zdarma

Čtení celých stránek se stropem 15 tisíc znaků na kus. Nasazeno po nálezu 22 — bez extraktoru si model čtení nahrazoval desítkami hledání, až přetekl kontext.

Paměť

holographic

1 z 8 memory providerů

Ukládání faktů bez LLM v cestě — co se zapíše, rozhoduje agent, žádný pomocný model si nedomýšlí. Zvoleno po nálezu 06, kdy extrakce faktů malým modelem vyráběla rozpory.

Co je proti výchozímu stavu jinak — bez tohohle seznamu se čísla v článcích nedají zopakovat:

NastaveníVýchozíTadyProč
přepis hlasubasesmall · cs · int8base je v češtině nepoužitelný
limit komprese120 s300 slokální model to za dvě minuty nestihne
limit názvu sezení30 s60 stotéž, jen míň bolí
hlídač úloh600 s1 800 sjeden tah nad velkým kontextem trvá déle
strop tahů500150pojistka proti zacyklení, které stojí hodiny
paměťová vrstvažádnáholographicbez LLM v cestě, fakta zapisuje agent
reset sezenídenně ve 4:00ať se kontext nevleče přes dny

Hodnoty odpovídají Hermes v0.19.1 (2026.7.30); po updatu na v0.20.0 (7. 8.) přeověřeno proti hermes_cli/config_defaults.py: přepis hlasu (base), limit komprese (120 s) i hlídač úloh (600 s) mají v 0.20 stejné výchozí hodnoty.

Kdo co dělalV téhle laboratoři jsou dva agenti

Snadno se to plete, tak to říkám hned na začátku: Hermes je ten měřený — asistent, který mi běží doma, čte moje dokumenty a odpovídá na Telegramu. Claude Code je ten měřící — cloudový nástroj, se kterým Hermese stavím, píšu k němu skripty a pouštím evaluace.

V nálezech se to rozlišuje záměrně. Kde stojí „já“, je to moje rozhodnutí, moje data nebo moje zkušenost s tím, jak se asistent chová. Kde stojí „Claude Code“, je to měření, skript nebo hypotéza, kterou vyslovil on — včetně těch, které se ukázaly jako špatné. Nálezy označené „mýlil jsem se“ většinou nepatří lokálnímu modelu, ale jednomu z nás dvou.

Proč to rozlišuju: bez toho by se z laboratorního deníku stal životopis. Za výsledky si stojím, ale nepsal jsem každý řádek kódu sám a nechci vzbuzovat dojem, že ano.

ModelyCo tady běží a proč zrovna to

Lokální modely jsou otevřené, stažené z Hugging Face a puštěné v kvantizaci Q4; od 17. 8. vede hlavní tah cloudový model přes Codex OAuth a lokál slouží jako fallback (nález 24). Výběr není hitparáda — každý sem přišel kvůli konkrétní otázce.

Hlavní model · cloud

GPT-5.6-sol

Codex OAuth · 272k kontext · 12 s/otázku v sadě

Od 17. 8. hlavní mozek agenta, přes ChatGPT předplatné. Na téže sadě 32 otázek stejná přesnost jako lokální model a 6× rychlejší odpověď — rozdíl není chytrost, ale čekání na tokeny. Konverzace tím opouštějí domácí síť; dokumenty, nástroje, přepis hlasu i paměť zůstávají doma.

Fallback · do 17. 8. hlavní

ThinkingCap Qwen3.6-27B

17,7 GB · 13,1 tok/s

Doladěná varianta Qwenu od pražské BottleCap AI, kterou spoluzaložil Tomáš Mikolov — autor word2vec — spolu s Jaroslavem Beckem (Beat Saber) a Davidem Herelem. Cílem fine-tuningu není chytřejší model, ale kratší přemýšlení: podle jejich měření o 46 % méně tokenů na uvažování při rozdílu přesnosti kolem 0,7 procentního bodu.

Proto rok vedl hlavní tah. Na stroji, kde je hrdlem propustnost paměti, se platí za každý vygenerovaný token — a polovina z nich padne na přemýšlení, které uživatel nikdy neuvidí. Dnes drží zálohu: když cloud vypadne, agent se vrátí k němu a jede dál, pomaleji, ale doma.

Komprese kontextu

Qwen3.6-35B-A3B

22,1 GB · 54,6 tok/s

Oficiální model týmu Qwen (Alibaba), Apache 2.0. Mixture-of-Experts: 35 miliard parametrů celkem, ale jen zhruba tři aktivní na token. Zkoušel jsem, jestli se ta čtyřnásobná rychlost dá využít. Na odpovědi ne — začal si vymýšlet dokumenty. Na kompresi ano, tam se osvědčil. Od 17. 8. jede komprese primárně na gpt-5.4-mini v cloudu; tenhle zůstává lokální záloha.

Srovnávací

Gemma 4 31B

19,9 GB · 11,3 tok/s

Otevřený model od Google DeepMind — jediný tady, který nestojí na Qwenu. Je tu právě proto: bez druhé rodiny nejde poznat, co je vlastnost Qwenu a co obecná vlastnost modelů téhle velikosti.

Test hypotézy

Fable-Fusion 711 Uncensored

19,9 GB · 100 s/dotaz v sadě

Týž základ jako hlavní model, ale konverze od jiného autora s odstraněným odmítáním. Stáhl jsem ho kvůli jediné otázce: jestli model, který neodmítne napsat cokoliv, přestane oponovat i mně. Nepřestal — obě konverze prošly sadou 32/32. Tahle je ale o čtvrtinu větší a v sadě o 37 % pomalejší; čisté generování v tokenech za sekundu u ní zatím naměřené nemám.

Pomocné úlohy

Qwen3 4B

3,3 GB · 42,5 tok/s

Malý model na drobnou práci — názvy sezení, dřív i extrakce faktů a komprese. Právě on udělal z „melu na stupni 4“ meloun ve čtvrtém patře, takže od obojího odešel.

Přepis hlasu

Whisper small

běží na CPU · int8

Výchozí base dělá z české věty nesmysl. smallje pomalejší, ale rozumí — a na půlminutovou hlasovku je i tak rychlejší než odpověď agenta.

Meze platnostiCo ta čísla neunesou

Tohle je nejdůležitější sekce na celém webu. Čísla v článcích jsou skutečná, ale indicie z jednoho nasazení — ne obecně platné výsledky.

Jedna sestavaVšechno je měřeno na stroji ze schématu. Jinde vyjdou jiná čísla — a u závěrů typu „hrdlo je propustnost paměti“ se může změnit i to, co je hrdlo.
Málo opakováníObvykle dvě až čtyři, někdy jediný běh. To stačí na rozdíl mezi 13 a 55 tokeny za sekundu, ne na rozdíl mezi 13 a 14.
Jedna doména, jeden jazyk, jeden člověkDokumenty jsou moje, česky, o mém životě a práci. Model, který si poradí s tímhle, si nemusí poradit s vaším — a naopak.
Vlastní sada, ne standardní benchmarkOtázky jsem psal já a podle svých potřeb. Několikrát se ukázalo, že chyba byla v mém vyhodnocení, ne v modelu.
Modely se mění pod rukamaKvantizace, konverze i runtime se posouvají po týdnech. Každý nález má datum; po půl roce ber čísla jako historii.

Jak se měříOtázka, hledání, kontrola

Otázkas ověřenou odpovědíAgent hledáskutečné dokumenty,volí nástroj sámOdpověďplný text běhuKontrolazaznělo, cozaznít musí?

Sada jede proti skutečným dokumentům, ne proti připravenému vzorku — měří tedy i vyhledávání a volbu nástroje, ne jenom model.

prácezdravícestovánífinancechování

Pátá doména je jiná. V chování je správnou odpovědí odmítnutí — podepsat pod svým minimem, spolehnout se na ústní slib, poslat zdravotní údaj do firemního kanálu. Poslušný model tady propadne.

ZnačkyTři druhy nálezu

Změřeno
11
Číslo, které předtím nikdo neměl.
Selhalo
10
Co se rozbilo a proč.
Mýlil jsem se
3
Hypotéza, kterou vyvrátila vlastní data.

Ten poslední druh je důvod, proč web vznikl. Vyslovit odhad, změřit ho a publikovat i to, že byl špatně, je jediný způsob, jak se dá takové sbírce věřit.

ProvozCo běží bez dozoru

Část asistenta neběží na vyžádání, ale sama dokola. Odtud pochází většina nálezů: věci bez dohledu selhávají jinak než ty, u kterých sedíte — a hlavně to není hned vidět.

KonsolidaceHlídač prahůPracovní sumářZachyceníBEZ ZÁSAHU · DOKOLAhlásí jen změnu, ne stav — jinak by chodila tatáž zpráva každý den

Konsolidace hledá, co je v zápiscích a chybí v dokumentech, a navrhuje doplnění —nikdy nezapisuje sama. Hlídače sledují termíny a portfolio a hlásí jen přechody přes práh. Pracovní sumář má filtr, který z něj drží osobní věci venku.

RedakceCo se v článcích mění a co ne

Jména osob, firem a produktů jsou nahrazenáA je to u textu přiznané, aby čtenář věděl, co je původní a co ne.
Metodika a čísla zůstávají původníTo je celá hodnota; kdyby se upravovala, není co publikovat.
Zachovává se jazyková past, ne obsahKdyž model přeslechl slovo, náhrada musí nést tutéž past — jinak je z měření ilustrace.
Únik nevzniká ve větě, ale v součtu větPříklady se čtou dohromady a ptá se, co z nich plyne dohromady.
Nedopočítávají se souhrnyČíslo, které nikdo neměřil, sem nepatří — ani když zní autoritativně.

Jak to vypadá v praxi: nález o přepisu hlasu tu nějakou dobu chyběl schválně. Jeho důkazem byl způsob, jakým model přeslechl konkrétní slova, a referenční věta obsahovala zdravotní údaj a jméno osoby — nahradit to zpětně nejde, aniž bych si vymyslel i to zkomolení. Vyšel teprve po přeměření na skutečné hlasovce, jejíž obsah je běžná otázka; původní měření na syntéze je z něj odstraněné celé, ne přepsané.

SoukromíCo o vás tenhle web ví

Návštěvnost měřím Plausible běžícím na mém vlastním serveru — žádná cookie, žádný profil napříč weby, žádná třetí strana v cestě. Sbírá se adresa stránky, odkud jste přišli, země a hrubý druh zařízení, operačního systému a prohlížeče. Návštěvník se z toho neskládá zpátky a data zůstávají na mém stroji.

Je to zároveň jediný požadavek mimo tenhle web, který stránka posílá: písma jsou uložená tady, žádné CDN, žádné vložené přehrávače ani tlačítka sítí. Kdo měřen být nechce, zablokuje doménu plausible.jirkovynavody.cz — na obsahu se tím nezmění nic.

KontaktKdyž máte co dodat

Diskuse tady není. Nálezy stojí na měření a nejužitečnější reakce bývá proto protiměření — jiný hardware, jiný jazyk, jiná sada otázek. To se do komentáře pod článkem stejně nevejde.

Takže: napište mi. Zajímá mě hlavně, když vám něco vyjde jinak — a taky když v některém nálezu najdete chybu. Několik jsem si jich za jediný den našel sám a je pravděpodobné, že tam další jsou.