Přeskočit na obsah
← NálezyO projektu

Co tu vlastně měřím

Asistent, který běží u mě doma a čte moje dokumenty — ty zůstávají na místě. Od 17. 8. má hlavní slovo cloudový model, takže konverzace už síť opouštějí; dokumenty, nástroje a paměť ne (nález 24). Tahle stránka říká, na čem to stojí, jak vznikají čísla v článcích — a hlavně kde jsou jejich hranice.

Nálezů
33z toho 17 o selhání
Dokumentů
280+zhruba 1,5 MB textu
Otázek v sadě
32napříč pěti doménami
Porovnaných modelů
5lokální Q4 (27–35B) + cloud

ArchitekturaDva stroje, jedna místnost

Od 19. 8. běží agent i lokální model na jednom stroji: Mac mini (M4 Pro, 64 GB), agent v linuxové VM, model v LM Studiu vedle ní (nález 26). Hlavní slovo má cloudový model přes Codex OAuth; lokální drží zálohu a přepis hlasu. Domácí server zůstal v roli, kterou umí nejlíp: každou noc na něm přistává záloha dat agenta.

DOMÁCÍ SÍŤ — DOKUMENTY JI NEOPOUŠTĚJÍVSTUPYChatTerminálPlánovačMAC MINI — VMAgentdokumenty · fulltextstav · paměť · přepis hlasuzálohy jezdí na serverPROMPTTOKENYMAC — INFERENCEModel 27B / 35B64 GB sdílené paměti

↑ Ven z toho rámečku jde jen záloha zašifrovaná před odesláním a tenhle web, kde jsou jména nahrazená.

Stroj
Mac miniM4 Pro
CPU
14 jader10 výkonných + 4
GPU
20 jaderMetal 4
Paměť
64 GBsdílená, 273 GB/s

Ta propustnost je jediný údaj, který jsem neměřil — je z katalogu. Ověřit se ale dá vlastními daty: model o velikosti 17,7 GB generuje 13,1 tokenu za sekundu, a protože každý token přečte všechny váhy, dělá to 232 GB/s, tedy 85 % katalogového maxima. Na tomhle stroji tedy rozhoduje propustnost paměti, ne výpočetní výkon.

SoftwareAgent se jmenuje Hermes

Nepsal jsem si vlastního agenta. Všechno tady běží na Hermes Agent od Nous Research — hotovém open source runtimu, který řeší smyčku nástrojů, kanály, plánovač i kompresi kontextu. Moje práce je volba modelů, dokumenty, evaluační sada a nastavení; runtime je cizí.

Píšu to sem proto, že to mění, jak číst zbytek webu. Většina nálezů není o modelech, ale o tom, jak se model chová uvnitř konkrétního systému — a ten systém si můžete nainstalovat taky. Několik nálezů se navíc týká jeho výchozího nastavení, ne mého: přepis hlasu jede z krabice na modelu, který v češtině selhává, a hlídač úloh nepozná pracující model od zaseknutého, protože streamování je vypnuté a limit je 30 minut.

Runtime
Hermesv0.21.5 · 2026.9.24
Instalace
gitPython 3.11
Modely
LM Studiolokálně, GGUF Q4

Z bundlovaných pluginů běží tři. Hledání a čtení webu jedou schválně přes dva různé free tiery — jedna rešerše umí spálit desítky volání (nález 22) a sdílený rozpočet by se vyčerpal dvakrát rychleji:

Hledání

web-brave-free

2 000 dotazů/měs. zdarma

Fulltextové hledání přes Brave Data-for-Search. Vrací úryvky výsledků — na rychlou orientaci stačí, na čtení stránek ne.

Extrakce stránek

web-tavily

1 000 kreditů/měs. zdarma

Čtení celých stránek se stropem 15 tisíc znaků na kus. Nasazeno po nálezu 22 — bez extraktoru si model čtení nahrazoval desítkami hledání, až přetekl kontext.

Paměť

holographic

1 z 8 memory providerů

Ukládání faktů bez LLM v cestě — co se zapíše, rozhoduje agent, žádný pomocný model si nedomýšlí. Zvoleno po nálezu 06, kdy extrakce faktů malým modelem vyráběla rozpory.

Co je proti výchozímu stavu jinak — bez tohohle seznamu se čísla v článcích nedají zopakovat:

NastaveníVýchozíTadyProč
přepis hlasubasesmall · cs · int8base je v češtině nepoužitelný
limit komprese120 s300 slokální model to za dvě minuty nestihne
limit názvu sezení30 s60 stotéž, jen míň bolí
hlídač úloh600 s1 800 sjeden tah nad velkým kontextem trvá déle
strop tahů500150pojistka proti zacyklení, které stojí hodiny
paměťová vrstvažádnáholographicbez LLM v cestě, fakta zapisuje agent
reset sezení—denně ve 4:00ať se kontext nevleče přes dny

Výchozí hodnoty přeověřeny 29. 9. 2026 proti hermes_cli/config_defaults.py verze 0.21.5: přepis hlasu (base), limit komprese (120 s), hlídač úloh (30 min).

Kdo co dělalV téhle laboratoři jsou dva agenti

Snadno se to plete, tak to říkám hned na začátku: Hermes je ten měřený — asistent, který mi běží doma, čte moje dokumenty a odpovídá na Telegramu. Claude Code je ten měřící — cloudový nástroj, se kterým Hermese stavím, píšu k němu skripty a pouštím evaluace.

V nálezech se to rozlišuje záměrně. Kde stojí „já“, je to moje rozhodnutí, moje data nebo moje zkušenost s tím, jak se asistent chová. Kde stojí „Claude Code“, je to měření, skript nebo hypotéza, kterou vyslovil on — včetně těch, které se ukázaly jako špatné. Nálezy označené „mýlil jsem se“ většinou nepatří lokálnímu modelu, ale jednomu z nás dvou.

A platí to i pro texty na tomhle webu: nálezy vznikají s pomocí AI. Koncept obvykle skládá Claude nad měřeními, logy a mými poznámkami; zadání, ověření, škrty a schválení jsou moje. Čísla AI negeneruje — přebírají se z reálných běhů a před publikací procházejí kontrolou proti jedinému zdroji měření (viz Jak se měří). Píšu to sem kvůli otevřenosti: označení obsahu vytvořeného s pomocí AI považuju za férové vůči čtenáři bez ohledu na to, co zrovna vyžaduje regulace.

Proč to rozlišuju: bez toho by se z laboratorního deníku stal životopis. Za výsledky si stojím, ale nepsal jsem každý řádek kódu sám a nechci vzbuzovat dojem, že ano.

ModelyCo tady běží a proč zrovna to

Lokální modely jsou otevřené, stažené z Hugging Face a puštěné v kvantizaci Q4; od 17. 8. vede hlavní tah cloudový model přes Codex OAuth a lokál slouží jako fallback (nález 24). Výběr není hitparáda — každý sem přišel kvůli konkrétní otázce.

Hlavní model · cloud

GPT-5.6-sol

Codex OAuth · 272k kontext · 12 s/otázku v sadě

Od 17. 8. hlavní mozek agenta, přes ChatGPT předplatné. Na téže sadě 32 otázek stejná přesnost jako lokální model a 6× rychlejší odpověď — rozdíl není chytrost, ale čekání na tokeny. Konverzace tím opouštějí domácí síť; dokumenty, nástroje, přepis hlasu i paměť zůstávají doma.

Fallback · do 17. 8. hlavní

ThinkingCap Qwen3.6-27B

17,7 GB · 13,1 tok/s

Doladěná varianta Qwenu od pražské BottleCap AI, kterou spoluzaložil Tomáš Mikolov — autor word2vec — spolu s Jaroslavem Beckem (Beat Saber) a Davidem Herelem. Cílem fine-tuningu není chytřejší model, ale kratší přemýšlení: podle jejich měření o 46 % méně tokenů na uvažování při rozdílu přesnosti kolem 0,7 procentního bodu.

Proto rok vedl hlavní tah. Na stroji, kde je hrdlem propustnost paměti, se platí za každý vygenerovaný token — a polovina z nich padne na přemýšlení, které uživatel nikdy neuvidí. Dnes drží zálohu: když cloud vypadne, agent se vrátí k němu a jede dál, pomaleji, ale doma.

Komprese kontextu

Qwen3.6-35B-A3B

22,1 GB · 54,6 tok/s

Oficiální model týmu Qwen (Alibaba), Apache 2.0. Mixture-of-Experts: 35 miliard parametrů celkem, ale jen zhruba tři aktivní na token. Zkoušel jsem, jestli se ta čtyřnásobná rychlost dá využít. Na odpovědi ne — začal si vymýšlet dokumenty. Na kompresi ano, tam se osvědčil. Od 17. 8. jede komprese primárně na gpt-5.4-mini v cloudu; tenhle zůstává lokální zálohou.

Srovnávací

Gemma 4 31B

19,9 GB · 11,3 tok/s

Otevřený model od Google DeepMind — jediný tady, který nestojí na Qwenu. Je tu právě proto: bez druhé rodiny nejde poznat, co je vlastnost Qwenu a co obecná vlastnost modelů téhle velikosti.

Test hypotézy

Fable-Fusion 711 Uncensored

19,9 GB · 100 s/dotaz v sadě

Týž základ jako hlavní model, ale konverze od jiného autora s odstraněným odmítáním. Stáhl jsem ho kvůli jediné otázce: jestli model, který neodmítne napsat cokoliv, přestane oponovat i mně. Nepřestal — obě konverze prošly sadou 32/32. Tahle je ale o čtvrtinu větší a v sadě o 37 % pomalejší; čisté generování v tokenech za sekundu u ní zatím naměřené nemám.

Pomocné úlohy

Qwen3 4B

3,3 GB · 42,5 tok/s

Malý model na drobnou práci — názvy sezení, dřív i extrakce faktů a komprese. Právě on udělal z „melu na stupni 4“ meloun ve čtvrtém patře, takže od obojího odešel.

Přepis hlasu

Whisper small

běží na CPU · int8

Výchozí base dělá z české věty nesmysl. small je pomalejší, ale rozumí — a na půlminutovou hlasovku je i tak rychlejší než odpověď agenta.

Meze platnostiCo ta čísla neunesou

Tohle je nejdůležitější sekce na celém webu. Čísla v článcích jsou skutečná, ale indicie z jednoho nasazení — ne obecně platné výsledky.

Jedna sestavaVšechno je měřeno na stroji ze schématu. Jinde vyjdou jiná čísla — a u závěrů typu „hrdlo je propustnost paměti“ se může změnit i to, co je hrdlo.
Málo opakováníObvykle dvě až čtyři, někdy jediný běh. To stačí na rozdíl mezi 13 a 55 tokeny za sekundu, ne na rozdíl mezi 13 a 14.
Jedna doména, jeden jazyk, jeden člověkDokumenty jsou moje, česky, o mém životě a práci. Model, který si poradí s tímhle, si nemusí poradit s vaším — a naopak.
Vlastní sada, ne standardní benchmarkOtázky jsem psal já a podle svých potřeb. Několikrát se ukázalo, že chyba byla v mém vyhodnocení, ne v modelu.
Modely se mění pod rukamaKvantizace, konverze i runtime se posouvají po týdnech. Každý nález má datum; po půl roce ber čísla jako historii.

Jak se měříOtázka, hledání, kontrola

Otázkas ověřenou odpovědíAgent hledáskutečné dokumenty,volí nástroj sámOdpověďplný text běhuKontrolazaznělo, cozaznít musí?

Sada jede proti skutečným dokumentům, ne proti připravenému vzorku — měří tedy i vyhledávání a volbu nástroje, ne jenom model.

prácezdravícestovánífinancechování

Pátá doména je jiná. V chování je správnou odpovědí odmítnutí — podepsat pod svým minimem, spolehnout se na ústní slib, poslat zdravotní údaj do firemního kanálu. Poslušný model tady propadne.

ZnačkyTři druhy nálezu

Změřeno
16
Číslo, které předtím nikdo neměl.
Selhalo
14
Co se rozbilo a proč.
Mýlil jsem se
3
Hypotéza, kterou vyvrátila vlastní data.

Ten poslední druh je důvod, proč web vznikl. Vyslovit odhad, změřit ho a publikovat i to, že byl špatně, je jediný způsob, jak se dá takové sbírce věřit.

ProvozCo běží bez dozoru

Část asistenta neběží na vyžádání, ale sama dokola. Odtud pochází většina nálezů: věci bez dohledu selhávají jinak než ty, u kterých sedíte — a hlavně to není hned vidět.

KonsolidaceHlídač prahůPracovní sumářZachyceníBEZ ZÁSAHU · DOKOLAhlásí jen změnu, ne stav — jinak by chodila tatáž zpráva každý den

Konsolidace hledá, co je v zápiscích a chybí v dokumentech, a navrhuje doplnění — nikdy nezapisuje sama. Hlídače sledují termíny a portfolio a hlásí jen přechody přes práh. Pracovní sumář má filtr, který z něj drží osobní věci venku.

RedakceCo se v článcích mění a co ne

Texty vznikají s pomocí AIKoncepty píše Claude nad reálnými měřeními a logy; ověření, škrty a schválení jsou lidské. Čísla se nikdy negenerují — přebírají se z běhů.
Jména osob, firem a produktů jsou nahrazenáA je to u textu přiznané, aby čtenář věděl, co je původní a co ne.
Metodika a čísla zůstávají původníTo je celá hodnota; kdyby se upravovala, není co publikovat.
Zachovává se jazyková past, ne obsahKdyž model přeslechl slovo, náhrada musí nést tutéž past — jinak je z měření ilustrace.
Únik nevzniká ve větě, ale v součtu větPříklady se čtou dohromady a ptá se, co z nich plyne dohromady.
Nedopočítávají se souhrnyČíslo, které nikdo neměřil, sem nepatří — ani když zní autoritativně.

Jak to vypadá v praxi: nález o přepisu hlasu tu nějakou dobu chyběl schválně. Jeho důkazem byl způsob, jakým model přeslechl konkrétní slova, a referenční věta obsahovala zdravotní údaj a jméno osoby — nahradit to zpětně nejde, aniž bych si vymyslel i to zkomolení. Vyšel teprve po přeměření na skutečné hlasovce, jejíž obsah je běžná otázka; původní měření na syntéze je z něj odstraněné celé, ne přepsané.

SoukromíCo o vás tenhle web ví

Návštěvnost měřím Plausible běžícím na mém vlastním serveru — žádná cookie, žádný profil napříč weby, žádná třetí strana v cestě. Sbírá se adresa stránky, odkud jste přišli, země a hrubý druh zařízení, operačního systému a prohlížeče. Návštěvník se z toho neskládá zpátky a data zůstávají na mém stroji.

Z prohlížeče přitom neodchází žádný požadavek mimo tenhle web: písma jsou uložená tady, žádné CDN, žádné vložené přehrávače ani tlačítka sítí, a měření jde přes vlastní adresu (/mereni/…) — na server Plausible ho předává až tenhle web. Říkám to otevřeně: blokátory reklam takhle měření nevidí. Kdo měřen být nechce, napíše si do konzole localStorage.plausible_ignore = "true" — skript to respektuje a na obsahu se tím nezmění nic.

KontaktKdyž máte co dodat

Diskuse tady není. Nálezy stojí na měření a nejužitečnější reakce bývá proto protiměření — jiný hardware, jiný jazyk, jiná sada otázek. To se do komentáře pod článkem stejně nevejde.

Takže: napište mi. Zajímá mě hlavně, když vám něco vyjde jinak — a taky když v některém nálezu najdete chybu. Několik jsem si jich za jediný den našel sám a je pravděpodobné, že tam další jsou.