Tentýž agent, cloudový mozek: 6× rychleji, stejná přesnost
- Sada 32 otázek
- 32/32 oba
- Čas na otázku
- 73 → 12 s
- Celý běh
- 39 → 7 min
- Cena
- konverzace v cloudu
Měřeno 17. 8. 2026. Do Hermese přibylo přihlášení k ChatGPT předplatnému (Codex OAuth) a hlavní model se přepnul na GPT-5.6-sol; lokální thinkingcap-27B zůstal jako fallback pro výpadky cloudu. Vzácná příležitost: změřit tentýž agent, tytéž nástroje, tytéž dokumenty — a vyměnit jen mozek.
Teze: Sada z nálezu 11 neměří model, ale celý systém: vyhledávání, volbu nástroje, čtení dokumentů. Právě proto je zajímavá i pro cloud — ukáže, kolik z těch 73 sekund na otázku byl model a kolik systém okolo.
Výsledek
Táž sada 32 otázek, kterou 2. 8. prošly čtyři lokální modely:
| thinkingcap-27B (lokál) | GPT-5.6-sol (cloud) | |
|---|---|---|
| prošlo | 32/32 | 32/32 |
| čas na otázku | 73 s | 12 s (medián 10) |
| celý běh | 39 min | 7 min |
Odpověď byla skoro vždycky správně u obou — rozdíl není v přesnosti, ale v čekání. A nejde jen o sadu:
Titulky sezení, které po updatu 0.20.1 tiše umíraly na rozpočtu 64 tokenů, teď generuje gpt-5.4-mini za 2,8 s místo 27,7 s. A modelový tah z nálezu 21 („spusť přes terminál…") klesl z 208,5 s na 58,2 s — poměr k bang módu se smrskl z 3 595× na ~970×, pointa ale platí dál: deterministická cesta pořád vyhrává o skoro tři řády, i proti cloudu.
Co ta rychlost stojí
Konverzace tečou k OpenAI. Zdrojové dokumenty zůstávají doma — agent, nástroje, vyhledávání i soubory běží dál na kontejneru — ale co model čte a píše, opouští síť. To je vědomá výměna, ne opomenutí: přepis hlasu a extrakce paměti zůstaly lokální a lokální model drží celou sestavu použitelnou i bez internetu (přesně scénář nálezu 23 naruby).
A jedna poctivá výhrada k měření: lokální čísla jsou z 2. 8., cloudová ze 17. 8. — patnáct dní od sebe, jiná zátěž cloudu, jiný den. Sada, dokumenty i agent jsou ale beze změny, a rozdíl 6× je řádový, ne kosmetický.
Kde se těch 61 sekund vzalo
Lokální stroj s propustností paměti 273 GB/s generuje ~13 tokenů za sekundu a systémový prompt agenta má přes 17 tisíc tokenů. Většina z 73 sekund na otázku padla na čtení promptu a na přemýšlení, které uživatel nikdy neuvidí (nález 01, nález 15). Cloud tenhle účet neplatí — respektive platí ho někdo jiný, na hardwaru, kde prefill 17 tisíc tokenů trvá zlomek sekundy.
Poznámka k publikaci
Časy jsou z eval reportů (eval-2026-08-17_1721.json) a z měření v témže
dni; lokální hodnoty jsou kanonická sada z 2. 8. Obsah otázek se nemění ani
nezveřejňuje — jde o osobní dokumenty. Bang přeměření: medián ze tří běhů,
výstup všech tří byl totožný.
- confighlavní model gpt-5.6-sol (Codex OAuth), thinkingcap-27B jako fallback řetěz
- configpomocné úlohy (titulky, komprese, session search) na gpt-5.4-mini
- configMoA preset: reference gpt-5.5 + lokální 27B, agregace gpt-5.6-sol
- opravaeval-run.py měl IP LM Studia natvrdo — čtvrté místo s touž adresou (nález 23)