Přeskočit na obsah
← NálezyZMĚŘENO24/24Předchozí

Tentýž agent, cloudový mozek: 6× rychleji, stejná přesnost

provoz · volba modelugpt-5.6-solthinkingcap-27b
Sada 32 otázek
32/32 oba
Čas na otázku
73 → 12 s
Celý běh
39 → 7 min
Cena
konverzace v cloudu

Měřeno 17. 8. 2026. Do Hermese přibylo přihlášení k ChatGPT předplatnému (Codex OAuth) a hlavní model se přepnul na GPT-5.6-sol; lokální thinkingcap-27B zůstal jako fallback pro výpadky cloudu. Vzácná příležitost: změřit tentýž agent, tytéž nástroje, tytéž dokumenty — a vyměnit jen mozek.

Teze: Sada z nálezu 11 neměří model, ale celý systém: vyhledávání, volbu nástroje, čtení dokumentů. Právě proto je zajímavá i pro cloud — ukáže, kolik z těch 73 sekund na otázku byl model a kolik systém okolo.

Výsledek

Táž sada 32 otázek, kterou 2. 8. prošly čtyři lokální modely:

thinkingcap-27B (lokál) GPT-5.6-sol (cloud)
prošlo 32/32 32/32
čas na otázku 73 s 12 s (medián 10)
celý běh 39 min 7 min

Odpověď byla skoro vždycky správně u obou — rozdíl není v přesnosti, ale v čekání. A nejde jen o sadu:

otázka ze sady 32 (medián běhu)73 s12 s6,1× rychlejimodelový tah z nálezu 21208,5 s58,2 s3,6× rychlejititulek sezení27,7 s2,8 s9,9× rychlejiOsa je odmocninová — jinak by 2,8 s vedle 208,5 s nebylo vidět.Stejný agent, stejné nástroje; mění se jen mozek.
lokálně (thinkingcap 27B)cloud (GPT-5.6-sol přes Codex OAuth)

Titulky sezení, které po updatu 0.20.1 tiše umíraly na rozpočtu 64 tokenů, teď generuje gpt-5.4-mini za 2,8 s místo 27,7 s. A modelový tah z nálezu 21 („spusť přes terminál…") klesl z 208,5 s na 58,2 s — poměr k bang módu se smrskl z 3 595× na ~970×, pointa ale platí dál: deterministická cesta pořád vyhrává o skoro tři řády, i proti cloudu.

Co ta rychlost stojí

Konverzace tečou k OpenAI. Zdrojové dokumenty zůstávají doma — agent, nástroje, vyhledávání i soubory běží dál na kontejneru — ale co model čte a píše, opouští síť. To je vědomá výměna, ne opomenutí: přepis hlasu a extrakce paměti zůstaly lokální a lokální model drží celou sestavu použitelnou i bez internetu (přesně scénář nálezu 23 naruby).

A jedna poctivá výhrada k měření: lokální čísla jsou z 2. 8., cloudová ze 17. 8. — patnáct dní od sebe, jiná zátěž cloudu, jiný den. Sada, dokumenty i agent jsou ale beze změny, a rozdíl 6× je řádový, ne kosmetický.

Kde se těch 61 sekund vzalo

Lokální stroj s propustností paměti 273 GB/s generuje ~13 tokenů za sekundu a systémový prompt agenta má přes 17 tisíc tokenů. Většina z 73 sekund na otázku padla na čtení promptu a na přemýšlení, které uživatel nikdy neuvidí (nález 01, nález 15). Cloud tenhle účet neplatí — respektive platí ho někdo jiný, na hardwaru, kde prefill 17 tisíc tokenů trvá zlomek sekundy.

Poznámka k publikaci

Časy jsou z eval reportů (eval-2026-08-17_1721.json) a z měření v témže dni; lokální hodnoty jsou kanonická sada z 2. 8. Obsah otázek se nemění ani nezveřejňuje — jde o osobní dokumenty. Bang přeměření: medián ze tří běhů, výstup všech tří byl totožný.

Co se pro to změnilo
  • confighlavní model gpt-5.6-sol (Codex OAuth), thinkingcap-27B jako fallback řetěz
  • configpomocné úlohy (titulky, komprese, session search) na gpt-5.4-mini
  • configMoA preset: reference gpt-5.5 + lokální 27B, agregace gpt-5.6-sol
  • opravaeval-run.py měl IP LM Studia natvrdo — čtvrté místo s touž adresou (nález 23)
Souvisí — štítek „architektura“