Rychlejší model, který přemýšlí stejně dlouho
- Myšlení hlavního modelu
- 96 tokenů
- Myšlení MoE modelu
- 422 tokenů
- Čas myšlení u obou
- ~8 s
- Vzorků z logu
- 51 559
Změřeno 2. 8. 2026 ze záznamů inferenčního serveru — 51 559 řádků o průběhu generování z celodenního provozu. Nebyl kvůli tomu spuštěný jediný dotaz navíc.
Teze: Tokeny za sekundu neříkají skoro nic. Rozhoduje, kolik tokenů model spotřebuje na uvažování, které se nikdy nezobrazí — a rychlý model to umí utratit celé.
Kolik který model přemýšlí
Medián tokenů uvažování na jednu odpověď, měřeno napříč celým dnem evaluací:
| model | tokenů na myšlení | rychlost generování | čas myšlení |
|---|---|---|---|
| thinkingcap 27B | 96 | 12,4 t/s | 7,7 s |
| gemma 4 31B | 261 | 9,9 t/s | 26,4 s |
| MoE 35B-A3B | 422 | 52,3 t/s | 8,1 s |
Poslední sloupec je celý článek. Model, který generuje 4,2krát rychleji, stráví přemýšlením stejný čas jako ten pomalý — 8,1 proti 7,7 sekundy. Celý náskok v rychlosti padne na to, že si toho namyslí čtyřapůlkrát víc.
Gemma je na tom nejhůř z obou stran: přemýšlí skoro třikrát víc než hlavní model a generuje pomaleji, takže na uvažování spotřebuje 26 sekund na odpověď.
Proč to vysvětluje dva starší nálezy
Proč se čtyřnásobek scvrkl na dvojnásobek. Nález o MoE končil tím, že čtyřikrát rychlejší generování dalo v agentní smyčce jen dvojnásobek, a Claude Code to připsal prefillu a volání nástrojů. Bylo to jinak: hlavní ztráta je tady. Čtyřnásobná rychlost se vynuluje čtyřapůlnásobným množstvím myšlení.
Proč je hlavní model doladěný právě na tohle. Hlavní model je varianta Qwenu od BottleCap AI, jejíž fine-tuning necílí na chytřejší odpovědi, ale na kratší uvažování. Slibují o 46 % méně tokenů na přemýšlení. Na téhle zátěži je rozdíl proti ostatním modelům násobný — a je to jediný důvod, proč nejpomalejší model z trojice není nejpomalejší v praxi.
Zpracování vstupu
Ze stejného zdroje, protože se to nabízelo:
| model | prefill |
|---|---|
| MoE 35B-A3B | 531 tok/s |
| Fable-Fusion 711 | 113 tok/s |
| thinkingcap 27B | 101 tok/s |
| gemma 4 31B | 88 tok/s |
Číslo u hlavního modelu je nezávislé potvrzení vlastního měření z téhož dne: křivka prefillu vyšla na 96 až 106 tok/s a záznam ze stovek skutečných generování říká 101. Dvě metody, jiná data, stejný výsledek.
MoE model má prefill pětkrát rychlejší, ne jen generování. Tím spíš platí, že o jeho výsledku rozhoduje množství myšlení.
Anomálie, kterou zatím neumím vysvětlit
Uncensored konverze nemá v záznamu ani jeden řádek o uvažování, zatímco ostatní tři jich mají tisíce. Buď neodděluje myšlení od odpovědi, nebo ho inferenční server u téhle konverze nerozpozná.
Zapadalo by to do čísel — proti hlavnímu modelu je o 37 % pomalejší na otázku, ale jen o 16 % pomalejší na token, takže rozdíl musí být v množství vygenerovaného textu. Ověřené to ale není a dokud nebude, zůstává to poznámka, ne závěr.
Metodická poznámka
Tenhle záznam ležel na disku celý den a Claude Code se do něj podíval až večer, když jsem ho na něj navedl. Ráno u jednoho selhání hádal příčinu a vyvrátil ji až řádek z toho záznamu, který jsem mu poslal ručně.
Pravidlo tedy zní: když ladíš model, čti záznam inferenčního serveru, ne jen záznam agenta. Agent vidí, co poslal a co dostal. Server vidí, co se dělo mezi tím — a v tomhle případě tam bylo úplně všechno.
- žádnénález je z logu, nic se pro něj nenastavovalo