Přeskočit na obsah
modelyvýkon

Rychlejší model, který přemýšlí stejně dlouho

Myšlení hlavního modelu
96 tokenů
Myšlení MoE modelu
422 tokenů
Čas myšlení u obou
~8 s
Vzorků z logu
51 559

Změřeno 2. 8. 2026 ze záznamů inferenčního serveru — 51 559 řádků o průběhu generování z celodenního provozu. Nebyl kvůli tomu spuštěný jediný dotaz navíc.

Teze: Tokeny za sekundu neříkají skoro nic. Rozhoduje, kolik tokenů model spotřebuje na uvažování, které se nikdy nezobrazí — a rychlý model to umí utratit celé.

Kolik který model přemýšlí

Medián tokenů uvažování na jednu odpověď, měřeno napříč celým dnem evaluací:

model tokenů na myšlení rychlost generování čas myšlení
thinkingcap 27B 96 12,4 t/s 7,7 s
gemma 4 31B 261 9,9 t/s 26,4 s
MoE 35B-A3B 422 52,3 t/s 8,1 s
TOKENŮ NA PŘEMÝŠLENÍVÝSLEDNÝ ČASthinkingcap · 12,4 t/s967,7 sgemma · 9,9 t/s26126,4 sMoE A3B · 52,3 t/s4228,1 sModel, který generuje 4,2× rychleji, stráví přemýšlením stejný čas jako ten pomalý —celý náskok utratí za tokeny, které nikdo neuvidí.

Poslední sloupec je celý článek. Model, který generuje 4,2krát rychleji, stráví přemýšlením stejný čas jako ten pomalý — 8,1 proti 7,7 sekundy. Celý náskok v rychlosti padne na to, že si toho namyslí čtyřapůlkrát víc.

Gemma je na tom nejhůř z obou stran: přemýšlí skoro třikrát víc než hlavní model a generuje pomaleji, takže na uvažování spotřebuje 26 sekund na odpověď.

Proč to vysvětluje dva starší nálezy

Proč se čtyřnásobek scvrkl na dvojnásobek. Nález o MoE končil tím, že čtyřikrát rychlejší generování dalo v agentní smyčce jen dvojnásobek, a Claude Code to připsal prefillu a volání nástrojů. Bylo to jinak: hlavní ztráta je tady. Čtyřnásobná rychlost se vynuluje čtyřapůlnásobným množstvím myšlení.

Proč je hlavní model doladěný právě na tohle. Hlavní model je varianta Qwenu od BottleCap AI, jejíž fine-tuning necílí na chytřejší odpovědi, ale na kratší uvažování. Slibují o 46 % méně tokenů na přemýšlení. Na téhle zátěži je rozdíl proti ostatním modelům násobný — a je to jediný důvod, proč nejpomalejší model z trojice není nejpomalejší v praxi.

Zpracování vstupu

Ze stejného zdroje, protože se to nabízelo:

model prefill
MoE 35B-A3B 531 tok/s
Fable-Fusion 711 113 tok/s
thinkingcap 27B 101 tok/s
gemma 4 31B 88 tok/s
thinkingcap39 minFable-Fusion53 minMoE 35B-A3B20 mingemma 4 31B96 min · mimo osu020 min40 min60 min
čtení vstupugenerovánínástroje a režie

Číslo u hlavního modelu je nezávislé potvrzení vlastního měření z téhož dne: křivka prefillu vyšla na 96 až 106 tok/s a záznam ze stovek skutečných generování říká 101. Dvě metody, jiná data, stejný výsledek.

MoE model má prefill pětkrát rychlejší, ne jen generování. Tím spíš platí, že o jeho výsledku rozhoduje množství myšlení.

Anomálie, kterou zatím neumím vysvětlit

Uncensored konverze nemá v záznamu ani jeden řádek o uvažování, zatímco ostatní tři jich mají tisíce. Buď neodděluje myšlení od odpovědi, nebo ho inferenční server u téhle konverze nerozpozná.

Zapadalo by to do čísel — proti hlavnímu modelu je o 37 % pomalejší na otázku, ale jen o 16 % pomalejší na token, takže rozdíl musí být v množství vygenerovaného textu. Ověřené to ale není a dokud nebude, zůstává to poznámka, ne závěr.

Metodická poznámka

Tenhle záznam ležel na disku celý den a Claude Code se do něj podíval až večer, když jsem ho na něj navedl. Ráno u jednoho selhání hádal příčinu a vyvrátil ji až řádek z toho záznamu, který jsem mu poslal ručně.

Pravidlo tedy zní: když ladíš model, čti záznam inferenčního serveru, ne jen záznam agenta. Agent vidí, co poslal a co dostal. Server vidí, co se dělo mezi tím — a v tomhle případě tam bylo úplně všechno.

Co se pro to změnilo
  • žádnénález je z logu, nic se pro něj nenastavovalo
Souvisí — štítek „výkon“