Přeskočit na obsah
modelyvýkon

Čtyřikrát rychlejší, dvakrát méně spolehlivý

Generování MoE
52,3 tok/s
Proti dense
12,4 tok/s
Úspěšnost
30/32
Selhání trvala
18 s

Změřeno 1. 8. 2026. Mixture-of-Experts proti dense modelu na téže sadě.

Čísla

qwen3.6-35b-a3b — 35 miliard parametrů celkem, ~3 aktivní na token.

dense 27B MoE 35B-A3B
Soubor 17,7 GB 22,1 GB
Sada 32 otázek · měřeno 2. 8. 2026
ModelRoleProšloČas / otázkuGenerování
thinkingcap 27Bhlavní32/3273 s12,4 tok/s
MoE 35B-A3Bkomprese30/3237 s52,3 tok/s
Fable-Fusion 711uncensored32/32100 s10,4 tok/s
gemma 4 31Bsrovnávací28/32106 s9,9 tok/s
GPT-5.6-solcloud32/3212 s

MoE 35B-A3B: běželo s druhým modelem v paměti — uvolnění gemmy se nepovedlo, takže sdílel stroj

GPT-5.6-sol: měřeno 17. 8. přes Codex OAuth (předplatné ChatGPT) — jiný den než lokální modely, jinak stejná sada, agent i dokumenty; rychlost generování se u cizího serveru z logu měřit nedá

Tabulka výš pochází z jediného zdroje pro celý web (src/data/mereni.ts). Původně tu stála čísla z běhu 1. 8. — „32/32 · 78 s" a „29/32 · 38 s" — a byla nespolehlivá ze dvou důvodů: runner tehdy nezapisoval do reportu, který model běh obsloužil, takže přiřazení stálo jen na poznámkách, a hodnota 32/32 navíc vznikla mou ruční opravou falešných negativů, ne měřením. Sada byla 2. 8. přeběhnuta s opraveným runnerem a platí čísla z ní.

Čtyřikrát rychlejší generování, přestože je soubor o čtvrtinu větší. To potvrzuje, že hrdlem je propustnost paměti, ne výpočet — kdyby rozhodovala velikost souboru nebo výpočetní náročnost, tenhle model by prohrál.

Do agentní smyčky se ale ten čtyřnásobek promítl jen jako dvojnásobek. Zbytek času padne na prefill dokumentů a volání nástrojů, ne na psaní odpovědi.

Kde se ta rychlost bere

Tři selhání, všechna stejného druhu — vymyšlené dokumenty a vymyšlená fakta:

  • na dotaz po vzorovém balicím seznamu pro hory nabídl „Rakousko 2022 (Alpy)" a „Španělsko 2022 (Pyreneje)". Ani jeden takový soubor neexistuje.
  • na dotaz po poplatku za pracovní místo vysvětlil obchodní model firmy z obecné znalosti, přestože v dokumentu stojí konkrétní částka. Dvakrát.
  • na dotaz po výsledku jedné události popsal organizaci z obecné znalosti místo odpovědi z vlastních poznámek.

A teď to podstatné:

průměrný čas
úspěšné odpovědi 40 s
tři selhání 18 s

Když si vymýšlí, je dvakrát rychlejší než když odpovídá správně. Část té rychlosti tedy nepochází z architektury, ale z toho, že tu práci neudělá — nesáhne do dokumentů a odpoví z parametrické znalosti.

Kde obstál

chovani 4/4, health 9/9. Selhala jen práce a cestování — tedy domény s mnoha dokumenty, kde odpověď vyžaduje najít ten správný. Kde stačí pravidlo nebo je fakt jediný, problém nebyl.

Co se pro to změnilo
  • config.yamlmodel.default přepnut mezi modely (jen pro test)
Souvisí — štítek „výkon“