Čtyřikrát rychlejší, dvakrát méně spolehlivý
- Generování MoE
- 52,3 tok/s
- Proti dense
- 12,4 tok/s
- Úspěšnost
- 30/32
- Selhání trvala
- 18 s
Změřeno 1. 8. 2026. Mixture-of-Experts proti dense modelu na téže sadě.
Čísla
qwen3.6-35b-a3b — 35 miliard parametrů celkem, ~3 aktivní na token.
| dense 27B | MoE 35B-A3B | |
|---|---|---|
| Soubor | 17,7 GB | 22,1 GB |
| Model | Role | Prošlo | Čas / otázku | Generování |
|---|---|---|---|---|
| thinkingcap 27B | hlavní | 32/32 | 73 s | 12,4 tok/s |
| MoE 35B-A3B | komprese | 30/32 | 37 s | 52,3 tok/s |
| Fable-Fusion 711 | uncensored | 32/32 | 100 s | 10,4 tok/s |
| gemma 4 31B | srovnávací | 28/32 | 106 s | 9,9 tok/s |
| GPT-5.6-sol | cloud | 32/32 | 12 s | — |
MoE 35B-A3B: běželo s druhým modelem v paměti — uvolnění gemmy se nepovedlo, takže sdílel stroj
GPT-5.6-sol: měřeno 17. 8. přes Codex OAuth (předplatné ChatGPT) — jiný den než lokální modely, jinak stejná sada, agent i dokumenty; rychlost generování se u cizího serveru z logu měřit nedá
Tabulka výš pochází z jediného zdroje pro celý web
(src/data/mereni.ts). Původně tu stála čísla z běhu 1. 8. —
„32/32 · 78 s" a „29/32 · 38 s" — a byla nespolehlivá ze dvou důvodů:
runner tehdy nezapisoval do reportu, který model běh obsloužil, takže přiřazení
stálo jen na poznámkách, a hodnota 32/32 navíc vznikla mou ruční opravou
falešných negativů, ne měřením. Sada byla 2. 8. přeběhnuta s opraveným runnerem
a platí čísla z ní.
Čtyřikrát rychlejší generování, přestože je soubor o čtvrtinu větší. To potvrzuje, že hrdlem je propustnost paměti, ne výpočet — kdyby rozhodovala velikost souboru nebo výpočetní náročnost, tenhle model by prohrál.
Do agentní smyčky se ale ten čtyřnásobek promítl jen jako dvojnásobek. Zbytek času padne na prefill dokumentů a volání nástrojů, ne na psaní odpovědi.
Kde se ta rychlost bere
Tři selhání, všechna stejného druhu — vymyšlené dokumenty a vymyšlená fakta:
- na dotaz po vzorovém balicím seznamu pro hory nabídl „Rakousko 2022 (Alpy)" a „Španělsko 2022 (Pyreneje)". Ani jeden takový soubor neexistuje.
- na dotaz po poplatku za pracovní místo vysvětlil obchodní model firmy z obecné znalosti, přestože v dokumentu stojí konkrétní částka. Dvakrát.
- na dotaz po výsledku jedné události popsal organizaci z obecné znalosti místo odpovědi z vlastních poznámek.
A teď to podstatné:
| průměrný čas | |
|---|---|
| úspěšné odpovědi | 40 s |
| tři selhání | 18 s |
Když si vymýšlí, je dvakrát rychlejší než když odpovídá správně. Část té rychlosti tedy nepochází z architektury, ale z toho, že tu práci neudělá — nesáhne do dokumentů a odpoví z parametrické znalosti.
Kde obstál
chovani 4/4, health 9/9. Selhala jen práce a cestování — tedy domény s mnoha
dokumenty, kde odpověď vyžaduje najít ten správný. Kde stačí pravidlo nebo je
fakt jediný, problém nebyl.
- config.yamlmodel.default přepnut mezi modely (jen pro test)