Přeskočit na obsah
← Nálezy

Téma

Co jsem změřil na téma „výkon“

Osm nálezů na téma „výkon“ — co jsem o něm změřil při stavbě lokálního AI asistenta doma. Nejnovější je z 17. 8. 2026. Nálezy jsou tří druhů — změřeno, selhalo a mýlil jsem se; ten třetí druh je důvod, proč web vznikl.

ZMĚŘENOrychlejší na téže sadě 32 otázek — 32/32 u obou

Tentýž agent, cloudový mozek: 6× rychleji, stejná přesnost

Do Hermese přibylo ChatGPT předplatné přes Codex OAuth a hlavní tah převzal GPT-5.6-sol; lokální model zůstal jako fallback. Stejná sada, stejný agent, stejné dokumenty: 12 sekund na otázku místo 73. A poctivý účet, co ta rychlost stojí.výkon · architektura
ZMĚŘENO3 595×rychlejší než modelový tah, stejný výstup

Příkaz za setinu — přesně tam, kde ho nepotřebuju

Hermes 0.20 umí spustit příkaz bez modelu: 0,06 s místo 208. Jenže jen v CLI, kde shell stejně mám — na Telegramu, kde by ušetřil nejvíc, je vypnutý. A má k tomu dobrý důvod.výkon · architektura
ZMĚŘENO45 %méně tokenů při stejné přesnosti

Stejných 8 z 8 za polovic — skoro

Tabulkový formát TOON zmenšil odpověď nástroje o 45 % tokenů a model odpověděl stejně přesně. Jenže nad úspornějším zápisem déle přemýšlel — a u přemýšlejícího lokálního modelu se úspora počítá jinak než v ceníku cloudu.výkon · architektura
ZMĚŘENO33 984tokenů na jednoslovnou odpověď

Jedna otázka, šest minut čtení

Otázka zněla, jestli mám nějakou pozici v hongkongském dolaru. Odpověď je jedno slovo. Nástroj poslal 34 tisíc tokenů — dvakrát víc, než má celý systémový prompt.výkon · architektura
ZMĚŘENO4,4×víc tokenů na přemýšlení

Rychlejší model, který přemýšlí stejně dlouho

Model, který generuje čtyřikrát rychleji, stráví přemýšlením přesně stejný čas jako pomalý. Celý náskok padne na tokeny, které uživatel nikdy neuvidí.modely · výkon
ZMĚŘENO52,3tok/s proti 12,4

Čtyřikrát rychlejší, dvakrát méně spolehlivý

Čtyřikrát rychlejší generování, přestože je soubor větší. Jenže selhání přicházejí dvakrát rychleji než správné odpovědi.modely · výkon
ZMĚŘENO0,05s místo 2,5 minuty

Termíny nepatří modelu

Datum je fakt, ne věc k odvozování. Skript je tady vyšší forma než model — nemá jak si vymyslet.architektura · výkon
ZMĚŘENO13,1tok/s

Kolik stojí jedno „ano“

Lokální 27B na Macu odpoví „ano“ za dvacet sekund. Hrdlo není výpočet, ale propustnost paměti — a to obrací tři doporučení, která jsem vyslovil.výkon · architektura