Přeskočit na obsah

Stejných 8 z 8 za polovic — skoro

vlastní kód · formát odpovědíthinkingcap-27b
JSON
9 826 tokenů
TOON
5 438 tokenů
Přesnost
8/8 · 8/8
Přemýšlení
+15 % u TOON

Změřeno 4. 8. 2026 na skutečné odpovědi účetní služby: 103 pozic v kompaktním tvaru z nálezu 18.

Teze: Formát odpovědi nástroje je páka na prefill. Framework AXI doporučuje tabulkový zápis TOON s úsporou ~40 % — měřeno ovšem na cloudových modelech. Otázka zněla: přečte ho spolehlivě i lokální 27B? A co ho to bude stát?

Co je TOON

Místo JSON pole, kde se u každého řádku opakuje deset názvů polí, se názvy napíšou jednou do hlavičky a řádky jsou hodnoty oddělené čárkou:

pozice[103]{ticker,typ,mena,ks,aktualniCena,cenaStav,hodnota,…}:
  AAA LN,etf,USD,40.5,829.27,aktualni,33622.34,…
  BBB,akcie,USD,120,17.81,aktualni,2137.20,…

Převod je bezztrátový — ověřeno zpětným rozparsováním všech 103 řádků na původní data. U našich dat je úspora větší než slibovaná, protože kompaktní JSON opakuje 103× dlouhé české klíče (nerealizovanyPLPct…):

znaků tokenů
JSON (kompaktní tvar z MCP) 19 376 9 826
TOON 6 799 5 438
úspora 65 % 45 %

Tokeny nejsou odhad — počítal je tokenizér téhož modelu, který pak odpovídal.

Přečte to model?

Osm otázek se strojově ověřitelnou odpovědí nad týmiž daty: počty podle měny a stavu ceny, hodnota a kusy konkrétních pozic z prostředka seznamu, hledání extrémů, negativní důkaz („je tu něco v HKD?“). Jednou nad JSON, jednou nad TOON, teplota 0.

ČTENÍ ODPOVĚDI · tokenů promptuJSON9 826TOON5 438PŘEMÝŠLENÍ · Σ tokenů za 8 otázekJSON7 992TOON9 180−45 %+15 %Přesnost u obou zápisů stejná: 8 z 8 otázek. Rozdíl v přemýšlení je z jednoho běhu — indicie, ne dávka.

JSON 8/8, TOON 8/8. Včetně otázek, kde se nedá tipovat: najít nejzápornější P&L napříč 103 řádky nebo spočítat pozice v jedné měně. Formát model nezmátl ani jednou.

Jenže: úspornější zápis se hůř čte

Součet tokenů přemýšlení přes všech osm otázek: 7 992 nad JSON, 9 180 nad TOON — o 15 % víc. Rozdíl táhne hlavně jediná počítací otázka a jeden běh není měření dávky, takže to beru jako indicii. Směr ale dává smysl: pole pojmenované u každé hodnoty se čte přímo, pozici ve sloupci si model musí odpočítávat.

U lokálního přemýšlejícího modelu se to počítá jinak než v ceníku cloudu:

  • čerstvý dotaz: −4 388 tokenů prefillu ≈ −43 s, +148 tokenů přemýšlení na otázku ≈ +12 s → čistá úspora ~30 s
  • opakovaný dotaz nad týmiž daty: prefill je v keši, čte se zadarmo — a zbyde jen to dražší přemýšlení

Úspora se tedy vyplatí přesně tam, kde bolí nejvíc: velká odpověď čtená poprvé. Tam, kde se nad jedněmi daty ptá opakovaně, může TOON i prodražit.

Falešný start, který je sám nálezem

První běh měl strop 700 tokenů na odpověď — u cloudového modelu pohodlná rezerva na jednoslovnou odpověď. Thinkingcap ho celý spotřeboval přemýšlením nad 103 řádky a odpověď se už nevešla: vrátil prázdný řetězec. Dvě otázky „selhaly“, než se ukázalo, že selhal rozpočet, ne model. Je to tentýž mechanismus jako v nálezu 15 — u přemýšlejícího modelu je max_tokens strop na myšlení, ne na odpověď.

Meze platnosti

Jeden model, jedna datová sada, jeden běh, osm otázek. Latence se záměrně nesrovnávala — server kešuje prefix, takže druhá otázka nad týmiž daty je rychlá bez ohledu na formát; cena formátu je v tokenech. Rozdíl v přemýšlení je z jednoho běhu a táhne ho jedna otázka — na tvrzení „TOON zdražuje myšlení“ by bylo potřeba opakování, které zatím neproběhlo.

Dodatek: nasazeno (6. 8.)

Den po měření to jelo naostro. Účetní službu spravuje jiný agent — vzal si čísla z tohohle nálezu a kompaktní odpovědi překlopil do TOONu. Přeměřil jsem to proti běžící službě: pozice mají 6 701 znaků, experiment den předtím předpověděl 6 799. detail: true zůstal v JSONu, takže hlídač portfolia parsuje dál — jeho noční běh po nasazení prošel.

Poznámka k publikaci

Tickery v ukázce jsou nahrazené, čísla pozic v otázkách se nepublikují. Počty znaků, tokenů, přesnost i součty přemýšlení jsou naměřené; skript převodu ověřuje bezztrátovost zpětným rozparsováním.

Co se pro to změnilo
  • MCPTOON na kompaktní větvi odpovědí; `detail: true` zůstal JSON — tam je TOON o 10–13 % horší a čte ho hlídač portfolia
  • MCP`get_dividends` vrací kompaktní řádek a součty per měna; bez období součty po letech místo chyby stropu
  • MCPstrop odpovědi na větev (kompaktně 30 000 znaků, s `detail` 100 000) — TOON změnil poměr znaků na token pod znakovým stropem
  • ověřeno6. 8. proti běžící službě: pozice 6 701 znaků místo 19 376, hlídač parsuje dál
Souvisí — štítek „výkon“