A što braž mít
- Konfigurací
- 6
- Trefilo „naposledy“
- 0
- Nejlepší přepis
- 0,4× realtime
- Ztracený čas agenta
- 4 min
Teze: Přepis českých hlasovek přes Whisper base je nepoužitelný, ale ne z důvodu,
který by člověk čekal. A osvědčený trik na vlastní jména to zhoršil.
Jak to vypadalo v provozu
Hlasovka poslaná do Telegramu se přepsala takto:
„A što braž mít, tak mi udělejí sumář, naši hodné tak, jak ho zítra pošleš?“
Hned nato následovala psaná zpráva: „Poslal jsem ti hlasovou zprávu ale nevím jestli dokážeš zpracovat.“ Zpracovalo — jen z toho vyšel nesmysl, takže to vypadalo jako nefunkčnost.
Měření
První sada měření běžela na syntéze české řeči a její referenční věta obsahovala osobní údaje, takže se nedala zveřejnit: důkazem je právě to, jak model ta konkrétní slova přeslechl, a nahradit je zpětně by znamenalo vymyslet si i to zkomolení.
Nahradilo ji měření níže — na skutečné hlasovce z běžného provozu, jejíž věta žádné osobní údaje neobsahuje. Obě konfigurační zjištění, kvůli kterým ten článek vznikl, se na ní potvrdila.
Druhé měření — skutečná hlasovka
2. 8. 2026. Původní tabulka běžela na syntéze. Tohle je živý hlas: hlasovka poslaná do Telegramu za normálního provozu, 4,1 s, běžná česká věta bez osobních údajů. Řečeno bylo:
Najdi mi kdy jsem byl naposledy v Maďarsku.
Šest konfigurací na tomtéž souboru:
| Konfigurace | Přepis |
|---|---|
base, jazyk hádaný |
„Najjemé, kde jsem byl naposad v majá rysku." |
base, jazyk cs |
znak po znaku totéž |
base + slovník jmen |
„Najjemé, grejsem byl naposad v Maďarsko." |
small, jazyk cs |
„Najdí mi, když jsem byl na posady v maďarsku." |
small + slovník |
totéž, jen „Maďarsku" s velkým písmenem |
large-v3-turbo |
„Najdi mi, když jsem byl na posady v Maďarsku." |
Oba původní nálezy se potvrdily na živém hlase. Vynucení jazyka cs dalo
u base identický text a jen zrychlilo běh. Slovník jmen opravil název země,
ale rozbil vedle toho „kdy jsem" na „grejsem" — přesně to samé zhoršení jako na
syntéze.
Co nezvládl žádný z nich
Ani jedna ze šesti konfigurací nepřepsala správně „naposledy" — vyšlo „naposad" nebo „na posady". A ani jedna netrefila „kdy"; všechny daly „kde" nebo „když".
To druhé je horší, i když vypadá nevinněji. Z otázky na čas se stala otázka na místo a nic to nesignalizuje, protože „kde jsem byl v Maďarsku" je smysluplná věta.
Rychlost, tentokrát bez načítání modelu
| model | načtení | přepis 4,1 s | × realtime |
|---|---|---|---|
base |
0,9 s | 3,6 s | 1,2× |
small |
2,4 s | 10,5 s | 0,4× |
large-v3-turbo |
6,8 s | 67,8 s | 0,1× |
Načtení modelu je u krátké hlasovky srovnatelné s přepisem, u large dokonce
desetina celkového času. Kdo měří jen „jak dlouho to trvalo", měří u čtyřsekundových
zpráv z velké části start.
Dvě věci proti očekávání
Jazyk nebyl příčina. Claude Code byl přesvědčený, že Whisper hádá špatný jazyk. Nehádá —
base určil češtinu s jistotou 0,96 sám a vynucení cs dalo identický text,
jen o 40 % rychleji (odpadne detekce).
Slovník vlastních jmen přes initial_prompt pomůže jednomu slovu a rozbije
zbytek. Na base opravil název země, takže vypadal slibně — a v téže větě
udělal z „kdy jsem" nesmyslné „grejsem". Nasměruje model k vypsaným slovům na
úkor všeho ostatního.
Nasazeno
Model base není nešťastná volba — je to výchozí nastavení přepisu v Hermes Agent v0.19.1 (2026.7.30). Nález se tedy netýká exotické konfigurace, ale toho, co dostane každý, kdo hlasovky zapne a nic dalšího neudělá.
small + language: cs + compute_type: int8. Půlminutová hlasovka ≈ 37 s,
což je vedle dvouminutové odpovědi agenta jedno.
Poznámka k publikaci
Nahrávka je skutečná hlasovka z provozu; její obsah je běžná otázka bez osobních údajů. Původní měření na syntéze je z článku odstraněné celé, protože jeho referenční věta obsahovala zdravotní údaj a jméno osoby.