Přeskočit na obsah
češtinamodely

A što braž mít

Hermes · přepis hlasuwhisper small
Konfigurací
6
Trefilo „naposledy“
0
Nejlepší přepis
0,4× realtime
Ztracený čas agenta
4 min

Teze: Přepis českých hlasovek přes Whisper base je nepoužitelný, ale ne z důvodu, který by člověk čekal. A osvědčený trik na vlastní jména to zhoršil.

Jak to vypadalo v provozu

Hlasovka poslaná do Telegramu se přepsala takto:

„A što braž mít, tak mi udělejí sumář, naši hodné tak, jak ho zítra pošleš?“

Hned nato následovala psaná zpráva: „Poslal jsem ti hlasovou zprávu ale nevím jestli dokážeš zpracovat.“ Zpracovalo — jen z toho vyšel nesmysl, takže to vypadalo jako nefunkčnost.

Měření

První sada měření běžela na syntéze české řeči a její referenční věta obsahovala osobní údaje, takže se nedala zveřejnit: důkazem je právě to, jak model ta konkrétní slova přeslechl, a nahradit je zpětně by znamenalo vymyslet si i to zkomolení.

Nahradilo ji měření níže — na skutečné hlasovce z běžného provozu, jejíž věta žádné osobní údaje neobsahuje. Obě konfigurační zjištění, kvůli kterým ten článek vznikl, se na ní potvrdila.

Druhé měření — skutečná hlasovka

2. 8. 2026. Původní tabulka běžela na syntéze. Tohle je živý hlas: hlasovka poslaná do Telegramu za normálního provozu, 4,1 s, běžná česká věta bez osobních údajů. Řečeno bylo:

Najdi mi kdy jsem byl naposledy v Maďarsku.

Šest konfigurací na tomtéž souboru:

Konfigurace Přepis
base, jazyk hádaný Najjemé, kde jsem byl naposad v majá rysku."
base, jazyk cs znak po znaku totéž
base + slovník jmen „Najjemé, grejsem byl naposad v Maďarsko."
small, jazyk cs Najdí mi, když jsem byl na posady v maďarsku."
small + slovník totéž, jen „Maďarsku" s velkým písmenem
large-v3-turbo Najdi mi, když jsem byl na posady v Maďarsku."

Oba původní nálezy se potvrdily na živém hlase. Vynucení jazyka cs dalo u base identický text a jen zrychlilo běh. Slovník jmen opravil název země, ale rozbil vedle toho „kdy jsem" na „grejsem" — přesně to samé zhoršení jako na syntéze.

Co nezvládl žádný z nich

Ani jedna ze šesti konfigurací nepřepsala správně „naposledy" — vyšlo „naposad" nebo „na posady". A ani jedna netrefila „kdy"; všechny daly „kde" nebo „když".

To druhé je horší, i když vypadá nevinněji. Z otázky na čas se stala otázka na místo a nic to nesignalizuje, protože „kde jsem byl v Maďarsku" je smysluplná věta.

Rychlost, tentokrát bez načítání modelu

model načtení přepis 4,1 s × realtime
base 0,9 s 3,6 s 1,2×
small 2,4 s 10,5 s 0,4×
large-v3-turbo 6,8 s 67,8 s 0,1×

Načtení modelu je u krátké hlasovky srovnatelné s přepisem, u large dokonce desetina celkového času. Kdo měří jen „jak dlouho to trvalo", měří u čtyřsekundových zpráv z velké části start.

Dvě věci proti očekávání

Jazyk nebyl příčina. Claude Code byl přesvědčený, že Whisper hádá špatný jazyk. Nehádá — base určil češtinu s jistotou 0,96 sám a vynucení cs dalo identický text, jen o 40 % rychleji (odpadne detekce).

Slovník vlastních jmen přes initial_prompt pomůže jednomu slovu a rozbije zbytek. Na base opravil název země, takže vypadal slibně — a v téže větě udělal z „kdy jsem" nesmyslné „grejsem". Nasměruje model k vypsaným slovům na úkor všeho ostatního.

Nasazeno

Model base není nešťastná volba — je to výchozí nastavení přepisu v Hermes Agent v0.19.1 (2026.7.30). Nález se tedy netýká exotické konfigurace, ale toho, co dostane každý, kdo hlasovky zapne a nic dalšího neudělá.

small + language: cs + compute_type: int8. Půlminutová hlasovka ≈ 37 s, což je vedle dvouminutové odpovědi agenta jedno.

Poznámka k publikaci

Nahrávka je skutečná hlasovka z provozu; její obsah je běžná otázka bez osobních údajů. Původní měření na syntéze je z článku odstraněné celé, protože jeho referenční věta obsahovala zdravotní údaj a jméno osoby.

Souvisí — štítek „modely“