Sada Monsoon ukázala větší rozdíly mezi regiony Indie než mezi osmi modely přepisu řeči
Hugging Face a Voice Arena přidaly do žebříčku Open ASR Leaderboard sady Monsoon pro indickou angličtinu a hindštinu. Každý klip v nich nese dvanáct údajů o mluvčím, a to stačilo, aby se osm modelů, které dělí 0,18 bodu chybovosti, rozešlo podle toho, odkud mluvčí pochází. Jeden z nich kolísá mezi regiony o 1,68 bodu.

Hugging Face a indická platforma Voice Arena přidaly 28. srpna 2026 do žebříčku Open ASR Leaderboard dvě testovací sady pro rozpoznávání řeči: Monsoon en-IN pro indickou angličtinu a Monsoon hi-IN pro hindštinu. Hindština je na vícejazyčné záložce první indický jazyk, do té doby tam stály jen evropské. Od ostatních sad se ale obě liší něčím jiným – u každého klipu vedou dvanáct údajů o tom, kdo mluví.
Přepis řeči se hodnotí slovní chybovostí, zkratkou WER: kolik slov model vloží, vypustí nebo zamění, děleno počtem slov v referenčním přepisu. Je to jedno číslo za celou sadu, a o tom, komu model rozumí hůř, z něj nevyčtete nic. Ne proto, že by to žebříček tajil. Běžná testovací sada zaznamenává, co bylo řečeno, a skoro nic o tom, kdo to řekl.
Osmnáct sloupců, dvanáct o mluvčím
Monsoon jich má osmnáct a dvanáct z nich popisuje mluvčího: pohlaví, datum narození, povolání, vzdělání, rodinný stav, příjmové pásmo, rodný okres a stát, současné město, počet let strávených v něm, výrobce a model telefonu. Schéma souborů vydá rozhraní Hugging Face bez stahování jediné vteřiny zvuku, takže se ten počet dá přepočítat – a sedí.
Každá sada je rozdělená na dvě části. Veřejnou si stáhne kdokoli a změří si na ní model sám, skrytou spouští Hugging Face nad přihlášeným modelem, aby se na ni nedalo dolaďovat. Mluvčí se mezi částmi nepřekrývají.
| Část | Délka | Mluvčích | Klipů |
|---|---|---|---|
| Monsoon en-IN, veřejná | 5,62 h | 1 444 | 2 102 |
| Monsoon en-IN, skrytá | 5,58 h | 1 405 | neuvedeno |
| Monsoon hi-IN, veřejná | 1,33 h | 468 | 753 |
| Monsoon hi-IN, skrytá | 4,47 h | 1 571 | neuvedeno |
Dohromady 17 hodin zvuku a 4 888 mluvčích. Počty klipů nejsou z oznámení, ale z metadat souborů parquet; po vydělení délkou z nich vyjde průměrný klip 9,63 s u angličtiny a 6,36 s u hindštiny, což odpovídá 9,6 a 6,4 s uvedeným v oznámení. Obojí je vlastní výpočet.
Dva popisy téhož se přitom rozcházejí. Karta sady na Hugging Face licenci neuvádí vůbec – pole license v její hlavičce chybí –, kdežto tabulka datových sad přímo v žebříčku píše u obou jazyků CC BY 4.0. U poměru pohlaví v hindštině má oznámení 54/46 pro veřejnou a 55/45 pro skrytou část, tabulka žebříčku u obou 60/40. Ani jeden zdroj neříká, jestli počítá mluvčí, nebo klipy.
Kde se osm modelů přestane podobat
Na veřejné anglické části se osm modelů z žebříčku vejde mezi 4,81 a 4,99 WER. To je rozdíl 0,18 bodu, tedy méně, než co pět hodin zvuku rozliší; seřazené podle celkového skóre jsou to podle autorů jeden a týž model.
Pak se mluvčí seskupí podle rodného okresu do zón, které používá indické ministerstvo vnitra. Model openai/whisper-large-v3-turbo mezi nimi kolísá o 0,46 bodu. Model mistralai/Voxtral-Mini-3B-2507, který je na celé sadě o čtrnáct setin horší, kolísá o 1,68 bodu: ve střední zóně má 4,38, na východě 6,06. Rozptyl toho druhého je tedy 9,3násobek celého rozdílu mezi osmi modely – vlastní výpočet z čísel 1,68 a 0,18.
Nejtěžší zóna navíc není u všech stejná. ibm-granite/granite-speech-3.3-2b si vede nejhůř na severu, microsoft/VibeVoice-ASR-HF na jihu, Voxtral na východě. Kdyby byl jeden region prostě hůř nahraný, seřadily by zóny všechny modely stejně. Autoři z toho vyvozují, že rozdíl dělají modely, ne zvuk – a dodávají, že tenhle rozbor je ukázka toho, co metadata dovolí, ne hlavní výsledek, kvůli kterému sady vznikly.
Zón je šest, počítalo se s pěti. Podíly, které oznámení vypisuje – 35 % jih, 18 % východ, 18 % střed, 16 % sever a 11 % západ –, dávají dohromady 98 %, takže na šestou zbývají zhruba dvě procenta segmentů (vlastní součet). Oznámení označuje za dostatečně zastoupených právě těch pět.
Hindštinu slovní chybovost měřit neumí
Hindské přepisy mají potíž navíc. Slova přejatá z angličtiny nemají v dévanágarí ustálený zápis, složeniny se píšou dohromady i zvlášť a jedna fráze má klidně deset správných podob. Kdo měří proti jedinému referenčnímu přepisu, odměňuje model za to, že se trefil do pravopisu, který si vybral přepisovatel. Dva systémy, které slyšely stejně dobře, se pak liší o několik bodů kvůli pravopisu.
Hindské sady proto místo prostého textu nesou lattice: u každého úseku seznam zápisů, které se uznávají jako správné. Sestavuje se ručně – varianty se sbírají z několika strojových přepisů téhož zvuku, rozšíří se jazykovým modelem a pak lingvisté škrtají to, co k nahrávce nesedí. Hodnotí se metrikou OIWER, kterou zavedla skupina AI4Bharat v práci Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages (arXiv, 1. března 2026, přijato na ICASSP 2026). Podle jejího abstraktu snižuje OIWER naměřenou chybovost v průměru o 6,3 bodu a u dvojice Gemini a Canary stáhla rozdíl mezi modely z 18,1 na 11,5 bodu. Skript, který to počítá, visí na PyPI jako voi-oiwer pod licencí MIT.
Veřejná hindská část je ale malá. Proti 4,47 hodiny skryté části má 1,33 hodiny, tedy 22,9 % hindského materiálu; u angličtiny se veřejná a skrytá část dělí zhruba půl na půl (50,2 %). Kdo si chce hindštinu změřit sám, má na to necelou hodinu a půl a 468 mluvčích. Obojí je vlastní výpočet z délek uvedených v oznámení.
Jak se model do měření dostane
Postup se nemění: návrh změny v repozitáři žebříčku na GitHubu, vyplněný seznam k modelu a vlastní výsledky nad veřejnými sadami. Hugging Face je ověří a čísla nad skrytými částmi dopočítá sám. Indická angličtina se přitom počítá do hlavního průměru WER všem modelům v žebříčku, ne jako volitelný sloupec navíc; hindština je na vícejazyčné záložce, kde se model zařadí jen tehdy, když umí všechny vybrané jazyky.
Kdo měřil, na čem a v jaké verzi – to je u výsledků testů ta část, která rozhoduje, a bývá to zrovna to, co v oznámeních chybí; psali jsme třeba o modelu Ling-3.0-flash, který podmínky měření popsal podrobně, ale samotné výsledky nechal jen v obrázcích. Monsoon k těm třem otázkám přidává čtvrtou: na kom.
Zdroje
- The Open ASR Leaderboard Adds Its First Global South Language – oznámení Hugging Face a Voice Arena z 28. srpna 2026
- Karty sad Monsoon en-IN a Monsoon hi-IN na Hugging Face
- Open ASR Leaderboard a tabulka datových sad v jeho souboru
constants.py - Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages, arXiv:2603.00941
- Repozitář žebříčku na GitHubu