Přeskočit na obsah
Čísla 4 min čtení

Sada Monsoon ukázala větší rozdíly mezi regiony Indie než mezi osmi modely přepisu řeči

Hugging Face a Voice Arena přidaly do žebříčku Open ASR Leaderboard sady Monsoon pro indickou angličtinu a hindštinu. Každý klip v nich nese dvanáct údajů o mluvčím, a to stačilo, aby se osm modelů, které dělí 0,18 bodu chybovosti, rozešlo podle toho, odkud mluvčí pochází. Jeden z nich kolísá mezi regiony o 1,68 bodu.

Žena v sárí sedí u domu a drží mobilní telefon
Mobilní telefon na indickém venkově. Sady Monsoon vznikly z nahrávek, které přispěvatelé pořídili na vlastních přístrojích. Foto: Ammalu, Wikimedia Commons (CC BY-SA 3.0)

Hugging Face a indická platforma Voice Arena přidaly 28. srpna 2026 do žebříčku Open ASR Leaderboard dvě testovací sady pro rozpoznávání řeči: Monsoon en-IN pro indickou angličtinu a Monsoon hi-IN pro hindštinu. Hindština je na vícejazyčné záložce první indický jazyk, do té doby tam stály jen evropské. Od ostatních sad se ale obě liší něčím jiným – u každého klipu vedou dvanáct údajů o tom, kdo mluví.

Přepis řeči se hodnotí slovní chybovostí, zkratkou WER: kolik slov model vloží, vypustí nebo zamění, děleno počtem slov v referenčním přepisu. Je to jedno číslo za celou sadu, a o tom, komu model rozumí hůř, z něj nevyčtete nic. Ne proto, že by to žebříček tajil. Běžná testovací sada zaznamenává, co bylo řečeno, a skoro nic o tom, kdo to řekl.

Osmnáct sloupců, dvanáct o mluvčím

Monsoon jich má osmnáct a dvanáct z nich popisuje mluvčího: pohlaví, datum narození, povolání, vzdělání, rodinný stav, příjmové pásmo, rodný okres a stát, současné město, počet let strávených v něm, výrobce a model telefonu. Schéma souborů vydá rozhraní Hugging Face bez stahování jediné vteřiny zvuku, takže se ten počet dá přepočítat – a sedí.

Každá sada je rozdělená na dvě části. Veřejnou si stáhne kdokoli a změří si na ní model sám, skrytou spouští Hugging Face nad přihlášeným modelem, aby se na ni nedalo dolaďovat. Mluvčí se mezi částmi nepřekrývají.

ČástDélkaMluvčíchKlipů
Monsoon en-IN, veřejná5,62 h1 4442 102
Monsoon en-IN, skrytá5,58 h1 405neuvedeno
Monsoon hi-IN, veřejná1,33 h468753
Monsoon hi-IN, skrytá4,47 h1 571neuvedeno

Dohromady 17 hodin zvuku a 4 888 mluvčích. Počty klipů nejsou z oznámení, ale z metadat souborů parquet; po vydělení délkou z nich vyjde průměrný klip 9,63 s u angličtiny a 6,36 s u hindštiny, což odpovídá 9,6 a 6,4 s uvedeným v oznámení. Obojí je vlastní výpočet.

Dva popisy téhož se přitom rozcházejí. Karta sady na Hugging Face licenci neuvádí vůbec – pole license v její hlavičce chybí –, kdežto tabulka datových sad přímo v žebříčku píše u obou jazyků CC BY 4.0. U poměru pohlaví v hindštině má oznámení 54/46 pro veřejnou a 55/45 pro skrytou část, tabulka žebříčku u obou 60/40. Ani jeden zdroj neříká, jestli počítá mluvčí, nebo klipy.

Kde se osm modelů přestane podobat

Na veřejné anglické části se osm modelů z žebříčku vejde mezi 4,81 a 4,99 WER. To je rozdíl 0,18 bodu, tedy méně, než co pět hodin zvuku rozliší; seřazené podle celkového skóre jsou to podle autorů jeden a týž model.

Pak se mluvčí seskupí podle rodného okresu do zón, které používá indické ministerstvo vnitra. Model openai/whisper-large-v3-turbo mezi nimi kolísá o 0,46 bodu. Model mistralai/Voxtral-Mini-3B-2507, který je na celé sadě o čtrnáct setin horší, kolísá o 1,68 bodu: ve střední zóně má 4,38, na východě 6,06. Rozptyl toho druhého je tedy 9,3násobek celého rozdílu mezi osmi modely – vlastní výpočet z čísel 1,68 a 0,18.

Nejtěžší zóna navíc není u všech stejná. ibm-granite/granite-speech-3.3-2b si vede nejhůř na severu, microsoft/VibeVoice-ASR-HF na jihu, Voxtral na východě. Kdyby byl jeden region prostě hůř nahraný, seřadily by zóny všechny modely stejně. Autoři z toho vyvozují, že rozdíl dělají modely, ne zvuk – a dodávají, že tenhle rozbor je ukázka toho, co metadata dovolí, ne hlavní výsledek, kvůli kterému sady vznikly.

Zón je šest, počítalo se s pěti. Podíly, které oznámení vypisuje – 35 % jih, 18 % východ, 18 % střed, 16 % sever a 11 % západ –, dávají dohromady 98 %, takže na šestou zbývají zhruba dvě procenta segmentů (vlastní součet). Oznámení označuje za dostatečně zastoupených právě těch pět.

Hindštinu slovní chybovost měřit neumí

Hindské přepisy mají potíž navíc. Slova přejatá z angličtiny nemají v dévanágarí ustálený zápis, složeniny se píšou dohromady i zvlášť a jedna fráze má klidně deset správných podob. Kdo měří proti jedinému referenčnímu přepisu, odměňuje model za to, že se trefil do pravopisu, který si vybral přepisovatel. Dva systémy, které slyšely stejně dobře, se pak liší o několik bodů kvůli pravopisu.

Hindské sady proto místo prostého textu nesou lattice: u každého úseku seznam zápisů, které se uznávají jako správné. Sestavuje se ručně – varianty se sbírají z několika strojových přepisů téhož zvuku, rozšíří se jazykovým modelem a pak lingvisté škrtají to, co k nahrávce nesedí. Hodnotí se metrikou OIWER, kterou zavedla skupina AI4Bharat v práci Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages (arXiv, 1. března 2026, přijato na ICASSP 2026). Podle jejího abstraktu snižuje OIWER naměřenou chybovost v průměru o 6,3 bodu a u dvojice Gemini a Canary stáhla rozdíl mezi modely z 18,1 na 11,5 bodu. Skript, který to počítá, visí na PyPI jako voi-oiwer pod licencí MIT.

Veřejná hindská část je ale malá. Proti 4,47 hodiny skryté části má 1,33 hodiny, tedy 22,9 % hindského materiálu; u angličtiny se veřejná a skrytá část dělí zhruba půl na půl (50,2 %). Kdo si chce hindštinu změřit sám, má na to necelou hodinu a půl a 468 mluvčích. Obojí je vlastní výpočet z délek uvedených v oznámení.

Jak se model do měření dostane

Postup se nemění: návrh změny v repozitáři žebříčku na GitHubu, vyplněný seznam k modelu a vlastní výsledky nad veřejnými sadami. Hugging Face je ověří a čísla nad skrytými částmi dopočítá sám. Indická angličtina se přitom počítá do hlavního průměru WER všem modelům v žebříčku, ne jako volitelný sloupec navíc; hindština je na vícejazyčné záložce, kde se model zařadí jen tehdy, když umí všechny vybrané jazyky.

Kdo měřil, na čem a v jaké verzi – to je u výsledků testů ta část, která rozhoduje, a bývá to zrovna to, co v oznámeních chybí; psali jsme třeba o modelu Ling-3.0-flash, který podmínky měření popsal podrobně, ale samotné výsledky nechal jen v obrázcích. Monsoon k těm třem otázkám přidává čtvrtou: na kom.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    Váhy modelu Hy4 preview se ani ve verzi FP8 nevejdou na osm karet po 80 GB

    Tencent nahrál na Hugging Face váhy vlajkového modelu Hy4 preview a dal je pod licenci Apache 2.0. Součet 131 souborů v repozitáři dá 1 560 GB, kvantizovaná verze FP8…

  2. Čísla

    OpenAI uvádí u čipu Jalapeño až 1,9krát více práce na watt

    První vlastní čip OpenAI pro běh modelů má podle výsledků výrobce zvládnout 1,5 až 1,9krát více práce na watt než srovnávané systémy Nvidia. Při stejné práci by to…

  3. Čísla

    Tabulka n-gramů drží ve vahách Qwen3.8-Flash-Next 51 miliard parametrů

    Qwen zveřejnil váhy Qwen3.8-Flash-Next, na kterých chce postavit příští generaci svých modelů. Soubory nesou 179 999 981 459 parametrů a zaberou 360 GB. Přes 51 miliard…

  4. U sebe doma

    SGLang odstranil přepínač pro kvantizaci, který v devíti vydáních jen hlásil chybu

    Přepínač --torchao-config končil v SGLangu chybou ImportError, ať mu uživatel předal kteroukoli z povolených hodnot. Rozbil ho skok verze knihovny torchao, který se…