Přeskočit na obsah
Čísla 3 min čtení

Místo průměru nejslabší výsledek: první pětka HELM Lite se vymění celá

Pořadí modelů v žebříčku závisí na tom, jak se dílčí výsledky slijí do jednoho čísla. Práce ze sborníku workshopu GEM přepočítala dva veřejné žebříčky HELM podle nejslabšího výsledku místo průměru: u HELM Lite nemá první pětka podle jednoho pravidla s první pěticí podle druhého jediný společný model. Přepočet jsme si zopakovali z veřejných dat a u menšího žebříčku vyšel do posledního místa stejně.

Články rezavého řetězu ležící na přístavním nábřeží
Články rezavého řetězu na přístavním nábřeží. Pravidlo o nejslabším článku je v práci hlavním argumentem proti průměru. Foto: Islander61, Wikimedia Commons (CC BY-SA 4.0)

Žebříček modelů skoro vždycky stojí na průměru: sečtou se výsledky z několika zkoušek a vydělí se jejich počtem. Sedmistránková práce Sankalpa Gildy a Shloka Gildy ukazuje, o kolik se pořadí posune, když se místo průměru vezme nejslabší z dílčích výsledků. Text vyšel ve sborníku workshopu GEM na konferenci ACL 2026 a 28. července ho autoři vystavili na arXivu. Na žebříčku HELM Lite se první pětka vymění celá.

HELM, tedy Holistic Evaluation of Language Models, je rodina veřejných žebříčků skupiny CRFM na Stanfordově univerzitě. Model se v nich pouští na několika oddělených úlohách, kterým HELM říká scénáře, a jejich výsledky se pak slijí do jednoho pořadí. Autoři to pořadí spočítali dvakrát: jednou průměrem přes scénáře, podruhé podle nejhoršího z nich. Druhému pravidlu se říká nejslabší článek, protože řetěz unese jen tolik, kolik unese jeho nejhorší oko.

Menší žebříček: přepočet sedí do posledního místa

Prvním z nich je HELM Capabilities v1.0.0 z 20. března 2025, kde je 22 modelů a pět scénářů: MMLU-Pro, GPQA, IFEval, WildBench a Omni-MATH. Ke každému vydání zveřejňuje CRFM celou tabulku výsledků jako soubor JSON, takže jsme si přepočet pustili sami. Vyšel stejně jako v práci: pořadí podle průměru a podle nejslabšího výsledku mají Spearmanovu korelaci 0,87, největší posun je o osm míst a v první pětce se liší jeden model z pěti. Claude 3.5 Sonnet z 22. října 2024 klesne z pátého místa na dvanácté, protože na Omni-MATH dosáhl 0,276, kdežto na zbylých čtyřech scénářích 0,565 až 0,856.

Velký žebříček: pětky se nepřekrývají vůbec

Druhý žebříček je HELM Lite v1.13.0 z 10. ledna 2025 s deseti scénáři, od čtení příběhu přes MMLU a školní matematiku po strojový překlad. Tady je rozdíl největší: první pětka podle průměru a první pětka podle nejslabšího výsledku nemají společný ani jeden model. Platí to i proti pořadí, které HELM sám vypisuje jako výchozí, tedy podle průměrné úspěšnosti v přímých soubojích modelů. I s ním je průnik nulový.

V jednom údaji jsme se s prací rozešli. Uvádí 54 modelů, kdežto zveřejněná tabulka vydání v1.13.0 má 91 řádků a 90 z nich má vyplněné všechny scénáře. Které modely autoři vybrali, v textu nestojí. Nad všemi devadesáti nám vychází Spearmanova korelace 0,84 místo uvedených 0,89 a největší posun 46 míst místo 21. Závěr o nepřekrývajících se pěticích to nemění, čísla kolem něj ano.

Nejslabším článkem bývá pořád tentýž scénář

Zajímavější než samotný posun je, kde ten nejslabší výsledek leží. Na HELM Lite připadá u 78 z 90 modelů na strojový překlad měřený metrikou BLEU, u jedenácti na matematiku a u jediného na otázky zodpovídané bez vyhledávání. Na HELM Capabilities je to ještě vyhraněnější: nejhorší skóre má na Omni-MATH všech 22 modelů. Řadit podle nejslabšího článku tedy v praxi neznamená řadit přísněji, ale řadit podle jednoho nejtěžšího scénáře. A protože BLEU u překladu měří shodu s referenčním překladem, ne podíl správných odpovědí, staví se tu vedle sebe čísla, která spolu nejsou souměřitelná. Práce sama BLEU jako nejslabší článek HELM Lite jmenuje; kolika modelů se to týká, neuvádí.

Zkusili jsme totéž na nejnovějším vydání HELM Capabilities, v1.15.0 z 24. listopadu 2025 s 68 modely. Rozdíl je mírnější: pětky se shodují ve třech modelech z pěti a největší posun je o 18 míst. Nejslabším scénářem zůstává Omni-MATH, a to u 64 modelů z 68.

Trvanlivost výsledku dopadá i na vlastní příklad práce

Návrh, který z toho autoři vyvozují, míří dál než na volbu operace. Ke každému skóre by podle nich mělo patřit trojí: jak silný je typ důkazu, na jakou oblast výsledek platí a do kdy. Typy důkazu rozdělují do čtyř stupňů se stropem spolehlivosti, od modelu v roli hodnotitele a davových anotací se stropem 0,70 přes automatické metriky se stropem 0,85 a řízené lidské hodnocení se stropem 0,95 po matematický důkaz. Na HELM Lite přesahují strop automatických metrik nejlepší výsledky rovnou u čtyř scénářů, mezi nimi 0,97 na OpenBookQA a 0,96 na GSM8K.

Na vlastní ukázku práce ovšem dopadá právě ta trvanlivost. HELM Lite od vydání v1.13.0 z ledna 2025 žádné novější nemá a nejnovějším modelem v jeho tabulce je DeepSeek v3 z 24. prosince 2024. U HELM Capabilities autoři sáhli po úplně prvním vydání, ačkoli od listopadu 2025 je venku v1.15.0. Na výpočtu to nic nemění, na tom, co si z něj čtenář odnese o dnešních modelech, ano.

Co si z toho odnést

Průměr ani nejslabší článek nejsou správná a špatná volba. Průměr odměňuje model, který je v něčem hodně dobrý; nejslabší článek odměňuje model, který nikde úplně nepropadne. Podle nás je na tom nejcennější právě to, že se ta volba dá spočítat a ukázat, místo aby zůstala schovaná v jednom čísle na titulní stránce žebříčku.

Že se dílčí propad v souhrnu ztratí, přitom není jen vlastnost velkých tabulek. Vidět je to i na jednotlivém modelu: Claude Opus 5 vedl v souhrnném testu o bod a v dílčí zkoušce faktické přesnosti měl padesátiprocentní míru halucinací.

Zdroje: práce na arXivu a ve sborníku workshopu GEM, veřejná data žebříčků HELM LiteHELM Capabilities. Vlastní přepočty vznikly nad zveřejněnými soubory JSON obou žebříčků.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    vLLM 0.26.0 bere tři, pět i sedm bitů na váhu. Dva bity model v měření položily

    Nástroje pro běh jazykových modelů zmenšují váhy skoro vždy na osm nebo čtyři bity. Vydání vLLM 0.26.0 z 27. července 2026 přidalo dvě schémata, která ke kratším šířkám…

  2. Čísla

    Font proti sběru dat: mezi čtyřmi filtry se jeho výsledek liší víc než třicetkrát

    Projekt ShieldFont zaměňuje slova ve zdroji stránky, aby robotům sbírajícím trénovací data podstrčil jiný text než čtenáři. Jeho vlastní měření v repozitáři zkoušelo…

  3. Čísla

    Test agentů nechal na Hugging Face 205 stejnojmenných modelů, 107 za tři dny

    Sada úloh Toolathlon nechává agenta nahrát model na Hugging Face pod pevným jménem MyAwesomeModel-TestRepo. Úklid je ale zapsaný v přípravě před testem, ne za ním, takže…

  4. Čísla

    llama.cpp vydal za třicet dnů 229 verzí. U kritické díry se dva záznamy liší o 501 buildů

    Knihovna llama.cpp, na které stojí většina domácího provozu jazykových modelů, vydala mezi 1. a 30. červencem 2026 dvě stě dvacet devět verzí. Číslo v jejich názvu…