Místo průměru nejslabší výsledek: první pětka HELM Lite se vymění celá
Pořadí modelů v žebříčku závisí na tom, jak se dílčí výsledky slijí do jednoho čísla. Práce ze sborníku workshopu GEM přepočítala dva veřejné žebříčky HELM podle nejslabšího výsledku místo průměru: u HELM Lite nemá první pětka podle jednoho pravidla s první pěticí podle druhého jediný společný model. Přepočet jsme si zopakovali z veřejných dat a u menšího žebříčku vyšel do posledního místa stejně.

Žebříček modelů skoro vždycky stojí na průměru: sečtou se výsledky z několika zkoušek a vydělí se jejich počtem. Sedmistránková práce Sankalpa Gildy a Shloka Gildy ukazuje, o kolik se pořadí posune, když se místo průměru vezme nejslabší z dílčích výsledků. Text vyšel ve sborníku workshopu GEM na konferenci ACL 2026 a 28. července ho autoři vystavili na arXivu. Na žebříčku HELM Lite se první pětka vymění celá.
HELM, tedy Holistic Evaluation of Language Models, je rodina veřejných žebříčků skupiny CRFM na Stanfordově univerzitě. Model se v nich pouští na několika oddělených úlohách, kterým HELM říká scénáře, a jejich výsledky se pak slijí do jednoho pořadí. Autoři to pořadí spočítali dvakrát: jednou průměrem přes scénáře, podruhé podle nejhoršího z nich. Druhému pravidlu se říká nejslabší článek, protože řetěz unese jen tolik, kolik unese jeho nejhorší oko.
Menší žebříček: přepočet sedí do posledního místa
Prvním z nich je HELM Capabilities v1.0.0 z 20. března 2025, kde je 22 modelů a pět scénářů: MMLU-Pro, GPQA, IFEval, WildBench a Omni-MATH. Ke každému vydání zveřejňuje CRFM celou tabulku výsledků jako soubor JSON, takže jsme si přepočet pustili sami. Vyšel stejně jako v práci: pořadí podle průměru a podle nejslabšího výsledku mají Spearmanovu korelaci 0,87, největší posun je o osm míst a v první pětce se liší jeden model z pěti. Claude 3.5 Sonnet z 22. října 2024 klesne z pátého místa na dvanácté, protože na Omni-MATH dosáhl 0,276, kdežto na zbylých čtyřech scénářích 0,565 až 0,856.
Velký žebříček: pětky se nepřekrývají vůbec
Druhý žebříček je HELM Lite v1.13.0 z 10. ledna 2025 s deseti scénáři, od čtení příběhu přes MMLU a školní matematiku po strojový překlad. Tady je rozdíl největší: první pětka podle průměru a první pětka podle nejslabšího výsledku nemají společný ani jeden model. Platí to i proti pořadí, které HELM sám vypisuje jako výchozí, tedy podle průměrné úspěšnosti v přímých soubojích modelů. I s ním je průnik nulový.
V jednom údaji jsme se s prací rozešli. Uvádí 54 modelů, kdežto zveřejněná tabulka vydání v1.13.0 má 91 řádků a 90 z nich má vyplněné všechny scénáře. Které modely autoři vybrali, v textu nestojí. Nad všemi devadesáti nám vychází Spearmanova korelace 0,84 místo uvedených 0,89 a největší posun 46 míst místo 21. Závěr o nepřekrývajících se pěticích to nemění, čísla kolem něj ano.
Nejslabším článkem bývá pořád tentýž scénář
Zajímavější než samotný posun je, kde ten nejslabší výsledek leží. Na HELM Lite připadá u 78 z 90 modelů na strojový překlad měřený metrikou BLEU, u jedenácti na matematiku a u jediného na otázky zodpovídané bez vyhledávání. Na HELM Capabilities je to ještě vyhraněnější: nejhorší skóre má na Omni-MATH všech 22 modelů. Řadit podle nejslabšího článku tedy v praxi neznamená řadit přísněji, ale řadit podle jednoho nejtěžšího scénáře. A protože BLEU u překladu měří shodu s referenčním překladem, ne podíl správných odpovědí, staví se tu vedle sebe čísla, která spolu nejsou souměřitelná. Práce sama BLEU jako nejslabší článek HELM Lite jmenuje; kolika modelů se to týká, neuvádí.
Zkusili jsme totéž na nejnovějším vydání HELM Capabilities, v1.15.0 z 24. listopadu 2025 s 68 modely. Rozdíl je mírnější: pětky se shodují ve třech modelech z pěti a největší posun je o 18 míst. Nejslabším scénářem zůstává Omni-MATH, a to u 64 modelů z 68.
Trvanlivost výsledku dopadá i na vlastní příklad práce
Návrh, který z toho autoři vyvozují, míří dál než na volbu operace. Ke každému skóre by podle nich mělo patřit trojí: jak silný je typ důkazu, na jakou oblast výsledek platí a do kdy. Typy důkazu rozdělují do čtyř stupňů se stropem spolehlivosti, od modelu v roli hodnotitele a davových anotací se stropem 0,70 přes automatické metriky se stropem 0,85 a řízené lidské hodnocení se stropem 0,95 po matematický důkaz. Na HELM Lite přesahují strop automatických metrik nejlepší výsledky rovnou u čtyř scénářů, mezi nimi 0,97 na OpenBookQA a 0,96 na GSM8K.
Na vlastní ukázku práce ovšem dopadá právě ta trvanlivost. HELM Lite od vydání v1.13.0 z ledna 2025 žádné novější nemá a nejnovějším modelem v jeho tabulce je DeepSeek v3 z 24. prosince 2024. U HELM Capabilities autoři sáhli po úplně prvním vydání, ačkoli od listopadu 2025 je venku v1.15.0. Na výpočtu to nic nemění, na tom, co si z něj čtenář odnese o dnešních modelech, ano.
Co si z toho odnést
Průměr ani nejslabší článek nejsou správná a špatná volba. Průměr odměňuje model, který je v něčem hodně dobrý; nejslabší článek odměňuje model, který nikde úplně nepropadne. Podle nás je na tom nejcennější právě to, že se ta volba dá spočítat a ukázat, místo aby zůstala schovaná v jednom čísle na titulní stránce žebříčku.
Že se dílčí propad v souhrnu ztratí, přitom není jen vlastnost velkých tabulek. Vidět je to i na jednotlivém modelu: Claude Opus 5 vedl v souhrnném testu o bod a v dílčí zkoušce faktické přesnosti měl padesátiprocentní míru halucinací.
Zdroje: práce na arXivu a ve sborníku workshopu GEM, veřejná data žebříčků HELM Lite a HELM Capabilities. Vlastní přepočty vznikly nad zveřejněnými soubory JSON obou žebříčků.