Známku ověřeného měření nemá ani jeden z 2 542 výsledků v žebříčcích Hugging Face
Hugging Face ukládá od prosince 2025 výsledky testů přímo do repozitáře modelu a skládá z nich žebříčky benchmarků. Ze 2 542 položek, které v nich 4. září 2026 stály, nemá známku ověřeného měření ani jedna. Devětatřicet dalších patří kopiím a kvantizacím, které nesou čísla původního modelu.

Hugging Face sbírá výsledky testů modelů přímo v jejich repozitářích. Skóre se ukládá jako soubor YAML ve složce .eval_results/, vypíše se na stránce modelu a přebírá ho žebříček té datové sady, na které se měřilo. Popis mechanismu nese od začátku větu, že jde o rozdělanou práci; první verze té stránky přibyla do dokumentace 16. prosince 2025.
Jedna kolonka v té specifikaci stojí za pozornost. Vedle naměřené hodnoty smí záznam nést pole verifyToken a jedině s ním dostane výsledek na stránce modelu známku „verified“. Dokumentace k ní píše, že token platí tehdy, když měření proběhlo v HF Jobs přes nástroj inspect-ai. Zbylé tři známky o měření neříkají nic: „leaderboard“ odkazuje na žebříček, „source“ na adresu, kterou k číslu někdo připsal, a „community“ znamená, že skóre přidal někdo cizí návrhem změny, který ještě nikdo nesloučil.
Dva a půl tisíce položek, ani jedna ověřená
Benchmarkem se datová sada stane tím, že má v kořeni soubor eval.yaml a Hugging Face ji zapíše na seznam. Takových sad bylo 4. září 2026 čtyřicet osm. Čtyřicet tři z nich vydá svůj seznam úloh i bez přihlášení a úloh je v něm dohromady 209. Žebříček každé z nich vrátí veřejné rozhraní api/datasets/<sada>/leaderboard?task_id=<úloha>.
Součet za všech 209 úloh vyšel takhle: 2 542 položek, 362 různých modelů, u 43 úloh zatím žádný výsledek. Známku ověřeného měření nemá ani jedna položka – pole verifyToken v nich nestojí ani jednou. Náhodný vzorek 150 modelů z 1 760, které štítek eval-results nesou, dal totéž: 478 záznamů v předepsaném tvaru a u žádného ten token.
Vydavatelé si přitom podmínky měření hlídají různě pečlivě – Ling-3.0-flash je popisuje podrobně a čísla dává jen do obrázků. Rozdíl mezi „změřili jsme si to sami“ a „někdo to přeměřil“ ale strojově nese jedině to prázdné pole.
Kopie modelu si nese čísla originálu
Soubory ve složce .eval_results/ se kopírují se zbytkem repozitáře. Když si někdo model překlopí k sobě nebo z něj udělá kvantizovanou verzi, jdou čísla s ním a v poli source zůstane adresa karty toho původního. Takových položek je v žebříčcích 39 a patří deseti repozitářům. Odvozeniny se přitom od svého vzoru rozcházejí i v jiných věcech, třeba v tom, jestli u sebe mají text licence.
Nejlíp je to vidět na úloze terminal-bench-3.0. Její žebříček má jedinou položku: Tort-AI/GLM-5.3 s hodnotou 28,3 a se zdrojem, který vede na kartu zai-org/GLM-5.3. Tort-AI ten model nahrál 28. srpna, tři dny po vydavateli, a rozhraní u obou hlásí stejný součet parametrů do posledního čísla, 753 329 940 480. Sám vydavatel v tom žebříčku není: totéž číslo zapsal pod starší datovou sadu téhož testu, a i ta má jedinou položku.
Druhý případ je kvantizace. Repozitář INCModel/Kimi-K2.6-MXFP4-CT-AutoRound drží váhy převedené do MXFP4 a k nim devět souborů s výsledky, které pocházejí z karty modelu moonshotai/Kimi-K2.6 a nesou datum 20. dubna 2026. V žebříčku MMMU-Pro je ta kvantizace s hodnotou 79,4 druhá, v terminal-bench-2.0 sedmá s 66,7 – hned za původním modelem, který má tutéž hodnotu. Stejně stojí v žebříčcích převod onnx-community/Surya-Ocr-2-Onnx s devíti položkami nebo RedHatAI/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 se čtyřmi.
Nikdo přitom nic nezastírá: v souboru je napsané, odkud číslo je, a kdo si ho rozklikne, dostane se na kartu původního modelu. Ze žebříčku ta poznámka vidět není, jen štítek „source“ – takže vedle sebe stojí model a jeho odvozenina s týmž skóre, aniž na převedených vahách kdokoli něco měřil.
Štítek přidá i nesloučený návrh změny
Ve vzorku 150 modelů mělo složku .eval_results/ 110 z nich, pět mělo jen starší zápis model-index v kartě a 35 nemělo ani jedno. U 31 z těch pětatřiceti visí otevřený návrh změny, jehož název mluví o výsledcích testů; u zbylých čtyř je štítek napsaný rovnou v kartě. Model tak nese označení a čísla, která jeho vydavatel nepřijal – u MiniMaxAI/MiniMax-M2 jsou to čtyři návrhy z ledna až března 2026 s výsledky HLE, MMLU-Pro, Terminal-Bench a SWE-bench Verified. Dokumentace s tím počítá: když je skóre sporné, může autor modelu návrh zavřít a tím ho ze stránky odstranit.
Většina čísel má zdroj mimo vlastní kartu
Mechanismus umí i to, kvůli čemu vznikl. Z 2 542 položek jich na vlastní kartu modelu odkazuje jen 307. Nejvíc jich vede jinam: 575 na Open ASR Leaderboard, který si vede sada hf-audio/open-asr-leaderboard, dalších 513 na samostatný web s výsledky testu ScreenSpot-Pro. V žebříčku terminal-bench-2.0 se vedle karet vydavatelů objevují odkazy na tbench.ai i na dvě práce na arXivu.
Právě proto je to prázdné pole verifyToken nepříjemné. Odkaz na cizí žebříček je doklad, který se dá otevřít a přečíst, jenže ho čtenář musí najít sám; známka „verified“ by tutéž informaci nesla rovnou v seznamu. Zatím platí, že štítek „leaderboard“ u modelu říká, že někdo číslo zapsal do souboru – ne že ho někdo změřil.
Zdroje
- Evaluation Results – dokumentace Hugging Face Hubu, včetně tabulky známek a popisu pole
verifyToken - Historie té stránky v repozitáři
huggingface/hub-docs - Vlastní měření 4. září 2026 nad veřejným rozhraním Hubu: seznam sad se štítkem
benchmark:eval-yaml, jejicheval.yaml, žebříčky všech 209 úloh a náhodný vzorek 150 modelů se štítkem eval-results