Přeskočit na obsah
Čísla 4 min čtení

Známku ověřeného měření nemá ani jeden z 2 542 výsledků v žebříčcích Hugging Face

Hugging Face ukládá od prosince 2025 výsledky testů přímo do repozitáře modelu a skládá z nich žebříčky benchmarků. Ze 2 542 položek, které v nich 4. září 2026 stály, nemá známku ověřeného měření ani jedna. Devětatřicet dalších patří kopiím a kvantizacím, které nesou čísla původního modelu.

Světelná výsledková tabule na stadionu v Pori
Tabule ukáže pořadí, ne to, kdo čas naměřil. Snímek je ilustrační a s popisovanou službou nesouvisí. Foto: Joe K., Wikimedia Commons (CC BY-SA 4.0)

Hugging Face sbírá výsledky testů modelů přímo v jejich repozitářích. Skóre se ukládá jako soubor YAML ve složce .eval_results/, vypíše se na stránce modelu a přebírá ho žebříček té datové sady, na které se měřilo. Popis mechanismu nese od začátku větu, že jde o rozdělanou práci; první verze té stránky přibyla do dokumentace 16. prosince 2025.

Jedna kolonka v té specifikaci stojí za pozornost. Vedle naměřené hodnoty smí záznam nést pole verifyToken a jedině s ním dostane výsledek na stránce modelu známku „verified“. Dokumentace k ní píše, že token platí tehdy, když měření proběhlo v HF Jobs přes nástroj inspect-ai. Zbylé tři známky o měření neříkají nic: „leaderboard“ odkazuje na žebříček, „source“ na adresu, kterou k číslu někdo připsal, a „community“ znamená, že skóre přidal někdo cizí návrhem změny, který ještě nikdo nesloučil.

Dva a půl tisíce položek, ani jedna ověřená

Benchmarkem se datová sada stane tím, že má v kořeni soubor eval.yaml a Hugging Face ji zapíše na seznam. Takových sad bylo 4. září 2026 čtyřicet osm. Čtyřicet tři z nich vydá svůj seznam úloh i bez přihlášení a úloh je v něm dohromady 209. Žebříček každé z nich vrátí veřejné rozhraní api/datasets/<sada>/leaderboard?task_id=<úloha>.

Součet za všech 209 úloh vyšel takhle: 2 542 položek, 362 různých modelů, u 43 úloh zatím žádný výsledek. Známku ověřeného měření nemá ani jedna položka – pole verifyToken v nich nestojí ani jednou. Náhodný vzorek 150 modelů z 1 760, které štítek eval-results nesou, dal totéž: 478 záznamů v předepsaném tvaru a u žádného ten token.

Vydavatelé si přitom podmínky měření hlídají různě pečlivě – Ling-3.0-flash je popisuje podrobně a čísla dává jen do obrázků. Rozdíl mezi „změřili jsme si to sami“ a „někdo to přeměřil“ ale strojově nese jedině to prázdné pole.

Kopie modelu si nese čísla originálu

Soubory ve složce .eval_results/ se kopírují se zbytkem repozitáře. Když si někdo model překlopí k sobě nebo z něj udělá kvantizovanou verzi, jdou čísla s ním a v poli source zůstane adresa karty toho původního. Takových položek je v žebříčcích 39 a patří deseti repozitářům. Odvozeniny se přitom od svého vzoru rozcházejí i v jiných věcech, třeba v tom, jestli u sebe mají text licence.

Nejlíp je to vidět na úloze terminal-bench-3.0. Její žebříček má jedinou položku: Tort-AI/GLM-5.3 s hodnotou 28,3 a se zdrojem, který vede na kartu zai-org/GLM-5.3. Tort-AI ten model nahrál 28. srpna, tři dny po vydavateli, a rozhraní u obou hlásí stejný součet parametrů do posledního čísla, 753 329 940 480. Sám vydavatel v tom žebříčku není: totéž číslo zapsal pod starší datovou sadu téhož testu, a i ta má jedinou položku.

Druhý případ je kvantizace. Repozitář INCModel/Kimi-K2.6-MXFP4-CT-AutoRound drží váhy převedené do MXFP4 a k nim devět souborů s výsledky, které pocházejí z karty modelu moonshotai/Kimi-K2.6 a nesou datum 20. dubna 2026. V žebříčku MMMU-Pro je ta kvantizace s hodnotou 79,4 druhá, v terminal-bench-2.0 sedmá s 66,7 – hned za původním modelem, který má tutéž hodnotu. Stejně stojí v žebříčcích převod onnx-community/Surya-Ocr-2-Onnx s devíti položkami nebo RedHatAI/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 se čtyřmi.

Nikdo přitom nic nezastírá: v souboru je napsané, odkud číslo je, a kdo si ho rozklikne, dostane se na kartu původního modelu. Ze žebříčku ta poznámka vidět není, jen štítek „source“ – takže vedle sebe stojí model a jeho odvozenina s týmž skóre, aniž na převedených vahách kdokoli něco měřil.

Štítek přidá i nesloučený návrh změny

Ve vzorku 150 modelů mělo složku .eval_results/ 110 z nich, pět mělo jen starší zápis model-index v kartě a 35 nemělo ani jedno. U 31 z těch pětatřiceti visí otevřený návrh změny, jehož název mluví o výsledcích testů; u zbylých čtyř je štítek napsaný rovnou v kartě. Model tak nese označení a čísla, která jeho vydavatel nepřijal – u MiniMaxAI/MiniMax-M2 jsou to čtyři návrhy z ledna až března 2026 s výsledky HLE, MMLU-Pro, Terminal-Bench a SWE-bench Verified. Dokumentace s tím počítá: když je skóre sporné, může autor modelu návrh zavřít a tím ho ze stránky odstranit.

Většina čísel má zdroj mimo vlastní kartu

Mechanismus umí i to, kvůli čemu vznikl. Z 2 542 položek jich na vlastní kartu modelu odkazuje jen 307. Nejvíc jich vede jinam: 575 na Open ASR Leaderboard, který si vede sada hf-audio/open-asr-leaderboard, dalších 513 na samostatný web s výsledky testu ScreenSpot-Pro. V žebříčku terminal-bench-2.0 se vedle karet vydavatelů objevují odkazy na tbench.ai i na dvě práce na arXivu.

Právě proto je to prázdné pole verifyToken nepříjemné. Odkaz na cizí žebříček je doklad, který se dá otevřít a přečíst, jenže ho čtenář musí najít sám; známka „verified“ by tutéž informaci nesla rovnou v seznamu. Zatím platí, že štítek „leaderboard“ u modelu říká, že někdo číslo zapsal do souboru – ne že ho někdo změřil.

Zdroje

  • Evaluation Results – dokumentace Hugging Face Hubu, včetně tabulky známek a popisu pole verifyToken
  • Historie té stránky v repozitáři huggingface/hub-docs
  • Vlastní měření 4. září 2026 nad veřejným rozhraním Hubu: seznam sad se štítkem benchmark:eval-yaml, jejich eval.yaml, žebříčky všech 209 úloh a náhodný vzorek 150 modelů se štítkem eval-results

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    Experti uložení po čtyřech bitech tvoří 94 % vah DeepSeeku V4 Flash Vision

    DeepSeek nahrál 31. srpna 2026 na Hugging Face váhy experimentálního modelu DeepSeek-V4-Flash-Vision-Exp. Osmačtyřicet souborů má dohromady 167,8 GB a 93,8 % z toho…

  2. Čísla

    Zrychlení jádra Qwen-Image se v celém požadavku neprojevilo

    SGLang sloučil závěrečnou normalizaci a modulaci obrazového modelu Qwen-Image do jediného jádra. Samotná operace zrychlila podle délky vstupu 3,1krát až 5,6krát, deset…

  3. Čísla

    Sada Monsoon ukázala větší rozdíly mezi regiony Indie než mezi osmi modely přepisu řeči

    Hugging Face a Voice Arena přidaly do žebříčku Open ASR Leaderboard sady Monsoon pro indickou angličtinu a hindštinu. Každý klip v nich nese dvanáct údajů o mluvčím, a…

  4. Čísla

    Váhy modelu Hy4 preview se ani ve verzi FP8 nevejdou na osm karet po 80 GB

    Tencent nahrál na Hugging Face váhy vlajkového modelu Hy4 preview a dal je pod licenci Apache 2.0. Součet 131 souborů v repozitáři dá 1 560 GB, kvantizovaná verze FP8…