Přeskočit na obsah
Čísla 4 min čtení

Test agentů nechal na Hugging Face 205 stejnojmenných modelů, 107 za tři dny

Sada úloh Toolathlon nechává agenta nahrát model na Hugging Face pod pevným jménem MyAwesomeModel-TestRepo. Úklid je ale zapsaný v přípravě před testem, ne za ním, takže repozitáře zůstávají veřejně stát. K 31. červenci jich pod tím jménem bylo 205, každý od jiného účtu.

Zasuvky listkoveho katalogu v knihovne
Lístkový katalog Univerzitní knihovny v Göteborgu. Foto: Alicia Fagerving, Wikimedia Commons (CC BY-SA 3.0)

Kdo si na Hugging Face vypíše nově založené modely, narazí na podivnou řadu. Desítky repozitářů se shodným jménem MyAwesomeModel-TestRepo, každý pod jiným účtem, každý založený a naposledy změněný v tutéž minutu. Účty se jmenují sdfsgg5667, asfafq3f nebo ewqefee. Nejde o spam ani o útok. Je to stopa po testu, který někdo pustil a po kterém se v katalogu neuklízí.

Zadání zní: nahraj model pod tímhle jménem

Zdrojem je Toolathlon, sada úloh pro měření agentů, kterou vydala skupina hkust-nlp. Agent v ní nedostává hádanku, ale práci: obsluhuje poštu, tabulky, Kubernetes, obchod WooCommerce nebo systém pro výuku. Úloh je v závěrečné sadě 108 a konfigurací pro připojené služby 34. Práce k ní vyšla na arXivu 29. října 2025 a autoři ji v popisu repozitáře označují za přijatou na konferenci ICLR 2026.

Jedna z úloh se jmenuje huggingface-upload. Její zadání říká agentovi, ať projde pracovní adresář, vybere kontrolní bod modelu s nejlepší úspěšností a nahraje ho na Hugging Face jako repozitář „named MyAwesomeModel-TestRepo“, tedy pod přesně tímhle jménem. Přeloženo: úloha jméno nenechává na agentovi, protože se pak podle něj vyhodnocuje.

Úklid běží před testem, ne po něm

Úloha má i úklidovou část, jenže je zapsaná v souboru preprocess/main.py, který se pouští před během. Funkce se jmenuje remote_cleanup, vypíše „Checking for and deleting pre-existing repository“ a zavolá delete_repo. Vyhodnocovací skript, který se pouští po běhu, repozitář jen stáhne a porovná s předlohou. Nemaže nic.

Z toho plyne pořadí, které rozhoduje o celém zbytku: repozitář zmizí teprve tehdy, když tentýž účet pustí tutéž úlohu znovu. Kdo ji pustí jednou, nechá po sobě veřejný záznam v katalogu modelů natrvalo. A kdo si při druhém pokusu jméno pozmění – na -v2, -final nebo s časovým razítkem –, obejde tím i ten úklid, protože maže se jen přesná shoda.

Kolik jich je

Čísla níž jsou naše měření z veřejného rozhraní Hugging Face, dotaz api/models?search=MyAwesomeModel-TestRepo&limit=1000, 31. července 2026 kolem 12:15 UTC. Hledání vrátilo 256 repozitářů.

  • 205 z nich má jméno přesně MyAwesomeModel-TestRepo – a patří 205 různým účtům, tedy na každý účet jeden.
  • Zbylých 51 jsou obměny: -v2-v6, -final, -20251202_223813 nebo náhodná osmiznaková přípona.
  • Nejstarší je z 25. listopadu 2025, v samotném červenci jich vzniklo 150.
  • Za poslední tři dny (29. až 31. července, poslední den do poledne) přibylo 107: třináct, třicet a čtyřiašedesát.
  • Součet stažení u těch 205 repozitářů je 53 639.

Jedna výhrada k těm číslům patří rovnou: spojení s Toolathlonem stojí na jménu, které jeho zadání předepisuje. Že žádný z těch repozitářů nevznikl jinak, se z veřejných dat dokázat nedá. U čtyř, které jsme otevřeli, ale soubory předloze z úlohy odpovídají do bajtu.

Druhý pohled na totéž. Vypsali jsme si 1 000 posledních modelů založených na Hugging Face; vešly se do okna mezi 5:29 a 12:14 UTC téhož dne, což vychází na zhruba dva a půl nového modelu za minutu. Z té tisícovky jich 55 neslo jméno z téhle úlohy. To je 5,5 % všeho, co za těch necelých sedm hodin v katalogu přibylo.

Co v těch repozitářích stojí

Otevřít se dá kterýkoli, protože jsou všechny veřejné. Jeden z dnešních obsahuje sedm souborů. Váhy modelu, tedy pytorch_model.bin, mají 23 bajtů a stojí v nich text ...dummy binary data.... Soubor config.json má 66 bajtů a hlásí architekturu BERT. Tři obrázky mají po 410 bajtech.

Zajímavější je karta modelu. Má 7 530 bajtů, je psaná ve stylu ohlášení skutečného modelu a obsahuje tabulku s patnácti testy – matematická úvaha 0,550, generování kódu 0,650, bezpečnostní hodnocení 0,739. V úvodu tvrdí, že úspěšnost v testu AIME 2025 stoupla proti předchozí verzi ze 70 % na 87,5 %. Všechna ta čísla jsou součástí zadání: agent je má opsat z pracovního adresáře a vyhodnocení kontroluje, jestli je opsal přesně. Se skutečným měřením nemají nic společného.

Pro čtenáře to znamená jedinou praktickou věc: kdo prochází Hugging Face strojově – filtrem, dotazem přes rozhraní nebo agentem, jako v našem textu o licenčních štítcích –, dostane mezi výsledky i dvě stě karet s vymyšlenými výsledky testů, které vypadají jako opravdové.

Chyba to podle nás není, ale pořadí kroků ano

Sada úloh je míněná vážně a dělá věc, kterou umělé prostředí nedokáže: zkouší agenta na skutečných službách, se skutečnými přihlašovacími údaji a skutečnými následky. Autoři navíc nabízejí i variantu, kdy testy běží na jejich vlastních serverech a s jejich účty, takže nikdo nic zakládat nemusí. Kdo si prostředí staví sám, ten podle návodu potřebuje mimo jiné jeden vlastní účet na Hugging Face. Že se právě tenhle účet stane veřejným počítadlem spuštění, návod neuvádí.

Náš názor: řešení je drobné a je na straně sady úloh – zavolat mazání i po vyhodnocení, ne jen před ním. Dokud se to nestane, roste ve veřejném katalogu modelů řada záznamů, jejichž počet neměří nic o modelech, ale to, kolikrát někdo pustil jeden konkrétní test.

Souvislost je širší, než vypadá. Testovací prostředí, které sahá na živé služby, po sobě něco nechává vždycky; u úniků z testů modelů Anthropicu to byl balíček ve veřejném úložišti, tady je to řádka v katalogu. V obou případech rozhoduje, jestli někdo napsal krok, který to po testu smaže.

Zdroje: repozitář Toolathlonu včetně zadání úlohy a úklidového skriptu, práce na arXivu a vlastní měření nad veřejným rozhraním Hugging Face z 31. července 2026.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    llama.cpp vydal za třicet dnů 229 verzí. U kritické díry se dva záznamy liší o 501 buildů

    Knihovna llama.cpp, na které stojí většina domácího provozu jazykových modelů, vydala mezi 1. a 30. červencem 2026 dvě stě dvacet devět verzí. Číslo v jejich názvu…