Přeskočit na obsah
Modely 4 min čtení

Institut IFM vydal u rodiny K2 Horizon 309 značek se stavy z průběhu trénování

Institute of Foundation Models při univerzitě MBZUAI zveřejnil 3. září 2026 šest modelů K2 Horizon pod licencí Apache 2.0. Vedle finálních vah nechal v repozitářích i stavy z průběhu trénování – k 5. září jich rozhraní Hugging Face vypisuje 309 značek a další přibývaly ještě dnes v noci. Karta modelu je přitom pořád slibuje v budoucím čase.

Sál superpočítače se stojany výpočetních uzlů
Superpočítač Kraken (Cray XT5) v Oak Ridge National Laboratory. Trénování se na takovém stroji ukládá po kontrolních bodech, aby šlo po výpadku pokračovat. Foto: Daderot, Wikimedia Commons (volné dílo)

Institute of Foundation Models, výzkumné pracoviště univerzity MBZUAI se sídlem v Abú Zabí a s pobočkami v Silicon Valley a Paříži, zveřejnil 3. září 2026 rodinu jazykových modelů K2 Horizon. Šest velikostí, od 0,9 miliardy parametrů po 375 miliard, všechny pod licencí Apache 2.0.

Zajímavější než ty modely je ale to, co leží vedle nich. Repozitáře na Hugging Face nenesou jen hotové váhy, ale i stavy, ve kterých byl model uprostřed trénování. K 5. září 2026 jich rozhraní vypisuje 309 v podobě značek a k tomu 43 pracovních větví mimo hlavní. Různých stavů je o kus méně: za těmi značkami stojí 290 různých commitů, protože závěrečná značka každé fáze ukazuje na tentýž snímek jako její poslední číslovaná.

Kontrolní bod je celý model, ne poznámka

Kontrolní bod (checkpoint) je snímek vah pořízený během trénování. Vydavatelé je běžně nezveřejňují – ven jde jen výsledek. Tady je každá značka plnohodnotný model: u K2-Horizon-MoVA-36B-A4B nese revize pretrain_100000 osmačtyřicet souborů s vahami, celkem 58 souborů, a stejných 37 444 792 020 parametrů jako hotový model.

Že to nejsou kopie téhož, se dá ověřit bez stahování. Hugging Face vrací u každého souboru hlavičku X-Linked-ETag s otiskem sha256. První ze čtyřiceti osmi dílů má ve značce pretrain_100000 otisk 4f02fec6… a délku 167 783 752 B, ve značce mid_1_final otisk 912e0904… a o osm bajtů víc, v hlavní větvi 47f00aa3… a o dalších osm bajtů víc. Tři různé soubory, tři různé stavy učení.

Značky nesou jméno fáze: pretrain_100000pretrain_1100000 pro předtrénování, mid_1mid_4 pro mezitrénování, sft_1sft_2 pro doladění na instrukce. Model 375B-A23B má navíc sft_3 a větev rl se zpevňovacím učením; nejmenší model rodiny má takové větve dvě, rlrl-mopd.

Stojí to místo. Podle údaje usedStorage zabírá šestice repozitářů 41 923 GB, tedy zhruba 41,9 TB, a samotný model 375B-A23B z toho má 34,7 TB. Hotové váhy modelu 36B-A4B přitom váží 74,9 GB. Součet je vlastní, ze šesti hodnot vrácených rozhraním.

Karta modelu slibuje to, co už v repozitáři leží

Karta modelu 36B-A4B mluví o mezistavech v budoucím čase: „We have released the final checkpoint; intermediate checkpoints, along with the data and the training code, will be released.“ Naposledy se ta karta upravovala 3. září ve 13.08. Značka mid_1_final v té chvíli v repozitáři visela od 7.15 a sft_1_final od 8.31 téhož dne.

Není to jen zaostalý text. Nahrávání opravdu ještě běží: větev pretrain dostala poslední soubor 4. září ve 22.38, mid_1 pak 5. září v 0.12 a mid_2 ve 3.59 ráno. Kdo se řídí kartou, čeká na něco, co si z větší části může stáhnout hned.

Manifest u vah jmenuje starší název architektury

V repozitáři 36B-A4B leží soubor migration_manifest.json, jaký u jiných modelů nebývá. Stojí v něm source_model_type: k2_aurora proti target_model_type: k2_horizon, jméno převodního skriptu convert_k2aurora_to_k2horizon.py a čas dokončení 1. září 2026 v 5.28 UTC. Architektura se tedy před vydáním jmenovala jinak.

Vah se to přejmenování nedotklo. Manifest má weights_reencoded: falseweight_mode: hardlink a otisk souboru model.safetensors.index.json uvádí shodný na straně zdroje i cíle (f5ce28dd…). Změnil se konfigurační soubor a kód modelu, 16 998 tenzorů zůstalo, jak bylo. Model jménem K2-Aurora přitom veřejně nikdy nevyšel – hledání na Hugging Face na to jméno nevrací nic.

Čísla, na kterých se vydavatel a recepty neshodnou

Jméno modelu i tabulka na jeho kartě uvádějí čtyři miliardy aktivních parametrů na token. Recept projektu vLLM u téhož modelu píše 5,95 miliardy. U většího modelu je rozdíl obdobný: oznámení mluví o „přibližně 23 miliardách“, přehled vLLM o 26,67 miliardy. Ani jedna strana neuvádí, co do součtu počítá.

Podobně u kontextového okna. Karta i konfigurační soubor uvádějí 524 288 tokenů, jenže spouštěcí příkaz na téže kartě i recept vLLM startují server s --max-model-len 131072, tedy se čtvrtinou. Nejmenší model rodiny má 131 072 tokenů rovnou v konfiguraci; oznámení u něj zmiňuje jen menší slovník (64 256 proti 250 624 tokenů), kratší okno ne.

Výsledky měření na kartě jsou měření vydavatele. IFM u modelu 36B-A4B uvádí 58,6 % na Terminal-Bench 2.1 a 80,8 % na GPQA Diamond, srovnávací hodnoty přebírá od Artificial Analysis a všechny běhy pouštěl s nastavením reasoning_effort="high". V několika řádcích té tabulky model prohrává s patnáctkrát větším Nemotronem 3 Ultra a u fyzikální sady CritPt dosáhly obě čísla jednotek procent. Nezávislé zopakování zatím nikde není, a žebříčky Hugging Face známku ověřeného měření nedávají ani jednomu z výsledků, které vedou.

Novou architekturu MoVA (Mixture-of-Value Attention), která posílá na experty i pozornost, ne jen dopřednou vrstvu jako běžný MoE, má z šesti modelů jediný: ten, co ji nese ve jméně. U zbylých pěti stojí v konfiguraci mova_num_experts: 0. Zbytek rodiny sdílí slovník, délku okna i postup trénování a liší se počtem vrstev a tím, jestli je řídký, nebo hustý.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Hlídač bezpečnosti k modelům Ling 3.0 stojí na jediné vrstvě pozornosti

    Ant Group vydal 1. září 2026 dvě sady vah pod jménem SingProbe. Nejsou to samostatné modely: napojí se na běžící Ling 3.0, odečtou mu skryté stavy ze tří vrstev a ke…

  2. Modely

    Destilovaný videomodel FastH3 nese strojově čitelný doklad o svém vzniku

    FastVideo zveřejnil čtyřkrokovou destilaci videomodelu MiniMax H3 a přiložil k ní soubor provenance.json: revizi základních vah, číslo kroku trénování, otisky sha256 i…

  3. Modely

    Smíšená kvantizace zmenšila váhy Qwen3.8-27B na 8,4 gigabajtu

    DASLab při IST Austria zveřejnila tři kvantizace modelu Qwen3.8-27B. Každému velkému tenzoru přidělují přesnost zvlášť, takže nejmenší jazykové váhy zabírají 8,4 GB…

  4. Modely

    Na vlastním testu Pipecatu vyskočil doladěný Nemotron 3 Nano z 28,6 na 72,3 procenta

    Tým Pipecat vydal PhoneLLM Alpha 1, plné doladění modelu NVIDIA Nemotron 3 Nano 30B-A3B na telefonní hovory. Na vlastním žebříčku PhoneBench mu skóre stouplo z 28,6 na…