Váhy modelu Hy4 preview se ani ve verzi FP8 nevejdou na osm karet po 80 GB
Tencent nahrál na Hugging Face váhy vlajkového modelu Hy4 preview a dal je pod licenci Apache 2.0. Součet 131 souborů v repozitáři dá 1 560 GB, kvantizovaná verze FP8 zabere 813,8 GB. Návod k nasazení z karty modelu přitom počítá s osmi kartami, na kterých musí být přes 94 GiB paměti.

Tencent nahrál 27. srpna 2026 na Hugging Face váhy modelu Hy4 preview a o pět minut později i jeho kvantizovanou verzi Hy4 preview-FP8. Je to model se směsí expertů: v každé vrstvě sedí několik samostatných podsítí a pro každý token se z nich vybere jen hrstka. Karta modelu uvádí 770 miliard parametrů, z nichž se na token zapojí 49 miliard. Obě čísla po přepočtu sedí, a právě rozdíl mezi nimi rozhoduje o tom, na čem model poběží.
Kolik váží soubory
Rozhraní Hugging Face vydá u každého souboru v repozitáři jeho velikost, takže se váhy dají sečíst bez stahování. Hlavní repozitář má 131 souborů .safetensors a dohromady 1 559 983 809 380 bajtů, tedy 1 560 GB neboli 1 452,8 GiB. Verze FP8 má 130 souborů a 813,8 GB, tedy 757,9 GiB. Obojí je vlastní součet z výpisu repozitáře, ne údaj z karty modelu.
Na dnešní poměry to není nic nevídaného. Kimi K3 má i v jednobitové kvantizaci 594 GB vah a K-EXAONE 2.0 od LG má 1,5 TB vah. Hy4 preview je v horním pásmu toho, co se dá stáhnout, ne mimo něj.
Osm karet po 80 GB nestačí
Karta modelu nabízí dvě cesty k nasazení a obě spouštějí verzi FP8 na osmi kartách: vLLM s přepínačem --tensor-parallel-size 8, SGLang s --tp-size 8. Rozdělením 757,9 GiB na osm dílů vyjde 94,7 GiB na kartu, a to jen na váhy. KV cache ani aktivace v tom nejsou. Karta s 80 GB paměti, jako je H100, na to nestačí.
Projekt vLLM to na stránce svého receptu říká rovnou: model tam vede jako „770B/49B on 16xB200, 8xB300“ a dodává, že recept ověřoval na kartách B300. Ty mají podle jeho vlastní tabulky 268 GB paměti na kus, B200 má 180 GB. U varianty BF16 uvádí vLLM 1 848 GB a u kvantizované 924 GB; u té první k tomu píše, že jde o váhy i KV cache dohromady. Samotné soubory jsou o 288, respektive o 110 GB lehčí.
Šestadevadesát procent vah drží experti
Odkud se ta hmota bere, se dá přečíst z hlaviček souborů. Formát safetensors nese na začátku každého souboru délku hlavičky a za ní JSON se jménem a tvarem každého tenzoru, takže stačí rozsahový dotaz na začátek souboru. Experti jsou v Hy4 preview poskládaní do dvou tenzorů na vrstvu: down_proj má tvar [256, 6144, 2048] a gate_up_proj tvar [256, 4096, 6144].
Na jednoho experta tedy připadá 37 748 736 parametrů a na jednu vrstvu 256krát tolik, tedy 9,66 miliardy. Takových bloků je v repozitáři 78, protože kromě sedmasedmdesáti řídkých vrstev páteře má vlastní sadu expertů i vrstva, která předpovídá další token. Dohromady je to 753,8 miliardy parametrů, tedy 96,6 % všech vah. Na pozornost, sdílené experty, první hustou vrstvu, slovník a normalizace zbývá 26,2 miliardy.
Na jeden token se z každé řídké vrstvy zapojí osm expertů z 256, dohromady 23,3 miliardy parametrů. Se zbytkem páteře to dá 49,06 miliardy, takže údaj 49 miliard z karty modelu sedí. Sedí i těch 770 miliard: součet bez vrstvy pro předpověď dá 769,9 miliardy a ta vrstva sama 10,05 miliardy.
Poměr mezi vším a aktivním je tedy 1 : 15,9. Na každý parametr, který se u daného tokenu opravdu počítá, jich dalších skoro patnáct leží v paměti a čeká, jestli na ně přijde řada. Počítá se v něm jako v padesátimiliardovém modelu, ale do paměti se musí vejít osmisetmiliardový.
Licence je Apache 2.0, i v souboru
Kolonka na kartě modelu hlásí apache-2.0 a soubor LICENSE to potvrzuje. Po třech řádcích od Tencentu následuje doslovný text licence Apache 2.0, bez prahu tržeb, bez omezení území a bez pravidel přijatelného užití. Zrcadlo na GitHubu má týž soubor, jen ho rozhraní GitHubu nepojmenuje a vrací u něj jen „Other“.
U předchozí generace to bylo jinak. Licence náhledu Hy3 preview je vlastní smlouva Tencent Hy Community License Agreement s datem vydání 23. dubna 2026 a hned ve třetím řádku říká, že neplatí v Evropské unii, Spojeném království a Jižní Koreji. Hotový Hy3 z července už má Apache 2.0 a Hy4 preview v tom pokračuje. Vyloučení Evropské unie z licence není v oboru ojedinělé, stejnou hranici má třeba videomodel MiniMax H3.
Čísla o schopnostech jsou zatím jen od výrobce
Tencent v kartě modelu popisuje slepé srovnání, ve kterém 163 jeho interních odborníků hodnotilo výstupy na 203 inženýrských úlohách. Hy4 preview z něj vyšel s průměrem 2,99 proti 2,92 u GLM 5.3 a 2,94 u Kimi K3. Měřil to výrobce, na vlastních lidech a vlastních úlohách, a nikdo jiný to zatím nezopakoval. Karta modelu sama v oddílu o známých omezeních uvádí, že model nad složitou úlohou stráví víc času, než je nutné, a má sklon vlastní práci znovu ověřovat.
Kdo nemá osm karet B300, může model zkusit přes rozhraní. Na OpenRouteru ho k 28. srpnu 2026 nabízí jediný poskytovatel, a je jím sám Tencent: 0,834 dolaru za milion tokenů na vstupu, 2,501 dolaru za milion na výstupu, kvantizace fp8 a okno 1 048 576 tokenů.
Zdroje
- Karta modelu Hy4 preview, její
config.jsona soubor LICENSE, Hugging Face - Hy4 preview-FP8 a LICENSE modelu Hy3 preview, Hugging Face
- Recept pro tencent/Hy4-preview, vLLM, aktualizováno 28. srpna 2026
- Tencent-Hunyuan/Hy4-preview, GitHub
- Tencent: Hy4 preview, OpenRouter, ceny odečtené 28. srpna 2026
- Součty velikostí souborů, podíl expertů na vahách i počet aktivních parametrů jsou vlastní výpočty z výpisu repozitářů, z hlaviček souborů
.safetensorsa z polímlp_layer_types,n_routed_expertsanum_experts_per_tokvconfig.json.