Přeskočit na obsah
Čísla 4 min čtení

Váhy modelu Hy4 preview se ani ve verzi FP8 nevejdou na osm karet po 80 GB

Tencent nahrál na Hugging Face váhy vlajkového modelu Hy4 preview a dal je pod licenci Apache 2.0. Součet 131 souborů v repozitáři dá 1 560 GB, kvantizovaná verze FP8 zabere 813,8 GB. Návod k nasazení z karty modelu přitom počítá s osmi kartami, na kterých musí být přes 94 GiB paměti.

Řada skříní superpočítače v sále
Váhy Hy4 preview zaberou i ve formátu FP8 757,9 GiB, takže osm karet po 80 GB na ně nestačí. Foto: Oak Ridge National Laboratory, Wikimedia Commons (CC BY 2.0)

Tencent nahrál 27. srpna 2026 na Hugging Face váhy modelu Hy4 preview a o pět minut později i jeho kvantizovanou verzi Hy4 preview-FP8. Je to model se směsí expertů: v každé vrstvě sedí několik samostatných podsítí a pro každý token se z nich vybere jen hrstka. Karta modelu uvádí 770 miliard parametrů, z nichž se na token zapojí 49 miliard. Obě čísla po přepočtu sedí, a právě rozdíl mezi nimi rozhoduje o tom, na čem model poběží.

Kolik váží soubory

Rozhraní Hugging Face vydá u každého souboru v repozitáři jeho velikost, takže se váhy dají sečíst bez stahování. Hlavní repozitář má 131 souborů .safetensors a dohromady 1 559 983 809 380 bajtů, tedy 1 560 GB neboli 1 452,8 GiB. Verze FP8 má 130 souborů a 813,8 GB, tedy 757,9 GiB. Obojí je vlastní součet z výpisu repozitáře, ne údaj z karty modelu.

Na dnešní poměry to není nic nevídaného. Kimi K3 má i v jednobitové kvantizaci 594 GB vahK-EXAONE 2.0 od LG má 1,5 TB vah. Hy4 preview je v horním pásmu toho, co se dá stáhnout, ne mimo něj.

Osm karet po 80 GB nestačí

Karta modelu nabízí dvě cesty k nasazení a obě spouštějí verzi FP8 na osmi kartách: vLLM s přepínačem --tensor-parallel-size 8, SGLang s --tp-size 8. Rozdělením 757,9 GiB na osm dílů vyjde 94,7 GiB na kartu, a to jen na váhy. KV cache ani aktivace v tom nejsou. Karta s 80 GB paměti, jako je H100, na to nestačí.

Projekt vLLM to na stránce svého receptu říká rovnou: model tam vede jako „770B/49B on 16xB200, 8xB300“ a dodává, že recept ověřoval na kartách B300. Ty mají podle jeho vlastní tabulky 268 GB paměti na kus, B200 má 180 GB. U varianty BF16 uvádí vLLM 1 848 GB a u kvantizované 924 GB; u té první k tomu píše, že jde o váhy i KV cache dohromady. Samotné soubory jsou o 288, respektive o 110 GB lehčí.

Šestadevadesát procent vah drží experti

Odkud se ta hmota bere, se dá přečíst z hlaviček souborů. Formát safetensors nese na začátku každého souboru délku hlavičky a za ní JSON se jménem a tvarem každého tenzoru, takže stačí rozsahový dotaz na začátek souboru. Experti jsou v Hy4 preview poskládaní do dvou tenzorů na vrstvu: down_proj má tvar [256, 6144, 2048] a gate_up_proj tvar [256, 4096, 6144].

Na jednoho experta tedy připadá 37 748 736 parametrů a na jednu vrstvu 256krát tolik, tedy 9,66 miliardy. Takových bloků je v repozitáři 78, protože kromě sedmasedmdesáti řídkých vrstev páteře má vlastní sadu expertů i vrstva, která předpovídá další token. Dohromady je to 753,8 miliardy parametrů, tedy 96,6 % všech vah. Na pozornost, sdílené experty, první hustou vrstvu, slovník a normalizace zbývá 26,2 miliardy.

Na jeden token se z každé řídké vrstvy zapojí osm expertů z 256, dohromady 23,3 miliardy parametrů. Se zbytkem páteře to dá 49,06 miliardy, takže údaj 49 miliard z karty modelu sedí. Sedí i těch 770 miliard: součet bez vrstvy pro předpověď dá 769,9 miliardy a ta vrstva sama 10,05 miliardy.

Poměr mezi vším a aktivním je tedy 1 : 15,9. Na každý parametr, který se u daného tokenu opravdu počítá, jich dalších skoro patnáct leží v paměti a čeká, jestli na ně přijde řada. Počítá se v něm jako v padesátimiliardovém modelu, ale do paměti se musí vejít osmisetmiliardový.

Licence je Apache 2.0, i v souboru

Kolonka na kartě modelu hlásí apache-2.0soubor LICENSE to potvrzuje. Po třech řádcích od Tencentu následuje doslovný text licence Apache 2.0, bez prahu tržeb, bez omezení území a bez pravidel přijatelného užití. Zrcadlo na GitHubu má týž soubor, jen ho rozhraní GitHubu nepojmenuje a vrací u něj jen „Other“.

U předchozí generace to bylo jinak. Licence náhledu Hy3 preview je vlastní smlouva Tencent Hy Community License Agreement s datem vydání 23. dubna 2026 a hned ve třetím řádku říká, že neplatí v Evropské unii, Spojeném království a Jižní Koreji. Hotový Hy3 z července už má Apache 2.0 a Hy4 preview v tom pokračuje. Vyloučení Evropské unie z licence není v oboru ojedinělé, stejnou hranici má třeba videomodel MiniMax H3.

Čísla o schopnostech jsou zatím jen od výrobce

Tencent v kartě modelu popisuje slepé srovnání, ve kterém 163 jeho interních odborníků hodnotilo výstupy na 203 inženýrských úlohách. Hy4 preview z něj vyšel s průměrem 2,99 proti 2,92 u GLM 5.3 a 2,94 u Kimi K3. Měřil to výrobce, na vlastních lidech a vlastních úlohách, a nikdo jiný to zatím nezopakoval. Karta modelu sama v oddílu o známých omezeních uvádí, že model nad složitou úlohou stráví víc času, než je nutné, a má sklon vlastní práci znovu ověřovat.

Kdo nemá osm karet B300, může model zkusit přes rozhraní. Na OpenRouteru ho k 28. srpnu 2026 nabízí jediný poskytovatel, a je jím sám Tencent: 0,834 dolaru za milion tokenů na vstupu, 2,501 dolaru za milion na výstupu, kvantizace fp8 a okno 1 048 576 tokenů.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    OpenAI uvádí u čipu Jalapeño až 1,9krát více práce na watt

    První vlastní čip OpenAI pro běh modelů má podle výsledků výrobce zvládnout 1,5 až 1,9krát více práce na watt než srovnávané systémy Nvidia. Při stejné práci by to…

  2. Čísla

    Tabulka n-gramů drží ve vahách Qwen3.8-Flash-Next 51 miliard parametrů

    Qwen zveřejnil váhy Qwen3.8-Flash-Next, na kterých chce postavit příští generaci svých modelů. Soubory nesou 179 999 981 459 parametrů a zaberou 360 GB. Přes 51 miliard…

  3. U sebe doma

    SGLang odstranil přepínač pro kvantizaci, který v devíti vydáních jen hlásil chybu

    Přepínač --torchao-config končil v SGLangu chybou ImportError, ať mu uživatel předal kteroukoli z povolených hodnot. Rozbil ho skok verze knihovny torchao, který se…

  4. Čísla

    LiteLLM počítal úsporu z mezipaměti bez ceny jejího zápisu

    LiteLLM až do verze 1.98.0 přičítal úsporu za tokeny načtené z mezipaměti, ale neodečetl příplatek za její vytvoření. U zápisu 20 000 tokenů pro Claude Sonnet 4.5 tak…