Tabulka n-gramů drží ve vahách Qwen3.8-Flash-Next 51 miliard parametrů
Qwen zveřejnil váhy Qwen3.8-Flash-Next, na kterých chce postavit příští generaci svých modelů. Soubory nesou 179 999 981 459 parametrů a zaberou 360 GB. Přes 51 miliard z toho ale nic nepočítá: je to vyhledávací tabulka, kterou jde odsunout do operační paměti serveru.

Repozitář Qwen/Qwen3.8-Flash-Next vznikl na Hugging Face 24. srpna 2026, oznámení k němu vyšlo o dva dny později. Qwen ho popisuje jako časný náhled architektury, na které má stát řada Qwen4 – tedy stejnou roli, jakou před rokem sehrál Qwen3-Next pro řadu Qwen3.5. Model bere na vstupu text i obrázky, nativně zvládá 262 144 tokenů kontextu a metodou YaRN se dá roztáhnout na milion.
Co v těch souborech doopravdy je
Váhy jsou rozsekané do 131 souborů. Jejich soupis model.safetensors.index.json uvádí total_size 359 999 963 128 bajtů, tedy 360 GB, a rozhraní Hugging Face k nim hlásí 179 999 981 459 parametrů. Každý soubor .safetensors nese v prvních bajtech hlavičku se jménem a tvarem každého tenzoru, takže se dá spočítat, kam ty parametry padnou, aniž se stáhne jediný gigabajt vah.
| část modelu | parametrů | podíl |
|---|---|---|
| experti MoE | 120,80 mld | 67,1 % |
| tabulka n-gramů | 51,20 mld | 28,4 % |
| modul MTP | 2,61 mld | 1,4 % |
| Gated DeltaNet | 2,09 mld | 1,2 % |
| vstupní a výstupní slovník | 1,27 mld | 0,7 % |
| gated residual | 0,64 mld | 0,4 % |
| řídká pozornost QSA | 0,62 mld | 0,3 % |
| obrazový kodér | 0,45 mld | 0,2 % |
| sdílený expert | 0,24 mld | 0,1 % |
Součet sedí na poslední jednotku s číslem, které hlásí Hugging Face. Je to vlastní výpočet z hlaviček všech 131 souborů.
Padesát jedna miliard je jedna tabulka
Druhý řádek té tabulky stojí za řeč. Tenzory se jmenují ngram_embedding.shard_0 až shard_127, každý má 2 500 012 řádků po 160 číslech a všech 128 dílů sedí u jediné vrstvy blízko začátku sítě. Dohromady 320 001 536 řádků a 51 200 245 760 parametrů. V BF16 zabere 102,4 GB – do operační paměti serveru se to vejde, na akcelerátoru je to místo, které by jinak patřilo expertům.
Karta modelu k tomu uvádí slovník 20 milionů n-gramů, konfigurace osm hlav na n-gram a řeč je o bigramech i trigramech – dvacet milionů krát osm hlav krát dva řády dá 320 milionů řádků. V souborech jich je o 1 536 víc, protože se slovník zarovnává nahoru.
Rozdíl proti expertům MoE je v tom, co se s takovou tabulkou dělá. Nevynásobí se, jen se z ní podle několika předchozích tokenů vyzvedne pár řádků. Adresy jsou navíc známé dopředu, takže Qwen tabulku pokládá za součást vah, kterou lze držet v operační paměti hostitele a přednačítat ji souběžně s počítáním. Server SGLang na to má přepínač --ple-offload-embedding, který ji odsune do připnuté paměti procesoru a tahá ji vedlejším proudem CUDA; u vah v BF16 na kartách NVIDIA se zapíná sám. Na kartách pak zbyde 128,8 miliardy parametrů, tedy 257,6 GB.
Na token se použije šest miliard
Model má 48 vrstev, skrytý rozměr 2 560 a 512 expertů, z nichž se na token pustí deset plus jeden sdílený. Tři ze čtyř vrstev jsou Gated DeltaNet, čtvrtá počítá řídkou pozornost QSA – v konfiguraci je to 36 lineárních vrstev proti dvanácti s plnou pozorností.
Kolik z těch 180 miliard se na jeden token opravdu vynásobí, jde dopočítat: deset z 512 expertů dá napříč vrstvami 2,36 miliardy, k tomu sdílený expert 0,24, Gated DeltaNet 2,09, řídká pozornost 0,62, gated residual 0,64 a směrovač 0,06. Dohromady 6,0 miliardy, což je přesně číslo, které Qwen uvádí jako počet aktivovaných parametrů. Vlastní přepočet mu tedy dává za pravdu.
Čím se to dá spustit
V konfiguraci stojí architektura Qwen4ExpForConditionalGeneration, kterou vydané verze knihovny Transformers do 26. srpna neznaly. Přidal ji návrh změny 48337 sloučený 26. srpna 2026 ve 12:03 UTC a vydání v5.16.0, které vyšlo o dvaatřicet minut později, už příslušné soubory obsahuje.
Server SGLang dostal kuchařku k modelu týž den, jeho návod ale zatím posílá uživatele stavět podporu z větve, protože ve vydané verzi není. Ověřených sestav je v ní dvaadvacet a všechny se vejdou do jednoho stroje: BF16 i FP8 běží na čtyřech kartách, na akcelerátorech AMD na osmi, a po kvantizaci do NVFP4 na jediné kartě Blackwell. Qwen vedle výchozích vah vydal i variantu Qwen3.8-Flash-Next-FP8; má tytéž parametry, ale 174,5 miliardy z nich je v osmibitovém formátu, takže soubory spadnou na 185,5 GB.
Licence a cena
Soubor LICENSE v repozitáři nese Qwen Community License 1.0. Otevřený zdroj to není: kdo modelem obslouží produkt s víc než 100 miliony uživatelů měsíčně nebo 20 miliony dolarů měsíčních tržeb, musí jméno modelu viditelně uvést v jeho rozhraní, a kdo provozuje pronájem modelu jako služby nebo asistenta pro programování a kancelářskou práci, potřebuje od Qwenu licenci zvlášť. Vlastní licenci má Qwen na svých vahách od letošního srpna, dřív vydával pod Apache 2.0.
Hostovanou obdobu pod jménem Qwen3.8-Flash chce Qwen prodávat za 0,16 USD za milion vstupních tokenů a 0,47 USD za milion výstupních. Zatím jde o ohlášenou cenu: oznámení samo píše, že rozhraní teprve přijde, a stránka toho modelu na webu Qwen Cloudu vrací 404.
Co z toho plyne
Srovnávací tabulka v oznámení vede Qwen3.8-Flash-Next jako model se 125 miliardami parametrů a tabulku n-gramů má v samostatném řádku. Číslo v první řádce tedy neříká, kolik se toho musí stáhnout ani kolik paměti to spolyká – to řeknou až soubory samotné, a u nich vychází 360 GB. Výsledky testů, kterými Qwen model doprovodil, měřil zatím jen on sám.
Zdroje
- Karta modelu Qwen3.8-Flash-Next a její soubor LICENSE, Hugging Face
- Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency, Qwen, 26. srpna 2026
- Add Qwen4Exp model, návrh změny v knihovně Transformers
- Add Qwen3.8-Flash-Next cookbook, návrh změny v serveru SGLang
- Rozpad parametrů je vlastní výpočet z hlaviček 131 souborů
.safetensorsa ze souboruconfig.jsonv repozitáři modelu.