Přeskočit na obsah
Čísla 4 min čtení

Tabulka n-gramů drží ve vahách Qwen3.8-Flash-Next 51 miliard parametrů

Qwen zveřejnil váhy Qwen3.8-Flash-Next, na kterých chce postavit příští generaci svých modelů. Soubory nesou 179 999 981 459 parametrů a zaberou 360 GB. Přes 51 miliard z toho ale nic nepočítá: je to vyhledávací tabulka, kterou jde odsunout do operační paměti serveru.

Serverový paměťový modul DDR5 RDIMM od Micronu s kapacitou 64 GiB
Serverový modul DDR5 RDIMM o kapacitě 64 GiB. Tabulka n-gramů z Qwen3.8-Flash-Next se v BF16 vejde do dvou takových. Foto: PantheraLeo1359531, Wikimedia Commons (CC BY 4.0)

Repozitář Qwen/Qwen3.8-Flash-Next vznikl na Hugging Face 24. srpna 2026, oznámení k němu vyšlo o dva dny později. Qwen ho popisuje jako časný náhled architektury, na které má stát řada Qwen4 – tedy stejnou roli, jakou před rokem sehrál Qwen3-Next pro řadu Qwen3.5. Model bere na vstupu text i obrázky, nativně zvládá 262 144 tokenů kontextu a metodou YaRN se dá roztáhnout na milion.

Co v těch souborech doopravdy je

Váhy jsou rozsekané do 131 souborů. Jejich soupis model.safetensors.index.json uvádí total_size 359 999 963 128 bajtů, tedy 360 GB, a rozhraní Hugging Face k nim hlásí 179 999 981 459 parametrů. Každý soubor .safetensors nese v prvních bajtech hlavičku se jménem a tvarem každého tenzoru, takže se dá spočítat, kam ty parametry padnou, aniž se stáhne jediný gigabajt vah.

část modeluparametrůpodíl
experti MoE120,80 mld67,1 %
tabulka n-gramů51,20 mld28,4 %
modul MTP2,61 mld1,4 %
Gated DeltaNet2,09 mld1,2 %
vstupní a výstupní slovník1,27 mld0,7 %
gated residual0,64 mld0,4 %
řídká pozornost QSA0,62 mld0,3 %
obrazový kodér0,45 mld0,2 %
sdílený expert0,24 mld0,1 %

Součet sedí na poslední jednotku s číslem, které hlásí Hugging Face. Je to vlastní výpočet z hlaviček všech 131 souborů.

Padesát jedna miliard je jedna tabulka

Druhý řádek té tabulky stojí za řeč. Tenzory se jmenují ngram_embedding.shard_0shard_127, každý má 2 500 012 řádků po 160 číslech a všech 128 dílů sedí u jediné vrstvy blízko začátku sítě. Dohromady 320 001 536 řádků a 51 200 245 760 parametrů. V BF16 zabere 102,4 GB – do operační paměti serveru se to vejde, na akcelerátoru je to místo, které by jinak patřilo expertům.

Karta modelu k tomu uvádí slovník 20 milionů n-gramů, konfigurace osm hlav na n-gram a řeč je o bigramech i trigramech – dvacet milionů krát osm hlav krát dva řády dá 320 milionů řádků. V souborech jich je o 1 536 víc, protože se slovník zarovnává nahoru.

Rozdíl proti expertům MoE je v tom, co se s takovou tabulkou dělá. Nevynásobí se, jen se z ní podle několika předchozích tokenů vyzvedne pár řádků. Adresy jsou navíc známé dopředu, takže Qwen tabulku pokládá za součást vah, kterou lze držet v operační paměti hostitele a přednačítat ji souběžně s počítáním. Server SGLang na to má přepínač --ple-offload-embedding, který ji odsune do připnuté paměti procesoru a tahá ji vedlejším proudem CUDA; u vah v BF16 na kartách NVIDIA se zapíná sám. Na kartách pak zbyde 128,8 miliardy parametrů, tedy 257,6 GB.

Na token se použije šest miliard

Model má 48 vrstev, skrytý rozměr 2 560 a 512 expertů, z nichž se na token pustí deset plus jeden sdílený. Tři ze čtyř vrstev jsou Gated DeltaNet, čtvrtá počítá řídkou pozornost QSA – v konfiguraci je to 36 lineárních vrstev proti dvanácti s plnou pozorností.

Kolik z těch 180 miliard se na jeden token opravdu vynásobí, jde dopočítat: deset z 512 expertů dá napříč vrstvami 2,36 miliardy, k tomu sdílený expert 0,24, Gated DeltaNet 2,09, řídká pozornost 0,62, gated residual 0,64 a směrovač 0,06. Dohromady 6,0 miliardy, což je přesně číslo, které Qwen uvádí jako počet aktivovaných parametrů. Vlastní přepočet mu tedy dává za pravdu.

Čím se to dá spustit

V konfiguraci stojí architektura Qwen4ExpForConditionalGeneration, kterou vydané verze knihovny Transformers do 26. srpna neznaly. Přidal ji návrh změny 48337 sloučený 26. srpna 2026 ve 12:03 UTC a vydání v5.16.0, které vyšlo o dvaatřicet minut později, už příslušné soubory obsahuje.

Server SGLang dostal kuchařku k modelu týž den, jeho návod ale zatím posílá uživatele stavět podporu z větve, protože ve vydané verzi není. Ověřených sestav je v ní dvaadvacet a všechny se vejdou do jednoho stroje: BF16 i FP8 běží na čtyřech kartách, na akcelerátorech AMD na osmi, a po kvantizaci do NVFP4 na jediné kartě Blackwell. Qwen vedle výchozích vah vydal i variantu Qwen3.8-Flash-Next-FP8; má tytéž parametry, ale 174,5 miliardy z nich je v osmibitovém formátu, takže soubory spadnou na 185,5 GB.

Licence a cena

Soubor LICENSE v repozitáři nese Qwen Community License 1.0. Otevřený zdroj to není: kdo modelem obslouží produkt s víc než 100 miliony uživatelů měsíčně nebo 20 miliony dolarů měsíčních tržeb, musí jméno modelu viditelně uvést v jeho rozhraní, a kdo provozuje pronájem modelu jako služby nebo asistenta pro programování a kancelářskou práci, potřebuje od Qwenu licenci zvlášť. Vlastní licenci má Qwen na svých vahách od letošního srpna, dřív vydával pod Apache 2.0.

Hostovanou obdobu pod jménem Qwen3.8-Flash chce Qwen prodávat za 0,16 USD za milion vstupních tokenů a 0,47 USD za milion výstupních. Zatím jde o ohlášenou cenu: oznámení samo píše, že rozhraní teprve přijde, a stránka toho modelu na webu Qwen Cloudu vrací 404.

Co z toho plyne

Srovnávací tabulka v oznámení vede Qwen3.8-Flash-Next jako model se 125 miliardami parametrů a tabulku n-gramů má v samostatném řádku. Číslo v první řádce tedy neříká, kolik se toho musí stáhnout ani kolik paměti to spolyká – to řeknou až soubory samotné, a u nich vychází 360 GB. Výsledky testů, kterými Qwen model doprovodil, měřil zatím jen on sám.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. U sebe doma

    SGLang odstranil přepínač pro kvantizaci, který v devíti vydáních jen hlásil chybu

    Přepínač --torchao-config končil v SGLangu chybou ImportError, ať mu uživatel předal kteroukoli z povolených hodnot. Rozbil ho skok verze knihovny torchao, který se…

  2. Čísla

    LiteLLM počítal úsporu z mezipaměti bez ceny jejího zápisu

    LiteLLM až do verze 1.98.0 přičítal úsporu za tokeny načtené z mezipaměti, ale neodečetl příplatek za její vytvoření. U zápisu 20 000 tokenů pro Claude Sonnet 4.5 tak…

  3. Čísla

    Pew našel stopy AI v desetině anglického webu, u novějších stránek ve více než třetině

    Pew Research Center prověřil 490 000 anglických webových stránek a v červencovém vzorku našel významné stopy strojového autorství u 10 % z nich. Mezi stránkami s datem…

  4. Čísla

    Gartner čeká 42,3 miliardy dolarů u infrastruktury, IDC čeká 497 miliard u hardwaru.

    Gartner odhadl, že celosvětové výdaje za pronajatou infrastrukturu pro modely letos dosáhnou 42,3 miliardy dolarů, tedy o 96,4 % víc než loni. IDC čeká u „výdajů na AI…