Experti uložení po čtyřech bitech tvoří 94 % vah DeepSeeku V4 Flash Vision
DeepSeek nahrál 31. srpna 2026 na Hugging Face váhy experimentálního modelu DeepSeek-V4-Flash-Vision-Exp. Osmačtyřicet souborů má dohromady 167,8 GB a 93,8 % z toho zabírají směrovaní experti, uložení po dvou čtyřbitových hodnotách v jednom bajtu. Proti textové verzi z konce července přibylo 466 milionů parametrů, tedy 0,15 % celku.

Repozitář deepseek-ai/DeepSeek-V4-Flash-Vision-Exp vznikl na Hugging Face 31. srpna 2026 v 6:16 UTC, velké soubory do něj naběhly o čtyřicet minut později a poslední úprava karty nese čas 12:23. Licence je MIT, tedy táž jako u textového V4-Flash-0731 z konce července. Přes rozhraní DeepSeeku model odpovídá od 21. srpna, kdy ho pod týmž jménem zařadil do nabídky i přeprodejce OpenRouter. Ke stažení je až teď.
Co je v těch osmačtyřiceti souborech
Karta modelu popisuje, co model umí, ale o samotných souborech neříká nic: ani jak jsou velké, ani v jakém formátu váhy leží. Změřit se to dá bez stahování: každý soubor .safetensors nese v prvních osmi bajtech délku hlavičky a hned za ní JSON se jménem, tvarem a datovým typem každého tenzoru. Rozsahové dotazy na všech osmačtyřicet souborů vydaly 72 633 tenzorů a 167,8 GB dat. Rozdělené podle toho, kam v modelu patří, vypadají takhle.
| část modelu | velikost | podíl |
|---|---|---|
| směrovaní experti | 157,4 GB | 93,8 % |
| pozornost | 5,72 GB | 3,4 % |
| slovník a výstupní vrstva | 2,12 GB | 1,3 % |
| sdílený expert | 1,16 GB | 0,7 % |
| obrazová věž a aligner | 0,93 GB | 0,6 % |
| ostatní | 0,44 GB | 0,3 % |
Model je směs expertů: v každé ze 43 vrstev sedí 256 samostatných dopředných sítí a brána pro každý token vybere šest z nich, k tomu jednoho sdíleného. Právě těch 256 expertů na vrstvu je ta hromada, která zabírá skoro celý stažený balík. Aligner je vrstva, která obrazové rysy převede do rozměru jazykového modelu.
Čtyři bity a jeden exponent na dvaatřicet hodnot
Experti nejsou uložení v žádném z běžných formátů. Hlavička u nich hlásí typ I8, tedy osmibitové celé číslo, jenže tvar nesedí: tenzor layers.18.ffn.experts.0.w1.weight má rozměr 2048 × 2048, kdežto z konfigurace vychází 2048 × 4096. Chybějící polovina je vysvětlená v kódu přiloženém k modelu: jeden bajt drží dvě čtyřbitová čísla ve tvaru e2m1, tedy znaménko, dva bity exponentu a jeden bit mantisy.
Vedle každé takové váhy leží druhý tenzor s měřítky, a to po jednom osmibitovém exponentu na každých dvaatřicet hodnot. Měřítka zabírají 9,26 GB, což je přesně šestnáctina objemu samotných vah – režie čtyřbitového uložení tedy dělá 6,25 %. Pozornost je proti tomu v osmibitovém e4m3 se společným měřítkem na blok 128 × 128, sdílený expert taky, slovník a obrazová věž v bf16.
Převodní tabulka ve skriptu convert.py vypisuje, co se do těch čtyř bitů vejde: nula, 0,5, 1, 1,5, 2, 3, 4 a 6, plus tytéž hodnoty se záporným znaménkem. Šestnáct kódů, patnáct různých čísel – nula je v tabulce dvakrát.
Proč karta mluví o 304 miliardách
Hugging Face vypisuje u modelu 304 646 824 126 parametrů a z toho 296 352 743 424 v typu I8. To druhé číslo je přesně dvojnásobek objemu, který jsem naměřil v bajtech, takže rozhraní čtyřbitové hodnoty počítá jednotlivě a ne po bajtech. Sedí to: model má kolem 304 miliard parametrů uložených ve 168 gigabajtech.
Skript convert.py umí experty převést do osmibitového e4m3 a v komentáři u té funkce stojí, že je převod bezeztrátový. Není to nadsázka, všech patnáct hodnot čtyřbitové tabulky se do e4m3 vejde. Cena je velikost: samotná data expertů narostou ze 148,2 na 296,4 GB.
Zrak stál 0,93 GB
Textová verze DeepSeek-V4-Flash-0731 má v souborech 166 886 535 336 bajtů, nová obrazová 167 819 404 368. Rozdíl je 932 869 032 bajtů, tedy 0,93 GB. Samotná obrazová věž s alignerem zabírá 932,75 MB a zbylých pár desítek kilobajtů si rozdělí čtyři pomocné tokeny, hrstka dalších hodnot a o něco delší hlavičky souborů. Zbytek modelu má tutéž velikost jako v červenci, což ale nic neříká o hodnotách uvnitř: karta mluví o dalším trénování.
V parametrech je to 466 405 632 hodnot navíc, tedy 0,15 % celku. Z toho 466 393 088 připadá na bf16, což je dvaatřicet vrstev obrazové věže o rozměru 1024, aligner a čtyři pomocné tokeny. Zbylých 12 544 hodnot ve float32 je drobnost, ale zajímavější: každá ze šestačtyřiceti bran, které vybírají experty, dostala druhý posunovací vektor o 256 hodnotách, používaný jen pro tokeny z obrázku. Tři vrstvy, které experty nevybírají podle skóre, ale pevnou tabulkou podle čísla tokenu, k tomu dostaly i obyčejný posunovací vektor, který dřív neměly. 46 × 256 plus 3 × 256 dá právě 12 544.
Referenční kód to potvrzuje: třída Gate má vedle pole bias i bias_vl a rozlišuje je podle toho, jestli číslo tokenu přesahuje velikost slovníku. Obrázek se tedy nepřipojuje jen zepředu k textu – model pro něj sahá po jiných expertech.
Kdo ty váhy rozběhne
Váhy jsou venku, rozběhnout je s obrazovou částí ale znamená práci navíc. V repozitáři je jen minimální implementace v PyTorchi a její vlastní README říká, že jde o čitelnou ukázku, ne o produkční server; návod počítá s převodem vah na čtyři karty a spuštěním přes torchrun.
Jak je na tom obvyklá cesta, tedy vLLM, se dá vyčíst jen zčásti. V seznamu podporovaných modelů v souboru registry.py stojí architektura DeepseekV4ForCausalLM, kterou model ve svém config.json uvádí, v oddílu pro generování textu. Mezi multimodálními modely má DeepSeek jen DeepseekVLV2, DeepseekOCR a DeepseekOCR2, a to jsou jiné architektury. Vlastní implementace V4 přitom leží mimo repozitář vLLM (seznam na ni odkazuje plnou cestou vllm.models.deepseek_v4), takže z něj se nedá vyčíst, co ten vnější modul umí. Poslední vydání vLLM v0.28.0 je z 26. srpna. Ve vlákně o vydání vah na vývojářském fóru Nvidie k tomu jeden z účastníků píše, že obrazovou část hlavní větev vLLM nezná vůbec a že návrh, který by ji doplnil, zatím nikdo nenapsal.
V návodu k referenční implementaci je ještě jedna drobnost: vyzývá spustit dva testovací soubory a ten druhý, inference/test_image_processor.py, v repozitáři není.
Tabulku výsledků měřil výrobce
Čísla, kterými se model na kartě představuje, naměřil DeepSeek sám. Uvádí u nich i podmínky měření: minimální režim vlastního nástroje DeepSeek Harness, nejvyšší stupeň uvažování, temperature 1,0 a top_p 0,95. Pod tabulkou navíc přiznává, že ve dvou zkouškách starší textový model obrazovou část zadání prostě ignoroval, takže tam náskok nového vypadá větší, než jaký je. Do repozitáře pak 31. srpna přibyly dva soubory nadepsané jako komunitní výsledky – jenže jako zdroj obou je uvedená tatáž karta modelu.
Že se ze souborů už moc vymáčknout nedá, ukazuje první cizí přebalení. Unsloth nahrál týž den kopii vah a k ní dvě verze ve formátu GGUF: čtyřbitová má 155,1 GB, osmibitová 161,9 GB. Dělí je 6,8 GB, tedy 4 %, a obě jsou menší než původní soubory. U modelu, jehož drtivou většinu tvoří váhy uložené ve čtyřech bitech, není kde ubírat.
Zdroje
- Karta modelu DeepSeek-V4-Flash-Vision-Exp na Hugging Face, včetně souborů
LICENSE,config.json,inference/convert.pyainference/model.py - Karta modelu DeepSeek-V4-Flash-0731 pro porovnání velikostí
- Přebalení do GGUF od Unslothu
- Seznam podporovaných modelů vLLM
- Vlákno o vydání vah na vývojářském fóru Nvidie
- Velikosti a podíly jsou vlastní výpočet z hlaviček všech osmačtyřiceti souborů
.safetensorsobou modelů