DeepSeek vydal V4-Pro, který si draft model pro zrychlení nese přímo ve vahách
DeepSeek vydal 13. srpna 2026 ostrou verzi modelu DeepSeek-V4-Pro-0813 pod licencí MIT. Hlavní novinkou je modul DSpark, který navrhuje tokeny dopředu a jehož váhy neleží v samostatném souboru, ale uvnitř týchž 66 souborů jako model sám. Ty mají dohromady 892,7 GB.

DeepSeek zveřejnil 13. srpna 2026 na Hugging Face váhy modelu DeepSeek-V4-Pro-0813. Karta modelu ho popisuje jako ostrou verzi, která nahrazuje dřívější preview, a jako hlavní změnu uvádí připojený modul DSpark. Licence je MIT stejně jako u červencového V4-Flash; stojí to v souboru LICENSE v repozitáři, ne jen v oznámení.
Draft model leží v týchž souborech jako model sám
Spekulativní dekódování je postup, kterým se běh modelu zrychluje: malý a rychlý model, anglicky draft model, navrhne několik tokenů dopředu a velký model je pak jedním průchodem buď potvrdí, nebo zahodí. Obvykle to znamená stáhnout dva checkpointy, jeden velký a jeden malý.
U V4-Pro to tak není. Návod pro SGLang na kartě modelu výslovně říká, že se nemá zadávat samostatná cesta --speculative-draft-model-path, protože cílové i draft váhy pocházejí z téhož checkpointu. Potvrzuje to i kód vLLM: v souboru vllm/config/speculative.py je u větve pro DSpark komentář, že tahle metoda umí dodat váhy uvnitř cílového checkpointu, a o pár set řádků níž, že DeepSeek-V4 používá pro draft tutéž konfiguraci jako model sám.
Kolik místa modul zabere, DeepSeek neuvádí. Z konfigurace jde vyčíst jen to, jak je postavený: dspark_target_layer_ids jmenuje vrstvy 58, 59 a 60, tedy tři poslední z 61, dspark_block_size je 5 a dspark_markov_rank 512. Návod pro vLLM doporučuje navrhovat sedm tokenů dopředu.
DSpark není jen věc DeepSeeku
Ta metoda není nová a nepatří jen tomuhle modelu. vLLM zná v téže části kódu i architektury Qwen3DSparkModel, Gemma4DSparkModel a K3DSparkModel a jako příklad odkazuje na repozitář deepseek-ai/dspark_qwen3_8b_block7, který na Hugging Face leží od 28. června 2026. SGLang má na DSpark vlastní adresář o dvanácti souborech. Rozdíl je v tom, že u těch ostatních modelů zůstává draft samostatný; u V4-Pro ne.
892,7 GB vah
Váhy jsou v 66 souborech formátu safetensors a jejich součet je 892 744 322 880 bajtů, tedy 892,7 GB. Je to náš součet velikostí ze seznamu souborů, který vydá rozhraní Hugging Face. Pro srovnání: V4-Flash z 31. července má 48 souborů a 166 886 535 336 bajtů, tedy 166,9 GB. Pro je proti němu 5,3× větší.
Právě tohle číslo rozhoduje, kde model poběží. Uzel s osmi kartami po 80 GB má dohromady 640 GB, takže na samotné váhy nestačí, natož na keš klíčů a hodnot. Karta modelu proto uvádí jako příklad uzel se čtyřmi kusy NVIDIA GB300 a odkazuje na recepty vLLM a na kuchařku SGLangu. Sami jsme model nespouštěli, tyhle nároky jsou z dokumentace.
Váhy nejsou v plné přesnosti. Konfigurace uvádí u expertů expert_dtype rovné fp4, tedy čtyři bity na parametr, a u zbytku kvantizaci fp8 ve formátu e4m3 po blocích 128×128. Model má 61 vrstev, 384 směrovaných expertů a jednoho sdíleného; na každý token se z nich vybere šest.
Tabulku výsledků měřil výrobce sám
Karta modelu srovnává V4-Pro-0813 v deseti testech se staršími verzemi i s cizími modely. Všechna čísla naměřil DeepSeek, u agentních úloh vlastním nástrojem DeepSeek Harness v režimu minimal, s nastavením temperature 1.0 a top_p 0.95 a s nejvyšší úrovní uvažování. Dvě řady z deseti jsou navíc vnitřní testovací sady firmy, DSBench-FullStack a DSBench-Hard, které zvenčí zopakovat nejde. Nezávislé měření zatím není.
Milion tokenů kontextu a žádná šablona chatu
Konfigurace udává max_position_embeddings 1 048 576, tedy milion tokenů; rozšíření obstarává YaRN s faktorem 16 z původních 65 536. Technická zpráva na arXivu z 26. dubna 2026 popisuje ještě verzi preview: Pro má podle ní 1,6 bilionu parametrů, z nichž je 49 miliard aktivních, a předtrénovala se na víc než 32 bilionech tokenů. K ostré verzi vlastní zpráva zatím nevyšla.
Jedna věc zůstala stejná jako u Flashe: repozitář nemá šablonu chatu ve formátu Jinja. Místo ní je v něm adresář encoding s pythonovými skripty, které převedou zprávy ve formátu OpenAI na vstupní řetězec a výstup zase zpátky. Parametr reasoning_effort nově zná tři stupně: low, high a max. Pro dva vyšší z nich doporučuje karta modelu počítat s výstupem až 384 tisíc tokenů.
Zdroje
- Karta modelu DeepSeek-V4-Pro-0813 na Hugging Face včetně souborů
LICENSEaconfig.json - vllm/config/speculative.py v repozitáři vLLM
- Adresář dspark_components v repozitáři SGLang
- DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence, arXiv, 26. dubna 2026