Přeskočit na obsah
Modely 3 min čtení

DeepSeek vydal V4-Pro, který si draft model pro zrychlení nese přímo ve vahách

DeepSeek vydal 13. srpna 2026 ostrou verzi modelu DeepSeek-V4-Pro-0813 pod licencí MIT. Hlavní novinkou je modul DSpark, který navrhuje tokeny dopředu a jehož váhy neleží v samostatném souboru, ale uvnitř týchž 66 souborů jako model sám. Ty mají dohromady 892,7 GB.

Řady serverových skříní v sále britského Národního archivu
Serverovna britského Národního archivu. Foto: The National Archives (UK), Wikimedia Commons (CC BY 3.0)

DeepSeek zveřejnil 13. srpna 2026 na Hugging Face váhy modelu DeepSeek-V4-Pro-0813. Karta modelu ho popisuje jako ostrou verzi, která nahrazuje dřívější preview, a jako hlavní změnu uvádí připojený modul DSpark. Licence je MIT stejně jako u červencového V4-Flash; stojí to v souboru LICENSE v repozitáři, ne jen v oznámení.

Draft model leží v týchž souborech jako model sám

Spekulativní dekódování je postup, kterým se běh modelu zrychluje: malý a rychlý model, anglicky draft model, navrhne několik tokenů dopředu a velký model je pak jedním průchodem buď potvrdí, nebo zahodí. Obvykle to znamená stáhnout dva checkpointy, jeden velký a jeden malý.

U V4-Pro to tak není. Návod pro SGLang na kartě modelu výslovně říká, že se nemá zadávat samostatná cesta --speculative-draft-model-path, protože cílové i draft váhy pocházejí z téhož checkpointu. Potvrzuje to i kód vLLM: v souboru vllm/config/speculative.py je u větve pro DSpark komentář, že tahle metoda umí dodat váhy uvnitř cílového checkpointu, a o pár set řádků níž, že DeepSeek-V4 používá pro draft tutéž konfiguraci jako model sám.

Kolik místa modul zabere, DeepSeek neuvádí. Z konfigurace jde vyčíst jen to, jak je postavený: dspark_target_layer_ids jmenuje vrstvy 58, 59 a 60, tedy tři poslední z 61, dspark_block_size je 5 a dspark_markov_rank 512. Návod pro vLLM doporučuje navrhovat sedm tokenů dopředu.

DSpark není jen věc DeepSeeku

Ta metoda není nová a nepatří jen tomuhle modelu. vLLM zná v téže části kódu i architektury Qwen3DSparkModel, Gemma4DSparkModelK3DSparkModel a jako příklad odkazuje na repozitář deepseek-ai/dspark_qwen3_8b_block7, který na Hugging Face leží od 28. června 2026. SGLang má na DSpark vlastní adresář o dvanácti souborech. Rozdíl je v tom, že u těch ostatních modelů zůstává draft samostatný; u V4-Pro ne.

892,7 GB vah

Váhy jsou v 66 souborech formátu safetensors a jejich součet je 892 744 322 880 bajtů, tedy 892,7 GB. Je to náš součet velikostí ze seznamu souborů, který vydá rozhraní Hugging Face. Pro srovnání: V4-Flash z 31. července má 48 souborů a 166 886 535 336 bajtů, tedy 166,9 GB. Pro je proti němu 5,3× větší.

Právě tohle číslo rozhoduje, kde model poběží. Uzel s osmi kartami po 80 GB má dohromady 640 GB, takže na samotné váhy nestačí, natož na keš klíčů a hodnot. Karta modelu proto uvádí jako příklad uzel se čtyřmi kusy NVIDIA GB300 a odkazuje na recepty vLLM a na kuchařku SGLangu. Sami jsme model nespouštěli, tyhle nároky jsou z dokumentace.

Váhy nejsou v plné přesnosti. Konfigurace uvádí u expertů expert_dtype rovné fp4, tedy čtyři bity na parametr, a u zbytku kvantizaci fp8 ve formátu e4m3 po blocích 128×128. Model má 61 vrstev, 384 směrovaných expertů a jednoho sdíleného; na každý token se z nich vybere šest.

Tabulku výsledků měřil výrobce sám

Karta modelu srovnává V4-Pro-0813 v deseti testech se staršími verzemi i s cizími modely. Všechna čísla naměřil DeepSeek, u agentních úloh vlastním nástrojem DeepSeek Harness v režimu minimal, s nastavením temperature 1.0top_p 0.95 a s nejvyšší úrovní uvažování. Dvě řady z deseti jsou navíc vnitřní testovací sady firmy, DSBench-FullStack a DSBench-Hard, které zvenčí zopakovat nejde. Nezávislé měření zatím není.

Milion tokenů kontextu a žádná šablona chatu

Konfigurace udává max_position_embeddings 1 048 576, tedy milion tokenů; rozšíření obstarává YaRN s faktorem 16 z původních 65 536. Technická zpráva na arXivu z 26. dubna 2026 popisuje ještě verzi preview: Pro má podle ní 1,6 bilionu parametrů, z nichž je 49 miliard aktivních, a předtrénovala se na víc než 32 bilionech tokenů. K ostré verzi vlastní zpráva zatím nevyšla.

Jedna věc zůstala stejná jako u Flashe: repozitář nemá šablonu chatu ve formátu Jinja. Místo ní je v něm adresář encoding s pythonovými skripty, které převedou zprávy ve formátu OpenAI na vstupní řetězec a výstup zase zpátky. Parametr reasoning_effort nově zná tři stupně: low, highmax. Pro dva vyšší z nich doporučuje karta modelu počítat s výstupem až 384 tisíc tokenů.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    EXAONE 4.5 přišla v GGUF o posuvnou pozornost kvůli pořadí metadat

    Oficiální GGUF modelu EXAONE 4.5 obsahuje 65 bloků včetně jedné hlavy pro předpověď více tokenů, ale llama.cpp kontrolovalo počet vrstev dřív, než tuto hlavu odečetlo.…

  2. Modely

    Mach-1 sbalil váhy Qwen3.6-35B na 7,5 GB, běžný nástroj je ale nepřečte

    Syzygy Research vydala Mach-1 Additive 35B, ternární balení modelu Qwen3.6-35B-A3B, které srazí 71,9 GB vah na 7,53 GB. Vlastní měření vydavatele mu přisuzuje 95 %…

  3. Modely

    Pokee-Isaac slibuje kontext deseti milionů tokenů na jedné kartě, váhy ale nezveřejnil

    Pokee AI ohlásila 8. srpna 2026 model Pokee-Isaac 28B, který má zvládnout kontext deseti milionů tokenů a vejít se na jedinou grafickou kartu. Váhy ale nezveřejnila;…

  4. Modely

    Nová řada modelů zkouší vštípit hodnoty už při předtrénování

    Skupina model-raising zveřejnila 9. srpna rodinu malých jazykových modelů ke studii Synthetic Persona Pretraining. Ta zkouší vepsat modelu hodnoty už do předtrénování,…