Přeskočit na obsah
Modely 4 min čtení

DeepSeek vydal ostrý V4-Flash pod MIT. Váhy mají 167 GB, šablonu chatu nahradily skripty

DeepSeek zveřejnil 31. července ostrou verzi modelu V4-Flash. Licence je čistá MIT bez prahů tržeb a bez podmínek navíc, kontext má milion tokenů a váhy 166,9 GB. Devět čísel v tabulce naměřil výrobce sám, u agentních úloh nástrojem, který zatím nevydal.

Čínský DeepSeek zveřejnil ostrou verzi modelu DeepSeek-V4-Flash-0731. Repozitář na Hugging Face vznikl 31. července v 7.30 světového času a nahrazuje náhledovou verzi, kterou stejná firma vydala 22. dubna. Karta modelu říká, že jde o tentýž model s výrazně posílenými agentními schopnostmi.

Skříň s výpočetními uzly a akcelerátory propojenými kabely
Výpočetní uzly s akcelerátory Nvidia Tesla propojené přes InfiniBand. Váhy modelu V4-Flash se do jedné takové skříně vejdou. Foto: ChrisDag, Wikimedia Commons (CC BY 2.0)

Licence je opravdu jen MIT

Soubor LICENSE obsahuje standardní text licence MIT a nic víc: dovoluje užívat, kopírovat, měnit, zveřejňovat, šířit, podlicencovat i prodávat, jedinou podmínkou je zachovat oznámení o autorských právech. Žádný práh tržeb, žádný limit uživatelů, žádná povinnost uvádět jméno modelu v rozhraní. U vah takhle velkého modelu to samozřejmost není.

Vidět je to na Kimi K3, o jehož zmenšených verzích jsme psali. Jeho licence nese jméno modelu a dvě podmínky navíc má. Kdo provozuje model jako službu a jeho tržby přesáhnou za dvanáct po sobě jdoucích měsíců 20 milionů dolarů, musí si s Moonshotem sjednat zvláštní smlouvu. A kdo má přes 100 milionů uživatelů měsíčně nebo přes 20 milionů dolarů měsíčních tržeb, musí ve svém rozhraní viditelně uvádět jméno Kimi K3. Obě podmínky jsme četli přímo v souboru LICENSE, ne v oznámení.

Kolik toho je

Karta náhledové verze uvádí u V4-Flash 284 miliard parametrů celkem a 13 miliard aktivních na jeden token. Soubor config.json ostré verze to upřesňuje: 43 vrstev, 256 směrovaných expertů plus jeden sdílený, z nichž se na token zapojí šest, a kontextové okno přesně 1 048 576 tokenů. Totéž rozdělení parametrů uvádí i stránka receptů projektu vLLM, na kterou karta ostré verze odkazuje.

Váhy jsou rozdělené do 48 souborů a dohromady mají 166,9 GB. Ten součet je náš, vstupem byl výpis repozitáře přes rozhraní Hugging Face. Na jeden parametr z toho vychází necelých šest desetin bajtu, tedy zhruba pět bitů. Nejde o kvantizaci od někoho zvenčí: experti jsou podle karty modelu uložení ve formátu FP4 a zbytek vah v FP8 rovnou od výrobce.

Do běžného počítače se to nevejde. Návod na místní běh přiložený v repozitáři počítá se čtyřmi kartami, doporučený příkaz pro vLLM v kartě modelu obsluhuje model na jednom uzlu se čtyřmi kartami GB300. Přehled hardwaru u vLLM nabízí i variantu s jedinou kartou, pracovní stanici DGX s 252 GB paměti. Počítat se ale musí i s vyrovnávací pamětí pro kontext: u dvou vyšších stupňů přemýšlení doporučuje karta modelu nechat na výstup až 384 tisíc tokenů.

Devět čísel od výrobce, nástroj k jejich zopakování zatím nikde

Tabulka na kartě modelu má devět testů. Ve všech devíti je ostrá verze lepší než dubnový náhled i než větší sourozenec V4-Pro v náhledové verzi. Největší rozdíl je u testu DeepSWE, kde náhled dosáhl 7,3 bodu a ostrá verze 54,4; u testu Cybergym je to 38,7 proti 76,7. Jedním z devíti je Toolathlon, o jehož vedlejších účincích na Hugging Face jsme psali; V4-Flash-0731 v něm má 70,3.

K té tabulce patří tři poznámky. Měřil ji výrobce sám a u agentních úloh vlastním nástrojem, o kterém pod tabulkou stojí, že teprve vyjde – mezi 35 repozitáři organizace DeepSeek na GitHubu jsme ho 31. července nenašli, takže výsledky zatím nikdo zvenčí nezopakuje. Dva z devíti testů jsou vlastní neveřejné sady, což karta modelu poctivě označuje křížkem. A v úvodu se píše, že je model v širokém záběru konkurenceschopný nejsilnějším dostupným uzavřeným modelům; ve vlastní tabulce přitom prohrává se sloupcem Opus 4.8 ve všech devíti řádcích, kdežto modelu GLM-5.2 utíká ve všech osmi řádcích, kde má GLM uvedené číslo. Obojí jsme z té tabulky spočítali sami.

Šablonu chatu nahradily skripty

Kdo si model pouští u sebe, narazí hned na začátku. Vydání neobsahuje šablonu chatu ve formátu Jinja, tedy předpis, podle kterého se konverzace složí do jediného řetězce na vstupu modelu. Většina nástrojů kolem otevřených vah takový soubor u modelu očekává a umí si ho přečíst sama.

Místo něj je v repozitáři adresář encoding s referenční implementací v Pythonu, popisem zvláštních značek a čtyřmi dvojicemi vstupu a očekávaného výstupu. Dokumentace k tomu přidává varování, které se vyplatí číst dřív než tabulku s výsledky: funkce, jež odpověď modelu rozebírá zpátky na strukturu, počítá jen se správně tvarovaným výstupem a nesnaží se opravovat to, co model občas splete.

V popisu rolí je i drobnost, která o modelu prozradí víc než benchmark. Vedle běžných rolí system, user, assistanttool zná zápis ještě roli developer. Podle dokumentace ji používá výhradně vnitřní vyhledávací agent DeepSeeku a oficiální rozhraní firmy zprávy s touhle rolí nepřijímá.

Co se dá říct dnes

Doložené je tohle: váhy jsou venku, licence je čistá MIT a model se dá provozovat na jednom uzlu. Nedoložené zůstává, jak si vede proti čemukoli jinému, protože jediná zveřejněná čísla naměřil ten, kdo model vydal, a nástroj k jejich ověření zatím není venku. Podle nás je z té dvojice zajímavější licence: čísla někdo za měsíc přeměří, licenční podmínky vydrží.

Zdroje: karta modelu DeepSeek-V4-Flash-0731 včetně souborů LICENSE, config.json a adresáře encoding, karta náhledové verze, recept projektu vLLMlicence Kimi K3. Velikost vah jsme sečetli z výpisu souborů přes rozhraní Hugging Face, počet repozitářů DeepSeeku z rozhraní GitHubu.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Anthropic vydal Opus 5 za polovinu ceny Fable, test mu naměřil 50 % halucinací

    Anthropic 24. července vydal model Claude Opus 5 za 5 dolarů za milion vstupních a 25 dolarů za milion výstupních tokenů, tedy za polovinu ceny Fable 5. V nezávislém…