Přeskočit na obsah
Modely 3 min čtení

GLM-5.3-Flash si drží KV cache jen v jedenácti ze 45 vrstev

Váhy modelu GLM-5.3-Flash jsou na Hugging Face pod licencí MIT: 321,3 miliardy parametrů v 62 souborech, dohromady 328,3 GB. Slovo „Flash“ se týká ceny provozu, ne rozměrů. Levný je proto, že z 45 vrstev si klíče a hodnoty ukládá jen jedenáct; zbylých 34 má lineární pozornost se stavem stálé velikosti.

Grafická karta držená v ruce
Váhy GLM-5.3-Flash zaberou 305,8 GiB, takže se ani ve formátu FP8 na jednu kartu nevejdou. Foto: Shixart1985, Wikimedia Commons (CC BY 2.0)

Repozitář s vahami modelu GLM-5.3-Flash vznikl na Hugging Face 25. srpna 2026 a den nato k němu firma Z.ai vydala oznámení. Slovo „Flash“ v názvu míří na cenu provozu, ne na rozměry: model nese 321,3 miliardy parametrů a jeho váhy zabírají v 62 souborech 328,3 GB. Licencí je MIT – 1 070 bajtů textu bez prahu obratu a bez pravidel přijatelného užití.

Klíče a hodnoty si pamatuje každá čtvrtá vrstva

Odkud se ta levnota bere, se dá přečíst z souboru config.json. Model má 45 vrstev a pole layer_types jim rozdává dva různé druhy pozornosti: 34 vrstev dostalo lineární, zbylých jedenáct řídkou. Ty řídké jsou vypsané jmenovitě – jsou to vrstvy 3, 7, 11 a tak dál po čtyřech až po 43.

Rozdíl mezi nimi je v paměti. Běžná pozornost si ke každému zpracovanému tokenu ukládá klíč a hodnotu do takzvané KV cache, tedy do vyrovnávací paměti, která roste s délkou rozhovoru. Lineární pozornost místo toho drží stav stálé velikosti a je jí jedno, jestli v kontextu leží tisíc tokenů, nebo milion. Okno má přitom GLM-5.3-Flash nastavené na 1 048 576 tokenů, takže je to rozdíl, na kterém při plném okně stojí celý provoz.

Z.ai to v oznámení vyčíslila proti svému staršímu modelu GLM-5.3: výpočet pozornosti klesl třikrát a KV cache 4,4krát. Ve stejném odstavci ale sama píše, že proti DeepSeeku V4-Flash a proti Kimi K3 je její KV cache pořád o něco větší a že tam zbývá prostor ke zlepšení.

Na jeden token připadá osmnáct miliard parametrů z 321

Druhá polovina úspory je ve směsi expertů. Konfigurace uvádí 288 směrovaných expertů a jednoho sdíleného, na každý token se z nich vybírá osm a první tři vrstvy zůstávají husté. Z celkových 321,3 miliardy parametrů se tedy na token použije osmnáct miliard, tedy 5,6 % – to je náš přepočet z čísel, která uvádí výrobce.

V paměti karet ale musí ležet všechny. Součet 62 souborů safetensors dává 328,3 GB, po přepočtu na binární jednotky 305,8 GiB, a 97,8 % parametrů je uloženo rovnou v osmibitovém FP8. Recept vLLM uvádí jako výchozí sestavu osm karet H200 se 141 GB paměti a mezi podporovaným hardwarem vede i starší H100 s 80 GB. Osm osmdesátigigabajtových karet dá dohromady 640 GiB, takže na samotné váhy to vyjde a na kontext zbývá zhruba polovina; kolik okna se do toho zbytku vejde, recept neříká.

Knihovnu, kterou karta jmenuje, model přerostl o jedno vydání

Karta se hlásí ke knihovně transformers a config.json u sebe uvádí verzi 5.16.0. Ta vyšla 26. srpna ve 12:35 UTC a architekturu glm5_next v sobě nemá; adresář s jejím kódem v té značce vydání vůbec není. Přibyl až návrhem změny číslo 48342, sloučeným téhož dne ve 14:26 UTC. O dvacet tři minut později vyšlo vydání 5.16.1 a jeho poznámky začínají větou, že jde o mimořádné vydání právě kvůli GLM.

U serverů pro inferenci je to zatím dál. Recept vLLM nenabízí číslo verze, ale zvláštní obraz vllm/vllm-openai:glm53-flash, a v hlavní větvi vLLM ani SGLangu jsme 27. srpna soubor pro tuhle architekturu nenašli. Kdo si chce model pustit u sebe, sahá tedy po připraveném obrazu, ne po vydané verzi serveru.

Před vydáním běžel na OpenRouteru beze jména

Z.ai v oznámení přiznává, že model před zveřejněním vah zkoušela anonymně pod označením Ox Alpha, a to na OpenRouteru a v nástroji OpenCode. O podmínkách toho zkušebního provozu jsme psali 24. srpna: bezplatný přístup byl vázaný na licenci, která provozovateli modelu dovoluje použít obsah požadavků k dalšímu trénování. Teď je jasné, komu ta data šla.

V katalogu OpenRouteru stálo 27. srpna 2026 devět poskytovatelů, skoro všichni s vahami ve FP8. Základní sazba je 0,15 dolaru za milion vstupních tokenů a 0,50 dolaru za milion výstupních; Z.AI, Novita a GMICloud k tomu téhož dne dávaly zaváděcí slevu 50 %. Starší GLM-5.3 tam stojí 1,40 a 4,40 dolaru, tedy zhruba devětkrát tolik.

Co z toho plyne

Tabulku testů, kterou oznámení doprovází, měřila Z.ai sama; jedinou výjimkou je řádek GDPval-AA v2, u kterého uvádí jako měřiče Artificial Analysis. Nezávislé zopakování zatím nikdo nezveřejnil. Oznámení končí provozním údajem: model prý týden obsluhoval klastr čínských akcelerátorů a proti výchozímu stavu na témž hardwaru se výkon zvedl třikrát. Který čip to je a od koho, v textu nestojí.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Nanbeige 4.2 pouští svých dvaadvacet vrstev dvakrát za sebou

    Model Nanbeige4.2-3B předčí v agentních testech podstatně větší modely a přitom má jen tři miliardy parametrů mimo vloženiny. Konfigurace prozrazuje proč: dvaadvacet…

  2. Modely

    Váhy modelu SenseNova U1.5-8B-MoT mají 17,5 miliardy parametrů

    SenseTime vydala 19. srpna otevřený multimodální model SenseNova U1.5-8B-MoT. Rozhraní Hugging Face u něj napočítá 17 532 854 464 parametrů a osm souborů s vahami zabere…

  3. Modely

    Draft model DFlash 2 pro Qwen3.8 se rozběhne jen na nevydaném kódu SGLangu a vLLM

    Inco AI zveřejnila 18. srpna DFlash 2 – malý model, který za Qwen3.8-27B předpovídá celé bloky tokenů dopředu. Ve vlastním měření tím propustnost SGLangu roste 2,7 až 3…

  4. Modely

    Kopie hudebního modelu MiniMax Music3 uvádějí na Hugging Face čtyři různé licence

    MiniMax nahrál 7. srpna 2026 na Hugging Face váhy hudebního modelu Music3 a přiložil k nim vlastní licenci s prahem dvaceti milionů dolarů ročních tržeb. Do hlavičky…