GLM-5.3-Flash si drží KV cache jen v jedenácti ze 45 vrstev
Váhy modelu GLM-5.3-Flash jsou na Hugging Face pod licencí MIT: 321,3 miliardy parametrů v 62 souborech, dohromady 328,3 GB. Slovo „Flash“ se týká ceny provozu, ne rozměrů. Levný je proto, že z 45 vrstev si klíče a hodnoty ukládá jen jedenáct; zbylých 34 má lineární pozornost se stavem stálé velikosti.

Repozitář s vahami modelu GLM-5.3-Flash vznikl na Hugging Face 25. srpna 2026 a den nato k němu firma Z.ai vydala oznámení. Slovo „Flash“ v názvu míří na cenu provozu, ne na rozměry: model nese 321,3 miliardy parametrů a jeho váhy zabírají v 62 souborech 328,3 GB. Licencí je MIT – 1 070 bajtů textu bez prahu obratu a bez pravidel přijatelného užití.
Klíče a hodnoty si pamatuje každá čtvrtá vrstva
Odkud se ta levnota bere, se dá přečíst z souboru config.json. Model má 45 vrstev a pole layer_types jim rozdává dva různé druhy pozornosti: 34 vrstev dostalo lineární, zbylých jedenáct řídkou. Ty řídké jsou vypsané jmenovitě – jsou to vrstvy 3, 7, 11 a tak dál po čtyřech až po 43.
Rozdíl mezi nimi je v paměti. Běžná pozornost si ke každému zpracovanému tokenu ukládá klíč a hodnotu do takzvané KV cache, tedy do vyrovnávací paměti, která roste s délkou rozhovoru. Lineární pozornost místo toho drží stav stálé velikosti a je jí jedno, jestli v kontextu leží tisíc tokenů, nebo milion. Okno má přitom GLM-5.3-Flash nastavené na 1 048 576 tokenů, takže je to rozdíl, na kterém při plném okně stojí celý provoz.
Z.ai to v oznámení vyčíslila proti svému staršímu modelu GLM-5.3: výpočet pozornosti klesl třikrát a KV cache 4,4krát. Ve stejném odstavci ale sama píše, že proti DeepSeeku V4-Flash a proti Kimi K3 je její KV cache pořád o něco větší a že tam zbývá prostor ke zlepšení.
Na jeden token připadá osmnáct miliard parametrů z 321
Druhá polovina úspory je ve směsi expertů. Konfigurace uvádí 288 směrovaných expertů a jednoho sdíleného, na každý token se z nich vybírá osm a první tři vrstvy zůstávají husté. Z celkových 321,3 miliardy parametrů se tedy na token použije osmnáct miliard, tedy 5,6 % – to je náš přepočet z čísel, která uvádí výrobce.
V paměti karet ale musí ležet všechny. Součet 62 souborů safetensors dává 328,3 GB, po přepočtu na binární jednotky 305,8 GiB, a 97,8 % parametrů je uloženo rovnou v osmibitovém FP8. Recept vLLM uvádí jako výchozí sestavu osm karet H200 se 141 GB paměti a mezi podporovaným hardwarem vede i starší H100 s 80 GB. Osm osmdesátigigabajtových karet dá dohromady 640 GiB, takže na samotné váhy to vyjde a na kontext zbývá zhruba polovina; kolik okna se do toho zbytku vejde, recept neříká.
Knihovnu, kterou karta jmenuje, model přerostl o jedno vydání
Karta se hlásí ke knihovně transformers a config.json u sebe uvádí verzi 5.16.0. Ta vyšla 26. srpna ve 12:35 UTC a architekturu glm5_next v sobě nemá; adresář s jejím kódem v té značce vydání vůbec není. Přibyl až návrhem změny číslo 48342, sloučeným téhož dne ve 14:26 UTC. O dvacet tři minut později vyšlo vydání 5.16.1 a jeho poznámky začínají větou, že jde o mimořádné vydání právě kvůli GLM.
U serverů pro inferenci je to zatím dál. Recept vLLM nenabízí číslo verze, ale zvláštní obraz vllm/vllm-openai:glm53-flash, a v hlavní větvi vLLM ani SGLangu jsme 27. srpna soubor pro tuhle architekturu nenašli. Kdo si chce model pustit u sebe, sahá tedy po připraveném obrazu, ne po vydané verzi serveru.
Před vydáním běžel na OpenRouteru beze jména
Z.ai v oznámení přiznává, že model před zveřejněním vah zkoušela anonymně pod označením Ox Alpha, a to na OpenRouteru a v nástroji OpenCode. O podmínkách toho zkušebního provozu jsme psali 24. srpna: bezplatný přístup byl vázaný na licenci, která provozovateli modelu dovoluje použít obsah požadavků k dalšímu trénování. Teď je jasné, komu ta data šla.
V katalogu OpenRouteru stálo 27. srpna 2026 devět poskytovatelů, skoro všichni s vahami ve FP8. Základní sazba je 0,15 dolaru za milion vstupních tokenů a 0,50 dolaru za milion výstupních; Z.AI, Novita a GMICloud k tomu téhož dne dávaly zaváděcí slevu 50 %. Starší GLM-5.3 tam stojí 1,40 a 4,40 dolaru, tedy zhruba devětkrát tolik.
Co z toho plyne
Tabulku testů, kterou oznámení doprovází, měřila Z.ai sama; jedinou výjimkou je řádek GDPval-AA v2, u kterého uvádí jako měřiče Artificial Analysis. Nezávislé zopakování zatím nikdo nezveřejnil. Oznámení končí provozním údajem: model prý týden obsluhoval klastr čínských akcelerátorů a proti výchozímu stavu na témž hardwaru se výkon zvedl třikrát. Který čip to je a od koho, v textu nestojí.
Zdroje
- Karta modelu GLM-5.3-Flash, její
config.jsona soubor LICENSE, Hugging Face - GLM-5.3-Flash: Frontier Intelligence, Flash Cost, Z.ai, 26. srpna 2026
- GLM 5.3 Flash Support a vydání 5.16.1, knihovna Transformers
- Recept pro zai-org/GLM-5.3-Flash, vLLM
- Z.ai: GLM 5.3 Flash, OpenRouter, ceny odečtené 27. srpna 2026
- Součet velikosti vah, poměr vrstev s KV cache i podíl aktivních parametrů jsou vlastní výpočty z velikostí 62 souborů
.safetensorsa z polílayer_types,n_routed_expertsanum_experts_per_tokvconfig.json.