LongCat-Flash-Lite-Sparse má 138 GB vah pod MIT. Plné kontextové okno přidá 16 GB
Meituan dal 31. července na Hugging Face váhy modelu LongCat-Flash-Lite-Sparse. Má 69 miliard parametrů, licenci MIT bez jakýchkoli prahů a kontextové okno 983 040 tokenů, tedy o něco méně, než kolik karta modelu slibuje. Z konfigurace jsme spočítali, kolik paměti si vezmou váhy a plný kontext a o kolik model povyrostl proti husté verzi.

Čínský Meituan dal 31. července na Hugging Face váhy modelu LongCat-Flash-Lite-Sparse. Karta modelu ho popisuje jako model se směsí odborníků, tedy takový, kde se na každý token zapojí jen část sítě: z 69 miliard parametrů zhruba tři miliardy. Soubor LICENSE v repozitáři je holá licence MIT, bez prahu na tržby i bez prahu na počet uživatelů. Karta k ní dodává jedinou výhradu: práva k ochranným známkám a patentům Meituanu z ní neplynou.
Pod touž licencí vyšel týž den i ostrý DeepSeek V4-Flash, jehož váhy mají 166,9 GB. Souvislost je i technická: řídká pozornost Meituanu je podle karty rozšířením DeepSeek Sparse Attention.
Indexer řídké pozornosti stál 109 megabajtů
Model navazuje na LongCat-Flash-Lite z 27. ledna a liší se podle karty jedinou věcí: hustou pozornost nahradila vlastní řídká, kterou výrobce označuje LongCat Sparse Attention (LSA). Porovnání obou souborů config.json to potvrzuje. Shodují se v šířce (3072), v počtu vrstev (14), v počtu odborníků (256 a k tomu 128 „nulových“, které vstup jen propustí) i v tom, že se na token vybírá dvanáct z nich. Přibyla jen pole s předponou index_, tedy nastavení výběru tokenů.
Kolik ten výběr váží, se dá spočítat z rejstříků vah. Hustá verze v něm uvádí 138 179 712 000 bajtů, řídká 138 288 833 280. Rozdíl je 109 121 280 bajtů, tedy 109 MB – necelá desetina procenta celku, a při šestnáctibitových vahách zhruba 55 milionů parametrů. Vlastní přepočet z obou souborů.
Z okna 983 040 tokenů se čte 2 048
Karta mluví o nativní podpoře kontextu až do jednoho milionu tokenů. V config.json má pole max_position_embeddings hodnotu 983 040, což je o 1,7 % méně. Číslo není náhodné: je to 8 192 krát 120, tedy základní okno roztažené postupem YaRN s činitelem 120, který stojí o pár řádků níž v témže souboru. Hustý předchůdce měl 327 680, okno se tedy ztrojnásobilo přesně.
Rozdíl mezi zaokrouhleným slibem a nastavením není v oboru nový. Podobně se rozešel údaj o milionu tokenů u modelu Laguna S 2.1 s tím, na co byly nastavené balíčky, které k němu výrobce sám nabízel.
Řídká pozornost znamená, že se dotaz nedívá na celé okno. Rozpočet výběru je v config.json zapsaný jako index_topk s hodnotou 2048; podle názvů dalších polí z něj připadá 1024 na okolí právě zpracovávaného místa a 16 na začátek textu, zbytek vybírá indexer podle obsahu. Při plném okně je to 0,21 % dostupných tokenů (vlastní výpočet). Karta k tomu popisuje tři doplňky: přesun části rozpočtu na pevné okolí kvůli souvislému čtení z paměti, sdílení jednoho výběru mezi sousedními vrstvami a dvoustupňové skórování od hrubého k jemnému, které jde zapnout až při běhu.
Kolik paměti si to vezme
Váhy zaberou 138,3 GB. Kontext se k nim počítá zvlášť a u tohohle modelu vychází nezvykle malý, protože používá pozornost s latentním klíčem a hodnotou: z konfigurace plyne 512 plus 64 čísel na token a vrstvu. Ve formátu bfloat16, který si vyžádá spouštěcí příkaz uvedený v kartě, to je 16 128 bajtů na jeden token, při plném okně 15,9 GB. Dohromady s vahami 154 GB. Obojí je vlastní výpočet z údajů v konfiguraci.
Karta u nasazení píše, že se LongCat-Flash-Lite dá obsloužit na jednom uzlu, a jako příklad uvádí H20 se 141 GB. Ta věta se týká hustého předchůdce a mluví o uzlu, ne o jediné kartě, a na tom rozdílu záleží: samotné váhy by se na kartu se 141 GB vešly, plný kontext k nim už ne.
Naměřil to výrobce sám
Tabulka v kartě staví řídkou verzi proti husté. U agentního programování uvádí na SWE-Bench Verified 68,20 proti 54,40, u práce s nástroji na τ²-Telecom 95,18 proti 72,80. Obecné znalosti zůstávají na svém: MMLU 85,31 proti 85,52. Všechna čísla naměřil Meituan a údaje za hustou verzi navíc přebírá z její vlastní technické zprávy z 29. ledna, ne z jednoho společného měření. Nikdo nezávislý je zatím nezopakoval.
Ta lednová zpráva stojí za přečtení i kvůli něčemu jinému. Popisuje, že hustý předchůdce má 68,5 miliardy parametrů a přes 30 miliard z nich je v tabulkách vnoření, ne v odbornících. Řídká verze má v konfiguraci tentýž poměr, takže nejméně dvě pětiny těch 138 GB nepočítají nic, jen se z nich vyhledává.
V SGLangu je zatím otevřený návrh
Karta odkazuje na návrh změny 32918 v SGLangu. K 2. srpnu je otevřený a nesloučený, mění tři soubory o 26 přidaných řádcích a automatické zkoušky u něj neprošly; vyplývá to z rozhraní GitHubu. Vlastní repozitář s kódem model zatím nemá, přestože jich účet meituan-longcat vede sedmatřicet. Technická zpráva k řídké verzi leží jako PDF přímo v repozitáři na Hugging Face.
Za pozornost stojí poměr, který se z těch čísel skládá. Na jeden token se použijí 4,3 % parametrů, do paměti se ale musí vejít všech 138 GB, a řídká pozornost na tom nic nemění: šetří práci s kontextem, ne místo pro váhy. Podle nás je to hlavní důvod, proč se údaj o aktivních parametrech nedá číst jako nárok na hardware, i když se tak často cituje.
Zdroje: karta modelu, konfigurace a licence na Hugging Face, karta a konfigurace husté verze, technická zpráva na arXivu a návrh změny v SGLangu.