Přeskočit na obsah
Čísla 3 min čtení

LongCat-Flash-Lite-Sparse má 138 GB vah pod MIT. Plné kontextové okno přidá 16 GB

Meituan dal 31. července na Hugging Face váhy modelu LongCat-Flash-Lite-Sparse. Má 69 miliard parametrů, licenci MIT bez jakýchkoli prahů a kontextové okno 983 040 tokenů, tedy o něco méně, než kolik karta modelu slibuje. Z konfigurace jsme spočítali, kolik paměti si vezmou váhy a plný kontext a o kolik model povyrostl proti husté verzi.

Serverovna v CERNu
Serverovna v CERNu. Váhy modelu LongCat-Flash-Lite-Sparse mají 138,3 GB, takže se na jednu akcelerátorovou kartu vejdou, ale bez místa na dlouhý kontext. Foto: Florian Hirzinger, Wikimedia Commons (CC BY-SA 3.0)

Čínský Meituan dal 31. července na Hugging Face váhy modelu LongCat-Flash-Lite-Sparse. Karta modelu ho popisuje jako model se směsí odborníků, tedy takový, kde se na každý token zapojí jen část sítě: z 69 miliard parametrů zhruba tři miliardy. Soubor LICENSE v repozitáři je holá licence MIT, bez prahu na tržby i bez prahu na počet uživatelů. Karta k ní dodává jedinou výhradu: práva k ochranným známkám a patentům Meituanu z ní neplynou.

Pod touž licencí vyšel týž den i ostrý DeepSeek V4-Flash, jehož váhy mají 166,9 GB. Souvislost je i technická: řídká pozornost Meituanu je podle karty rozšířením DeepSeek Sparse Attention.

Indexer řídké pozornosti stál 109 megabajtů

Model navazuje na LongCat-Flash-Lite z 27. ledna a liší se podle karty jedinou věcí: hustou pozornost nahradila vlastní řídká, kterou výrobce označuje LongCat Sparse Attention (LSA). Porovnání obou souborů config.json to potvrzuje. Shodují se v šířce (3072), v počtu vrstev (14), v počtu odborníků (256 a k tomu 128 „nulových“, které vstup jen propustí) i v tom, že se na token vybírá dvanáct z nich. Přibyla jen pole s předponou index_, tedy nastavení výběru tokenů.

Kolik ten výběr váží, se dá spočítat z rejstříků vah. Hustá verze v něm uvádí 138 179 712 000 bajtů, řídká 138 288 833 280. Rozdíl je 109 121 280 bajtů, tedy 109 MB – necelá desetina procenta celku, a při šestnáctibitových vahách zhruba 55 milionů parametrů. Vlastní přepočet z obou souborů.

Z okna 983 040 tokenů se čte 2 048

Karta mluví o nativní podpoře kontextu až do jednoho milionu tokenů. V config.json má pole max_position_embeddings hodnotu 983 040, což je o 1,7 % méně. Číslo není náhodné: je to 8 192 krát 120, tedy základní okno roztažené postupem YaRN s činitelem 120, který stojí o pár řádků níž v témže souboru. Hustý předchůdce měl 327 680, okno se tedy ztrojnásobilo přesně.

Rozdíl mezi zaokrouhleným slibem a nastavením není v oboru nový. Podobně se rozešel údaj o milionu tokenů u modelu Laguna S 2.1 s tím, na co byly nastavené balíčky, které k němu výrobce sám nabízel.

Řídká pozornost znamená, že se dotaz nedívá na celé okno. Rozpočet výběru je v config.json zapsaný jako index_topk s hodnotou 2048; podle názvů dalších polí z něj připadá 1024 na okolí právě zpracovávaného místa a 16 na začátek textu, zbytek vybírá indexer podle obsahu. Při plném okně je to 0,21 % dostupných tokenů (vlastní výpočet). Karta k tomu popisuje tři doplňky: přesun části rozpočtu na pevné okolí kvůli souvislému čtení z paměti, sdílení jednoho výběru mezi sousedními vrstvami a dvoustupňové skórování od hrubého k jemnému, které jde zapnout až při běhu.

Kolik paměti si to vezme

Váhy zaberou 138,3 GB. Kontext se k nim počítá zvlášť a u tohohle modelu vychází nezvykle malý, protože používá pozornost s latentním klíčem a hodnotou: z konfigurace plyne 512 plus 64 čísel na token a vrstvu. Ve formátu bfloat16, který si vyžádá spouštěcí příkaz uvedený v kartě, to je 16 128 bajtů na jeden token, při plném okně 15,9 GB. Dohromady s vahami 154 GB. Obojí je vlastní výpočet z údajů v konfiguraci.

Karta u nasazení píše, že se LongCat-Flash-Lite dá obsloužit na jednom uzlu, a jako příklad uvádí H20 se 141 GB. Ta věta se týká hustého předchůdce a mluví o uzlu, ne o jediné kartě, a na tom rozdílu záleží: samotné váhy by se na kartu se 141 GB vešly, plný kontext k nim už ne.

Naměřil to výrobce sám

Tabulka v kartě staví řídkou verzi proti husté. U agentního programování uvádí na SWE-Bench Verified 68,20 proti 54,40, u práce s nástroji na τ²-Telecom 95,18 proti 72,80. Obecné znalosti zůstávají na svém: MMLU 85,31 proti 85,52. Všechna čísla naměřil Meituan a údaje za hustou verzi navíc přebírá z její vlastní technické zprávy z 29. ledna, ne z jednoho společného měření. Nikdo nezávislý je zatím nezopakoval.

Ta lednová zpráva stojí za přečtení i kvůli něčemu jinému. Popisuje, že hustý předchůdce má 68,5 miliardy parametrů a přes 30 miliard z nich je v tabulkách vnoření, ne v odbornících. Řídká verze má v konfiguraci tentýž poměr, takže nejméně dvě pětiny těch 138 GB nepočítají nic, jen se z nich vyhledává.

V SGLangu je zatím otevřený návrh

Karta odkazuje na návrh změny 32918 v SGLangu. K 2. srpnu je otevřený a nesloučený, mění tři soubory o 26 přidaných řádcích a automatické zkoušky u něj neprošly; vyplývá to z rozhraní GitHubu. Vlastní repozitář s kódem model zatím nemá, přestože jich účet meituan-longcat vede sedmatřicet. Technická zpráva k řídké verzi leží jako PDF přímo v repozitáři na Hugging Face.

Za pozornost stojí poměr, který se z těch čísel skládá. Na jeden token se použijí 4,3 % parametrů, do paměti se ale musí vejít všech 138 GB, a řídká pozornost na tom nic nemění: šetří práci s kontextem, ne místo pro váhy. Podle nás je to hlavní důvod, proč se údaj o aktivních parametrech nedá číst jako nárok na hardware, i když se tak často cituje.

Zdroje: karta modelu, konfigurace a licence na Hugging Face, karta a konfigurace husté verze, technická zpráva na arXivunávrh změny v SGLangu.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    Místo průměru nejslabší výsledek: první pětka HELM Lite se vymění celá

    Pořadí modelů v žebříčku závisí na tom, jak se dílčí výsledky slijí do jednoho čísla. Práce ze sborníku workshopu GEM přepočítala dva veřejné žebříčky HELM podle…

  2. Čísla

    vLLM 0.26.0 bere tři, pět i sedm bitů na váhu. Dva bity model v měření položily

    Nástroje pro běh jazykových modelů zmenšují váhy skoro vždy na osm nebo čtyři bity. Vydání vLLM 0.26.0 z 27. července 2026 přidalo dvě schémata, která ke kratším šířkám…

  3. Čísla

    Font proti sběru dat: mezi čtyřmi filtry se jeho výsledek liší víc než třicetkrát

    Projekt ShieldFont zaměňuje slova ve zdroji stránky, aby robotům sbírajícím trénovací data podstrčil jiný text než čtenáři. Jeho vlastní měření v repozitáři zkoušelo…

  4. Čísla

    Test agentů nechal na Hugging Face 205 stejnojmenných modelů, 107 za tři dny

    Sada úloh Toolathlon nechává agenta nahrát model na Hugging Face pod pevným jménem MyAwesomeModel-TestRepo. Úklid je ale zapsaný v přípravě před testem, ne za ním, takže…