Návod k modelu Ling-3.0-tiny radí zapnout zrychlení, které ten model nemá
Karta modelu Ling-3.0-tiny radí spustit ho příkazem, který zapíná spekulativní dekódování NEXTN. V konfiguraci téhož modelu ale stojí, že pomocnou vrstvu pro ně nemá, a dokumentace SGLangu to říká výslovně. Přepočítali jsme k tomu, kolik váhy zaberou v každé ze tří nabízených přesností.
Organizace inclusionAI zveřejnila 10. srpna 2026 model Ling-3.0-tiny a popisuje ho jako model na běh u sebe doma. Karta modelu jmenuje NVIDIA DGX Spark, MacBook s Apple Silicon a Mac mini a dodává, že si vystačí bez karet z datového centra. Její vlastní návod ale ukazuje, kolik práce to zatím stojí.

Osm expertů ze 128 a okno na 131 072 tokenů
Ling-3.0-tiny je řídký model se směsí expertů (MoE): má 128 směrovaných expertů a na každý token zapojí osm z nich plus jednoho sdíleného. Karta uvádí 7,9 miliardy parametrů celkem a 1,3 miliardy aktivních na token. Kuchařka SGLangu píše u téhož modelu „~1,2 miliardy aktivních“ a rozdíl proti kartě nevysvětluje ani jedna strana.
Pozornost je poskládaná ze dvou druhů vrstev. Podle karty připadají na každý čtyřvrstvý blok tři vrstvy KDA a jedna vrstva MLA; celkem jich má model 24. Kontextové okno je v konfiguraci 131 072 tokenů a doporučený příkaz v kartě ho metodou YaRN roztahuje na 262 144.
Licence je MIT, ale stojí jedině v hlavičce karty jako řádek license: mit. Soubor LICENSE repozitář neobsahuje, stejně jako u většího sourozence Ling-3.0-flash. MIT je ustálený text bez prahů na tržby nebo počet uživatelů, takže z chybějícího souboru žádná neznámá podmínka neplyne.
Kolik váhy opravdu zaberou
Váhy jsou ke stažení ve třech přesnostech. Sečetli jsme velikosti souborů .safetensors tak, jak je u každého repozitáře vypisuje rozhraní Hugging Face:
- bf16 ve výchozím repozitáři: 32 souborů, 15,79 GB, tedy 14,70 GiB;
- fp8: 8,41 GB, tedy 7,83 GiB;
- int4: 5,81 GB, tedy 5,41 GiB.
Karta slibuje „přibližně 8,34 GiB špičkové spotřeby paměti“ při kontextu osmi tisíc tokenů. To číslo se výslovně týká fp8 a po přepočtu sedí: váhy zaberou 7,83 GiB a na kontext s mezivýpočty zbývá zhruba půl gibibajtu. Kdo si ale stáhne výchozí repozitář, dostane bf16, a ten je skoro dvakrát větší.
Jedno číslo v repozitáři s bf16 nesedí vůbec. Soubor model.safetensors.index.json uvádí v položce total_size hodnotu 3,87 TB, tedy zhruba 245krát víc, než kolik váhy zabírají. U fp8, u int4 i u Ling-3.0-flash přitom táž položka odpovídá skutečnosti na jednotky kilobajtů. Jde tedy o chybu v jednom souboru, ne o jiný způsob počítání.
Doporučený příkaz zapíná to, co model nemá
V oddílu o SGLangu stojí, že jde o doporučený recept pro nízkou odezvu s vestavěným MTP a NEXTN a s kontextem 256K, a to na jedné kartě třídy 141 GB. Příkaz pod tím obsahuje přepínač --speculative-algorithm NEXTN. NEXTN je spekulativní dekódování: pomocná vrstva modelu předpovídá další token dopředu, hlavní část ho jen potvrdí, a tím se zkrátí čekání na odpověď.
Jenže v config.json téhož modelu stojí "num_nextn_predict_layers": 0. Kuchařka SGLangu to říká rovnou: Ling-3.0-tiny žádnou vestavěnou pomocnou vrstvu MTP nemá, a proto pro něj recept se spekulativním dekódováním neexistuje. Její generátor příkazů nabízí u tohohle modelu jedinou strategii, a tou je průchodnost.
Údaj o kartě se 141 GB paměti přitom neříká, kolik model potřebuje. Je to sestava, na které autoři recept vyzkoušeli, a patří k ní i přepínač --mem-fraction-static 0.8, který osm desetin karty rovnou zabere pro vyrovnávací paměť. Váhy z předchozího oddílu se vejdou do zlomku toho místa.
Do Ollamy vede zatím jen nesloučený návrh
Nejkratší cestou k běhu modelu na vlastním stroji bývá Ollama a právě její oddíl je nejvýmluvnější. Postup začíná tím, že si čtenář naklonuje repozitář Ollamy, přepne se na větev z návrhu změny 17643 a celý program si přeloží. Karta k tomu dodává, že podpora je omezená na běh přes MLX na Apple Silicon a že ve vydané Ollamě zatím není. Touž cestou šel Muse Glimmer.
Ten návrh je ke 12. srpnu 2026 otevřený. Podal ho 10. srpna uživatel aftersnow, má deset commitů a mění 27 souborů. Do jeho sloučení znamená věta „běží to na Macu“ přeložit si Ollamu ze zdrojových kódů. Sami jsme ten postup nezkoušeli, popisujeme ho podle dokumentace.
Import navíc míří na bf16 váhy, tedy na těch 15,79 GB, a kontext se v návodu nastavuje na 8 192 tokenů. Sestava, na které to autoři ověřili, je MacBook s čipem M4 Pro a 48 GB sjednocené paměti. U vLLM je to podobné: instaluje se z odnože inclusionAI/vllm-ling-v3, ne z vydaného balíčku.
Jediné číslo o schopnostech modelu, které nepochází od jeho autorů, změřil tým SGLangu: 94,01 % na sadě úloh GSM8K, na vývojovém sestavení sglang dev-Ling-3.0-tiny. Zbytek výsledků má karta jen v obrázku, stejně jako u flashe. Kdo si chce model pustit dnes, má tedy dvě různá zadání od dvou stran: kartu modelu s příkazem, který si žádá funkci navíc, a kuchařku SGLangu, jejíž generátor tu funkci u Ling-3.0-tiny vůbec nenabízí.
Zdroje: karta modelu Ling-3.0-tiny včetně souboru config.json, kuchařka SGLangu, návrh změny 17643 v Ollamě a výpisy souborů z rozhraní Hugging Face pro repozitáře fp8 a int4.