Přeskočit na obsah
U sebe doma 3 min čtení

Návod k modelu Ling-3.0-tiny radí zapnout zrychlení, které ten model nemá

Karta modelu Ling-3.0-tiny radí spustit ho příkazem, který zapíná spekulativní dekódování NEXTN. V konfiguraci téhož modelu ale stojí, že pomocnou vrstvu pro ně nemá, a dokumentace SGLangu to říká výslovně. Přepočítali jsme k tomu, kolik váhy zaberou v každé ze tří nabízených přesností.

Organizace inclusionAI zveřejnila 10. srpna 2026 model Ling-3.0-tiny a popisuje ho jako model na běh u sebe doma. Karta modelu jmenuje NVIDIA DGX Spark, MacBook s Apple Silicon a Mac mini a dodává, že si vystačí bez karet z datového centra. Její vlastní návod ale ukazuje, kolik práce to zatím stojí.

Zadní strana Mac mini s čipem M4 s viditelnými porty
Mac mini s čipem M4 patří k sestavám, na kterých autoři model vyzkoušeli. Foto: AzureSaturn, Wikimedia Commons (CC0)

Osm expertů ze 128 a okno na 131 072 tokenů

Ling-3.0-tiny je řídký model se směsí expertů (MoE): má 128 směrovaných expertů a na každý token zapojí osm z nich plus jednoho sdíleného. Karta uvádí 7,9 miliardy parametrů celkem a 1,3 miliardy aktivních na token. Kuchařka SGLangu píše u téhož modelu „~1,2 miliardy aktivních“ a rozdíl proti kartě nevysvětluje ani jedna strana.

Pozornost je poskládaná ze dvou druhů vrstev. Podle karty připadají na každý čtyřvrstvý blok tři vrstvy KDA a jedna vrstva MLA; celkem jich má model 24. Kontextové okno je v konfiguraci 131 072 tokenů a doporučený příkaz v kartě ho metodou YaRN roztahuje na 262 144.

Licence je MIT, ale stojí jedině v hlavičce karty jako řádek license: mit. Soubor LICENSE repozitář neobsahuje, stejně jako u většího sourozence Ling-3.0-flash. MIT je ustálený text bez prahů na tržby nebo počet uživatelů, takže z chybějícího souboru žádná neznámá podmínka neplyne.

Kolik váhy opravdu zaberou

Váhy jsou ke stažení ve třech přesnostech. Sečetli jsme velikosti souborů .safetensors tak, jak je u každého repozitáře vypisuje rozhraní Hugging Face:

  • bf16 ve výchozím repozitáři: 32 souborů, 15,79 GB, tedy 14,70 GiB;
  • fp8: 8,41 GB, tedy 7,83 GiB;
  • int4: 5,81 GB, tedy 5,41 GiB.

Karta slibuje „přibližně 8,34 GiB špičkové spotřeby paměti“ při kontextu osmi tisíc tokenů. To číslo se výslovně týká fp8 a po přepočtu sedí: váhy zaberou 7,83 GiB a na kontext s mezivýpočty zbývá zhruba půl gibibajtu. Kdo si ale stáhne výchozí repozitář, dostane bf16, a ten je skoro dvakrát větší.

Jedno číslo v repozitáři s bf16 nesedí vůbec. Soubor model.safetensors.index.json uvádí v položce total_size hodnotu 3,87 TB, tedy zhruba 245krát víc, než kolik váhy zabírají. U fp8, u int4 i u Ling-3.0-flash přitom táž položka odpovídá skutečnosti na jednotky kilobajtů. Jde tedy o chybu v jednom souboru, ne o jiný způsob počítání.

Doporučený příkaz zapíná to, co model nemá

V oddílu o SGLangu stojí, že jde o doporučený recept pro nízkou odezvu s vestavěným MTP a NEXTN a s kontextem 256K, a to na jedné kartě třídy 141 GB. Příkaz pod tím obsahuje přepínač --speculative-algorithm NEXTN. NEXTN je spekulativní dekódování: pomocná vrstva modelu předpovídá další token dopředu, hlavní část ho jen potvrdí, a tím se zkrátí čekání na odpověď.

Jenže v config.json téhož modelu stojí "num_nextn_predict_layers": 0. Kuchařka SGLangu to říká rovnou: Ling-3.0-tiny žádnou vestavěnou pomocnou vrstvu MTP nemá, a proto pro něj recept se spekulativním dekódováním neexistuje. Její generátor příkazů nabízí u tohohle modelu jedinou strategii, a tou je průchodnost.

Údaj o kartě se 141 GB paměti přitom neříká, kolik model potřebuje. Je to sestava, na které autoři recept vyzkoušeli, a patří k ní i přepínač --mem-fraction-static 0.8, který osm desetin karty rovnou zabere pro vyrovnávací paměť. Váhy z předchozího oddílu se vejdou do zlomku toho místa.

Do Ollamy vede zatím jen nesloučený návrh

Nejkratší cestou k běhu modelu na vlastním stroji bývá Ollama a právě její oddíl je nejvýmluvnější. Postup začíná tím, že si čtenář naklonuje repozitář Ollamy, přepne se na větev z návrhu změny 17643 a celý program si přeloží. Karta k tomu dodává, že podpora je omezená na běh přes MLX na Apple Silicon a že ve vydané Ollamě zatím není. Touž cestou šel Muse Glimmer.

Ten návrh je ke 12. srpnu 2026 otevřený. Podal ho 10. srpna uživatel aftersnow, má deset commitů a mění 27 souborů. Do jeho sloučení znamená věta „běží to na Macu“ přeložit si Ollamu ze zdrojových kódů. Sami jsme ten postup nezkoušeli, popisujeme ho podle dokumentace.

Import navíc míří na bf16 váhy, tedy na těch 15,79 GB, a kontext se v návodu nastavuje na 8 192 tokenů. Sestava, na které to autoři ověřili, je MacBook s čipem M4 Pro a 48 GB sjednocené paměti. U vLLM je to podobné: instaluje se z odnože inclusionAI/vllm-ling-v3, ne z vydaného balíčku.

Jediné číslo o schopnostech modelu, které nepochází od jeho autorů, změřil tým SGLangu: 94,01 % na sadě úloh GSM8K, na vývojovém sestavení sglang dev-Ling-3.0-tiny. Zbytek výsledků má karta jen v obrázku, stejně jako u flashe. Kdo si chce model pustit dnes, má tedy dvě různá zadání od dvou stran: kartu modelu s příkazem, který si žádá funkci navíc, a kuchařku SGLangu, jejíž generátor tu funkci u Ling-3.0-tiny vůbec nenabízí.

Zdroje: karta modelu Ling-3.0-tiny včetně souboru config.json, kuchařka SGLangu, návrh změny 17643 v Ollamě a výpisy souborů z rozhraní Hugging Face pro repozitáře fp8int4.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. U sebe doma

    vLLM 0.27.0 přeskočil PyTorch 2.12 a přechod na 2.13 stál čtyři ústupky v testech

    Vydání vLLM 0.27.0 z 10. srpna 2026 má v závislostech pevně zadaný torch 2.13.0 místo dosavadního 2.11.0. Mezi těmi dvěma čísly leží dvě vydání PyTorche, která projekt…

  2. U sebe doma

    Muse Glimmer v Ollamě má 21 GB a zatím běží jen na Apple Silicon

    Ollama 0.32.7 přidala třicetimiliardový multimodální model od Mety. Varianta pro MLX stahuje 21,2 GB dat, Meta nejmenší kvantizaci míří do 24GB paměťového rozpočtu a…

  3. U sebe doma

    Ollama přestala opisovat otisky všech vrstev do konfigurace modelu

    Ollama 9. srpna odstranila z hlavní vývojové větve pole rootfs.diff_ids, které do konfigurace modelu podruhé zapisovalo otisky všech vrstev. U modelů tvořených soubory…

  4. U sebe doma

    Server llama.cpp umí nástroje oddělit do Dockeru, výchozí kontejner jim ale nechává síť

    Nový parametr serveru llama.cpp posílá vestavěné nástroje agenta do nového nebo už běžícího kontejneru Docker. Bez něj nástroje dál běží přímo na hostitelském systému.…