Přeskočit na obsah
Modely 4 min čtení

Ling-3.0-flash popisuje podmínky měření podrobně, výsledky testů má jen v obrázcích

Skupina inclusionAI zveřejnila 2. srpna 2026 na Hugging Face model Ling-3.0-flash: 124 miliardy vah, z toho 5,1 miliardy aktivních při každém tokenu, licence MIT. U testů karta uvádí nástroj, ve kterém běžely, teplotu vzorkování i model, který odpovědi hodnotil. Jediný výsledek v textu ale není – všechna čísla jsou zavřená ve třech grafech.

Organizace inclusionAI vydala 2. srpna 2026 jazykový model Ling-3.0-flash. Je to směs expertů: v každé ze 42 vrstev vybere směrovač osm z 512 expertů a přidá k nim jednoho sdíleného, takže se ze 124 miliard vah použije na každý token 5,1 miliardy. To je 4,1 % celku, vlastní podíl obou čísel z karty.

Pozornost je hybridní. Pětatřicet vrstev jede na lineární pozornosti KDA, sedm na klasické MLA a střídají se v poměru pět ku jedné. Lineární vrstva si místo rostoucí zásoby klíčů a hodnot nese stav pevné velikosti, takže dlouhý kontext stojí méně paměti. Okno má podle souboru config.json 262 144 tokenů a trénovalo se ve třech krocích, z 8 tisíc přes 32 tisíc na 256 tisíc.

Serverovna s racky
Serverovna s racky. Foto: Carl Lender, Wikimedia Commons (CC BY 2.0)

Za značkou inclusionAI stojí Ant Group. Karta modelu to nikde neříká, ale hlavička přiloženého kódu nese copyright Antgroup a obrázky v kartě leží na doméně Alipay.

Devět odstavců o tom, jak se měřilo

Oddíl s hodnocením je proti běžné kartě modelu nezvykle pečlivý. Devět odstavců popisuje, za jakých podmínek se jednotlivé testy pouštěly, a čtyři další rozvádějí úlohy s vyhledáváním. U sady SWE-Bench stojí, že běžela v nástroji OpenHands s teplotou 0,6 a oknem 256 tisíc tokenů. Terminal-Bench 2.1 má uvedený dvouhodinový časový strop a průměr ze tří běhů, SkillsBench 87 úloh, MCP-Atlas 500 úloh se stropem dvaceti kol a GDPval v2 220 úloh se stropem 250 kol a pěti hodinami času.

Pozoruhodné je, kdo v těch testech rozhoduje. Odpovědi u MCP-Atlas hodnotil Gemini 2.5 Pro, u testu WideSearch GPT-4.1, u testu Draco Claude Opus 4.6 a u bankovní úlohy Tau3 dělal GPT-5.4-mini zároveň simulovaného uživatele i rozhodčího. Jsou to vesměs modely konkurence.

Co v celém oddílu není, je jediné číslo. Ani jedno procento, ani jeden bodový zisk. Všechny výsledky jsou ve třech obrázcích, které karta vkládá přes proxy serveru Alipay; prohlížeči se po dvou přesměrováních načtou, ale opsat, vyhledat ani porovnat je z textu nejde.

Výsledek testu je tvrzení výrobce, dokud ho nezopakuje někdo jiný – a na způsobu měření může viset celé pořadí, jak ukázala změna metodiky u žebříčku HELM Lite. Ling-3.0-flash k zopakování dává dost podrobný návod, ale dva z devíti popsaných testů se zvenčí spustit nedají: AntSWEBench je podle karty vnitřní test Ant Group a u vyhledávacích úloh běžel rovněž vnitřní nástroj.

Jediné číslo o rychlosti nemá k čemu se vztáhnout

Jedno výkonnostní číslo v textu karty přece jen je. Díky vrstvené vyrovnávací paměti (SGLang HiCache s úložištěm Mooncake) prý u dlouhých vstupů klesá čas do prvního tokenu o 60 % až přes 80 %. Proti čemu se to počítá, na jakém hardwaru a jak dlouhý ten vstup je, karta neuvádí. Druhý údaj z textu, přes deset tisíc interaktivních prostředí použitých při trénování, je zase číslo, které nikdo zvenčí neověří.

Váhy mají 255 GB, karta mluví o 124 miliardách

Rejstřík model.safetensors.index.json uvádí u 24 souborů s váhami dohromady 254 973 142 144 bajtů, tedy 255 GB (237,5 GiB). Váhy jsou v bfloat16, takže na parametr připadají dva bajty a v souborech je 127,5 miliardy parametrů, o 3,5 miliardy víc, než říká záhlaví karty. Rozdíl zhruba odpovídá jedné vrstvě expertů navíc, kterou balík nese pro spekulativní dekódování a kterou má config.json pod klíčem num_nextn_predict_layers. Obojí je vlastní výpočet z velikosti souborů a z rozměrů v config.json.

Aktivních 5,1 miliardy parametrů je údaj o výpočtu, ne o paměti: do té musí model celý. Karta doporučuje čtyři karty třídy 141 GB (H20-3e) nebo čtyřkartový uzel Blackwell; na osmdesátigigabajtových H100 a H800 chce model rozdělit na osm dílů. Kuchařka SGLangu k tomu nabízí šest hardwarových sestav – GB300, B200, H200, H100, H20-3e a H800 – ve dvou přesnostech, BF16 a FP8. Zmenšené podoby pro FP8, INT4 a FP4 vydala inclusionAI 4. srpna.

Slibovaných 256 tisíc tokenů se přitom nedostane samo. Klíč rope_scaling je v config.json prázdný, takže se natažení kontextu metodou YaRN dosazuje až ve spouštěcím příkazu a SGLang k tomu navíc potřebuje proměnnou prostředí, která přepsání délky povolí. U vLLM karta doporučuje vlastní větev od výrobce. Repozitář s ní vznikl 13. července a poslední zápis ve větvi ling_3_0 je z 2. srpna, tedy z téhož dne jako karta modelu.

MIT je v hlavičce, soubor s licencí v repozitáři není

Licenci uvádí jediné slovo v hlavičce karty: license: mit. Samostatný soubor LICENSE v repozitáři není a nemají ho ani starší modely téže organizace, tedy Ling-1T, Ring-2.6-1T a Ling-flash-2.0. Jediné plné licenční znění, které se s modelem stáhne, je Apache 2.0 v hlavičce souboru modeling_bailing_moe_v3.py. Týká se kódu, ne vah – a ten kód musí uživatel spustit, protože bez něj se model nenačte.

Samotné MIT je přitom to nejvolnější, co v téhle kategorii chodí: žádný práh tržeb, žádný seznam vyloučených zemí, žádná povinnost pojmenovat po výrobci odvozený model. Stejnou cestou jde i DeepSeek u modelu V4-Flash.

Kde se dá vyzkoušet bez vlastního hardwaru

Model běží zdarma na OpenRouteru, u jediného poskytovatele a s oknem 262 tisíc tokenů. Jako datum vydání tam ovšem stojí 23. července, tedy o deset dní dřív, než na Hugging Face vznikla karta modelu; k čemu se to starší datum vztahuje, OpenRouter neuvádí.

Čísla ze tří grafů zůstanou tvrzením výrobce, dokud je někdo nezopakuje. Podklad k tomu je v kartě podrobnější než u většiny konkurence: u testů, které karta označuje za veřejné, stačí je pustit znovu podle popsaného postupu. Teprve pak bude co porovnávat.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Ternární model Maple-Preview má v hlavním repozitáři 40 GB vah místo slíbených 5,31

    DeepGrove zveřejnil 4. srpna 2026 pod licencí MIT ternární model Maple-Preview: 20,21 miliardy vah, z toho 1,49 miliardy aktivních při každém tokenu. Karta modelu…

  2. Modely

    AMD popisuje Instella-MoE jako plně otevřený model, licence vah dovoluje jen výzkum

    AMD dala na Hugging Face model Instella-MoE-16B-A3B a s ním kontrolní body ze všech šesti fází tréninku. Kód k němu je pod licencí MIT, váhy pod licencí RESEARCH-ONLY…

  3. Modely

    LG dala K-EXAONE 2.0 s 1,5 TB vah pod Apache 2.0 místo vlastní licence

    Korejská LG AI Research zveřejnila K-EXAONE 2.0, model se 750 miliardami parametrů, z nichž se na token používá 37 miliard. Váhy zabírají 1 497,7 GB a model vznikl…

  4. Modely

    NVIDIA radí sdílet KV hlavu mezi víc dotazů, ale neříká, na kterých GPU měřila

    Nový technický rozbor rozděluje obsluhu dlouhého kontextu na dvě odlišné úlohy: načtení zadání omezuje výpočetní výkon, generování dalšího tokenu propustnost paměti.…