Ling-3.0-flash popisuje podmínky měření podrobně, výsledky testů má jen v obrázcích
Skupina inclusionAI zveřejnila 2. srpna 2026 na Hugging Face model Ling-3.0-flash: 124 miliardy vah, z toho 5,1 miliardy aktivních při každém tokenu, licence MIT. U testů karta uvádí nástroj, ve kterém běžely, teplotu vzorkování i model, který odpovědi hodnotil. Jediný výsledek v textu ale není – všechna čísla jsou zavřená ve třech grafech.
Organizace inclusionAI vydala 2. srpna 2026 jazykový model Ling-3.0-flash. Je to směs expertů: v každé ze 42 vrstev vybere směrovač osm z 512 expertů a přidá k nim jednoho sdíleného, takže se ze 124 miliard vah použije na každý token 5,1 miliardy. To je 4,1 % celku, vlastní podíl obou čísel z karty.
Pozornost je hybridní. Pětatřicet vrstev jede na lineární pozornosti KDA, sedm na klasické MLA a střídají se v poměru pět ku jedné. Lineární vrstva si místo rostoucí zásoby klíčů a hodnot nese stav pevné velikosti, takže dlouhý kontext stojí méně paměti. Okno má podle souboru config.json 262 144 tokenů a trénovalo se ve třech krocích, z 8 tisíc přes 32 tisíc na 256 tisíc.

Za značkou inclusionAI stojí Ant Group. Karta modelu to nikde neříká, ale hlavička přiloženého kódu nese copyright Antgroup a obrázky v kartě leží na doméně Alipay.
Devět odstavců o tom, jak se měřilo
Oddíl s hodnocením je proti běžné kartě modelu nezvykle pečlivý. Devět odstavců popisuje, za jakých podmínek se jednotlivé testy pouštěly, a čtyři další rozvádějí úlohy s vyhledáváním. U sady SWE-Bench stojí, že běžela v nástroji OpenHands s teplotou 0,6 a oknem 256 tisíc tokenů. Terminal-Bench 2.1 má uvedený dvouhodinový časový strop a průměr ze tří běhů, SkillsBench 87 úloh, MCP-Atlas 500 úloh se stropem dvaceti kol a GDPval v2 220 úloh se stropem 250 kol a pěti hodinami času.
Pozoruhodné je, kdo v těch testech rozhoduje. Odpovědi u MCP-Atlas hodnotil Gemini 2.5 Pro, u testu WideSearch GPT-4.1, u testu Draco Claude Opus 4.6 a u bankovní úlohy Tau3 dělal GPT-5.4-mini zároveň simulovaného uživatele i rozhodčího. Jsou to vesměs modely konkurence.
Co v celém oddílu není, je jediné číslo. Ani jedno procento, ani jeden bodový zisk. Všechny výsledky jsou ve třech obrázcích, které karta vkládá přes proxy serveru Alipay; prohlížeči se po dvou přesměrováních načtou, ale opsat, vyhledat ani porovnat je z textu nejde.
Výsledek testu je tvrzení výrobce, dokud ho nezopakuje někdo jiný – a na způsobu měření může viset celé pořadí, jak ukázala změna metodiky u žebříčku HELM Lite. Ling-3.0-flash k zopakování dává dost podrobný návod, ale dva z devíti popsaných testů se zvenčí spustit nedají: AntSWEBench je podle karty vnitřní test Ant Group a u vyhledávacích úloh běžel rovněž vnitřní nástroj.
Jediné číslo o rychlosti nemá k čemu se vztáhnout
Jedno výkonnostní číslo v textu karty přece jen je. Díky vrstvené vyrovnávací paměti (SGLang HiCache s úložištěm Mooncake) prý u dlouhých vstupů klesá čas do prvního tokenu o 60 % až přes 80 %. Proti čemu se to počítá, na jakém hardwaru a jak dlouhý ten vstup je, karta neuvádí. Druhý údaj z textu, přes deset tisíc interaktivních prostředí použitých při trénování, je zase číslo, které nikdo zvenčí neověří.
Váhy mají 255 GB, karta mluví o 124 miliardách
Rejstřík model.safetensors.index.json uvádí u 24 souborů s váhami dohromady 254 973 142 144 bajtů, tedy 255 GB (237,5 GiB). Váhy jsou v bfloat16, takže na parametr připadají dva bajty a v souborech je 127,5 miliardy parametrů, o 3,5 miliardy víc, než říká záhlaví karty. Rozdíl zhruba odpovídá jedné vrstvě expertů navíc, kterou balík nese pro spekulativní dekódování a kterou má config.json pod klíčem num_nextn_predict_layers. Obojí je vlastní výpočet z velikosti souborů a z rozměrů v config.json.
Aktivních 5,1 miliardy parametrů je údaj o výpočtu, ne o paměti: do té musí model celý. Karta doporučuje čtyři karty třídy 141 GB (H20-3e) nebo čtyřkartový uzel Blackwell; na osmdesátigigabajtových H100 a H800 chce model rozdělit na osm dílů. Kuchařka SGLangu k tomu nabízí šest hardwarových sestav – GB300, B200, H200, H100, H20-3e a H800 – ve dvou přesnostech, BF16 a FP8. Zmenšené podoby pro FP8, INT4 a FP4 vydala inclusionAI 4. srpna.
Slibovaných 256 tisíc tokenů se přitom nedostane samo. Klíč rope_scaling je v config.json prázdný, takže se natažení kontextu metodou YaRN dosazuje až ve spouštěcím příkazu a SGLang k tomu navíc potřebuje proměnnou prostředí, která přepsání délky povolí. U vLLM karta doporučuje vlastní větev od výrobce. Repozitář s ní vznikl 13. července a poslední zápis ve větvi ling_3_0 je z 2. srpna, tedy z téhož dne jako karta modelu.
MIT je v hlavičce, soubor s licencí v repozitáři není
Licenci uvádí jediné slovo v hlavičce karty: license: mit. Samostatný soubor LICENSE v repozitáři není a nemají ho ani starší modely téže organizace, tedy Ling-1T, Ring-2.6-1T a Ling-flash-2.0. Jediné plné licenční znění, které se s modelem stáhne, je Apache 2.0 v hlavičce souboru modeling_bailing_moe_v3.py. Týká se kódu, ne vah – a ten kód musí uživatel spustit, protože bez něj se model nenačte.
Samotné MIT je přitom to nejvolnější, co v téhle kategorii chodí: žádný práh tržeb, žádný seznam vyloučených zemí, žádná povinnost pojmenovat po výrobci odvozený model. Stejnou cestou jde i DeepSeek u modelu V4-Flash.
Kde se dá vyzkoušet bez vlastního hardwaru
Model běží zdarma na OpenRouteru, u jediného poskytovatele a s oknem 262 tisíc tokenů. Jako datum vydání tam ovšem stojí 23. července, tedy o deset dní dřív, než na Hugging Face vznikla karta modelu; k čemu se to starší datum vztahuje, OpenRouter neuvádí.
Čísla ze tří grafů zůstanou tvrzením výrobce, dokud je někdo nezopakuje. Podklad k tomu je v kartě podrobnější než u většiny konkurence: u testů, které karta označuje za veřejné, stačí je pustit znovu podle popsaného postupu. Teprve pak bude co porovnávat.