AMD popisuje Instella-MoE jako plně otevřený model, licence vah dovoluje jen výzkum
AMD dala na Hugging Face model Instella-MoE-16B-A3B a s ním kontrolní body ze všech šesti fází tréninku. Kód k němu je pod licencí MIT, váhy pod licencí RESEARCH-ONLY RAIL, která povoluje jen akademické a výzkumné použití. Zveřejněné konfigurace navíc uvádějí u doladěných kontrolních bodů poloviční kontextové okno, než jaké slibuje oznámení.

AMD dala 23. července na Hugging Face šest repozitářů s modelem Instella-MoE-16B-A3B. Nejsou to varianty jednoho modelu, ale kontrolní body z po sobě jdoucích fází jednoho tréninku: předtrénink, mezitrénink, rozšíření kontextu, supervizované doladění, preferenční ladění a závěrečné doladění posilovaným učením. Den nato k nim vyšel zápis na blogu ROCm, který popisuje datové směsi i nastavení každé fáze.
Blog i karta modelu o Instelle mluví jako o plně otevřeném modelu. Trénovacího kódu se to týká doslova: repozitář AMD-AGI/Instella-MoE má licenci MIT. Váhy mají jinou.
Šestnáct miliard parametrů, aktivních 2,8 miliardy
Instella-MoE je model se směsí expertů: místo aby na každý token počítal celou síť, zapojí jen její část. Konfigurace uvádí 27 vrstev, skrytý rozměr 2 048, 64 směrovaných expertů a 2 sdílené, přičemž na token se vybírá 6 směrovaných. Ze 16 miliard parametrů se tak podle blogu počítá 2,8 miliardy. Předtrénink spotřeboval 7,1 bilionu tokenů a běžel na kartách AMD Instinct MI300X a MI325X.
V souboru config.json stojí u položky model_type hodnota deepseek_v3. Architektura tedy vychází z pozornosti s latentní projekcí, kterou zavedl DeepSeek, a AMD k ní přidala učené hradlo na výstupu a vlastní propojení expertů zvané FarSkip-Collective.
Kód pod MIT, váhy jen pro výzkum
Soubor LICENSE u vah se jmenuje RESEARCH-ONLY RAIL Model License. Povolený účel v něm definuje jediná věta: v originále „academic or research purposes only“, tedy pouze akademické nebo výzkumné účely. Autorskoprávní i patentové oprávnění platí výhradně v souvislosti s tímto účelem, takže komerční nasazení licence nepokrývá.
Zkratka RAIL označuje rodinu licencí, které k modelu připojují omezení chování, ne jen podmínky šíření; spravuje ji volné sdružení Responsible AI Licenses. U AMD to není novinka. Stejný typ licence měl už Instella-3B z března 2025.
Vlastní zákazy jsou v příloze A pod hlavičkou AMD Responsible AI Use Policy a je jich devět: porušování zákonů, násilný nebo sexuálně explicitní obsah, škodlivá užití včetně podvodu a vydávání se za člověka, vysoce riziková nasazení včetně zbraní, zpracování osobních údajů bez oprávnění, zásahy do duševního vlastnictví, tvorba škodlivého kódu, zatajení toho, že s uživatelem mluví model, a spoléhání na výstup bez posouzení. Článek 4 z nich dělá závaznou podmínku užití.
Šířit váhy dál licence dovoluje a dovoluje i provozovat model jako vzdálenou službu. Článek 6 k tomu váže pět podmínek: předat příjemci celé znění licence, uvést zákazy jako předpoklad jakékoli navazující smlouvy, viditelně označit změněné soubory, ponechat údaje o autorství a držet povolený účel i u dalších příjemců. Při porušení licence podle článku 12 zaniká a stažené soubory se mají smazat.
Jiní výrobci to řeší jinak. Inkling-Small má váhy pod Apache 2.0 a pravidla chování vedle ní. U videomodelu MiniMax H3 je omezení naopak zeměpisné.
Okno na 65 536 tokenů má jen základní kontrolní bod
Blog uvádí, že fáze rozšíření kontextu protáhla okno ze 4 096 na 65 536 tokenů. Ve zveřejněných konfiguracích to tak má jediný ze šesti kontrolních bodů. Položka max_position_embeddings je 65 536 u bodu Base, ale 32 768 u doladěných bodů SFT, DPO i Think. U prvních dvou, z předtréninku a mezitréninku, zůstalo 4 096.
Prakticky to znamená, že kdo si stáhne Think, tedy verzi určenou k běžnému používání, dostane polovinu okna, o kterém mluví oznámení. Blog ani karta modelu ten rozdíl nezmiňují.
Váhy zaberou 31,73 GB
Šest souborů se samotnými váhami má podle rozhraní Hugging Face dohromady 31,73 GB, tedy 29,55 GiB; sečetli jsme je z výpisu repozitáře. Uloženy jsou v bfloat16, což jsou dva bajty na parametr. Na kartu s 24 GB paměti se tedy nevejdou. Na kartě s 32 GB po nich zbude kolem 2,5 GiB.
K tomu je potřeba připočíst vyrovnávací paměť klíčů a hodnot, kterou si model drží pro už zpracovaný text. Latentní pozornost ji udržuje malou: konfigurace uvádí 512 latentních hodnot a 32 hodnot s rotační složkou na vrstvu a token, což je 544 hodnot krát 27 vrstev krát dva bajty, tedy 28,7 KiB na token. Při plném okně 32 768 tokenů z toho vychází 0,9 GiB, takže se model i s plným kontextem na kartu s 32 GB vejde. Ten výpočet je náš, karta modelu žádné číslo o paměti neuvádí.
Čísla o zrychlení změřila AMD sama
Blog uvádí, že propojení FarSkip-Collective zrychlilo předtrénink o 12,7 % a že při obsluze s expertním paralelismem v SGLangu klesla doba do prvního tokenu až o 39,2 %. Obojí měřila AMD sama na vlastních kartách a doklad je zatím jen graf v tom blogu. Technická zpráva podle něj teprve vyjde.
Výsledky testů schopností jsou v kartě modelu i na blogu jen jako obrázky tabulek, takže se z nich nedá nic vyčíst jinak než okem. Průměry 76,7 u základního bodu a 73,22 u Thinku z nich vypsal přehled na serveru MarkTechPost. U doladěných bodů karta modelu uvádí, že je AMD měřila nástrojem OLMES s délkou odpovědi do 32 768 tokenů.
Pro čtenáře, který si chce z Instelly něco postavit, z toho plyne dělicí čára uprostřed vydání: trénovací a inferenční řetězec je použitelný bez omezení, váhy jen ve výzkumu. Dva první převody do formátu GGUF se na Hugging Face objevily 31. července a pole s licencí u obou zůstalo nevyplněné, ačkoli článek 6 předání licence dalším příjemcům vyžaduje.