Přeskočit na obsah
Modely 4 min čtení

AMD popisuje Instella-MoE jako plně otevřený model, licence vah dovoluje jen výzkum

AMD dala na Hugging Face model Instella-MoE-16B-A3B a s ním kontrolní body ze všech šesti fází tréninku. Kód k němu je pod licencí MIT, váhy pod licencí RESEARCH-ONLY RAIL, která povoluje jen akademické a výzkumné použití. Zveřejněné konfigurace navíc uvádějí u doladěných kontrolních bodů poloviční kontextové okno, než jaké slibuje oznámení.

Sídlo AMD v Santa Claře
Sídlo AMD v Santa Claře. Váhy modelu Instella-MoE mají 31,73 GB a licence u nich dovoluje jen akademické a výzkumné použití. Foto: Lijiaxuan, Wikimedia Commons (CC0)

AMD dala 23. července na Hugging Face šest repozitářů s modelem Instella-MoE-16B-A3B. Nejsou to varianty jednoho modelu, ale kontrolní body z po sobě jdoucích fází jednoho tréninku: předtrénink, mezitrénink, rozšíření kontextu, supervizované doladění, preferenční ladění a závěrečné doladění posilovaným učením. Den nato k nim vyšel zápis na blogu ROCm, který popisuje datové směsi i nastavení každé fáze.

Blog i karta modelu o Instelle mluví jako o plně otevřeném modelu. Trénovacího kódu se to týká doslova: repozitář AMD-AGI/Instella-MoE má licenci MIT. Váhy mají jinou.

Šestnáct miliard parametrů, aktivních 2,8 miliardy

Instella-MoE je model se směsí expertů: místo aby na každý token počítal celou síť, zapojí jen její část. Konfigurace uvádí 27 vrstev, skrytý rozměr 2 048, 64 směrovaných expertů a 2 sdílené, přičemž na token se vybírá 6 směrovaných. Ze 16 miliard parametrů se tak podle blogu počítá 2,8 miliardy. Předtrénink spotřeboval 7,1 bilionu tokenů a běžel na kartách AMD Instinct MI300X a MI325X.

V souboru config.json stojí u položky model_type hodnota deepseek_v3. Architektura tedy vychází z pozornosti s latentní projekcí, kterou zavedl DeepSeek, a AMD k ní přidala učené hradlo na výstupu a vlastní propojení expertů zvané FarSkip-Collective.

Kód pod MIT, váhy jen pro výzkum

Soubor LICENSE u vah se jmenuje RESEARCH-ONLY RAIL Model License. Povolený účel v něm definuje jediná věta: v originále „academic or research purposes only“, tedy pouze akademické nebo výzkumné účely. Autorskoprávní i patentové oprávnění platí výhradně v souvislosti s tímto účelem, takže komerční nasazení licence nepokrývá.

Zkratka RAIL označuje rodinu licencí, které k modelu připojují omezení chování, ne jen podmínky šíření; spravuje ji volné sdružení Responsible AI Licenses. U AMD to není novinka. Stejný typ licence měl už Instella-3B z března 2025.

Vlastní zákazy jsou v příloze A pod hlavičkou AMD Responsible AI Use Policy a je jich devět: porušování zákonů, násilný nebo sexuálně explicitní obsah, škodlivá užití včetně podvodu a vydávání se za člověka, vysoce riziková nasazení včetně zbraní, zpracování osobních údajů bez oprávnění, zásahy do duševního vlastnictví, tvorba škodlivého kódu, zatajení toho, že s uživatelem mluví model, a spoléhání na výstup bez posouzení. Článek 4 z nich dělá závaznou podmínku užití.

Šířit váhy dál licence dovoluje a dovoluje i provozovat model jako vzdálenou službu. Článek 6 k tomu váže pět podmínek: předat příjemci celé znění licence, uvést zákazy jako předpoklad jakékoli navazující smlouvy, viditelně označit změněné soubory, ponechat údaje o autorství a držet povolený účel i u dalších příjemců. Při porušení licence podle článku 12 zaniká a stažené soubory se mají smazat.

Jiní výrobci to řeší jinak. Inkling-Small má váhy pod Apache 2.0 a pravidla chování vedle ní. U videomodelu MiniMax H3 je omezení naopak zeměpisné.

Okno na 65 536 tokenů má jen základní kontrolní bod

Blog uvádí, že fáze rozšíření kontextu protáhla okno ze 4 096 na 65 536 tokenů. Ve zveřejněných konfiguracích to tak má jediný ze šesti kontrolních bodů. Položka max_position_embeddings je 65 536 u bodu Base, ale 32 768 u doladěných bodů SFT, DPO i Think. U prvních dvou, z předtréninku a mezitréninku, zůstalo 4 096.

Prakticky to znamená, že kdo si stáhne Think, tedy verzi určenou k běžnému používání, dostane polovinu okna, o kterém mluví oznámení. Blog ani karta modelu ten rozdíl nezmiňují.

Váhy zaberou 31,73 GB

Šest souborů se samotnými váhami má podle rozhraní Hugging Face dohromady 31,73 GB, tedy 29,55 GiB; sečetli jsme je z výpisu repozitáře. Uloženy jsou v bfloat16, což jsou dva bajty na parametr. Na kartu s 24 GB paměti se tedy nevejdou. Na kartě s 32 GB po nich zbude kolem 2,5 GiB.

K tomu je potřeba připočíst vyrovnávací paměť klíčů a hodnot, kterou si model drží pro už zpracovaný text. Latentní pozornost ji udržuje malou: konfigurace uvádí 512 latentních hodnot a 32 hodnot s rotační složkou na vrstvu a token, což je 544 hodnot krát 27 vrstev krát dva bajty, tedy 28,7 KiB na token. Při plném okně 32 768 tokenů z toho vychází 0,9 GiB, takže se model i s plným kontextem na kartu s 32 GB vejde. Ten výpočet je náš, karta modelu žádné číslo o paměti neuvádí.

Čísla o zrychlení změřila AMD sama

Blog uvádí, že propojení FarSkip-Collective zrychlilo předtrénink o 12,7 % a že při obsluze s expertním paralelismem v SGLangu klesla doba do prvního tokenu až o 39,2 %. Obojí měřila AMD sama na vlastních kartách a doklad je zatím jen graf v tom blogu. Technická zpráva podle něj teprve vyjde.

Výsledky testů schopností jsou v kartě modelu i na blogu jen jako obrázky tabulek, takže se z nich nedá nic vyčíst jinak než okem. Průměry 76,7 u základního bodu a 73,22 u Thinku z nich vypsal přehled na serveru MarkTechPost. U doladěných bodů karta modelu uvádí, že je AMD měřila nástrojem OLMES s délkou odpovědi do 32 768 tokenů.

Pro čtenáře, který si chce z Instelly něco postavit, z toho plyne dělicí čára uprostřed vydání: trénovací a inferenční řetězec je použitelný bez omezení, váhy jen ve výzkumu. Dva první převody do formátu GGUF se na Hugging Face objevily 31. července a pole s licencí u obou zůstalo nevyplněné, ačkoli článek 6 předání licence dalším příjemcům vyžaduje.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    LG dala K-EXAONE 2.0 s 1,5 TB vah pod Apache 2.0 místo vlastní licence

    Korejská LG AI Research zveřejnila K-EXAONE 2.0, model se 750 miliardami parametrů, z nichž se na token používá 37 miliard. Váhy zabírají 1 497,7 GB a model vznikl…

  2. Modely

    NVIDIA radí sdílet KV hlavu mezi víc dotazů, ale neříká, na kterých GPU měřila

    Nový technický rozbor rozděluje obsluhu dlouhého kontextu na dvě odlišné úlohy: načtení zadání omezuje výpočetní výkon, generování dalšího tokenu propustnost paměti.…

  3. Modely

    Váhy Solar Open 2 mají 500 GB, licence chce jméno začínající na Solar

    Korejský Upstage vydal 22. července otevřené váhy modelu Solar Open 2 – 250 miliard parametrů, z toho 15 miliard aktivních na token, kontext milion tokenů. Ke stažení je…

  4. Modely

    DeepSeek vydal V4-Flash pod MIT se 167 GB vah a skripty místo šablony chatu

    DeepSeek zveřejnil 31. července ostrou verzi modelu V4-Flash. Licence je čistá MIT bez prahů tržeb a bez podmínek navíc, kontext má milion tokenů a váhy 166,9 GB. Devět…