LG dala K-EXAONE 2.0 pod Apache 2.0, dosud měla vlastní licenci. Váhy mají 1,5 TB
Korejská LG AI Research zveřejnila K-EXAONE 2.0, model se 750 miliardami parametrů, z nichž se na token používá 37 miliard. Váhy zabírají 1 497,7 GB a model vznikl rozšířením předchozí generace, ne novým tréninkem. Nová je i licence: všech šestačtyřicet starších repozitářů téhož účtu má vlastní podmínky, tenhle čistou Apache 2.0.

LG AI Research oznámila 31. července vydání modelu K-EXAONE-2.0-750B-A37B. Podle oznámení na webu firmy je to druhý model státního projektu, který vede korejské ministerstvo vědy a informačních technologií, a největší model postavený dosud v Koreji. Repozitář na Hugging Face vznikl už 29. července, poslední změnu v něm má z 31. července.
Jméno nese obě podstatná čísla: 750 miliard parametrů celkem, 37 miliard aktivních na jeden token. Zbytek se u každého tokenu nepoužije, protože model je směs odborníků – z 256 expertů se na token pouští osm plus jeden sdílený.
Licenci firma vyměnila, a je to větší změna než čísla
Předchozí model téhož účtu, K-EXAONE-236B-A23B z prosince, měl vlastní podmínky pojmenované K-EXAONE AI Model License Agreement. Komerční užití dovolovaly, ale s dvěma háčky: název modelu i odvozeného díla musel podle článku 2.1 začínat řetězcem „K-EXAONE“ a podle článku 2.2 vyžadovalo šíření nebo zpřístupnění třetím stranám pro komerční účely samostatnou dohodu s poskytovatelem. K tomu článek 3.1 zakazoval zpětné rozebírání modelu.
Soubor LICENSE u nového modelu má 569 bajtů a je to obvyklá hlavička Apache 2.0 s odkazem na plné znění. Žádná dodatečná pravidla užití vedle ní nestojí. Účet LGAI-EXAONE má padesát repozitářů a Apache 2.0 jsou u čtyř z nich – u tohohle modelu a u tří jeho převodů, které vyšly hned druhý den. Zbylých šestačtyřicet je vedených pod položkou „other“, tedy pod vlastními podmínkami firmy. Povinné jméno je konstrukce, kterou použila i jiná korejská licence – a právě ta v Apache 2.0 být nemůže.
Odkud se vzalo 750 miliard
Ne z nového tréninku. Technická zpráva popisuje postup jako upcycling: model se rozšířil do hloubky ze 48 na 78 vrstev a do šířky ze 128 na 256 expertů, načež se v trénování pokračovalo. Počet aktivních expertů, velikost klouzavého okna, směrovací pravidlo i tokenizátor zůstaly podle zprávy beze změny.
Porovnání obou konfiguračních souborů to potvrzuje z druhé strany: skrytý rozměr 6 144, slovník 153 600 položek a kontext 262 144 tokenů má nový model přesně stejné jako starý. Nezměnily se ani hlavy pozornosti, 64 dotazovacích a 8 pro klíče a hodnoty.
Kolik parametrů to dělá, si lze spočítat ze souborů. Váhy zabírají 1 497 665 548 416 bajtů, a protože jsou v bf16, tedy po dvou bajtech, vychází 748,8 miliardy. Předchůdce má 474,2 GB, tedy 237,1 miliardy; nástupce je 3,16krát větší. Sečteno z konfigurace vychází totéž číslo a je z něj vidět, kam ta hmota šla: samotní experti dělají 737 miliard parametrů, tedy 98,5 % modelu. Na pozornost ve všech 78 vrstvách připadá 8,8 miliardy.
K běhu chce dva stroje a knihovny z osobních větví
Karta modelu uvádí jako vzorovou sestavu dva uzly po osmi kartách NVIDIA H200, tedy šestnáct karet. Samotné váhy z nich zaberou zhruba dvě třetiny paměti, na vyrovnávací paměť pozornosti zbývá zbytek.
Rozběhat model z vydané verze některé z obvyklých knihoven ale zatím nejde. Karta u SGLangu i u vLLM posílá na osobní odnože jednoho vývojáře a k tomu na cizí odnož knihovny transformers. Upstreamový vLLM přitom architekturu předchozí generace zná; nový model se v konfiguraci hlásí jménem, které se od zapsaného liší velikostí jednoho písmene. Poznámky k vydání dodávají, že na kartách B200 se musí vypnout klouzavé okno ve vyrovnávací paměti a část přípravné fáze, jinak se generování rozpadá; firma píše, že poznámku aktualizuje, až se to vyřeší. Repozitář na GitHubu obsahuje jen licenci, README a obrázky, žádný kód.
Průměr, který vychází jinak
Výsledky jsou měření výrobce. Tabulka v kartě staví K-EXAONE 2.0 vedle předchůdce a tří cizích modelů, u kterých poznámka pod čarou přiznává, že označená čísla pocházejí z jejich vlastních zpráv, blogů nebo žebříčků – tedy z cizího měření za neznámých podmínek. Nezávisle to zatím nikdo nezopakoval.
Oznámení firmy uvádí průměr 70,1 bodu ze 24 testů proti 63,3 u prvního modelu. Průměr těch čtyřiadvaceti čísel, jak stojí v tabulce, ale vychází 73,3 a 66,9. Rozdíl mezi generacemi je pak 9,5 %, kdežto oznámení i technická zpráva mluví o „více než 10 %“. Z čeho se počítal ten první průměr, oznámení neuvádí; sada testů je v obou případech popsaná stejně.
Ve čtyřech z těch čtyřiadvaceti testů dopadl trojnásobně velký nástupce hůř než předchůdce: MMLU-Pro 83,5 proti 83,8, HMMT 78,4 proti 80,7, korejský HRM8K-KSM 91,1 proti 91,9 a GlobalMMLU-Lite 86,6 proti 86,9. Naopak v agentním programování je posun velký – SWE-Bench Verified 68,2 proti 49,4.
Proti třem cizím modelům v tabulce má K-EXAONE 2.0 nejvyšší číslo ve třech testech z 24: v dlouhém kontextu (OpenAI-MRCR 94,4) a ve dvou bezpečnostních, z nichž jeden si firma sestavila sama. V sedmnácti je z té čtveřice nejslabší. Odpovídá to tomu, čím se karta chlubí, ale i větě ze závěru technické zprávy, že model nevede ve všech testech.
U toho nejlepšího výsledku stojí za přečtení metodika. Technická zpráva u testu OpenAI-MRCR píše, že se vyhodnocovaly úseky do 128 tisíc tokenů, ačkoli test zvládá až milion. Model přitom slibuje kontext 262 144 tokenů. Číslo, které ho staví na první místo v práci s dlouhým vstupem, se tedy měřilo na polovině toho, co model nabízí. Podle nás je to u modelu, jehož hlavní přednost má být právě dlouhý kontext, ta nejpodstatnější chybějící informace. Změřit ji může kdokoli, kdo na to má stroje; nová licence mu v tom aspoň nebrání a výsledek nemusí s nikým dojednávat.