Nová řada modelů zkouší vštípit hodnoty už při předtrénování
Skupina model-raising zveřejnila 9. srpna rodinu malých jazykových modelů ke studii Synthetic Persona Pretraining. Ta zkouší vepsat modelu hodnoty už do předtrénování, místo aby se přidávaly až po něm. Vyšla jako ablační mřížka pěti postupů ve dvou velikostech, i s mezikroky trénování jako samostatnými revizemi.

Skupina model-raising zveřejnila rodinu malých jazykových modelů, které patří ke studii Synthetic Persona Pretraining (SPP). Její teze zní, že dnešní zarovnání je mělké: hodnoty se modelu dodávají až po předtrénování, a proto se dají obejít. SPP je zkouší zapsat rovnou do předtrénování. Zarovnání je přitom obvyklé české slovo pro to, jak se model ladí, aby dělal, co po něm chceme, a odmítal, co nemá.
Postup je jednoduchý. Zhruba k desetině předtrénovacích dokumentů se za zvláštní značku <assistant> připojí umělá úvaha v první osobě – morální komentář opřený o hodnotovou ústavu o šesti oblastech (důstojnost a práva, újma a bezpečí, poctivost, vztahy, blahobyt, moc a správa). U závadného textu úvaha říká, co je špatně a proč, u neškodného poznamená, že není co řešit. Aby přípisek neměnil, jak původní text pokračuje, drží ho stranou maskování pozornosti a posun pozic v RoPE, tedy ve způsobu, jakým model počítá polohu slov.
Vydaná mřížka porovnává pět postupů vedle sebe
Nevyšel jeden model, ale mřížka: pět variant ve dvou velikostech (1,7 a 3 miliardy parametrů) a pokaždé v základní a instrukční podobě, dohromady dvacet repozitářů. Dva jsou srovnávací. Varianta vanilla je běžné předtrénování bez zásahu, filtered navíc maskuje ztrátu na dokumentech označených jako nebezpečné – to je ten odečítací přístup, který závadná data spíš odstraňuje. Tři varianty používají SPP: t0 vkládá úvahy od prvního tokenu předtrénování, mt až v pozdější mezifázi a t0-mt v obojím. Srovnání je smysl celé věci, základní modely tu jsou proto, aby šlo účinek zásahu vyčíst.
Architekturu mají všechny stejnou: tvar podle Llama 3.2 3B, trénované od nuly na zhruba 500 miliardách tokenů z výřezu směsi Olmo 3 Dolma 3. Varianty s SPP jedou na rozšířeném tokenizéru SmolLM2 s přidanou značkou <assistant> a znaky ústavy (slovník 49 280), srovnávací modely na běžném (49 152).
Výsledky jsou zatím měření samotných autorů
Předběžný zápis autorů z 20. května uvádí na menších modelech (1,7 miliardy parametrů, 100 miliard tokenů) a napříč pěti protivnickými testy průměrnou úspěšnost útoku 1,7 %, tedy o 63 % méně než u základního modelu. Jsou to ale čísla autorů, změřená na těch menších modelech, ne na dnes vydané řadě 3B – a karty modelů žádnou nezávisle zopakovanou tabulku nenesou. Výsledek testu je tvrzení toho, kdo měřil, dokud ho nezopakuje někdo jiný. Myšlenka stojí na modelu výběru person (Marks a kol., 2026): předtrénování ustaví prostor person a pozdější ladění už jen vybírá z těch, které v něm jsou, žádnou novou nepřidá.
Váhy modelu 3B zaberou necelých 6 GB
Váhy modelu 3B jsou ve dvou souborech, 4,98 GB a 0,96 GB, tedy 5,94 GB podle rozpisu velikostí v kartě modelu. To odpovídá aritmetice: 3 miliardy parametrů po 2 bajtech (formát bf16) jsou přibližně 6 GB, takže se model vejde na běžnou herní kartu s 8 GB, menší varianta 1,7B tím spíš. Licence je slabší místo. V metadatech je uvedena jako „other“, jenže repozitáře nenesou název licence, odkaz na ni ani soubor LICENSE. Za jakých podmínek se váhy smějí použít, tak v repozitáři nestojí – a u otevřených vah je právě soubor s licencí jediný zdroj pravdy.
Ke každému modelu jsou i mezikroky trénování
Kvůli ověřitelnosti jsou k modelům přibalené i mezikroky, uložené jako revize gitu. Základní model t0 3B jich má jedenáct, od kroku 25 000 po 254 313, a každý se dá načíst parametrem revision=. Instrukční modely k tomu přidávají řadu podle podílu bezpečnostních dat, od nuly do šedesáti procent z 300 000 příkladů doladění. Vydané jsou jen váhy, ne stav optimalizátoru ani generátoru náhody, takže z nich jde vyhodnocovat, zkoumat a doučovat, ale ne přesně zopakovat celý běh. Samotné doladění instrukčních modelů je popsané do detailu: 300 000 jednokolových příkladů, z toho 90 % pokynů z WildChat-1M a 10 % bezpečnostních, odpovědi citují ústavu přímo v textu značkou [N.M], jedna epocha.
Otevřená otázka teď není další ukázkové povídání s modelem, ale nezávislé zopakování na větších modelech: jestli hodnoty vepsané už do předtrénování drží líp než ty přidané až po něm, a co to stojí na schopnostech. Právě to, že vydaná mřížka nese i mezikroky trénování, dělá takové zopakování možným – kdokoli může načíst tentýž bod trajektorie a měřit na něm sám.