Přeskočit na obsah
Modely 3 min čtení

Nová řada modelů zkouší vštípit hodnoty už při předtrénování

Skupina model-raising zveřejnila 9. srpna rodinu malých jazykových modelů ke studii Synthetic Persona Pretraining. Ta zkouší vepsat modelu hodnoty už do předtrénování, místo aby se přidávaly až po něm. Vyšla jako ablační mřížka pěti postupů ve dvou velikostech, i s mezikroky trénování jako samostatnými revizemi.

Vizualizace neuronové sítě s čipem
Běžná ilustrace neuronové sítě. Foto: mikemacmarketing, Wikimedia Commons (CC BY 2.0)

Skupina model-raising zveřejnila rodinu malých jazykových modelů, které patří ke studii Synthetic Persona Pretraining (SPP). Její teze zní, že dnešní zarovnání je mělké: hodnoty se modelu dodávají až po předtrénování, a proto se dají obejít. SPP je zkouší zapsat rovnou do předtrénování. Zarovnání je přitom obvyklé české slovo pro to, jak se model ladí, aby dělal, co po něm chceme, a odmítal, co nemá.

Postup je jednoduchý. Zhruba k desetině předtrénovacích dokumentů se za zvláštní značku <assistant> připojí umělá úvaha v první osobě – morální komentář opřený o hodnotovou ústavu o šesti oblastech (důstojnost a práva, újma a bezpečí, poctivost, vztahy, blahobyt, moc a správa). U závadného textu úvaha říká, co je špatně a proč, u neškodného poznamená, že není co řešit. Aby přípisek neměnil, jak původní text pokračuje, drží ho stranou maskování pozornosti a posun pozic v RoPE, tedy ve způsobu, jakým model počítá polohu slov.

Vydaná mřížka porovnává pět postupů vedle sebe

Nevyšel jeden model, ale mřížka: pět variant ve dvou velikostech (1,7 a 3 miliardy parametrů) a pokaždé v základní a instrukční podobě, dohromady dvacet repozitářů. Dva jsou srovnávací. Varianta vanilla je běžné předtrénování bez zásahu, filtered navíc maskuje ztrátu na dokumentech označených jako nebezpečné – to je ten odečítací přístup, který závadná data spíš odstraňuje. Tři varianty používají SPP: t0 vkládá úvahy od prvního tokenu předtrénování, mt až v pozdější mezifázi a t0-mt v obojím. Srovnání je smysl celé věci, základní modely tu jsou proto, aby šlo účinek zásahu vyčíst.

Architekturu mají všechny stejnou: tvar podle Llama 3.2 3B, trénované od nuly na zhruba 500 miliardách tokenů z výřezu směsi Olmo 3 Dolma 3. Varianty s SPP jedou na rozšířeném tokenizéru SmolLM2 s přidanou značkou <assistant> a znaky ústavy (slovník 49 280), srovnávací modely na běžném (49 152).

Výsledky jsou zatím měření samotných autorů

Předběžný zápis autorů z 20. května uvádí na menších modelech (1,7 miliardy parametrů, 100 miliard tokenů) a napříč pěti protivnickými testy průměrnou úspěšnost útoku 1,7 %, tedy o 63 % méně než u základního modelu. Jsou to ale čísla autorů, změřená na těch menších modelech, ne na dnes vydané řadě 3B – a karty modelů žádnou nezávisle zopakovanou tabulku nenesou. Výsledek testu je tvrzení toho, kdo měřil, dokud ho nezopakuje někdo jiný. Myšlenka stojí na modelu výběru person (Marks a kol., 2026): předtrénování ustaví prostor person a pozdější ladění už jen vybírá z těch, které v něm jsou, žádnou novou nepřidá.

Váhy modelu 3B zaberou necelých 6 GB

Váhy modelu 3B jsou ve dvou souborech, 4,98 GB a 0,96 GB, tedy 5,94 GB podle rozpisu velikostí v kartě modelu. To odpovídá aritmetice: 3 miliardy parametrů po 2 bajtech (formát bf16) jsou přibližně 6 GB, takže se model vejde na běžnou herní kartu s 8 GB, menší varianta 1,7B tím spíš. Licence je slabší místo. V metadatech je uvedena jako „other“, jenže repozitáře nenesou název licence, odkaz na ni ani soubor LICENSE. Za jakých podmínek se váhy smějí použít, tak v repozitáři nestojí – a u otevřených vah je právě soubor s licencí jediný zdroj pravdy.

Ke každému modelu jsou i mezikroky trénování

Kvůli ověřitelnosti jsou k modelům přibalené i mezikroky, uložené jako revize gitu. Základní model t0 3B jich má jedenáct, od kroku 25 000 po 254 313, a každý se dá načíst parametrem revision=. Instrukční modely k tomu přidávají řadu podle podílu bezpečnostních dat, od nuly do šedesáti procent z 300 000 příkladů doladění. Vydané jsou jen váhy, ne stav optimalizátoru ani generátoru náhody, takže z nich jde vyhodnocovat, zkoumat a doučovat, ale ne přesně zopakovat celý běh. Samotné doladění instrukčních modelů je popsané do detailu: 300 000 jednokolových příkladů, z toho 90 % pokynů z WildChat-1M a 10 % bezpečnostních, odpovědi citují ústavu přímo v textu značkou [N.M], jedna epocha.

Otevřená otázka teď není další ukázkové povídání s modelem, ale nezávislé zopakování na větších modelech: jestli hodnoty vepsané už do předtrénování drží líp než ty přidané až po něm, a co to stojí na schopnostech. Právě to, že vydaná mřížka nese i mezikroky trénování, dělá takové zopakování možným – kdokoli může načíst tentýž bod trajektorie a měřit na něm sám.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Pokee-Isaac slibuje kontext deseti milionů tokenů na jedné kartě, váhy ale nezveřejnil

    Pokee AI ohlásila 8. srpna 2026 model Pokee-Isaac 28B, který má zvládnout kontext deseti milionů tokenů a vejít se na jedinou grafickou kartu. Váhy ale nezveřejnila;…

  2. Modely

    Ve vlastním testu Nvidie dokončil VoiceChat 11B třetinu nástrojových úloh

    Nvidia vydala 3. srpna hlasový model VoiceChat 11B pro průběžný rozhovor a volání nástrojů. V jejím měření na FDB-v3 vybral správný nástroj v 82,5 % případů, správné…

  3. Modely

    Ling-3.0-flash popisuje podmínky měření podrobně, výsledky testů má jen v obrázcích

    Skupina inclusionAI zveřejnila 2. srpna 2026 na Hugging Face model Ling-3.0-flash: 124 miliardy vah, z toho 5,1 miliardy aktivních při každém tokenu, licence MIT. U…

  4. Modely

    Ternární model Maple-Preview má v hlavním repozitáři 40 GB vah místo slíbených 5,31

    DeepGrove zveřejnil 4. srpna 2026 pod licencí MIT ternární model Maple-Preview: 20,21 miliardy vah, z toho 1,49 miliardy aktivních při každém tokenu. Karta modelu…