Přeskočit na obsah
Modely 3 min čtení

Váhy modelu SenseNova U1.5-8B-MoT mají 17,5 miliardy parametrů

SenseTime vydala 19. srpna otevřený multimodální model SenseNova U1.5-8B-MoT. Rozhraní Hugging Face u něj napočítá 17 532 854 464 parametrů a osm souborů s vahami zabere pětatřicet gigabajtů. Není to překlep: architektura Mixture-of-Transformers nese každou vrstvu dvakrát, jednou pro chápání vstupu a jednou pro kreslení obrázků.

Ruka zasouvá paměťový modul do patice serverové základní desky
Kolik paměti model spolyká, se pozná až ze součtu souborů s vahami. Foto: Jemimus, Wikimedia Commons (CC BY 2.0)

SenseTime dala 19. srpna 2026 na Hugging Face váhy modelu SenseNova-U1.5-8B-MoT a kartu k nim doplnila druhý den. Model dělá obojí naráz: rozumí obrázkům i textu a obrázky zároveň kreslí a upravuje. Licenci Apache 2.0 uvádí karta i repozitář referenčního kódu.

Součet souborů dá pětatřicet gigabajtů

Rozhraní Hugging Face vypisuje u každého úložiště počet parametrů odečtený přímo z vah. U tohohle stojí v poli safetensors.total hodnota 17 532 854 464 a všechny jsou v bf16, tedy po dvou bajtech na parametr. Osm souborů zabere dohromady 35 065 858 136 bajtů, což je 35,07 GB, nebo 32,66 GiB, když se počítá po mocninách dvou.

Celkové číslo v kartě nestojí a jméno modelu slibuje jiné. Označení „8B“ v něm patří té části, která rozumí vstupu; článek autorů na arXivu z 12. května 2026 mluví o husté osmimiliardové předloze pro chápání. Rozdíl mezi číslem v názvu a velikostí stahování není na Hugging Face nic výjimečného – ternární Maple-Preview měl v hlavním repozitáři 40 GB vah proti slíbeným 5,31.

Každou vrstvu nese úložiště dvakrát

Kde se druhá půlka bere, prozradí rejstřík tenzorů. Stáhli jsme hlavičky všech osmi souborů a sečetli tvary: u každé ze 42 vrstev leží vedle sebe dvě sady vah stejných rozměrů a ta druhá má v názvu příponu _mot_gen. Zdvojené jsou projekce dotazu, klíče, hodnoty i výstupu, celý blok dopředné sítě a obě normalizace.

Čísla z toho součtu vypadají takhle. Větev _mot_gen má 8 103 754 240 parametrů a její textový protějšek přesně tolik taky. K tomu přijde 1 244 659 712 parametrů ve vstupní tabulce tokenů a ve výstupní hlavě, které jsou pro obě větve společné, a 80 686 272 v obrazových modulech a v hlavě pro flow matching. Dvakrát 8 103 754 240 plus 1 244 659 712 plus 80 686 272 dá 17 532 854 464 – tedy přesně to, co hlásí rozhraní.

Rozdělení podle modality vymyslel někdo jiný

Architekturu Mixture-of-Transformers popsala práce skupiny kolem Weixina Lianga, zveřejněná 7. listopadu 2024 a přijatá o rok později do časopisu TMLR. Recept zní: oddělit podle modality všechny parametry kromě vloženého slovníku, tedy dopředné sítě, matice pozornosti i normalizace, a nechat pozornost samotnou působit přes celou vstupní posloupnost.

Váhy to potvrzují do puntíku. Společná zůstala tabulka tokenů a výstupní hlava, dohromady 1,24 miliardy parametrů; všechno ostatní má každá modalita svoje. Autoři MoT si od toho slibují levnější trénování – v jednom z jejich pokusů dosáhl model kvality husté předlohy na 55,8 % počtu operací. Ta úspora je ale ve výpočtu, ne v paměti: parametry v ní leží všechny.

Model se obejde bez kodéru i bez autoenkodéru

Vlastní příspěvek SenseTime je v tom, co v modelu chybí. V zápisu NEO-unify z 5. března 2026 firma píše, že model pracuje rovnou s pixely a slovy, bez vizuálního kodéru a bez variačního autoenkodéru. Obrazová část je proto drobná: obě kopie vizuálního modulu mají dohromady 35 137 536 parametrů, tedy dvě promile celku. Zbytek práce odvede jazykový transformer.

Konfigurace k tomu dodá dvě čísla, která karta nezmiňuje. Kontextové okno má 262 144 tokenů a horní mez obrázku je 16 777 216 pixelů, tedy 4 096 na 4 096. Odtud slib nativního 4K v popisu.

Náhled vážil o patnáct gigabajtů víc

Stahování mezitím zhublo. Náhledová verze z 28. července má týchž 17 532 854 464 parametrů, jenže rozhraní u ní hlásí 9 972 275 648 v bf16 a 7 560 578 816 ve fp32; třináct souborů zabere 50 187 015 408 bajtů, tedy 50,19 GB. Commit z 24. srpna nazvaný „Convert to BF16 and re-shard“ převedl zbytek na poloviční přesnost a přebalil váhy do osmi souborů. Ubral tím 15,12 GB, aniž se počet parametrů změnil.

Karta neuvádí nároky na paměť

Karta ukazuje dva příkazy ke spuštění, oba s přepínačem --device_map auto, který model rozloží na dostupné karty. Kolik jich má být a kolik paměti dohromady, se z ní nedozvíte; instalační návod uvádí Python 3.11, PyTorch 2.8 a CUDA 12.8 a o paměti mlčí taky. Samotné váhy si těch 32,66 GiB vezmou dřív, než se zpracuje první token.

Jinde je karta otevřená až nezvykle. Vlastní oddíl v ní vyjmenuje, co modelu nejde: přeostřuje detaily a barvy, plete se v drobném a hustém textu, u přesných počtů a zarovnání chybuje a při rozsáhlejších úpravách obrázku ujíždí od zadání. Takový výčet se v popisech modelů nevidí často.

Dubnová verze má parametrů ještě o něco víc

Zdvojení není zvláštnost téhle verze. Dubnový SenseNova U1-8B-MoT hlásí 17 552 340 992 parametrů a varianta U1-A3B-MoT, postavená podle článku na třicetimiliardové směsi expertů, jich má 38 737 986 560. Kdo si z téhle rodiny vybírá podle čísla v názvu, počítá s poloviční pamětí, než jakou bude potřebovat.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Draft model DFlash 2 pro Qwen3.8 se rozběhne jen na nevydaném kódu SGLangu a vLLM

    Inco AI zveřejnila 18. srpna DFlash 2 – malý model, který za Qwen3.8-27B předpovídá celé bloky tokenů dopředu. Ve vlastním měření tím propustnost SGLangu roste 2,7 až 3…

  2. Modely

    Kopie hudebního modelu MiniMax Music3 uvádějí na Hugging Face čtyři různé licence

    MiniMax nahrál 7. srpna 2026 na Hugging Face váhy hudebního modelu Music3 a přiložil k nim vlastní licenci s prahem dvaceti milionů dolarů ročních tržeb. Do hlavičky…

  3. Modely

    Malé modely se jménem Qwen3.8 nevydal Qwen, ale Empero, a stojí na Qwen3.5

    Na Hugging Face přibyly 15. srpna 2026 tři modely pojmenované Qwen3.8-9B, Qwen3.8-4B a Qwen3.8-2B. Qwen žádnou takovou velikost nevydal: jsou to destilace, které do o…

  4. Modely

    RWKV-7 G1i dostal formát pro Transformers, samotné váhy jsou venku od 5. srpna

    Projekt RWKV zveřejnil čtyři velikosti řady G1i ve formátu, který načte knihovna Transformers – od 1,5 do 13,3 miliardy parametrů, všechny pod licencí Apache 2.0.…