Váhy modelu SenseNova U1.5-8B-MoT mají 17,5 miliardy parametrů
SenseTime vydala 19. srpna otevřený multimodální model SenseNova U1.5-8B-MoT. Rozhraní Hugging Face u něj napočítá 17 532 854 464 parametrů a osm souborů s vahami zabere pětatřicet gigabajtů. Není to překlep: architektura Mixture-of-Transformers nese každou vrstvu dvakrát, jednou pro chápání vstupu a jednou pro kreslení obrázků.

SenseTime dala 19. srpna 2026 na Hugging Face váhy modelu SenseNova-U1.5-8B-MoT a kartu k nim doplnila druhý den. Model dělá obojí naráz: rozumí obrázkům i textu a obrázky zároveň kreslí a upravuje. Licenci Apache 2.0 uvádí karta i repozitář referenčního kódu.
Součet souborů dá pětatřicet gigabajtů
Rozhraní Hugging Face vypisuje u každého úložiště počet parametrů odečtený přímo z vah. U tohohle stojí v poli safetensors.total hodnota 17 532 854 464 a všechny jsou v bf16, tedy po dvou bajtech na parametr. Osm souborů zabere dohromady 35 065 858 136 bajtů, což je 35,07 GB, nebo 32,66 GiB, když se počítá po mocninách dvou.
Celkové číslo v kartě nestojí a jméno modelu slibuje jiné. Označení „8B“ v něm patří té části, která rozumí vstupu; článek autorů na arXivu z 12. května 2026 mluví o husté osmimiliardové předloze pro chápání. Rozdíl mezi číslem v názvu a velikostí stahování není na Hugging Face nic výjimečného – ternární Maple-Preview měl v hlavním repozitáři 40 GB vah proti slíbeným 5,31.
Každou vrstvu nese úložiště dvakrát
Kde se druhá půlka bere, prozradí rejstřík tenzorů. Stáhli jsme hlavičky všech osmi souborů a sečetli tvary: u každé ze 42 vrstev leží vedle sebe dvě sady vah stejných rozměrů a ta druhá má v názvu příponu _mot_gen. Zdvojené jsou projekce dotazu, klíče, hodnoty i výstupu, celý blok dopředné sítě a obě normalizace.
Čísla z toho součtu vypadají takhle. Větev _mot_gen má 8 103 754 240 parametrů a její textový protějšek přesně tolik taky. K tomu přijde 1 244 659 712 parametrů ve vstupní tabulce tokenů a ve výstupní hlavě, které jsou pro obě větve společné, a 80 686 272 v obrazových modulech a v hlavě pro flow matching. Dvakrát 8 103 754 240 plus 1 244 659 712 plus 80 686 272 dá 17 532 854 464 – tedy přesně to, co hlásí rozhraní.
Rozdělení podle modality vymyslel někdo jiný
Architekturu Mixture-of-Transformers popsala práce skupiny kolem Weixina Lianga, zveřejněná 7. listopadu 2024 a přijatá o rok později do časopisu TMLR. Recept zní: oddělit podle modality všechny parametry kromě vloženého slovníku, tedy dopředné sítě, matice pozornosti i normalizace, a nechat pozornost samotnou působit přes celou vstupní posloupnost.
Váhy to potvrzují do puntíku. Společná zůstala tabulka tokenů a výstupní hlava, dohromady 1,24 miliardy parametrů; všechno ostatní má každá modalita svoje. Autoři MoT si od toho slibují levnější trénování – v jednom z jejich pokusů dosáhl model kvality husté předlohy na 55,8 % počtu operací. Ta úspora je ale ve výpočtu, ne v paměti: parametry v ní leží všechny.
Model se obejde bez kodéru i bez autoenkodéru
Vlastní příspěvek SenseTime je v tom, co v modelu chybí. V zápisu NEO-unify z 5. března 2026 firma píše, že model pracuje rovnou s pixely a slovy, bez vizuálního kodéru a bez variačního autoenkodéru. Obrazová část je proto drobná: obě kopie vizuálního modulu mají dohromady 35 137 536 parametrů, tedy dvě promile celku. Zbytek práce odvede jazykový transformer.
Konfigurace k tomu dodá dvě čísla, která karta nezmiňuje. Kontextové okno má 262 144 tokenů a horní mez obrázku je 16 777 216 pixelů, tedy 4 096 na 4 096. Odtud slib nativního 4K v popisu.
Náhled vážil o patnáct gigabajtů víc
Stahování mezitím zhublo. Náhledová verze z 28. července má týchž 17 532 854 464 parametrů, jenže rozhraní u ní hlásí 9 972 275 648 v bf16 a 7 560 578 816 ve fp32; třináct souborů zabere 50 187 015 408 bajtů, tedy 50,19 GB. Commit z 24. srpna nazvaný „Convert to BF16 and re-shard“ převedl zbytek na poloviční přesnost a přebalil váhy do osmi souborů. Ubral tím 15,12 GB, aniž se počet parametrů změnil.
Karta neuvádí nároky na paměť
Karta ukazuje dva příkazy ke spuštění, oba s přepínačem --device_map auto, který model rozloží na dostupné karty. Kolik jich má být a kolik paměti dohromady, se z ní nedozvíte; instalační návod uvádí Python 3.11, PyTorch 2.8 a CUDA 12.8 a o paměti mlčí taky. Samotné váhy si těch 32,66 GiB vezmou dřív, než se zpracuje první token.
Jinde je karta otevřená až nezvykle. Vlastní oddíl v ní vyjmenuje, co modelu nejde: přeostřuje detaily a barvy, plete se v drobném a hustém textu, u přesných počtů a zarovnání chybuje a při rozsáhlejších úpravách obrázku ujíždí od zadání. Takový výčet se v popisech modelů nevidí často.
Dubnová verze má parametrů ještě o něco víc
Zdvojení není zvláštnost téhle verze. Dubnový SenseNova U1-8B-MoT hlásí 17 552 340 992 parametrů a varianta U1-A3B-MoT, postavená podle článku na třicetimiliardové směsi expertů, jich má 38 737 986 560. Kdo si z téhle rodiny vybírá podle čísla v názvu, počítá s poloviční pamětí, než jakou bude potřebovat.
Zdroje
- Karta modelu SenseNova-U1.5-8B-MoT na Hugging Face
- Soubor config.json téhož modelu
- SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture
- Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models
- NEO-unify: Building Native Multimodal Unified Models End to End
- Referenční kód SenseNova-U1 na GitHubu