Smíšená kvantizace zmenšila váhy Qwen3.8-27B na 8,4 gigabajtu
DASLab při IST Austria zveřejnila tři kvantizace modelu Qwen3.8-27B. Každému velkému tenzoru přidělují přesnost zvlášť, takže nejmenší jazykové váhy zabírají 8,4 GB místo 53,8 GB u srovnávacího souboru BF16. Laboratoř si testy měřila sama; největší pokles uvádí u programování.

Deep Algorithms and Systems Lab při Institute of Science and Technology Austria založila 28. srpna 2026 na Hugging Face repozitář se třemi kvantizacemi Qwen3.8-27B. Poslední soubory přibyly 30. srpna. Nejmenší váhy zabírají 8,4 GB, prostřední 9,3 GB a největší 10,1 GB. Přesnost se na rozdíl od běžných převodů volí pro každý velký tenzor zvlášť.
Každému velkému tenzoru připadne jiný formát
Základní Qwen3.8-27B je hustý obrazově-jazykový model s 27 miliardami parametrů. Jeho konfigurace uvádí 64 vrstev a nativní kontext 262 144 tokenů. DASLab používá jako srovnávací bod soubor BF16 o 53,8 GB. BF16 ukládá každou váhu do šestnácti bitů; kvantizace počet bitů snižuje.
Nové soubory kombinují dvě metody. GSQ hledá pro jednotlivé skupiny vah vhodnou mřížku hodnot. RCO pak rozděluje přesnost mezi tenzory tak, aby se celek vešel do zadaného rozpočtu. Autoři obou metod jsou z téže laboratoře jako vydavatelé modelu.
Repozitář zveřejňuje přesné rozdělení. Ke každé variantě leží v repozitáři textový soubor se všemi 851 tenzory. U nejmenší verze zůstává 96 z nich v BF16 a 353 ve F32. Jde hlavně o malé normalizační a stavové tenzory, takže jejich počet neodpovídá podílu na velikosti. Zbylých 402 tenzorů laboratoř rozdělila mezi deset typů od IQ1_M po Q4_K. Součet 96 + 353 + 402 je náš výpočet z alokačního souboru.
Nejmenší soubor ztrácí nejvíc při programování
Tabulka na kartě modelu pochází od DASLab; nezávislé zopakování těchto testů zatím zveřejněné není. Na pěti jednodušších úlohách bez ukázek dosáhla nejmenší varianta průměru 74,54 bodu, zatímco základ BF16 měl 74,34. Tohle malé zvýšení neznamená, že je nízkobitová kvantizace obecně přesnější. V náročnějších testech jde výsledek opačným směrem.
V AIME25 kleslo skóre ze 100 na 96,67 bodu a v GPQA-Diamond z 89,90 na 84,85. Největší rozdíl ukázal LiveCodeBench v6, test programování: 85,71 bodu u BF16 proti 76,57 u souboru o 8,4 GB. Varianta o 10,1 GB v těchto třech testech dosáhla 100, 88,89 a 84,57 bodu. Přidaných 1,7 GB mezi krajními soubory tedy podle měření autorů kupuje osm bodů v LiveCodeBench a 4,04 bodu v GPQA-Diamond.
Prostřední soubor o 9,3 GB není prostým půlením rozdílu. Na AIME25 dorovnal BF16 na 100 bodů, v GPQA-Diamond měl 86,36 a v LiveCodeBench 82,29. Výběr varianty se musí řídit konkrétní úlohou, ne jedním souhrnným procentem.
Obrazová část přidá dalších 0,9 gigabajtu
Čísla 8,4 až 10,1 GB platí jen pro jazykovou část. Qwen3.8-27B umí přijímat obrázky a video, ale k tomu potřebuje ještě samostatný soubor mmproj s obrazovým kodérem a projektorem. Rozhraní Hugging Face u nejmenších vah uvádí 8 422 841 472 bajtů a u projektoru 931 146 528 bajtů. Dohromady je to 9,354 GB; součet je náš.
Ani 9,354 GB není údaj o celé potřebné operační paměti. Při běhu přibude paměť pracovního prostředí a vyrovnávací paměť kontextu. Velikost druhé části roste s počtem tokenů. Titulek proto mluví o vahách, ne o tom, že model poběží v počítači s 8 GB RAM.
Kvantizace nemění podmínky původního modelu
Původní Qwen3.8-27B má v repozitáři celý text licence Apache 2.0. Karta kvantizací uvádí stejnou licenci a říká, že ji přebírá od základu. V samotném odvozeném repozitáři však k 31. srpnu soubor LICENSE není; leží tam jen váhy, projektor, alokační soubory, obrázky a README. Oddíl 4 (a) Apache 2.0 přitom při šíření žádá předat příjemci kopii licence. To je vlastnost dnešního obsahu repozitáře, ne rozhodnutí o tom, zda jeho karta nebo odkaz na původní Qwen právně stačí.
Všechny tři soubory zůstávají ve standardním formátu GGUF a karta uvádí spuštění bez úprav v llama.cpp, Ollamě a LM Studiu. Nové je, co leží uvnitř: místo jedné přesnosti dostává každý velký tenzor takovou, kterou mu vybral společný rozpočet a ztráta modelu.