Mach-1 sbalil váhy Qwen3.6-35B na 7,5 GB, běžný nástroj je ale nepřečte
Syzygy Research vydala Mach-1 Additive 35B, ternární balení modelu Qwen3.6-35B-A3B, které srazí 71,9 GB vah na 7,53 GB. Vlastní měření vydavatele mu přisuzuje 95 % výkonu původního modelu. Repozitář ale místo obvyklých vah obsahuje dekodér v NumPy a běžný nástroj z něj model nenačte.
Na Hugging Face je od 2. srpna model Mach-1 Additive 35B od organizace Syzygy Research. Není to nový model v obvyklém smyslu slova: je to jinak zabalený Qwen3.6-35B-A3B, jehož váhy se vešly do balíku zhruba desetkrát menšího. Za to se ale platí tím, že s ním zatím žádný běžný nástroj nepracuje.

Sedm a půl gigabajtu místo dvaasedmdesáti
Původní Qwen3.6-35B-A3B má podle rozhraní Hugging Face 35 951 822 704 parametrů uložených v bf16 a jeho repozitář zabírá 71,92 GB. Soubor MANIFEST.json u Mach-1 uvádí u textové části balíku 7,5335 GB a průměr 1,6978 bitu na váhu. To je 9,5násobný rozdíl.
Ta dvě čísla jdou proti sobě prověřit. 7,5335 GB je 60,27 miliardy bitů; vydělené 1,6978 dávají 35,5 miliardy vah, tedy o 450 milionů méně, než kolik má původní model. Manifest to sám vysvětluje na dvou místech: sedmnáct tenzorů z vrstvy pro předpověď více tokenů do balíku nešlo a embedding je přiložený ve dvou zaměnitelných podobách, ale do součtu se počítá jen jedna. Celý repozitář má proto 8,12 GB, o něco víc než deklarovaná textová část.
Průměr 1,6978 bitu je přitom vyšší než log₂3, tedy zhruba 1,585 bitu, které by teoreticky stačily na tři úrovně. Vedle vlastních kódů vah totiž balík nese i spojité stupnice ve fp16 a měřítka pro jednotlivé skupiny, a ta se do průměru počítají taky.
Sčítání místo násobení
Popis formátu je v souborech BOARD.md a RELEASE_NOTES.md. Experti jsou uložení jako celočíselné trellisové kódy s vlastní kódovou knihou, páteř sítě v 64úrovňové celočíselné mřížce, výstupní vrstva v pětibitovém formátu po skupinách po 64 a embedding ve čtyřech bitech. Trellisový kód popisuje posloupnost hodnot přechody mezi stavy místo jednotlivých čísel, takže se rozbaluje popořadě, ne po jednotlivých vahách.
Slovo „additive“ v názvu odkazuje na to, co je z toho v dokumentaci vyzdvižené: každý maticový součin vah je podle BOARD.md jen sčítání a odčítání, bez násobení. To je smysl ternárních vah obecně – když má váha jen hodnoty −1, 0 a +1, násobička není potřeba. Jak s ternárními vahami zachází nástroj, který je umí načíst, jsme rozebírali u dvoubitového Q2_0 v llama.cpp.
V repozitáři je dekodér, ne váhy
Praktický háček je v tom, že soubory v repozitáři nejsou váhy, které by načetl transformers, vLLM nebo llama.cpp. Jsou to komprimované bitové proudy ve vlastním rozvržení a jediné, co je umí přečíst, je přiložený decode.py – samostatný dekodér napsaný v NumPy. Jeho úvodní komentář popisuje rozvržení do detailu, takže se dá zpětně dopočítat, co v kterém souboru je. Spustit z něj model ale znamená napsat si zbytek sám.
Vidět je to na diskusi pod modelem. Dva dny po vydání se tam někdo ptal, jaký nástroj to vlastně spustí, a odpověď od jiného uživatele zněla, že si nechal předělat webové rozhraní a posílá odkaz na sdílené úložiště. O den později další uživatel hledal slíbenou verzi GGUF, na kterou odkazuje popis upravené větve llama.cpp, a dostal chybu 401. V odpovědi ze 6. srpna stojí, že GGUF i upravená větev llama.cpp vyjdou „ještě tenhle týden“ (v originále „later this week“). Desátého srpna se v témže vlákně ptal na termín někdo další; repozitář s GGUF k tomu dni pořád vrací 401 a veřejné vyhledávání na GitHubu tu upravenou větev nenajde.
Na hlášení v diskusi se přitom odpovídá rychle. Když nejstarší z nich upozornilo, že v repozitáři chybí jeden ze souborů s embeddingem, byl týž den doplněný.
Devadesát pět procent, ale změřených doma
Karta modelu uvádí, že si Mach-1 na dvanácti testech drží průměrně 95,0 % skóre nezmenšeného učitele. Nejlépe dopadly matematické úlohy: u sady AIME26 je to 89,58 proti 90,00 bodu, tedy 99,5 %. Nejhůř skončilo sledování instrukcí v IFBench, kde model dal 54,08 bodu proti 64,97, tedy 83,2 %. Vedle toho stojí v tabulce Ternary Bonsai 27B od prism-ml s 93,6 % a dvoubitová varianta Gemma 4 s 85,6 %.
Všechna ta čísla naměřil vydavatel sám a nezávislé zopakování zatím není. BOARD.md aspoň říká, jak měřil: EvalScope 1.9.1 nad vLLM, režim uvažování, teplota 1,0, top_p 0,95 a top_k 20, u sad AIME průměr z osmi běhů. Poznamenává také, že rozptyl mezi opakovanými měřeními dosahuje u IFEval dvou až tří bodů a u τ²-bench až šesti, takže rozdíly pod jedním bodem jsou v jeho vlastní tabulce shoda, ne pořadí. Podle nás je to u srovnávací tabulky vydavatele nadprůměrně otevřené.
Váhy jsou pod licencí Apache 2.0, tedy bez prahů na tržby nebo počet uživatelů. Soubor LICENSE v repozitáři učitelského Qwenu je týž.
Z Mach-1 je zatím vidět formát a čísla, ne běžící model – podobně jako u ternárního Maple-Preview, kde se rozcházel slibovaný a skutečný obsah repozitáře. Kdo chce ternární model rovnou spustit, sáhne dnes po něčem, co existuje ve formátu GGUF. Jestli mezi to Mach-1 přibude, rozhodne slíbené vydání.