Přeskočit na obsah
Modely 3 min čtení

Mach-1 sbalil váhy Qwen3.6-35B na 7,5 GB, běžný nástroj je ale nepřečte

Syzygy Research vydala Mach-1 Additive 35B, ternární balení modelu Qwen3.6-35B-A3B, které srazí 71,9 GB vah na 7,53 GB. Vlastní měření vydavatele mu přisuzuje 95 % výkonu původního modelu. Repozitář ale místo obvyklých vah obsahuje dekodér v NumPy a běžný nástroj z něj model nenačte.

Na Hugging Face je od 2. srpna model Mach-1 Additive 35B od organizace Syzygy Research. Není to nový model v obvyklém smyslu slova: je to jinak zabalený Qwen3.6-35B-A3B, jehož váhy se vešly do balíku zhruba desetkrát menšího. Za to se ale platí tím, že s ním zatím žádný běžný nástroj nepracuje.

Grafická karta s osmi gigabajty paměti
Balík vah Mach-1 má 7,53 GB, tedy zhruba tolik, kolik pojme paměť běžné herní karty. Snímek je ilustrační. Foto: Jacek Halicki, Wikimedia Commons (CC BY-SA 4.0)

Sedm a půl gigabajtu místo dvaasedmdesáti

Původní Qwen3.6-35B-A3B má podle rozhraní Hugging Face 35 951 822 704 parametrů uložených v bf16 a jeho repozitář zabírá 71,92 GB. Soubor MANIFEST.json u Mach-1 uvádí u textové části balíku 7,5335 GB a průměr 1,6978 bitu na váhu. To je 9,5násobný rozdíl.

Ta dvě čísla jdou proti sobě prověřit. 7,5335 GB je 60,27 miliardy bitů; vydělené 1,6978 dávají 35,5 miliardy vah, tedy o 450 milionů méně, než kolik má původní model. Manifest to sám vysvětluje na dvou místech: sedmnáct tenzorů z vrstvy pro předpověď více tokenů do balíku nešlo a embedding je přiložený ve dvou zaměnitelných podobách, ale do součtu se počítá jen jedna. Celý repozitář má proto 8,12 GB, o něco víc než deklarovaná textová část.

Průměr 1,6978 bitu je přitom vyšší než log₂3, tedy zhruba 1,585 bitu, které by teoreticky stačily na tři úrovně. Vedle vlastních kódů vah totiž balík nese i spojité stupnice ve fp16 a měřítka pro jednotlivé skupiny, a ta se do průměru počítají taky.

Sčítání místo násobení

Popis formátu je v souborech BOARD.mdRELEASE_NOTES.md. Experti jsou uložení jako celočíselné trellisové kódy s vlastní kódovou knihou, páteř sítě v 64úrovňové celočíselné mřížce, výstupní vrstva v pětibitovém formátu po skupinách po 64 a embedding ve čtyřech bitech. Trellisový kód popisuje posloupnost hodnot přechody mezi stavy místo jednotlivých čísel, takže se rozbaluje popořadě, ne po jednotlivých vahách.

Slovo „additive“ v názvu odkazuje na to, co je z toho v dokumentaci vyzdvižené: každý maticový součin vah je podle BOARD.md jen sčítání a odčítání, bez násobení. To je smysl ternárních vah obecně – když má váha jen hodnoty −1, 0 a +1, násobička není potřeba. Jak s ternárními vahami zachází nástroj, který je umí načíst, jsme rozebírali u dvoubitového Q2_0 v llama.cpp.

V repozitáři je dekodér, ne váhy

Praktický háček je v tom, že soubory v repozitáři nejsou váhy, které by načetl transformers, vLLM nebo llama.cpp. Jsou to komprimované bitové proudy ve vlastním rozvržení a jediné, co je umí přečíst, je přiložený decode.py – samostatný dekodér napsaný v NumPy. Jeho úvodní komentář popisuje rozvržení do detailu, takže se dá zpětně dopočítat, co v kterém souboru je. Spustit z něj model ale znamená napsat si zbytek sám.

Vidět je to na diskusi pod modelem. Dva dny po vydání se tam někdo ptal, jaký nástroj to vlastně spustí, a odpověď od jiného uživatele zněla, že si nechal předělat webové rozhraní a posílá odkaz na sdílené úložiště. O den později další uživatel hledal slíbenou verzi GGUF, na kterou odkazuje popis upravené větve llama.cpp, a dostal chybu 401. V odpovědi ze 6. srpna stojí, že GGUF i upravená větev llama.cpp vyjdou „ještě tenhle týden“ (v originále „later this week“). Desátého srpna se v témže vlákně ptal na termín někdo další; repozitář s GGUF k tomu dni pořád vrací 401 a veřejné vyhledávání na GitHubu tu upravenou větev nenajde.

Na hlášení v diskusi se přitom odpovídá rychle. Když nejstarší z nich upozornilo, že v repozitáři chybí jeden ze souborů s embeddingem, byl týž den doplněný.

Devadesát pět procent, ale změřených doma

Karta modelu uvádí, že si Mach-1 na dvanácti testech drží průměrně 95,0 % skóre nezmenšeného učitele. Nejlépe dopadly matematické úlohy: u sady AIME26 je to 89,58 proti 90,00 bodu, tedy 99,5 %. Nejhůř skončilo sledování instrukcí v IFBench, kde model dal 54,08 bodu proti 64,97, tedy 83,2 %. Vedle toho stojí v tabulce Ternary Bonsai 27B od prism-ml s 93,6 % a dvoubitová varianta Gemma 4 s 85,6 %.

Všechna ta čísla naměřil vydavatel sám a nezávislé zopakování zatím není. BOARD.md aspoň říká, jak měřil: EvalScope 1.9.1 nad vLLM, režim uvažování, teplota 1,0, top_p 0,95 a top_k 20, u sad AIME průměr z osmi běhů. Poznamenává také, že rozptyl mezi opakovanými měřeními dosahuje u IFEval dvou až tří bodů a u τ²-bench až šesti, takže rozdíly pod jedním bodem jsou v jeho vlastní tabulce shoda, ne pořadí. Podle nás je to u srovnávací tabulky vydavatele nadprůměrně otevřené.

Váhy jsou pod licencí Apache 2.0, tedy bez prahů na tržby nebo počet uživatelů. Soubor LICENSE v repozitáři učitelského Qwenu je týž.

Z Mach-1 je zatím vidět formát a čísla, ne běžící model – podobně jako u ternárního Maple-Preview, kde se rozcházel slibovaný a skutečný obsah repozitáře. Kdo chce ternární model rovnou spustit, sáhne dnes po něčem, co existuje ve formátu GGUF. Jestli mezi to Mach-1 přibude, rozhodne slíbené vydání.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Pokee-Isaac slibuje kontext deseti milionů tokenů na jedné kartě, váhy ale nezveřejnil

    Pokee AI ohlásila 8. srpna 2026 model Pokee-Isaac 28B, který má zvládnout kontext deseti milionů tokenů a vejít se na jedinou grafickou kartu. Váhy ale nezveřejnila;…

  2. Modely

    Nová řada modelů zkouší vštípit hodnoty už při předtrénování

    Skupina model-raising zveřejnila 9. srpna rodinu malých jazykových modelů ke studii Synthetic Persona Pretraining. Ta zkouší vepsat modelu hodnoty už do předtrénování,…

  3. Modely

    Ve vlastním testu Nvidie dokončil VoiceChat 11B třetinu nástrojových úloh

    Nvidia vydala 3. srpna hlasový model VoiceChat 11B pro průběžný rozhovor a volání nástrojů. V jejím měření na FDB-v3 vybral správný nástroj v 82,5 % případů, správné…

  4. Modely

    Ling-3.0-flash popisuje podmínky měření podrobně, výsledky testů má jen v obrázcích

    Skupina inclusionAI zveřejnila 2. srpna 2026 na Hugging Face model Ling-3.0-flash: 124 miliardy vah, z toho 5,1 miliardy aktivních při každém tokenu, licence MIT. U…