Přeskočit na obsah
Modely 3 min čtení

Ternární model Maple-Preview má v hlavním repozitáři 40 GB vah místo slíbených 5,31

DeepGrove zveřejnil 4. srpna 2026 pod licencí MIT ternární model Maple-Preview: 20,21 miliardy vah, z toho 1,49 miliardy aktivních při každém tokenu. Karta modelu slibuje kontrolní bod o 5,31 GB, hlavní repozitář na Hugging Face ale nese 40,43 GB vah v bfloat16. Zabalené podoby existují, jen leží v jiných repozitářích.

Firma DeepGrove zveřejnila 4. srpna 2026 na Hugging Face jazykový model Maple-Preview. Staví na směsi expertů: směrovač v každé z 24 vrstev vybere osm z 256 expertů, takže se z 20,21 miliardy vah podle DeepGrove použije na každý token jen 1,49 miliardy. Kontextové okno má 131 072 tokenů a soubor LICENSE nese čistou licenci MIT bez dodatků: žádný práh tržeb, žádné vyloučené odvětví, žádný seznam zemí.

Podstatné je ale slovo ternární v popisu modelu. Znamená, že každá váha nabývá jen tří hodnot: nuly a dvou opačných čísel. Násobení maticí se tím z velké části mění na sčítání a odčítání, takže model šetří paměť i výpočet. Karta modelu z toho vyvozuje dvě čísla do záhlaví: kontrolní bod o 5,31 GB a 218 tokenů za sekundu na Macu mini M4.

Mac mini na pultu prodejny
Mac mini v prodejně v Indii. Foto: Ganesh Mohan T, Wikimedia Commons (CC BY-SA 4.0)

Hlavní repozitář má 40 GB, ne 5,31

Devět souborů s váhami má podle rejstříku model.safetensors.index.json dohromady 40 428 060 672 bajtů, tedy 40,43 GB (37,7 GiB). Hugging Face u téhož repozitáře vypisuje 20 214 030 336 parametrů a u všech uvádí formát bfloat16. Vlastní podíl obou čísel dává přesně dva bajty na parametr, tedy šestnáct bitů na váhu, která má nabývat tří hodnot.

Slíbených 5,31 GB opravdu existuje, jen jinde. Repozitář maple-preview-2bit-mlx vznikl o 88 minut dřív než ten hlavní a jeho váhy mají 5 314 328 134 bajtů, tedy právě 5,31 GB. Karta hlavního repozitáře na něj neodkazuje. 6. srpna k tomu přibyl repozitář ve formátu GGUF se čtyřmi soubory od 4,98 do 6,35 GB podle zvoleného ternárního formátu a uložení výstupní vrstvy.

Obě velikosti potvrzuje i převod od někoho jiného: v repozitáři stamsam/maple-preview-gguf z 5. srpna má soubor v plné přesnosti 40,46 GB a ternárně zabalený 5,45 GB.

Tři hodnoty uložené v šestnácti bitech

Že jsou váhy opravdu ternární, se dá ověřit bez stahování celého modelu. Formát safetensors má na začátku souboru hlavičku se seznamem tenzorů a jejich pozic, takže stačí požádat server o pár kilobajtů z vypočtené pozice. V prvních 2 048 vahách matice gate_proj nultého experta nulté vrstvy jsou tři různé hodnoty: nula a dvě opačná čísla 0,024169921875. V matici q_proj téže vrstvy jsou taky tři, ale jiné: nula a 0,036376953125 v obou znaménkách. Měřítko je tedy zapečené přímo do uložené hodnoty a pro každý řádek matice vychází jinak.

Výstupní vrstva lm_head má naproti tomu ve vzorku 32 768 vah 2 376 různých hodnot, tedy plnou přesnost. Podle vlastního přepočtu z konfigurace je ternárních 19,58 miliardy vah v expertech a v projekcích pozornosti, tedy 97 % modelu; slovník o 151 936 položkách a výstupní hlava zůstávají celé. Z toho vychází i těch 5,31 GB: na 20,21 miliardy vah to je 2,10 bitu na váhu, což zhruba odpovídá zabalené ternární hodnotě (log2 3, tedy 1,58 bitu) plus dvěma šestnáctibitovým slovníkovým vrstvám.

Přiložený kód modeling_maple.py přitom nic nezabaluje. Váhy načte tak, jak leží, a podle poznámky na kartě potřebuje prostředí s CUDA, knihovnou Triton a FlashAttention. Kdo tedy vyjde z hlavního repozitáře, potřebuje jen na váhy 37,7 GiB paměti akcelerátoru. Že se ternární model dá uložit podstatně úsporněji, ukázal už dvoubitový formát Q2_0, který přibyl do llama.cpp koncem července.

Výsledky testů měřil zatím jen výrobce

Na kartě modelu je tabulka výsledků pouze jako obrázek, čísla se z ní přečíst nedají. V textové podobě jsou na vlastních stránkách DeepGrove: LiveCodeBench v6 75,1, AIME 2026 87,5, HMMT 2026 78,8 a GPQA-D 73,5 %, průměr 78,7. Ve stejné tabulce má ale Qwen3.5 35B-A3B průměr 82,9 a v GPQA-D 84,2 %, takže tvrzení o špičce platí pro váhovou třídu, ne celkově. Rychlosti tamtéž: 218 tokenů za sekundu na Macu mini M4 a 281,5 na MacBooku Pro s čipem M5 Pro.

Všechna ta čísla naměřil DeepGrove sám a nikdo je zatím nezopakoval; u rychlostí navíc není uvedeno, na jaké verzi běhového prostředí vznikly. Výrobce k nim přidává vlastní výhradu: tahle verze dostala jen malé doučení pro agentní úlohy, takže na testech agentů si podle něj povede hůř.

Čím to spustit

Pro Apple Silicon má DeepGrove vlastní odnož knihovny mlx-lm pod licencí MIT, založenou 19. července 2026. V hlavní větvi llama.cpp architektura Maple 6. srpna 2026 nebyla: slovo maple neobsahoval ani převodní skript convert_hf_to_gguf.py, ani llama-arch.cpp. Podpora je v odnoži deepgrove-ai/llama.cpp, jejíž poslední commit s popisem maplesupport vznikl téhož dne v 01:37 světového času.

Na Maple není zajímavé to, že je ternární; takových modelů vyšlo víc. Zajímavé je, že podle DeepGrove takový vznikl už při trénování, místo aby se na nižší přesnost převáděl dodatečně. Jestli se to vyplácí, rozhodne až měření někoho zvenčí, a k tomu je nejkratší cesta přes podporu v hlavní větvi, ne v odnoži.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    AMD popisuje Instella-MoE jako plně otevřený model, licence vah dovoluje jen výzkum

    AMD dala na Hugging Face model Instella-MoE-16B-A3B a s ním kontrolní body ze všech šesti fází tréninku. Kód k němu je pod licencí MIT, váhy pod licencí RESEARCH-ONLY…

  2. Modely

    LG dala K-EXAONE 2.0 s 1,5 TB vah pod Apache 2.0 místo vlastní licence

    Korejská LG AI Research zveřejnila K-EXAONE 2.0, model se 750 miliardami parametrů, z nichž se na token používá 37 miliard. Váhy zabírají 1 497,7 GB a model vznikl…

  3. Modely

    NVIDIA radí sdílet KV hlavu mezi víc dotazů, ale neříká, na kterých GPU měřila

    Nový technický rozbor rozděluje obsluhu dlouhého kontextu na dvě odlišné úlohy: načtení zadání omezuje výpočetní výkon, generování dalšího tokenu propustnost paměti.…

  4. Modely

    Váhy Solar Open 2 mají 500 GB, licence chce jméno začínající na Solar

    Korejský Upstage vydal 22. července otevřené váhy modelu Solar Open 2 – 250 miliard parametrů, z toho 15 miliard aktivních na token, kontext milion tokenů. Ke stažení je…