Přeskočit na obsah
Modely 3 min čtení

RWKV-7 G1i dostal formát pro Transformers, samotné váhy jsou venku od 5. srpna

Projekt RWKV zveřejnil čtyři velikosti řady G1i ve formátu, který načte knihovna Transformers – od 1,5 do 13,3 miliardy parametrů, všechny pod licencí Apache 2.0. Původní soubory vah nesou datum 5. srpna a převod do GGUF pro llama.cpp vyšel týž den. Architektura je rekurentní, takže při generování nepotřebuje vyrovnávací paměť, která by rostla s délkou textu.

Účet fla-hub na Hugging Face založil 14. srpna 2026 mezi 12:00 a 12:04 UTC čtyři repozitáře s vahami řady RWKV-7 G1i. Jsou to 1,5 B, 2,9 B, 7,2 B13,3 B parametrů, všechny pod licencí Apache 2.0.

Husy velké v letu nad krajinou
Husy velké (Anser anser) v letu. Architektura RWKV-7 nese kódové jméno Goose, tedy husa. Foto: Charles J. Sharp, Wikimedia Commons (CC BY-SA 4.0)

Nové na tom není to, co by se z data čekalo. Samotné váhy leží v repozitáři BlinkDL/rwkv7-g1 jako soubory .pth s datem v názvu – rwkv7-g1i-13.3b-20260805-ctx16384.pth – a komunitní převod do GGUF vznikl 5. srpna odpoledne. Co přibylo teď, je formát pro knihovnu flash-linear-attention, tedy podoba, kterou umí načíst Transformers.

Skoro jedenáct měsíců bez nových vah na tomtéž účtu

Rozhraní Hugging Face vydá u každého repozitáře datum založení. Poslední předchozí váhy RWKV-7 na účtu fla-hub jsou rwkv7-1.5B-g1a z 25. září 2025 a největší tamní model téhle architektury byl dosud rwkv7-7.2B-g0a z 30. srpna 2025. Verze 13,3 B je tedy pro tenhle formát nová, i když stejně velké modely starších řad jsou v GGUF k dispozici déle – G1c od 2. ledna 2026, G1h od 13. července.

Největší model roste jen do hloubky

Údaje jsou z config.json jednotlivých repozitářů, velikost je součet souborů podle rozhraní Hugging Face. Váhy jsou v bfloat16.

ModelVrstevSkrytý rozměrHlavVáhy
G1i 1,5 B242 048323,06 GB
G1i 2,9 B322 560405,90 GB
G1i 7,2 B324 0966414,40 GB
G1i 13,3 B614 0966426,54 GB

Mezi 7,2 B a 13,3 B se nemění ani skrytý rozměr, ani počet hlav – model roste jen do hloubky, z 32 vrstev na 61. Slovník má u všech čtyř 65 536 položek a text do něj rozkládá vlastní tokenizér projektu, RWKV World.

Rekurentní stav místo vyrovnávací paměti, která roste

Karta modelu popisuje architekturu jako rekurentní a bez mechanismu pozornosti, s rekurentním stavem stálé velikosti a stálou prací na každý vygenerovaný token. Totéž říká odborná práce RWKV-7 „Goose“ with Expressive Dynamic State Evolution, vydaná na arXivu 18. března 2025: konstantní spotřeba paměti a konstantní čas na token.

Prakticky to znamená, že model nedrží vyrovnávací paměť klíčů a hodnot, která u běžného transformeru roste s každým dalším tokenem rozhovoru. Druhá strana téže mince: model se nemůže vrátit k přesnému znění staršího vstupu, protože ho nikde nedrží – má jen svůj stav.

Licence je Apache 2.0 na váhy i na trénovací kód

Metadata i text karty uvádějí u všech čtyř velikostí Apache 2.0, žádné dodatky ani prahy. Táž licence stojí u repozitářů RWKV-LM s trénovacím a inferenčním kódem. Projekt podle karty financuje RWKV Project pod hlavičkou LF AI & Data Foundation a jako autory uvádí Bo Peng, Yu Zhang, Songlin Yang, Ruichong Zhang a Zhiyuan Li.

Samozřejmé to není. Qwen sáhl u nedávné řady po vlastní licenci se třemi prahy a u jiných vah bývá strop na tržby nebo na počet uživatelů. Tady žádná taková podmínka není.

Co v oznámení není

Karta modelu neuvádí ani jeden výsledek testu – žádné číslo, žádné srovnání s jiným modelem téže velikosti. README u původních vah místo toho odkazuje na cizí žebříček a o všech modelech řady píše, že jsou to základní modely (base) vhodné pro další doučení, ne hotoví asistenti. Karta v novém formátu to opakuje výslovně: přiložená šablona chatu je rozhraní pro zadávání pokynů, ne tvrzení, že je model bezpečnostně vyladěný.

Druhá věc, kterou si musí čtenář dohledat sám: ve všech čtyřech souborech config.json stojí max_position_embeddings: 2048. To je výchozí hodnota třídy RWKV7Config v knihovně flash-linear-attention, kterou nikdo nepřepsal – název původního souboru vah přitom končí na ctx16384. U rekurentní architektury bez pozičních vektorů to pole nepopisuje totéž co u transformeru, takže z něj délku kontextu vyčíst nelze.

Kde se to spustí

Pro Transformers žádá karta instalaci flash-linear-attention přímo z gitu a knihovnu transformers ve verzi 4.48.0 a vyšší; soubory samotné byly uloženy verzí 4.50.2. Kdo jede na hlavní větvi Transformers, měl by počítat s tím, že ta knihovna vypsala od února 33 nekompatibilních změn.

Bez Pythonu to jde taky. Zdrojový kód llama.cpp vede architekturu rwkv7 ve svém seznamu llama-arch.cpp, hotové GGUF má každá ze čtyř velikostí v pěti souborech, od Q4_K_M po FP16. V katalogu Ollamy visí balíček rwkv-7-g1i se všemi čtyřmi. Ten balíček je komunitní, ne oficiální, a má zatím dvanáct stažení; převod do GGUF dělá týž účet, který vydal soubory na Hugging Face.

Zbývá jediná otázka, na kterou zdroje neodpovídají: jak si G1i vede proti transformeru téže velikosti. Bez jediného zveřejněného měření se to dá zjistit jen vlastním během – a u 13,3 B modelu to znamená 26,54 GB vah ke stažení, než člověk uvidí první token.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    DeepSeek vydal V4-Pro, který si draft model pro zrychlení nese přímo ve vahách

    DeepSeek vydal 13. srpna 2026 ostrou verzi modelu DeepSeek-V4-Pro-0813 pod licencí MIT. Hlavní novinkou je modul DSpark, který navrhuje tokeny dopředu a jehož váhy…

  2. Modely

    EXAONE 4.5 přišla v GGUF o posuvnou pozornost kvůli pořadí metadat

    Oficiální GGUF modelu EXAONE 4.5 obsahuje 65 bloků včetně jedné hlavy pro předpověď více tokenů, ale llama.cpp kontrolovalo počet vrstev dřív, než tuto hlavu odečetlo.…

  3. Modely

    Mach-1 sbalil váhy Qwen3.6-35B na 7,5 GB, běžný nástroj je ale nepřečte

    Syzygy Research vydala Mach-1 Additive 35B, ternární balení modelu Qwen3.6-35B-A3B, které srazí 71,9 GB vah na 7,53 GB. Vlastní měření vydavatele mu přisuzuje 95 %…

  4. Modely

    Pokee-Isaac slibuje kontext deseti milionů tokenů na jedné kartě, váhy ale nezveřejnil

    Pokee AI ohlásila 8. srpna 2026 model Pokee-Isaac 28B, který má zvládnout kontext deseti milionů tokenů a vejít se na jedinou grafickou kartu. Váhy ale nezveřejnila;…