RWKV-7 G1i dostal formát pro Transformers, samotné váhy jsou venku od 5. srpna
Projekt RWKV zveřejnil čtyři velikosti řady G1i ve formátu, který načte knihovna Transformers – od 1,5 do 13,3 miliardy parametrů, všechny pod licencí Apache 2.0. Původní soubory vah nesou datum 5. srpna a převod do GGUF pro llama.cpp vyšel týž den. Architektura je rekurentní, takže při generování nepotřebuje vyrovnávací paměť, která by rostla s délkou textu.
Účet fla-hub na Hugging Face založil 14. srpna 2026 mezi 12:00 a 12:04 UTC čtyři repozitáře s vahami řady RWKV-7 G1i. Jsou to 1,5 B, 2,9 B, 7,2 B a 13,3 B parametrů, všechny pod licencí Apache 2.0.

Nové na tom není to, co by se z data čekalo. Samotné váhy leží v repozitáři BlinkDL/rwkv7-g1 jako soubory .pth s datem v názvu – rwkv7-g1i-13.3b-20260805-ctx16384.pth – a komunitní převod do GGUF vznikl 5. srpna odpoledne. Co přibylo teď, je formát pro knihovnu flash-linear-attention, tedy podoba, kterou umí načíst Transformers.
Skoro jedenáct měsíců bez nových vah na tomtéž účtu
Rozhraní Hugging Face vydá u každého repozitáře datum založení. Poslední předchozí váhy RWKV-7 na účtu fla-hub jsou rwkv7-1.5B-g1a z 25. září 2025 a největší tamní model téhle architektury byl dosud rwkv7-7.2B-g0a z 30. srpna 2025. Verze 13,3 B je tedy pro tenhle formát nová, i když stejně velké modely starších řad jsou v GGUF k dispozici déle – G1c od 2. ledna 2026, G1h od 13. července.
Největší model roste jen do hloubky
Údaje jsou z config.json jednotlivých repozitářů, velikost je součet souborů podle rozhraní Hugging Face. Váhy jsou v bfloat16.
| Model | Vrstev | Skrytý rozměr | Hlav | Váhy |
| G1i 1,5 B | 24 | 2 048 | 32 | 3,06 GB |
| G1i 2,9 B | 32 | 2 560 | 40 | 5,90 GB |
| G1i 7,2 B | 32 | 4 096 | 64 | 14,40 GB |
| G1i 13,3 B | 61 | 4 096 | 64 | 26,54 GB |
Mezi 7,2 B a 13,3 B se nemění ani skrytý rozměr, ani počet hlav – model roste jen do hloubky, z 32 vrstev na 61. Slovník má u všech čtyř 65 536 položek a text do něj rozkládá vlastní tokenizér projektu, RWKV World.
Rekurentní stav místo vyrovnávací paměti, která roste
Karta modelu popisuje architekturu jako rekurentní a bez mechanismu pozornosti, s rekurentním stavem stálé velikosti a stálou prací na každý vygenerovaný token. Totéž říká odborná práce RWKV-7 „Goose“ with Expressive Dynamic State Evolution, vydaná na arXivu 18. března 2025: konstantní spotřeba paměti a konstantní čas na token.
Prakticky to znamená, že model nedrží vyrovnávací paměť klíčů a hodnot, která u běžného transformeru roste s každým dalším tokenem rozhovoru. Druhá strana téže mince: model se nemůže vrátit k přesnému znění staršího vstupu, protože ho nikde nedrží – má jen svůj stav.
Licence je Apache 2.0 na váhy i na trénovací kód
Metadata i text karty uvádějí u všech čtyř velikostí Apache 2.0, žádné dodatky ani prahy. Táž licence stojí u repozitářů RWKV-LM s trénovacím a inferenčním kódem. Projekt podle karty financuje RWKV Project pod hlavičkou LF AI & Data Foundation a jako autory uvádí Bo Peng, Yu Zhang, Songlin Yang, Ruichong Zhang a Zhiyuan Li.
Samozřejmé to není. Qwen sáhl u nedávné řady po vlastní licenci se třemi prahy a u jiných vah bývá strop na tržby nebo na počet uživatelů. Tady žádná taková podmínka není.
Co v oznámení není
Karta modelu neuvádí ani jeden výsledek testu – žádné číslo, žádné srovnání s jiným modelem téže velikosti. README u původních vah místo toho odkazuje na cizí žebříček a o všech modelech řady píše, že jsou to základní modely (base) vhodné pro další doučení, ne hotoví asistenti. Karta v novém formátu to opakuje výslovně: přiložená šablona chatu je rozhraní pro zadávání pokynů, ne tvrzení, že je model bezpečnostně vyladěný.
Druhá věc, kterou si musí čtenář dohledat sám: ve všech čtyřech souborech config.json stojí max_position_embeddings: 2048. To je výchozí hodnota třídy RWKV7Config v knihovně flash-linear-attention, kterou nikdo nepřepsal – název původního souboru vah přitom končí na ctx16384. U rekurentní architektury bez pozičních vektorů to pole nepopisuje totéž co u transformeru, takže z něj délku kontextu vyčíst nelze.
Kde se to spustí
Pro Transformers žádá karta instalaci flash-linear-attention přímo z gitu a knihovnu transformers ve verzi 4.48.0 a vyšší; soubory samotné byly uloženy verzí 4.50.2. Kdo jede na hlavní větvi Transformers, měl by počítat s tím, že ta knihovna vypsala od února 33 nekompatibilních změn.
Bez Pythonu to jde taky. Zdrojový kód llama.cpp vede architekturu rwkv7 ve svém seznamu llama-arch.cpp, hotové GGUF má každá ze čtyř velikostí v pěti souborech, od Q4_K_M po FP16. V katalogu Ollamy visí balíček rwkv-7-g1i se všemi čtyřmi. Ten balíček je komunitní, ne oficiální, a má zatím dvanáct stažení; převod do GGUF dělá týž účet, který vydal soubory na Hugging Face.
Zbývá jediná otázka, na kterou zdroje neodpovídají: jak si G1i vede proti transformeru téže velikosti. Bez jediného zveřejněného měření se to dá zjistit jen vlastním během – a u 13,3 B modelu to znamená 26,54 GB vah ke stažení, než člověk uvidí první token.