DFlash v hlavní větvi Ollamy zrychlil Lagunu-S při úpravách o 59 %, u prózy ji zpomalil
Ollama přidala 8. srpna do hlavní vývojové větve blokové spekulativní dekódování DFlash pro modely Laguna. V jejím měření na M5 Max vzrostla rychlost Laguny-S při úpravách textu ze 72,4 na 115,3 tokenu za sekundu, zatímco u prózy klesla ze 75,4 na 74,6. Přínos stejné techniky se tedy podle úlohy lišil od poklesu o 1,1 procenta po růst o 59,3 procenta.
Ollama přidala 8. srpna do hlavní vývojové větve podporu DFlash pro modely Laguna. DFlash je blokové spekulativní dekódování: menší pomocný model připraví několik dalších tokenů naráz a hlavní model je následně ověří. Smyslem je omezit počet pomalých kroků, při kterých velký model vytváří výstup po jednom tokenu.

Čísla zveřejněná přímo v commitu s podporou Laguny ale ukazují, že DFlash není automatická zkratka k vyšší rychlosti. U menší Laguny-XS pomohl jen mírně a u jedné úlohy dokonce ubral. U Laguny-S se rozdíl rozevřel od malého zpomalení po téměř šedesátiprocentní zrychlení.
Šest měření, dva pomalejší výsledky
Ollama porovnala běžné dekódování s DFlash na M5 Max. Cílový i pomocný model byly ve formátu NVFP4, teplota byla 0,8 a penalizace opakování 1,1. Test zahrnoval prózu, kód a úpravu textu. Rychlost je uvedená v tokenech za sekundu:
- Laguna-XS, próza: 139,4 bez DFlash a 142,3 s DFlash;
- Laguna-XS, kód: 139,7 a 139,2;
- Laguna-XS, úpravy: 137,3 a 145,1;
- Laguna-S, próza: 75,4 a 74,6;
- Laguna-S, kód: 70,0 a 80,8;
- Laguna-S, úpravy: 72,4 a 115,3.
Procenta jsme přepočítali jako rozdíl rychlostí dělený rychlostí bez DFlash. U Laguny-S při úpravách tedy platí (115,3 − 72,4) / 72,4 × 100 = 59,3 %. Stejným výpočtem vychází u kódu plus 15,4 % a u prózy minus 1,1 %. U Laguny-XS jsou změny plus 2,1 %, minus 0,4 % a plus 5,7 %.
Největší číslo tak nepopisuje model obecně. Patří jedné velikosti modelu, jedné úloze a jednomu počítači. Commit neuvádí použité výzvy, délku odpovědí ani počet opakování, takže z něj nelze určit rozptyl měření. Je to výsledek vývojářů Ollamy, ne naše nezávislé měření.
Pomocný model si půjčuje části hlavního
Implementace vznikla ve třech souvisejících commitech. První přidává pomocný model DFlash, který nemá vlastní tabulku tokenů ani výstupní vrstvu a půjčuje si je od cílového modelu. Druhý přidává samostatné blokové sezení: pomocný model navrhne celý blok v jednom průchodu, výsledky se vyberou dávkově a nepřijatá část se z mezipaměti vrátí zpět.
Třetí commit propojuje DFlash právě s Lagunou. Hlavní model předává pomocnému výstupy vybraných vrstev a zpřístupňuje mu vstupní i výstupní převod tokenů. Při načtení se zároveň kontroluje šířka skrytých vrstev, slovník i pozice vrstev, ze kterých pomocný model čerpá. Neodpovídající dvojice proto nemá projít jako funkční.
DFlash už není zvláštnost jednoho programu
Že nejde o pojmenování vymyšlené jen pro Ollamu, potvrzují dvě nezávislé implementace. NVIDIA přidala podporu pomocného DFlash modelu pro Lagunu do TensorRT-LLM už 14. července. Změna zahrnuje kód pro Lagunu, spekulativní dekódování i testy přesnosti.
Také dokumentace SGLang uvádí DFlash mezi podporovanými způsoby spekulativního dekódování. Popisuje ho jako samostatný pomocný model s lineárním ověřením bloku a upozorňuje na omezení: nelze současně zapnout některé režimy paralelismu a plánování. SGLang tedy potvrzuje princip a praktické použití, nikoli rychlost naměřenou Ollamou.
Pro uživatele je podstatnější rozpětí výsledků než rekordních 59,3 %. V téže tabulce jsou dvě zpomalení, dvě jednociferná zrychlení a teprve u Laguny-S při kódu a úpravách přichází větší zisk. DFlash má proto smysl hodnotit na vlastních výzvách; samotné zapnutí ještě nezaručuje rychlejší odpověď.
Zdroje: tři commity projektu Ollama z 8. srpna 2026, commit projektu TensorRT-LLM ze 14. července 2026 a dokumentace projektu SGLang. Procentní rozdíly jsou náš přepočet ze zdrojových hodnot Ollamy.