Přeskočit na obsah
Čísla 2 min čtení

DFlash v hlavní větvi Ollamy zrychlil Lagunu-S při úpravách o 59 %, u prózy ji zpomalil

Ollama přidala 8. srpna do hlavní vývojové větve blokové spekulativní dekódování DFlash pro modely Laguna. V jejím měření na M5 Max vzrostla rychlost Laguny-S při úpravách textu ze 72,4 na 115,3 tokenu za sekundu, zatímco u prózy klesla ze 75,4 na 74,6. Přínos stejné techniky se tedy podle úlohy lišil od poklesu o 1,1 procenta po růst o 59,3 procenta.

Ollama přidala 8. srpna do hlavní vývojové větve podporu DFlash pro modely Laguna. DFlash je blokové spekulativní dekódování: menší pomocný model připraví několik dalších tokenů naráz a hlavní model je následně ověří. Smyslem je omezit počet pomalých kroků, při kterých velký model vytváří výstup po jednom tokenu.

Černý MacBook Pro s čipem Apple M5 na dřevěném stole
MacBook Pro s čipem M5. Snímek je ilustrační, Ollama měřila na výkonnější variantě M5 Max. Foto: AzureSaturn, Wikimedia Commons (CC0)

Čísla zveřejněná přímo v commitu s podporou Laguny ale ukazují, že DFlash není automatická zkratka k vyšší rychlosti. U menší Laguny-XS pomohl jen mírně a u jedné úlohy dokonce ubral. U Laguny-S se rozdíl rozevřel od malého zpomalení po téměř šedesátiprocentní zrychlení.

Šest měření, dva pomalejší výsledky

Ollama porovnala běžné dekódování s DFlash na M5 Max. Cílový i pomocný model byly ve formátu NVFP4, teplota byla 0,8 a penalizace opakování 1,1. Test zahrnoval prózu, kód a úpravu textu. Rychlost je uvedená v tokenech za sekundu:

  • Laguna-XS, próza: 139,4 bez DFlash a 142,3 s DFlash;
  • Laguna-XS, kód: 139,7 a 139,2;
  • Laguna-XS, úpravy: 137,3 a 145,1;
  • Laguna-S, próza: 75,4 a 74,6;
  • Laguna-S, kód: 70,0 a 80,8;
  • Laguna-S, úpravy: 72,4 a 115,3.

Procenta jsme přepočítali jako rozdíl rychlostí dělený rychlostí bez DFlash. U Laguny-S při úpravách tedy platí (115,3 − 72,4) / 72,4 × 100 = 59,3 %. Stejným výpočtem vychází u kódu plus 15,4 % a u prózy minus 1,1 %. U Laguny-XS jsou změny plus 2,1 %, minus 0,4 % a plus 5,7 %.

Největší číslo tak nepopisuje model obecně. Patří jedné velikosti modelu, jedné úloze a jednomu počítači. Commit neuvádí použité výzvy, délku odpovědí ani počet opakování, takže z něj nelze určit rozptyl měření. Je to výsledek vývojářů Ollamy, ne naše nezávislé měření.

Pomocný model si půjčuje části hlavního

Implementace vznikla ve třech souvisejících commitech. První přidává pomocný model DFlash, který nemá vlastní tabulku tokenů ani výstupní vrstvu a půjčuje si je od cílového modelu. Druhý přidává samostatné blokové sezení: pomocný model navrhne celý blok v jednom průchodu, výsledky se vyberou dávkově a nepřijatá část se z mezipaměti vrátí zpět.

Třetí commit propojuje DFlash právě s Lagunou. Hlavní model předává pomocnému výstupy vybraných vrstev a zpřístupňuje mu vstupní i výstupní převod tokenů. Při načtení se zároveň kontroluje šířka skrytých vrstev, slovník i pozice vrstev, ze kterých pomocný model čerpá. Neodpovídající dvojice proto nemá projít jako funkční.

DFlash už není zvláštnost jednoho programu

Že nejde o pojmenování vymyšlené jen pro Ollamu, potvrzují dvě nezávislé implementace. NVIDIA přidala podporu pomocného DFlash modelu pro Lagunu do TensorRT-LLM už 14. července. Změna zahrnuje kód pro Lagunu, spekulativní dekódování i testy přesnosti.

Také dokumentace SGLang uvádí DFlash mezi podporovanými způsoby spekulativního dekódování. Popisuje ho jako samostatný pomocný model s lineárním ověřením bloku a upozorňuje na omezení: nelze současně zapnout některé režimy paralelismu a plánování. SGLang tedy potvrzuje princip a praktické použití, nikoli rychlost naměřenou Ollamou.

Pro uživatele je podstatnější rozpětí výsledků než rekordních 59,3 %. V téže tabulce jsou dvě zpomalení, dvě jednociferná zrychlení a teprve u Laguny-S při kódu a úpravách přichází větší zisk. DFlash má proto smysl hodnotit na vlastních výzvách; samotné zapnutí ještě nezaručuje rychlejší odpověď.

Zdroje: tři commity projektu Ollama z 8. srpna 2026, commit projektu TensorRT-LLM ze 14. července 2026 a dokumentace projektu SGLang. Procentní rozdíly jsou náš přepočet ze zdrojových hodnot Ollamy.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    OpenAI snížila ceny modelů GPT-5.6 Luna a Terra, aniž vydala nový model

    Od 30. července stojí GPT-5.6 Luna o 80 procent méně a Terra o 20 procent méně než dřív; OpenAI to zdůvodňuje úsporami v provozu, ne novým modelem. Čínský DeepSeek…

  2. Čísla

    LongCat-Flash-Lite-Sparse má pod MIT 138 GB vah a plné okno přidá dalších 16 GB

    Meituan dal 31. července na Hugging Face váhy modelu LongCat-Flash-Lite-Sparse. Má 69 miliard parametrů, licenci MIT bez jakýchkoli prahů a kontextové okno 983 040…

  3. Čísla

    Po záměně průměru za nejslabší výsledek se první pětka HELM Lite vymění celá

    Pořadí modelů v žebříčku závisí na tom, jak se dílčí výsledky slijí do jednoho čísla. Práce ze sborníku workshopu GEM přepočítala dva veřejné žebříčky HELM podle…

  4. Čísla

    vLLM 0.26.0 bere tři až sedm bitů na váhu, jenže dva bity model v měření položily

    Nástroje pro běh jazykových modelů zmenšují váhy skoro vždy na osm nebo čtyři bity. Vydání vLLM 0.26.0 z 27. července 2026 přidalo dvě schémata, která ke kratším šířkám…