Přeskočit na obsah
Infrastruktura 4 min čtení

NCCL 2.31 přidal přenos, který NVIDIA podporuje jen na Blackwellu a od CUDA 13.3

Knihovna, přes kterou si karty NVIDIA při trénování modelů předávají mezivýsledky, vydala 11. srpna verzi 2.31. Hlavní novinku, Compute Fabric Transport, podporuje NVIDIA jen na kartách Blackwell a od CUDA 13.3. Zbytek flotily dostal čtrnáct oprav, vestavěnou diagnostiku a síťový backend, který do NCCL přispěl tým AWS.

Trénování velkého modelu neběží na jedné kartě. Práce se rozdělí na desítky až tisíce karet a ty si po každém kroku musí navzájem sesbírat mezivýsledky. Na kartách NVIDIA to obstarává knihovna NCCL, která podle vlastního popisu zvládá operace jako all-reduce, all-gather nebo broadcast a je vyladěná na PCIe, NVLink a NVSwitch stejně jako na síť přes InfiniBand či TCP/IP. Verze 2.31.2-1 vyšla 11. srpna 2026, dva měsíce a týden po předchozí 2.30.7-1.

Kabely zapojené do portů přepínače InfiniBand
Kabely zapojené do portů přepínače InfiniBand. Foto: ChrisDag, Wikimedia Commons (CC BY 2.0)

Compute Fabric Transport a jeho dvě podmínky

Novinka, kterou poznámky k vydání jmenují první, se jmenuje Compute Fabric Transport, zkratkou CFT. Přidává rozhraní na straně hostitele i na straně karty: paměť registrovanou jako okno lze navázat na logické koncové body CUDA a přímo z kódu běžícího na kartě pak vydat operace Put, Get, Red a NVLS. Řečeno polopatě, o přesun dat si říká sama karta, ne procesor, který ji obsluhuje.

Hned pod tím ale stojí druhá odrážka: CFT je podporovaný na kartách Blackwell a s CUDA 13.3 nebo novější. Toolkit překážka není. Archiv vydání CUDA vede 13.3.0 od května 2026 a opravnou 13.3.1 od června, kterou zároveň označuje za poslední vydání. Překážkou je generace karet.

Jméno Blackwell padne v poznámkách třikrát

Poznámky k vydání mají 62 odrážek ve dvanácti oddílech; to je náš součet nad jejich textem, NVIDIA žádný neuvádí. Blackwell se v nich objeví třikrát a pokaždé jako podmínka. Kromě CFT ještě u jader TMA, která jsou na Blackwellu nově zapnutá ve výchozím stavu pro symetricky registrovanou paměť, a u opravy výběru síťové karty, kterou NVIDIA omezila právě na systémy s Blackwellem a ConnectX-8. Vázat doporučení na generaci karty přitom není u NVIDIE nic nového, jen se to nedozvíte vždycky: u rady sdílet KV hlavu mezi víc dotazů chybělo, na čem měření platilo.

Blackwell přesto není jen na straně zisku. Ze tří vad, které NVIDIA v oznámení sama vede jako známé, se dvě týkají karet řady B. Na B40 můžou symetrická jádra TMA přetéct dostupnou sdílenou paměť a skončit neplatným přístupem do paměti; obchází se to vypnutím přes NCCL_SYM_TMA_ENABLE=0. Na systémech B100 PCIe zase úlohy s víc procesy na jedné kartě přes MPS MLoPart padají při alokaci paměti na chybu CUDA 101. Třetí vada patří starší H100, kde kombinace algoritmu PAT s NVLS ztrácí výkon; opravu NVIDIA slibuje na příští vydání.

Zbytek vydání na generaci karty vázaný není. Oddíl oprav má čtrnáct odrážek a jsou mezi nimi věci, které bolí v provozu na čemkoli: zatuhnutí, když se inicializace spojení PXN potká s rušením komunikátoru, poškození dat, když se z jedné alokace vykrojí víc symetrických oken, nebo únik paměti po neúspěšném založení komunikátoru pro Device API.

Backend pro síť Amazonu psal Amazon

Nejdelší z oddílů věnovaných jedné funkci, devět odrážek, patří GIN. Zkratka znamená síť řízenou z grafické karty: operace nad sítí vydává kód běžící na kartě, místo aby o ně žádal procesor. Přibyly do něj časové limity u blokujících operací, možnost dát jednomu komunikátoru jiný backend než druhému a u backendu GDAKI podpora GRH a automatické zjištění MTU cesty.

Zajímavější než tenhle výčet je ale to, kdo jednu z položek napsal. Backend pro EFA GDA, tedy pro síťový adaptér Amazonu, do NCCL nepřidala NVIDIA, ale tým AWS EFA. Návrh změny #2273 otevřel 7. července 2026 vývojář vystupující jako bhasunit, sáhl v něm na 18 souborů a přidal 2 308 řádků. NVIDIA týmu AWS děkuje v závěru poznámek zvlášť, spolu s poděkováním za úpravy hostitelské proxy pro GIN. Knihovna, která drží pohromadě clustery karet NVIDIA, tak nejbližší cestu do sítě jednoho velkého poskytovatele dostala od toho poskytovatele.

Diagnostiku spustí jedna proměnná prostředí

Část, která nechce ani Blackwell, ani CUDA 13.3, je nová diagnostika. Proměnná NCCL_RUN_RAS_DIAGNOSTICS=1 spustí sadu kontrol: inventář karet, verze ovladače CUDA, chyby ECC, stav NVLinku a konzistenci proměnných NCCL_*. Druhá, NCCL_RUN_DIAGNOSTICS=1, aktivně vyzkouší spojení mezi kartami a k nálezu přidá i návod, co s ním. Do téhož oddílu patří i profiler ve verzi 7, který u každého jádra rozlišuje fáze úvodní synchronizace, výpočtu a závěrečné synchronizace.

Proti CFT je to drobnost, jenže poznámky u ní žádnou podmínku na kartu ani na verzi toolkitu neuvádějí.

Plán z července a co z něj vyšlo

NCCL vede plán vývoje veřejně. Zápis z 6. července 2026 vyjmenoval deset věcí, které měla přinést právě 2.31. Prošli jsme je proti poznámkám k vydání a u devíti se protějšek najít dá, od CFT přes podporu EFA GDA a nastavení jednotlivých kolektivů až po diagnostiku s RAS. Desátá položka, sjednocení hostitelské části starých a symetrických jader, vlastní odrážku v poznámkách nemá. Neznamená to, že se neudělala; vnitřní přestavba kódu se v seznamu novinek objevit nemusí. Přiřazení je naše, ne NVIDIE, a u dvou položek je to úsudek, ne doslovná shoda.

Tentýž zápis vede i delší okno od srpna do října a na jeho začátku stojí podpora architektury Rubin, kterou chce NCCL zvládnout s jinou topologií a vlastními optimalizacemi. Vedle ní přestavba starých algoritmů TREE, RING a LL nad novým Device API a možnost registrovat si vlastní komunikační jádro. Otázka, kolik z vydání dostane konkrétní hardware, tedy Blackwellem nekončí.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Infrastruktura

    IBM má za 240 milionů dolarů dodat Together AI cluster, kapacitu neuvádí

    Vyhrazený inferenční cluster s Nvidia HGX B300 má být na IBM Cloud dostupný v prvním čtvrtletí 2027. Oznámení uvádí hodnotu kontraktu a vlastní provoz Together AI,…

  2. Infrastruktura

    Envision uvedl do provozu areál v Ulanqabu, dva gigawatty i milion čipů jsou zatím cíl

    Envision oznámil 6. srpna uvedení areálu Galaxy Campus v Ulanqabu do provozu a přidal dvě velká čísla: přes dva gigawatty a milion akcelerátorů. Obě popisují cílový stav…

  3. Infrastruktura

    Hlavní větev Transformers přestala vydávat starý soubor z cache za aktuální

    Knihovna Transformers mohla na souborovém systému jen pro čtení předat aplikaci starší soubor z cache, i když na Hugging Face Hubu našla novější revizi. Oprava sloučená…

  4. Infrastruktura

    Načítání vah z disku spolklo ve SGLangu čtyři pětiny startu Qwen3-235B

    Vývojáři obslužné vrstvy SGLang si rozebrali po krocích, co server dělá, než přijme první požadavek. Ze 390 sekund startu modelu Qwen3-235B na čtyřech kartách připadlo…