Přeskočit na obsah
Infrastruktura 3 min čtení

NVIDIA přesouvá řadič paměti z akcelerátoru do základního čipu NVHBM

NVIDIA oznámila NVHBM, která přesouvá řadič paměti z akcelerátoru do základního čipu v HBM. Proti HBM4E slibuje až o 30 % vyšší propustnost a o 15 % nižší spotřebu, u uvolněné plochy ale její vlastní materiály střídají 25 a 30 %.

Čipy DRAM na starší grafické kartě
Samostatné čipy DRAM na starší grafické kartě. Paměti HBM včetně NVHBM skládají vrstvy do stohu vedle akcelerátoru. Foto: htomari, Wikimedia Commons (CC BY-SA 2.0)

NVIDIA 26. srpna představila paměť NVHBM pro zákaznické akcelerátory připojené přes NVLink Fusion. Hlavní změna není v počtu vrstev paměti. Řadič, který u běžného HBM4E zabírá místo na výpočetním čipu, se má přesunout do základního čipu pod vrstvami DRAM.

Výrobce slibuje proti standardnímu HBM4E až o 30 % vyšší propustnost a o 15 % nižší spotřebu paměti. Jde o údaje NVIDIA, ne o nezávisle zopakovaný test. Oznámení neuvádí kapacitu jednoho paměťového stohu, šířku rozhraní, cenu ani termín prvních dodávek.

Řadič se stěhuje z XPU do paměťového stohu

HBM tvoří několik vrstev paměti DRAM poskládaných nad základním čipem. Celý stoh leží v pouzdře vedle akcelerátoru a s ním komunikuje přes velké množství spojů. NVIDIA používá zkratku XPU pro zákaznický výpočetní čip, například akcelerátor navržený provozovatelem cloudu.

Jinou cestu ke snazšímu pouzdření navrhuje standard SPHBM4: omezuje počet datových signálů a míří na organický substrát. NVHBM místo toho mění umístění řadiče a NVIDIA ji váže na svou infrastrukturu NVLink Fusion.

U standardního HBM4E zůstává řadič na hlavním výpočetním čipu. NVHBM ho spolu s vlastním fyzickým rozhraním přesouvá do základního čipu paměti. Podle technického rozboru NVIDIA se tím plocha rozhraní a podpůrných obvodů zmenší až o 67 %. Užší spojení má zároveň zjednodušit vedení spojů v mezivrstvě pouzdra.

Vyšší propustnost má pomoci tam, kde výpočetní jednotky čekají na váhy modelu, aktivační data nebo mezipaměť KV. Ta uchovává mezivýsledky pozornosti pro předchozí tokeny, aby je model při každém dalším tokenu nepočítal znovu. Přesun dat mezi pamětí a výpočetními jádry pak může být užším místem než samotný výpočet.

Uvolněná plocha vychází jednou 25 a podruhé 30 procent

Dva materiály výrobce se rozcházejí v tom, kolik místa má přesun uvolnit. Kratší oznámení uvádí až o 25 % více plochy na výpočetním čipu XPU. Technický článek na jednom místě píše o 30 % více dostupného křemíku hlavního čipu, ale ve výpočtu celkového přínosu znovu pracuje s 25 %.

Texty nevysvětlují, zda se čísla počítají z jiného základu, nebo jde o nepřesnost. Nelze je proto sloučit do jediného údaje. Totéž platí pro tvrzení o 30 % nárůstu výkonu celého XPU: NVIDIA ho odvozuje společně z vyšší propustnosti, volné plochy a nižší spotřeby, ale nepřipojuje popis konkrétního čipu, modelu ani měřeného úkolu.

Výrobci pamětí mají dodat stohy se společným základem

NVIDIA nechce vyrábět vrstvy DRAM sama. Slibuje jednotné provedení základního čipu, které ověří s více výrobci pamětí. Pro návrháře akcelerátorů by to znamenalo, že nebudou kvalifikovat odlišné paměťové rozhraní pro každého dodavatele zvlášť.

Network World popisuje stejnou dělbu práce: NVIDIA navrhne základní čip a rozhraní, samotnou paměť vyrobí zavedený výrobce DRAM. Článek zároveň upozorňuje, že NVHBM není samostatný výrobek. Je to součást NVLink Fusion pro firmy, které stavějí vlastní akcelerátory a chtějí je zapojit do rackové infrastruktury NVIDIA.

Prvním oznámeným zájemcem je Annapurna Labs patřící Amazonu. Firma má NVHBM zkoumat spolu s propojením NVLink pro budoucí infrastrukturu AWS. Samotný Trainium4 má podle NVIDIA podporovat NVLink Fusion, oznámení však neříká, že dostane právě NVHBM.

Bez vzorků nejde sliby porovnat s HBM4E

NVHBM má tedy popsané rozdělení řadiče, první spolupráci a několik procentních tvrzení. Chybí parametry, podle kterých by se dal návrh porovnat s konkrétním HBM4E: kapacita stohu, počet stohů u XPU, dosažená propustnost v GB/s, spotřeba ve wattech a podmínky měření. Dokud se neobjeví vzorky nebo technický list, zůstávají uváděná zlepšení cílem výrobce.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Infrastruktura

    Triton 3.8.0 překládá jádra pro Rubin, který je zatím jen v náhledu dokumentace PTX

    Vydání z 28. srpna přidalo do překladače Triton cíl „cuda:107“ pro architekturu, kterou NVIDIA popisuje zatím jen ve vývojářském náhledu dokumentace PTX. Z Tritonu i z…

  2. Infrastruktura

    Vazba NIXL pro Rust běžela ve dvou obrazech Dynama na náhradních funkcích

    NVIDIA vydala 29. srpna opravu Dynama 1.4.2. Ve dvou jeho kontejnerových obrazech ležela knihovna NIXL v adresáři, kam dynamický zavaděč nedohlédne; přitom je to ona,…

  3. Infrastruktura

    Anthropic otevřel Model Hardware Standard jen vybraným laboratořím

    Model Hardware Standard má sjednotit ovládání mikroskopů, pipetovacích robotů a robotických ramen přes společné příkazy a bezpečnostní limity. Anthropic 27. srpna…

  4. Infrastruktura

    Ray 2.58 zohledňuje KV cache při směrování dotazů mezi replikami

    Ray 2.58 dokončil směrování požadavků podle toho, kolik jejich prefixu už leží v KV cache jednotlivých replik. Router převádí text na tokeny jednou, sleduje bloky v…