AMD se dohodlo na koupi Taalasu, který zapisuje model přímo do křemíku
AMD se dohodlo na převzetí torontského Taalasu. Jeho demonstrační HC1 drží váhy modelu Llama 3.1 8B přímo v křemíku a podle měření výrobce generuje 17 000 tokenů za sekundu pro jednoho uživatele. Cenou je pevná vazba na jediný model a nový návrh čipu při větší změně vah.
AMD se 6. srpna dohodlo na převzetí torontské firmy Taalas. Cena oznámena nebyla a dokončení obchodu, které se čeká ve čtvrtém čtvrtletí, ještě podléhá souhlasu úřadů. Taalas má do plánu AMD přinést jiný druh akcelerátoru: místo univerzálního čipu, do kterého se váhy modelu načítají z paměti, vyrábí křemík pro jeden konkrétní model.
CNBC popisuje transakci jako dohodu o převzetí. Taalas vznikl v roce 2023 a dosud získal od investorů 219 milionů dolarů. AMD chce jeho technologii zařadit do svého plánu a kombinovat ji se serverovými procesory i akcelerátory Instinct. Nahradit nemá GPU v celém racku, ale doplnit ho při části inference, ve které model vytváří další tokeny.

HC1 nese váhy Llamy přímo v čipu
Demonstrační čip HC1 je vyrobený šestinanometrovým procesem TSMC, zabírá 815 mm² a má 53 miliard tranzistorů. Produktová stránka Taalasu uvádí spotřebu celého serveru 2,5 kW. V čipu běží Llama 3.1 8B, tedy model s osmi miliardami parametrů.
Hlavní rozdíl proti GPU leží v tom, kde jsou váhy. GPU je při výpočtu čte z rychlé paměti HBM. HC1 je má podle technického rozboru The Register uložené v části označené jako masková ROM. Proměnlivá data, například mezipaměť klíčů a hodnot pro právě vedený rozhovor nebo adaptéry pro jemné doladění, zůstávají v SRAM.
Čip proto nemusí při každém kroku přesouvat miliardy vah z oddělené paměti. Ušetřený přenos se může projevit kratší odezvou a vyšší rychlostí generování. Současně mizí vlastnost, která dělá GPU univerzálním: dnes na něj lze nahrát jeden model a zítra jiný, aniž by se měnil hardware.
Číslo 17 000 platí pro jeden model a měření výrobce
Taalas uvádí 17 000 tokenů za sekundu pro jednoho uživatele. Přesnější hodnota v rozboru The Register je 16 960 tokenů za sekundu. Číslo pochází z laboratoře Taalasu, nikoli z nezávislého testu.
Výrobce na produktové stránce popisuje i podmínky: Llama 3.1 8B, vstup dlouhý tisíc tokenů a stejně dlouhý výstup. Výsledky H200 a B200 podle poznámky měřil také Taalas, zatímco údaje pro Groq, SambaNovu a Cerebras převzal z Artificial Analysis. Graf tak míchá vlastní měření s cizími výsledky. Dokud někdo HC1 nezměří stejnou metodou mimo firmu, lze rychlost brát jako doložené tvrzení výrobce, ne jako nezávisle potvrzené pořadí akcelerátorů.
Údaj „pro jednoho uživatele“ rovněž není celková propustnost serveru. Říká, jak rychle může běžet jeden proud odpovědi. Neříká, kolik souběžných požadavků server zvládne ani jak rychle zpracuje dlouhý vstup před prvním tokenem. Pro provozovatele služby jsou přitom důležité všechny tři hodnoty.
Změna modelu znamená změnu křemíku
Největší omezení je fyzické. Jemné doladění přes adaptéry se vejde do proměnlivé paměti, ale větší změna vah vyžaduje novou podobu čipu. Taalas tvrdí, že při převodu dalšího modelu stačí změnit dvě kovové vrstvy a že od převzetí hotového modelu k hardwaru potřebuje dva měsíce. Ani jeden údaj zatím nebyl ověřený na veřejné zakázce.
Dva měsíce mohou dávat smysl u modelu, který bude dlouho obsluhovat velké množství stejných požadavků. Pro vývojový tým, který mění základní model každých několik týdnů, je to pomalé. Vedle ceny výroby vzniká i riziko, že objednaný čip dorazí ve chvíli, kdy už služba používá jinou architekturu nebo nové váhy.
První HC1 je navíc demonstrátor. Taalas chystá HC2 pro 20 miliard parametrů a větší modely chce rozdělovat mezi více čipů. To je plán, nikoli vydaný produkt. Ani oznámení AMD neuvádí, kdy se modelově specifický čip objeví v prodávaném systému nebo který model na něm poběží jako první.
AMD skládá rack z více druhů výpočtu
Převzetí zapadá do stavby systému, ve kterém různé čipy dělají různé části práce. GPU může zpracovat dlouhý vstup a udržet pružnost pro nové modely, zatímco specializovaný čip může generovat tokeny u stabilního a hodně používaného modelu. AMD už skládá rackové systémy Helios a Taalas mu přidává technologii, kterou dosud nemělo.
Rozhodující budou tři dosud chybějící údaje: cena čipu, propustnost při více uživatelích a čas i cena převodu dalšího modelu do výroby. HC1 ukazuje, že model lze skutečně vtisknout do křemíku a spustit. Teprve první nasazení mimo laboratoř ukáže, jestli vyšší rychlost vyváží to, že hardware stárne spolu s modelem.