Přeskočit na obsah
Infrastruktura 3 min čtení

AMD se dohodlo na koupi Taalasu, který zapisuje model přímo do křemíku

AMD se dohodlo na převzetí torontského Taalasu. Jeho demonstrační HC1 drží váhy modelu Llama 3.1 8B přímo v křemíku a podle měření výrobce generuje 17 000 tokenů za sekundu pro jednoho uživatele. Cenou je pevná vazba na jediný model a nový návrh čipu při větší změně vah.

AMD se 6. srpna dohodlo na převzetí torontské firmy Taalas. Cena oznámena nebyla a dokončení obchodu, které se čeká ve čtvrtém čtvrtletí, ještě podléhá souhlasu úřadů. Taalas má do plánu AMD přinést jiný druh akcelerátoru: místo univerzálního čipu, do kterého se váhy modelu načítají z paměti, vyrábí křemík pro jeden konkrétní model.

CNBC popisuje transakci jako dohodu o převzetí. Taalas vznikl v roce 2023 a dosud získal od investorů 219 milionů dolarů. AMD chce jeho technologii zařadit do svého plánu a kombinovat ji se serverovými procesory i akcelerátory Instinct. Nahradit nemá GPU v celém racku, ale doplnit ho při části inference, ve které model vytváří další tokeny.

Křemíkový wafer se strukturami čipů
Křemíkový wafer se strukturami budoucích čipů. Foto: Windell Oskay, Wikimedia Commons (CC BY 2.0)

HC1 nese váhy Llamy přímo v čipu

Demonstrační čip HC1 je vyrobený šestinanometrovým procesem TSMC, zabírá 815 mm² a má 53 miliard tranzistorů. Produktová stránka Taalasu uvádí spotřebu celého serveru 2,5 kW. V čipu běží Llama 3.1 8B, tedy model s osmi miliardami parametrů.

Hlavní rozdíl proti GPU leží v tom, kde jsou váhy. GPU je při výpočtu čte z rychlé paměti HBM. HC1 je má podle technického rozboru The Register uložené v části označené jako masková ROM. Proměnlivá data, například mezipaměť klíčů a hodnot pro právě vedený rozhovor nebo adaptéry pro jemné doladění, zůstávají v SRAM.

Čip proto nemusí při každém kroku přesouvat miliardy vah z oddělené paměti. Ušetřený přenos se může projevit kratší odezvou a vyšší rychlostí generování. Současně mizí vlastnost, která dělá GPU univerzálním: dnes na něj lze nahrát jeden model a zítra jiný, aniž by se měnil hardware.

Číslo 17 000 platí pro jeden model a měření výrobce

Taalas uvádí 17 000 tokenů za sekundu pro jednoho uživatele. Přesnější hodnota v rozboru The Register je 16 960 tokenů za sekundu. Číslo pochází z laboratoře Taalasu, nikoli z nezávislého testu.

Výrobce na produktové stránce popisuje i podmínky: Llama 3.1 8B, vstup dlouhý tisíc tokenů a stejně dlouhý výstup. Výsledky H200 a B200 podle poznámky měřil také Taalas, zatímco údaje pro Groq, SambaNovu a Cerebras převzal z Artificial Analysis. Graf tak míchá vlastní měření s cizími výsledky. Dokud někdo HC1 nezměří stejnou metodou mimo firmu, lze rychlost brát jako doložené tvrzení výrobce, ne jako nezávisle potvrzené pořadí akcelerátorů.

Údaj „pro jednoho uživatele“ rovněž není celková propustnost serveru. Říká, jak rychle může běžet jeden proud odpovědi. Neříká, kolik souběžných požadavků server zvládne ani jak rychle zpracuje dlouhý vstup před prvním tokenem. Pro provozovatele služby jsou přitom důležité všechny tři hodnoty.

Změna modelu znamená změnu křemíku

Největší omezení je fyzické. Jemné doladění přes adaptéry se vejde do proměnlivé paměti, ale větší změna vah vyžaduje novou podobu čipu. Taalas tvrdí, že při převodu dalšího modelu stačí změnit dvě kovové vrstvy a že od převzetí hotového modelu k hardwaru potřebuje dva měsíce. Ani jeden údaj zatím nebyl ověřený na veřejné zakázce.

Dva měsíce mohou dávat smysl u modelu, který bude dlouho obsluhovat velké množství stejných požadavků. Pro vývojový tým, který mění základní model každých několik týdnů, je to pomalé. Vedle ceny výroby vzniká i riziko, že objednaný čip dorazí ve chvíli, kdy už služba používá jinou architekturu nebo nové váhy.

První HC1 je navíc demonstrátor. Taalas chystá HC2 pro 20 miliard parametrů a větší modely chce rozdělovat mezi více čipů. To je plán, nikoli vydaný produkt. Ani oznámení AMD neuvádí, kdy se modelově specifický čip objeví v prodávaném systému nebo který model na něm poběží jako první.

AMD skládá rack z více druhů výpočtu

Převzetí zapadá do stavby systému, ve kterém různé čipy dělají různé části práce. GPU může zpracovat dlouhý vstup a udržet pružnost pro nové modely, zatímco specializovaný čip může generovat tokeny u stabilního a hodně používaného modelu. AMD už skládá rackové systémy Helios a Taalas mu přidává technologii, kterou dosud nemělo.

Rozhodující budou tři dosud chybějící údaje: cena čipu, propustnost při více uživatelích a čas i cena převodu dalšího modelu do výroby. HC1 ukazuje, že model lze skutečně vtisknout do křemíku a spustit. Teprve první nasazení mimo laboratoř ukáže, jestli vyšší rychlost vyváží to, že hardware stárne spolu s modelem.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Infrastruktura

    Nová datová centra v Texasu se nepřipojí k síti, dokud neprojdou auditem

    Guvernér Greg Abbott nařídil 3. srpna texaské komisi pro veřejné služby a provozovateli sítě ERCOT prověřit všechna datová centra ve frontě na připojení. Projekt, který…

  2. Infrastruktura

    Nové úložiště ani rejstříky se v Milvusu 3.0 ve výchozím nastavení nezapnou

    Vektorová databáze Milvus dostala 29. července 2026 značku 3.0.0. Umí nově postavit rejstřík nad daty, která zůstanou ležet v objektovém úložišti, a má přepsaný řídký…

  3. Infrastruktura

    AMD uvedla rack Helios se 72 kartami MI455X, jehož náskok je zatím odhad

    AMD uvedla 23. července rack Helios se 72 akcelerátory Instinct MI455X a 18 procesory EPYC „Venice“. Katalogový list karty uvádí 432 GB paměti HBM4 a propustnost 23,3 TB…

  4. Infrastruktura

    PJM chce omezovat nová datová centra, která si nepřivedou vlastní kapacitu

    Správní rada PJM Interconnection, provozovatele přenosové soustavy pro 67 milionů lidí na východě USA, rozhodla 27. července, že nové velké odběry nad 50 MW vezme zvlášť…