Přeskočit na obsah
Infrastruktura 2 min čtení

IBM má za 240 milionů dolarů dodat Together AI cluster, kapacitu neuvádí

Vyhrazený inferenční cluster s Nvidia HGX B300 má být na IBM Cloud dostupný v prvním čtvrtletí 2027. Oznámení uvádí hodnotu kontraktu a vlastní provoz Together AI, nikoli počet systémů, příkon ani cenu za milion tokenů.

Řady serverových skříní v datovém centru
Nový cluster má sloužit výhradně inferenci modelů Together AI; snímek je ilustrační. Foto: Carl Lender, Wikimedia Commons (CC BY 2.0)

IBM a Together AI 11. srpna oznámily víceletou smlouvu za 240 milionů dolarů. IBM má pro poskytovatele modelů postavit na svém cloudu vyhrazený cluster se systémy Nvidia HGX B300. V provozu má být v prvním čtvrtletí 2027, takže zatím jde o objednanou infrastrukturu, ne o novou službu, kterou už lze změřit.

Oznámení IBM dává kontraktu cenu, termín a jméno hardwaru. Neříká však, kolik systémů HGX B300 cluster dostane, ve kterém datovém centru poběží, jaký bude mít příkon ani kolik tokenů za sekundu má při stanovené odezvě zpracovat. Bez těchto údajů nelze z částky odvodit velikost ani hospodárnost provozu.

Jeden systém má osm akcelerátorů, počet systémů chybí

HGX B300 není jeden samostatný čip. Podle technického přehledu Nvidie sdružuje jeden systém osm akcelerátorů Blackwell Ultra ve formátu SXM, celkem 2,1 TB jejich paměti a 14,4 TB/s souhrnné propustnosti propojení NVLink. U síťového připojení tabulka uvádí 1,6 TB/s. IBM k tomu přidává síť Nvidia Spectrum-X Ethernet.

Takový základ říká, z čeho se cluster skládá, ale ne kolikrát se v něm zopakuje. Deset systémů by znamenalo 80 akcelerátorů, stovka 800. Oznámená suma nepomůže, protože víceletá smlouva může vedle hardwaru zahrnovat síť, provoz datového centra, podporu i cloudové služby. Firmy její rozpad nezveřejnily.

Cluster má sloužit inferenci, tedy samotnému provozu už vytrénovaných modelů. To je jiná úloha než jejich trénování. U inference rozhoduje nejen počet akcelerátorů, ale také velikost modelu, přesnost výpočtů, délka vstupu, počet současných požadavků a požadovaná odezva. Samotné označení B300 proto ještě neříká, kolik uživatelů systém obslouží.

Třicetinásobek je tvrzení dodavatelů, ne výsledek clusteru

IBM píše, že platforma může proti předchozí generaci zvýšit výstup takzvané továrny na AI až třicetkrát. U této věty výslovně odkazuje na Nvidii. Není u ní uvedený model, číselná přesnost, velikost dávky, požadovaná odezva ani konkrétní předchozí sestava. Jde tedy o údaj výrobce pro vybraný scénář, nikoli o nezávislý test budoucího clusteru IBM.

Stejnou výhradu uvádí i nezávislý technický web StorageReview. Skutečný výkon podle něj závisí na architektuře modelu, přesnosti, dávkování a nastavení služby. Pro zákazníka by proto byly užitečnější údaje o počtu tokenů za sekundu při dané odezvě a o ceně za milion tokenů. Ty ve zveřejněných podkladech nejsou.

Čtyři sta bilionů tokenů popisuje dnešní provoz

Together AI v oznámení tvrdí, že její platforma už nyní zpracuje přes 400 bilionů tokenů měsíčně. Jde o údaj samotné firmy a není k němu přiložena metodika. Hlavně nepopisuje nový cluster: ten má být dostupný až v roce 2027. Číslo tak ukazuje řád současného provozu Together AI, ne výkon objednaných B300.

IBM používá pro nabídku Together AI spojení open-source modely. Ani tato zkratka neurčuje náročnost provozu. Modely s veřejně dostupnými vahami mají různé velikosti a licence a otevřené váhy samy o sobě neznamenají otevřený zdrojový kód. Oznámení navíc nejmenuje konkrétní modely, které budou na clusteru běžet.

Co bude možné ověřit v roce 2027

Kontrakt je konkrétní v tom, kdo infrastrukturu zaplatí, kdo ji dodá a jakou generaci akcelerátorů použije. Na posouzení výsledku ale chybějí provozní měřítka. Až IBM cluster spustí, bude podstatný počet systémů, dostupnost služby, výkon při známé odezvě a reálná cena. Bez nich zůstává 240 milionů dolarů cenou smlouvy a údaj 30× marketingovým srovnáním, nikoli měřítkem kapacity.

Zdroje: oznámení IBM a Together AI, specifikace Nvidia HGXrozbor StorageReview.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Infrastruktura

    Envision uvedl do provozu areál v Ulanqabu, dva gigawatty i milion čipů jsou zatím cíl

    Envision oznámil 6. srpna uvedení areálu Galaxy Campus v Ulanqabu do provozu a přidal dvě velká čísla: přes dva gigawatty a milion akcelerátorů. Obě popisují cílový stav…

  2. Infrastruktura

    Hlavní větev Transformers přestala vydávat starý soubor z cache za aktuální

    Knihovna Transformers mohla na souborovém systému jen pro čtení předat aplikaci starší soubor z cache, i když na Hugging Face Hubu našla novější revizi. Oprava sloučená…

  3. Infrastruktura

    Načítání vah z disku spolklo ve SGLangu čtyři pětiny startu Qwen3-235B

    Vývojáři obslužné vrstvy SGLang si rozebrali po krocích, co server dělá, než přijme první požadavek. Ze 390 sekund startu modelu Qwen3-235B na čtyřech kartách připadlo…

  4. Infrastruktura

    AMD se dohodlo na koupi Taalasu, který zapisuje model přímo do křemíku

    AMD se dohodlo na převzetí torontského Taalasu. Jeho demonstrační HC1 drží váhy modelu Llama 3.1 8B přímo v křemíku a podle měření výrobce generuje 17 000 tokenů za…