Přeskočit na obsah
Čísla 2 min čtení

OpenAI uvádí u čipu Jalapeño až 1,9krát více práce na watt

První vlastní čip OpenAI pro běh modelů má podle výsledků výrobce zvládnout 1,5 až 1,9krát více práce na watt než srovnávané systémy Nvidia. Při stejné práci by to znamenalo o 33 až 47 procent méně energie. Jalapeño zároveň dosáhlo nižší latence, čísla však zatím nikdo nezopakoval nezávisle.

Historický polovodičový wafer s neoddělenými čipy
Ilustrační snímek historického polovodičového waferu; podobu Jalapeña OpenAI ve zveřejněných výsledcích neukázalo. Foto: Retro-Computing Society of Rhode Island, Wikimedia Commons (CC BY-SA 4.0)

OpenAI zveřejnilo 25. srpna 2026 první výsledky čipu Jalapeño, který navrhlo s Broadcomem pro běh velkých jazykových modelů. V benchmarku InferenceX má proti srovnávaným systémům Nvidia zvládnout 1,5 až 1,9krát více práce na watt. Tohle číslo pochází od výrobce čipu, nikoli od nezávislé laboratoře.

Jalapeño je první vlastní inferenční čip OpenAI. Neučí modely, ale počítá jejich odpovědi poté, co už jsou natrénované. Firma ho na konferenci Hot Chips postavila proti systémům s akcelerátory Nvidia GB200 a GB300 a měřila tři otevřeně dostupné modely: GPT-OSS 120B, DeepSeek R1 670B a Kimi K2.5 1T. Podle TechCrunch jde o čip zaměřený na rychlou odezvu ve velkém provozu, ne o univerzální náhradu všech akcelerátorů.

Stejná práce by spotřebovala o třetinu až polovinu méně

Údaj „práce na watt“ říká, kolik výpočtu systém provede z každé jednotky energie. Pokud Jalapeño při stejné zátěži skutečně dosahuje 1,5násobné účinnosti, potřebuje na tutéž práci dvě třetiny energie, tedy o 33 procent méně. Při 1,9násobku je to přibližně 53 procent původní spotřeby, úspora skoro 47 procent. Jde o náš přepočet z poměrů OpenAI, ne o další měření.

Samotný příkon čipu má jmenovitou hodnotu 700 wattů. OpenAI uvádí, že při testech Jalapeño trvale nepřekročilo 550 wattů. To není totéž jako spotřeba celého serveru: paměti, procesory, síť a chlazení si berou další energii. Zveřejněný poměr je proto užitečný pro srovnání testovaných sestav, ale z jednoho čísla nelze spočítat účet za celé datové centrum.

Výrobce naměřil také kratší čekání na odpověď

Druhým výsledkem je koncová latence, tedy čas od přijetí požadavku po dokončení odpovědi. OpenAI hlásí 1,7 až 3,6krát nižší latenci a u interaktivní zátěže 2,1 až 4,1krát vyšší výkon. Právě spojení obou veličin je důležité. Server může vyrobit hodně tokenů za sekundu tím, že požadavky spojí do velkých dávek, ale jednotlivý člověk pak čeká. Jalapeño má podle zveřejněných grafů zvýšit propustnost bez stejné daně v podobě čekání.

Srovnání má několik pevných bodů: testované modely jsou pojmenované, InferenceX je veřejný benchmark a protihráči nejsou neurčitá „běžná GPU“, nýbrž systémy GB200 a GB300. Chybí však úplné zopakování někým, kdo čip nevyrábí ani nenasazuje. Také The Verge výsledky popisuje jako benchmarky zveřejněné OpenAI. Veřejná metodika tedy usnadňuje kontrolu podmínek, sama z firemního testu nezávislý test neudělá.

První kusy mají přijít letos

OpenAI počítá s nasazením malých objemů do konce roku 2026 a s větším rozšířením v roce 2027. Současně vyvíjí druhou generaci a připravuje třetí. Firma výslovně neříká, že akcelerátory Nvidia opustí. Vlastní čip jí dává další zdroj výpočetního výkonu pro jednu přesně vymezenou úlohu, zatímco trénování a ostatní zátěže mohou dál běžet na jiném hardwaru.

Do návrhu se zapojila i umělá inteligence. OpenAI uvádí, že se čip dostal od začátku návrhu k odeslání výrobních podkladů za devět měsíců. U vybraných bloků pro GPT-OSS byly implementace vytvořené s pomocí AI 1,5 až 1,8krát rychlejší než dřívější ruční varianty. Výrok se vztahuje jen k těmto blokům, ne k celému modelu ani k celému čipu.

Nejpřesnější závěr z prvních výsledků proto není, že Jalapeño „porazilo Nvidii“. OpenAI ukázalo, že jeho čip ve zvolených testech slibuje méně energie a kratší čekání při obsluze velkých modelů. Jestli se stejný náskok udrží v běžném provozu a v cizím měření, se ukáže až s dostupností skutečných systémů.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    Tabulka n-gramů drží ve vahách Qwen3.8-Flash-Next 51 miliard parametrů

    Qwen zveřejnil váhy Qwen3.8-Flash-Next, na kterých chce postavit příští generaci svých modelů. Soubory nesou 179 999 981 459 parametrů a zaberou 360 GB. Přes 51 miliard…

  2. U sebe doma

    SGLang odstranil přepínač pro kvantizaci, který v devíti vydáních jen hlásil chybu

    Přepínač --torchao-config končil v SGLangu chybou ImportError, ať mu uživatel předal kteroukoli z povolených hodnot. Rozbil ho skok verze knihovny torchao, který se…

  3. Čísla

    LiteLLM počítal úsporu z mezipaměti bez ceny jejího zápisu

    LiteLLM až do verze 1.98.0 přičítal úsporu za tokeny načtené z mezipaměti, ale neodečetl příplatek za její vytvoření. U zápisu 20 000 tokenů pro Claude Sonnet 4.5 tak…

  4. Čísla

    Pew našel stopy AI v desetině anglického webu, u novějších stránek ve více než třetině

    Pew Research Center prověřil 490 000 anglických webových stránek a v červencovém vzorku našel významné stopy strojového autorství u 10 % z nich. Mezi stránkami s datem…