Přeskočit na obsah
Modely 3 min čtení

Anthropic vydal Opus 5 za polovinu ceny Fable, test mu naměřil 50 % halucinací

Anthropic 24. července vydal model Claude Opus 5 za 5 dolarů za milion vstupních a 25 dolarů za milion výstupních tokenů, tedy za polovinu ceny Fable 5. V nezávislém souhrnném testu vede o bod, ale v dílčí zkoušce faktické přesnosti dosáhl 50% míry halucinací.

Anthropic 24. července uvedl model Claude Opus 5. Přes rozhraní API stojí 5 dolarů za milion vstupních a 25 dolarů za milion výstupních tokenů. Model je zároveň dostupný v placených tarifech aplikace Claude.

Sál se skříněmi superpočítače Summit
Superpočítač Summit v Oak Ridge National Laboratory. Snímek je ilustrační; ukazuje typ výpočetního zázemí, na kterém se velké modely provozují. Foto: Oak Ridge National Laboratory, Wikimedia Commons (CC BY 2.0)

Samotné označení Opus může mást. V červnu firma vydala dražší model Claude Fable 5, který účtuje 10 dolarů za milion vstupních a 50 dolarů za milion výstupních tokenů. Novější Opus je tedy v obou položkách přesně o polovinu levnější, přestože v některých měřeních dosahuje podobných nebo lepších výsledků.

Za stejný objem textu 7,50 místo 15 dolarů

Rozdíl je dobře vidět na jednoduchém příkladu. Požadavek s milionem vstupních tokenů a odpověďmi o celkové délce 100 tisíc tokenů stojí u Opusu 5 celkem 7,50 dolaru. U Fable 5 vyjde tentýž objem na 15 dolarů. Jde o prostý přepočet zveřejněného ceníku, nikoli o odhad skutečné měsíční útraty.

Anthropic nabízí také rychlý režim, který má podle firmy pracovat přibližně 2,5krát rychleji než běžná varianta. Účtuje za něj dvojnásobek základní ceny Opusu 5. Rychlý Opus tak vychází na stejných 10 a 50 dolarů za milion tokenů jako standardní Fable 5. Za vyšší rychlost se tedy cenová výhoda ztrácí.

Souhrnný test o bod vyhrál, jiný ho řadí za Fable

Výrobce uvádí vlastní výsledky v programování, práci s počítačem i řešení odborných úloh. Tyto tabulky ale Anthropic sestavil sám a část pokusů proběhla v interním prostředí. Nejsou proto nezávislým potvrzením výkonu.

Nezávislá měření dávají méně jednoznačný obraz. Podle přehledu serveru The Decoder získal Opus 5 v souhrnném indexu Artificial Analysis 61 bodů, Fable 5 měl 60 a předchozí Opus 4.8 dosáhl 56 bodů. Rozdíl proti dražšímu Fable je jediný bod.

V indexu schopností od organizace Epoch AI se pořadí obrátilo: Opus 5 získal 159 bodů a Fable 5 měl 161. V části zaměřené na vývoj softwaru oba modely skončily shodně na 161 bodech. Z těchto výsledků nelze poctivě vyvodit, že jeden z modelů poráží druhý ve všech úlohách.

Padesát procent se týká jednoho testu přesnosti

Největší varování přinesla dílčí zkouška AA-Omniscience, která sleduje faktické znalosti a halucinace. Opus 5 se proti Opusu 4.8 zlepšil o sedm bodů, zároveň však jeho míra halucinací stoupla o 14 procentních bodů na 50 procent. Model odpovídal častěji i v případech, kdy si správností nebyl jistý.

Číslo 50 procent neznamená, že je chybná každá druhá běžná odpověď v Claude. Platí pro konkrétní test a jeho způsob hodnocení. Ukazuje ale důležitý kompromis: model může v souhrnném žebříčku získat více bodů tím, že se častěji pokusí odpovědět, a současně si při nejistotě častěji vymýšlet.

Delší přemýšlení nebylo vždy lepší

Podobná výhrada platí pro nastavení úsilí při programování. V testu Vibe Code Bench měl režim „high“ úspěšnost 89,8 procenta. Dražší „xhigh“ dosáhl 88,3 procenta a nejvyšší „max“ 88,4 procenta. Víc času a víc výpočtů tedy v této zkoušce nepřineslo lepší výsledek.

To neznamená, že nejvyšší režim nemá smysl. U některých složitých úloh může pomoci. Ceník a benchmarky ale společně ukazují, že pro provoz nestačí vybrat nejsilnější název a nejvyšší nastavení. Rozhoduje cena celé úlohy, délka odpovědi a výsledek na vlastních datech.

Méně zásahů bezpečnostních filtrů

Opus 5 nemá stejný režim omezení jako Fable 5. Anthropic odhaduje, že jeho bezpečnostní klasifikátory zasáhnou přibližně o 85 procent méně často. Nadále však blokují například automatické skenování zranitelností v binárních souborech, penetrační testování a vytváření funkčních exploitů. Hledání chyb ve zdrojovém kódu firma povoluje.

U běžného přístupu se na Opus 5 nevztahuje zvláštní třicetidenní uchovávání dat, které firma zavedla pro Fable 5 a Mythos 5. Pokud bezpečnostní systém požadavek vyhodnotí jako rizikový, může ho v testovaném režimu místo úplného odmítnutí předat jinému modelu. Na tyto rozdíly upozornil také nezávislý server TechCrunch.

Levnější model není automaticky spolehlivější

Opus 5 mění ekonomiku nejdražší řady Claude: základní tokeny stojí polovinu proti Fable 5 a v souhrnném nezávislém indexu je výkon prakticky vyrovnaný. Tím ale srovnání nekončí. Jeden test řadí Fable výš, jiný Opus a zkouška faktické přesnosti odhalila vysokou ochotu odpovídat i bez jistoty.

Pro použití přes API je proto užitečnější měřit vlastní úlohy než opisovat první místo z jedné tabulky. Cena za token je pevná a snadno ověřitelná. Přesnost, rychlost a skutečná cena hotového výsledku se mění podle zadání i zvoleného režimu.

Zdroje: Anthropic – oznámení Opus 5, Anthropic – ceník Fable 5, The Decoder – nezávislá měřeníTechCrunch – dostupnost a bezpečnostní režim.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.