Přeskočit na obsah
Modely 5 min čtení

Na vlastním testu Pipecatu vyskočil doladěný Nemotron 3 Nano z 28,6 na 72,3 procenta

Tým Pipecat vydal PhoneLLM Alpha 1, plné doladění modelu NVIDIA Nemotron 3 Nano 30B-A3B na telefonní hovory. Na vlastním žebříčku PhoneBench mu skóre stouplo z 28,6 na 72,3 %, tedy z posledního místa na třetí z patnácti. Testovací sada k tomu měřítku ale zatím veřejná není a dopočet ceny za minutu se v oznámení liší od tabulky.

Telefonní přístroj se sluchátky na stole v call centru
PhoneLLM Alpha 1 cílí na jednu úlohu: vést hovor za firmu a přitom volat správné nástroje. Foto: Petiatil, Wikimedia Commons (CC BY-SA 3.0)

Tým Pipecat z firmy Daily, který vyvíjí stejnojmenný rámec pro hlasové agenty, vydal 27. srpna 2026 model PhoneLLM Alpha 1. Váhy nahrál na Hugging Face už 24. srpna, oznámení vyšlo o tři dny později. Model je plné doladění modelu NVIDIA Nemotron 3 Nano 30B-A3B na jedinou úlohu: vést telefonní hovor za firmu a přitom volat správné nástroje. Spolu s ním tým zveřejnil vlastní žebříček PhoneBench, ve kterém model skončil třetí z patnácti.

Doladění nezměnilo velikost ani architekturu

Rozhraní Hugging Face vydá u každého souboru v repozitáři velikost, takže se dá sečíst bez stahování. Třináct souborů .safetensors má dohromady 63 156 689 008 bajtů, tedy 63,16 GB neboli 58,8 GiB. Parametrů je 31 577 937 344 – a přesně tolik jich má i základní model od NVIDIE, do posledního kusu. Plné doladění mění hodnoty vah, ne jejich počet.

Nemění ani stavbu. Konfigurace je táž jako u Nemotronu: 52 vrstev, z toho 23 typu Mamba-2, 23 se směsí expertů a 6 pozornostních. Vrstva se směsí expertů drží 128 samostatných podsítí plus jednu sdílenou a na každý token se z nich zapojí šest. NVIDIA proto uvádí 3,5 miliardy aktivních parametrů z třiceti miliard celkových. Kontextové okno má v konfiguraci 262 144 tokenů, ačkoli NVIDIA v kartě modelu píše, že architektura zvládne až milion; nižší hodnota je tam kvůli paměti.

Ta stavba je celý důvod, proč si Pipecat vybral zrovna Nemotron. Pozornostních vrstev je jen šest z dvaapadesáti, takže KV cache – paměť na dosavadní část hovoru – roste pomalu a na jedné kartě se vejde vedle sebe hodně souběžných hovorů. Karta modelu doporučuje pouštět ho s teplotou 0 a vypnutým uvažováním, protože tak byl trénovaný.

Z posledního místa na třetí

PhoneBench Alpha 1 hodnotí patnáct modelů na vícekolových hovorech se zákaznickou podporou. Odpovědi porovnává s referenčními vzory porota jazykových modelů kalibrovaná podle lidských štítků a známkuje mimo jiné telefonní mluvu, přesnost volání nástrojů, soulad mezi tím, co model řekne a co udělá, ověřování volajícího a výsledek hovoru. Vedle přesnosti měřítko měří čas do první odpovědní značky a odhaduje cenu za minutu hovoru.

Nejlepší skóre má Gemini 3.6 Flash se 78,6 %. GPT-5.6 Terra má 72,4 %, PhoneLLM Alpha 1 hned za ním 72,3 %. Poslední, patnáctý řádek patří Nemotronu 3 Nano s 28,6 %. Jsou to tytéž váhy před doladěním. Mezi třetím a posledním místem tabulky tedy stojí jedno trénovací kolo.

Měřil to autor modelu na vlastním měřítku a u takového čísla platí, že je to zatím tvrzení, ne ověřený výsledek. Stránka PhoneBenche to říká sama: úplná testovací sada a metodika se podle ní zveřejní, „až měřítko dozraje“. Do té doby scénáře, seznamy nástrojů, instrukce pro porotu ani prompty veřejné nejsou, takže nikdo jiný měření nezopakuje. Podobně jsme psali o hlasovém modelu VoiceChat 11B, jehož čísla o volání nástrojů taky pocházela z měření výrobce.

Vydáno je naopak víc, než bývá zvykem: v tabulce stojí všech patnáct řádků včetně těch, kde model prohrává, a u každého je vedle skóre i latence a odhad ceny. Dvě velké nedoladěné Nemotrony to nešetří: Nemotron 3 Ultra 550B-A55B má 38,1 %, kdežto více než čtyřikrát menší Nemotron 3 Super 120B 55,9 %.

Co v té tabulce znamená „base“

Poslední řádek je pojmenovaný „Nemotron 3 Nano 30B base“ a poznámka pod tabulkou k němu dodává, že jde o nedoladěné základní modely. Slovo tam ale znamená něco jiného než u NVIDIE. Karta PhoneLLM uvádí jako základ repozitář NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 a to je hotový chatovací model, který prošel doučením na syntetických datech i posilovaným učením s lidskou zpětnou vazbou. Surový předtrénovaný model vydává NVIDIA zvlášť, pod jménem se slovem Base uvnitř.

Těch 28,6 % tedy nepatří polotovaru, ale modelu, který se běžně nasazuje – a to je pro článek o doladění spíš argument než výhrada. Základ je obecný stroj na uvažování a kód se šesti podporovanými jazyky; PhoneLLM umí anglicky a jednu věc.

Cena za minutu: dvě čísla, která nesedí

Oznámení tvrdí, že model dosahuje na GPT-5.6 Terra a je přitom o 94 % levnější a o 1 300 ms rychlejší v devadesátém pátém percentilu času do první odpovědi. Latence z tabulky vychází: 1 957 ms proti zhruba 600 ms je rozdíl 1 357 ms. Cena už ne. Tabulka uvádí 0,0347 dolaru za minutu u Terry a 0,0025 u PhoneLLM, což je o 92,8 % míň. Na 94 % by bylo potřeba dostat se na 0,0021 dolaru a zaokrouhlením čtyř desetinných míst se ten rozdíl vysvětlit nedá.

Vlastní dopočet v kartě modelu si navíc protiřečí s tabulkou o řád. Karta počítá s kartou B200 u poskytovatele Modal za 6,2496 dolaru na hodinu, s násobkem 1,5 za připnutí k regionu a se sedmdesátiprocentním využitím: 6,2496 × 1,5 = 9,3744, děleno 0,70 je 13,392 dolaru za hodinu, tedy 0,2232 za minutu. To děleno osmaosmdesáti souběžnými hovory dá 0,0025 dolaru – v textu ale stojí 0,00025. Správná je hodnota z tabulky.

Cena za minutu je tak jako tak odhad, ne účtenka. U hostovaných modelů ji autoři počítají z ceníkových sazeb, u modelů běžících na vlastním železe z modelované ceny karty, a obojí stojí na tom, kolik hovorů se na kartu vejde vedle sebe.

Kde model běží a pod jakou licencí

Podle karty se model vejde na jednu kartu B200 a pouští se stejně jako základní Nemotron. Projekt vLLM má pro něj hotový recept, ověřený na kartách H200, a u varianty BF16 v něm počítá se 72 GB paměti; samotné soubory vah mají 63,16 GB, zbytek padne na KV cache a režii. Druhá cesta vede přes SGLang. Modal k tomu přidal vlastní nastavení, které podle oznámení zdvojnásobí počet souběžných hovorů proti obecnému receptu.

Licence je dvouvrstvá a karta to nezamlčuje. Vlastní práci vydává Daily pod BSD 2-Clause, pod ní ale dál platí NVIDIA Nemotron Open Model License na podkladové dílo. Její oddíl 3 žádá po každém, kdo model nebo vlastní odvozeninu šíří dál, aby přiložil kopii licence a zachoval oznámení o autorství. Tentýž oddíl přitom výslovně dovoluje dát vlastním úpravám a celku jiné podmínky, takže tenhle dvojí zápis licenci NVIDIE neobchází.

Co si tedy z PhoneLLM Alpha 1 může ověřit každý sám: velikost vah, architekturu, kontext, obě licence a to, že se model vejde na jednu kartu. Co ne: jestli se opravdu vyrovná modelu GPT-5.6 Terra. Na to je potřeba, aby Pipecat vydal scénáře a instrukce poroty – nebo aby si někdo postavil vlastní měřítko a spočítal to znovu.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    GLM-5.3-Flash si drží KV cache jen v jedenácti ze 45 vrstev

    Váhy modelu GLM-5.3-Flash jsou na Hugging Face pod licencí MIT: 321,3 miliardy parametrů v 62 souborech, dohromady 328,3 GB. Slovo „Flash“ se týká ceny provozu, ne…

  2. Modely

    Nanbeige 4.2 pouští svých dvaadvacet vrstev dvakrát za sebou

    Model Nanbeige4.2-3B předčí v agentních testech podstatně větší modely a přitom má jen tři miliardy parametrů mimo vloženiny. Konfigurace prozrazuje proč: dvaadvacet…

  3. Modely

    Váhy modelu SenseNova U1.5-8B-MoT mají 17,5 miliardy parametrů

    SenseTime vydala 19. srpna otevřený multimodální model SenseNova U1.5-8B-MoT. Rozhraní Hugging Face u něj napočítá 17 532 854 464 parametrů a osm souborů s vahami zabere…

  4. Modely

    Draft model DFlash 2 pro Qwen3.8 se rozběhne jen na nevydaném kódu SGLangu a vLLM

    Inco AI zveřejnila 18. srpna DFlash 2 – malý model, který za Qwen3.8-27B předpovídá celé bloky tokenů dopředu. Ve vlastním měření tím propustnost SGLangu roste 2,7 až 3…