Ve vlastním testu Nvidie dokončil VoiceChat 11B třetinu nástrojových úloh
Nvidia vydala 3. srpna hlasový model VoiceChat 11B pro průběžný rozhovor a volání nástrojů. V jejím měření na FDB-v3 vybral správný nástroj v 82,5 % případů, správné argumenty však předal v 44,2 % a celý scénář prošel ve 33 %. Výsledek zatím není v původní práci ani na cizím žebříčku.

Nvidia vydala VoiceChat 11B jako otevřený hlasový model, který poslouchá i mluví průběžně. Nemusí tedy čekat, až člověk dokončí celou větu. Vedle odpovědi umí vytvořit volání nástroje, například požadavek na vyhledání letu nebo ceny akcie.
Model má 11 miliard parametrů a spojuje rychlý zvukový enkodér Conformer, jazykový základ Nemotron Nano v2 9B a dekodér převádějící odpověď zpět na řeč. Volání nástroje posílá odděleným kanálem. Samotný soubor model.safetensors má podle API Hugging Face 44,38 GB.
Správný nástroj ještě neznamená správně splněný úkol
Nejlépe to ukazuje výsledek v testu FDB-v3. Podle karty modelu VoiceChat vybral správný nástroj v 82,5 % případů. Správné argumenty však vytvořil jen ve 44,2 % případů a ukazatel Pass@1, tedy úspěch celého scénáře na první pokus, skončil na 33 %. Jedno vysoké číslo tak samo o sobě neříká, zda asistent úkol opravdu dokončil.
FDB-v3 vznikl na Nanyang Technological University ve spolupráci s Nvidií. Obsahuje lidskou řeč s přeřeknutími, odmlkami a opravami a řetězí několik API volání v oblastech jako cestování, finance nebo bydlení. Původní studie vyšla v dubnu, tedy před VoiceChatem. Jeho pozdější skóre uvádí Nvidia na modelové kartě, nikoli původní tabulka studie.
Druhý test, AU-Harness od ServiceNow, převádí úlohy BFCL-v3 do mluvené podoby. Nvidia uvádí průměr 56,1 %. Jednoduchá volání dosáhla 58,5 %, více volání 62,5 %, paralelní volání 42,5 % a paralelní kombinace více nástrojů jen 27,5 %. I tady jde o výsledky zveřejněné výrobcem na jeho kartě modelu.
Nvidia doporučuje nejvýš pět nástrojů za sezení
Dokument s omezeními modelu doporučuje nabídnout nejvýš pět nástrojů v jednom sezení. Při větším počtu může přesnost klesat. Model také neumí spolehlivě zavolat několik nástrojů současně a během provádění nástroje ho uživatel nemůže přerušit.
To mění dojem z plynulého rozhovoru. Při běžné odpovědi lze model zastavit, při čekání na externí službu nikoli. Dlouhá odpověď nástroje navíc prodlužuje prodlevu. Pokud se v jednom hovoru střídá obecná konverzace s nástroji, může model odpovědět ze svých znalostí místo toho, aby nástroj použil.
Další limity jsou praktičtější. VoiceChat je určen jen pro angličtinu a zpracovává nanejvýš přibližně dvouminutový zvukový kontext. Delší vstup už může být nespolehlivý. Výrobce upozorňuje také na horší chování v hluku, ozvěně nebo při řeči dalších lidí a na to, že model nebyl výslovně trénován pro uvažování ani bezpečnostní zarovnání.
Číslo 448 milisekund neměří dokončení nástroje
Nvidia uvádí v benchmarku FullDuplex 1.0 prodlevu 448 ms při plynulém střídání řečníků a 480 ms při přerušení. Jde však o reakci hlasového modelu, ne o čas potřebný k vyřízení letu, počasí nebo jiné externí služby. Celkovou odezvu proto ovlivní síť, samotné API i délka jeho odpovědi.
Karta současně tvrdí, že jde o druhý nejlepší otevřený plně duplexní model v testu VoiceBench. Veřejný repozitář VoiceBench ale v době vydání článku VoiceChat v tabulce neměl. Toto pořadí proto zatím nelze ověřit z nezávislého veřejného žebříčku.
Živé nástroje vyžadují kontejner Nvidie
Repozitář je dostupný pod licencí OpenMDW. Ukázka bez připojení pouze vrací předem připravený JSON a žádnou službu sama nespustí. Pro živé volání je potřeba inference kontejner Nvidie, vlastní nástrojový server a obousměrné spojení WebSocket.
Výrobce testoval inferenci na GPU H100 a uvádí podporu dalších datacentrových akcelerátorů i RTX 6000. Model je označen jako výzkumný. Nejdůležitějším dalším krokem proto nebude další demo hovoru, ale nezávislé zopakování výsledků včetně celých řetězců volání. Teprve to ukáže, jak často asistent uspěje mimo připravené scénáře a jak rychle se přesnost zhorší s větším počtem dostupných nástrojů.