Přeskočit na obsah
Nástroje 3 min čtení

Dohled v PILOTu umí přesměrovat běžícího agenta

Preprint týmu AllSpark z 27. srpna popisuje agenta, jehož práci za běhu sleduje a směruje druhý agent. PILOT v Terminal-Bench 2.0 překonal nejlepší srovnávaný nástroj o 4,4 až 5,0 procentního bodu. Čísla zatím pocházejí jen od autorů a adresa odkazovaného kódu vrací 404.

Letový ředitel u konzole v řídicím středisku
Letový ředitel Eugene F. Kranz u konzole v řídicím středisku NASA. Foto: Adam Cuerden, Wikimedia Commons (volné dílo)

Dlouhá práce agenta má obyčejný problém: jakmile se vydá špatným směrem, bývá jediným pozorovatelem vlastních chyb. Může se sice sám zastavit a zhodnotit postup, jenže v téže konverzaci současně drží příkazy, výstupy nástrojů, slepé uličky i původní cíl. Druhý agent u běžné delegace zase často uvidí až hotový výsledek.

PILOT zkouší obě role oddělit. Pracovní agent řeší úlohu, zatímco dohlížející agent zůstává v samostatném kontextu a sleduje jen cíl, události a známky toho, že se práce zadrhla. Parametry jazykového modelu se při tom nemění. Učí se vrstva okolo něj: dovednosti a paměť, které další pracovníci načtou při startu.

Dohled má dva zásahy, pracovník tři zprávy

Spojení mezi oběma agenty není nepřetržitý přepis celé konverzace. Pracovník může poslat oznámení o postupu, položit otázku a počkat na odpověď nebo odevzdat výsledek. Dohlížející agent má dvě možnosti: zařadit pokyn pro další tah pracovníka, nebo jeho relaci ukončit. Právě čekání na další tah je podstatné. Rozdělaný příkaz se nepřeruší uprostřed a pracovník dál nese odpovědnost za řešení.

Druhá smyčka ukládá zkušenost. Když dohled narazí na opakovatelný postup, konvenci projektu nebo slepou uličku, může ji zapsat do knihovny dovedností či do paměti. Nový pracovník pak dostane už změněnou výbavu. Autoři tomu říkají živé sebezdokonalování, ale nejde o další trénink modelu: GLM-5.1 i Kimi-K2.6 zůstaly po celý pokus zmrazené.

V porovnání se měnil nástroj, ne model

Jednorázová část pokusu použila tři sady dlouhých úloh. Vedle Terminal-Bench 2.0 šlo o SWE-bench Multilingual a SWE-bench Pro. Pro každý nástroj běžel tentýž základní model, stejné výchozí nastavení a dvě opakování celé konfigurace. V Terminal-Bench měl každý pokus nejvýše tři hodiny a odehrával se v odděleném kontejneru.

Na 89 úlohách Terminal-Bench 2.0 dosáhl PILOT s GLM-5.1 úspěšnosti 71,9 %. Nejlepší z ostatních nástrojů, OpenCode, měl 66,9 %. S Kimi-K2.6 vyšel PILOT na 71,3 %, zatímco Pi na 66,9 %. Rozdíl proti nejlepšímu soupeři tedy činil 5,0 a 4,4 procentního bodu. Abstrakt práce uvádí až 9,8 bodu; to je rozdíl proti jinému z porovnávaných nástrojů, ne proti vítěznému konkurentovi v každém sloupci.

Výsledek není bez výjimky. V SWE-bench Multilingual s Kimi-K2.6 dosáhl Pi 75,9 % a PILOT 73,7 %. PILOT vedl v pěti ze šesti dvojic modelu a testovací sady, ne ve všech. Z tabulky je také vidět, že největší podíl úspěšných běhů podpořených skutečným zásahem dohledu byl u těžkých úloh: 6,1 % s GLM-5.1 a 19,7 % s Kimi-K2.6. Autoři to určili ručním čtením průběhů, ne automatickým měřidlem.

Dvacet kol měnilo dovednosti mezi úlohami

Druhá část pokusu pustila Terminal-Bench 2.0 ve dvaceti iteracích. V jednom kole začínaly všechny úlohy se stejnou kopií dovedností a paměti. Hodnocení testu se k agentům během práce nedostalo. Teprve po dokončení kola rozhodl výsledek o tom, zda se změny z úspěšného běhu přenesou do další iterace; změny z neúspěšného běhu se zahodily.

Nejlepší pozorovaná úspěšnost GLM-5.1 vzrostla z 66,3 na 80,9 %, tedy o 14,6 bodu. U Kimi-K2.6 se posunula z 68,5 na 80,9 %, o 12,4 bodu. Slovo „nejlepší“ tu nelze vypustit: nejde o záruku, že právě poslední dvacáté kolo bylo nejlepší. Maximum přišlo ve čtrnácté, respektive třinácté iteraci.

Knihovna GLM-5.1 se rozrostla z 62 na 83 dovedností, u Kimi-K2.6 z 50 na 81. Průměrný výstup na vyhodnocenou úlohu se mezi prvním a posledním pětikolovým oknem zmenšil z 28,5 tisíce na 16,3 tisíce tokenů u GLM-5.1 a z 41,9 tisíce na 22,1 tisíce u Kimi-K2.6. Do součtu se započítaly odpovědi dohledu i pracovníků. Autoři z těchto hodnot odvozují pokles o 42,9 a 47,4 % a více než dvojnásobek úspěšných hodnocení na milion výstupních tokenů.

Testovací sada je veřejná, PILOT zatím ne

Terminal-Bench 2.0 je veřejný a jeho správci ho popisují jako sadu kontejnerových úloh od ladění asynchronního kódu po řešení bezpečnostních chyb. Každá úloha podle nich prošla několika hodinami kontroly, aby byla řešitelná, realistická a jednoznačně zadaná. To nezávisle potvrzuje povahu testu, nikoli výsledky PILOTu.

Samotné zopakování pokusu zatím brzdí chybějící kód. HTML verze preprintu odkazuje na github.com/XiaoYang66/Pilot, ale tato adresa i rozhraní GitHubu vracely 30. srpna chybu 404. Práce je navíc první verze preprintu z 27. srpna, nikoli výsledek nezávislého opakování nebo recenzního řízení. Čísla proto popisují měření týmu AllSpark na dvou konkrétních modelech; bez zveřejněné implementace zatím nejde ověřit, kolik z rozdílu dělá obecný princip odděleného dohledu a kolik právě jejich provedení.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Nástroje

    Codex 0.151.0 dovoluje rozšířením přepsat výsledek nástroje MCP

    Rozšíření Codexu mohou od verze 0.151.0 prohlédnout odpověď serveru MCP a před modelem ji nahradit. Dostanou i konečné argumenty a kontext volání; změna platí pro…

  2. Nástroje

    Modul mcp.server.fastmcp se do SDK vrátil jen proto, aby spadl s odkazem na návod

    Přejmenování třídy FastMCP na MCPServer nechalo ve druhé verzi knihovny mcp starý import padat na holé hlášce, ze které se nedalo poznat, že je nainstalovaná jiná hlavní…

  3. Nástroje

    Ollama 0.33.1 začala v MLX skutečně vynucovat JSON Schema

    Ollama uměla přijmout JSON Schema i u modelů v MLX, její runner se jím však neřídil. Verze 0.33.1 to mění: XGrammar před každým krokem zakáže tokeny, které by porušily…

  4. Nástroje

    Paseo ovládá z telefonu nativní CLI devětatřiceti agentních nástrojů

    Paseo pouští nativní příkazovou řádku cizích agentních nástrojů na stroji uživatele a ovládat se dá z telefonu, prohlížeče i desktopu. Model si nevybírá: rozhoduje o něm…