Přeskočit na obsah
Bezpečnost 3 min čtení

Hlídač agentů v API OpenAI umí konverzaci zastavit, hotové kroky ale nevrátí zpět

Spolu s modelem GPT-6 Astra ohlásilo OpenAI 3. září 2026 systém, který na pozadí čte uvažování agenta a při podezření na nezamýšlený přenos dat nebo destruktivní zásah konverzaci zastaví. Kontrola běží asynchronně, takže krok už může být hotový; zastavený požadavek podle příručky nic nevrací zpět.

K modelu GPT-6 Astra, který OpenAI vydalo 3. září 2026, patří i systém, o kterém se v oznámení mluví jednou větou: sledování nesouladu (misalignment monitoring). Čte uvažování a kroky agenta na pozadí a při podezření umí celou konverzaci zastavit. Vlastní záznam v seznamu změn nedostal – stojí jako odstavec pod ohlášením modelu.

Červené nouzové tlačítko na ovládacím panelu obráběcího stroje
Nouzové zastavení na obráběcím stroji. Foto: Flygklubben, Wikimedia Commons (CC BY-SA 4.0)

Čtyři situace, na které hlídač míří

Podle příručky pro vývojáře systém posuzuje, jestli agent správně vykládá pokyny uživatele ve chvílích, kdy na tom záleží: při přenosu citlivých dat, při přístupu k nim a při destruktivních změnách. Klientská knihovna to má rozepsané do čtyř hodnot pole error_typepotentially_unintended_data_transfer, potentially_unintended_data_access, potentially_unintended_destructive_activityother.

Označení samo o sobě neznamená, že agent udělal chybu. Příručka to říká rovnou: hlídač umí problém minout i označit legitimní práci, takže vlastní pojistky včetně lidského schválení u závažných kroků platí dál. Zásah do běžící práce agenta zkoušejí i jiné nástroje – dohled v PILOTu umí běžícího agenta přesměrovat.

Hlídač zastaví jen část požadavků

Automatické zastavení nedostane každé volání. Příručka rozlišuje tři případy. Požadavek do Responses API, který si nese uvažování mezi voláními, jede přes WebSocket nebo používá zhušťování kontextu od OpenAI, je sledovaný a systém u něj pozná pokračování téže konverzace, takže umí zarazit další vykonávání. Požadavek do Responses API bez některého z těch tří mechanismů sledovaný také je, jenže tam vše skončí u upozornění – konverzaci nikdo automaticky nezastaví. Rozhraní Chat Completions do tohohle systému nespadá vůbec; ostatní bezpečnostní kontroly na něm běží dál.

Nastavený webhook na tom nic nemění. „Nastavení webhooku pro upozornění automatické zastavování nezapíná,“ píše příručka (přeloženo).

Zastavenou konverzaci nikdo nerozjede

Když hlídač požadavek zablokuje ještě před začátkem streamování, vrátí rozhraní kód 403 s typem invalid_request_error a kódem misalignment_policy_violation. Porovnávat se má ten kód, ne text hlášky, a chybu musí umět zachytit i integrace, která už začala odebírat proud odpovědi.

Dvě věty pod tím mají pro provoz větší váhu než samo zastavení. Obecný způsob, jak zastavenou konverzaci obnovit, rozhraní nenabízí. A protože kontrola běží asynchronně, může být krok hotový dřív, než si ho hlídač všimne – zastavený požadavek dřívější kroky nevrací zpět.

Upozornění dorazí jako číslo, ne jako popis

Ke stejnému dni patří i verze 3.8.0 knihovny openai pro Python. Přibylo v ní volání client.safety.alerts.retrieve a dvě webhookové události – safety.alert.created pro projekt a safety.org_alert.created pro podnikový pracovní prostor. Ve verzi 3.7.0 ani ve starších ty soubory v repozitáři nejsou; událost safety_identifier.blocked, se kterou se novinka snadno splete, tam přitom leží od verze 3.0.0 a hlásí něco jiného – blokaci podle identifikátoru koncového uživatele.

Webhook nese jen identifikátor upozornění. Obsah se dotahuje voláním GET /v1/safety/alerts/{id} pod klíčem s oprávněním api.safety.alerts.read. Odpověď vedle kategorie vrací request_idresponse_id, podle kterých se dá dohledat dotčená práce, a pole request_paused. To poslední je zajímavější, než vypadá: hodnota true říká, že se blokaci podařilo zaregistrovat – ne že se vykonávání zastavilo nebo že se dřívější kroky vrátily zpět. Zdrojový soubor knihovny to má napsané u pole stejně jako příručka.

Pole reason bývá prázdné. Prázdné je mimo jiné u požadavků s nulovým uchováváním dat, a když prázdné není, jde o popis kategorie, ne o přepis konverzace nebo rozbor. Vyzvednutí navíc může skončit chybou 404 s kódem safety_alert_not_found, protože záznam může chybět nebo být neúplný. Doručování a vyzvedávání upozornění podle příručky úplnou auditní historii nedává.

Které modely to jsou, řekne až nápověda pro uživatele

Text mluví o „modelech pokrytých tímto systémem“, seznam v něm ale není. Odpověď leží až v nápovědě pro uživatele: jde o modely Astra a systém běží napříč ChatGPT, Codexem i rozhraním API. Tatáž stránka přidává dvě věci, které v příručce nejsou. U mobilu a u požadavků s nulovým uchováváním dat nedokáže OpenAI podrobné vysvětlení dát a konverzace se nedá obnovit. A když uživatel pozastavenou konverzaci v ChatGPT pustí dál, hlídač zůstává zapnutý a může ji zastavit znovu.

Pro toho, kdo staví agenta nad Responses API, z toho plyne jedna praktická věc. Hlídač je poslední záchrana, ne první – kdo chce mít jistotu, že se destruktivní krok neprovede, musí ho zastavit u sebe. Ochrana od OpenAI přijde na řadu až po něm, a někdy až po tom, co krok proběhl.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Bezpečnost

    Dynamicky sestavený Bifrost mohl bez přihlášení spustit modul z webu

    Správní rozhraní AI brány Bifrost před verzí 2.0.0 přijímalo od nepřihlášeného volajícího internetovou adresu vlastního zásuvného modulu. V dynamickém sestavení mohl…

  2. Bezpečnost

    Souběžné načtení dvou vektorů promptu obešlo ve vLLM pojistku proti loňské díře

    Záznam CVE-2026-73557 popisuje, že pojistka, kterou vLLM přidal v prosinci 2025 proti chybě CVE-2025-62164, stála na přepínači společném pro celý proces. Když server…

  3. Bezpečnost

    Tři skenery skillů pro AI agenty dostaly čísla CVE za přeskočený spustitelný kód

    AgentVerus Scanner, skill-scan z Tencent AI-Infra-Guard a claude-skill-antivirus dostaly 2. září tři čísla CVE. Všechny tři mají posoudit, jestli je cizí skill pro…

  4. Bezpečnost

    CowAgent má dvě nová CVE kvůli výstupu příkazů a sdílenému prohlížeči

    Dva záznamy CVE zveřejněné 2. září popisují odmítnutí služby v agentním nástroji CowAgent. Nástroj Bash hromadí celý výstup příkazu před jeho zkrácením, zatímco…