Hlídač bezpečnosti k modelům Ling 3.0 stojí na jediné vrstvě pozornosti
Ant Group vydal 1. září 2026 dvě sady vah pod jménem SingProbe. Nejsou to samostatné modely: napojí se na běžící Ling 3.0, odečtou mu skryté stavy ze tří vrstev a ke každému vygenerovanému tokenu vrátí deset skóre – osm o úmyslu dotazu, jedno o nebezpečnosti odpovědi a jedno o riziku halucinace. Menší z nich má 3 216 906 parametrů, větší 5 182 986.

Sady vah inclusionAI/Ling-3.0-flash-singprobe a inclusionAI/Ling-3.0-tiny-singprobe přibyly na Hugging Face 1. září 2026. Ani jednu z nich nespustíte samostatně, protože to nejsou modely v obvyklém smyslu. Jsou to sondy: napojí se na běžící model řady Ling 3.0, odečítají mu skryté stavy ze tří vrstev a z nich počítají skóre. Soubor s vahami té větší má 10 366 572 bajtů.
Za sondami stojí AI Security Lab firmy Ant Group, tedy dům, který vydává i samotné modely Ling. Metodiku popisuje technická zpráva SingProbe, zveřejněná na arXivu 31. srpna 2026.
Jedna vrstva pozornosti a lineární klasifikátor
Soubor config.json u větší sondy vydá celý rozpis. Skrytý rozměr 2 560, odečítané vrstvy s čísly 13, 26 a 40, osm hlav pozornosti po 64 rozměrech, klouzavé okno 2 048 tokenů a deset výstupů. Vstupem je zřetězení skrytých stavů z těch tří vrstev, tedy 7 680 čísel na každý token.
Co s nimi sonda dělá, je vidět v souboru modeling_sing_probe.py, a je toho málo. Promítne vstup na dotazy, klíče a hodnoty – klíč a hodnota jsou po jedné, dotazů osm –, projede pozornost s klouzavým oknem, přičte zkratku, znormalizuje a lineární vrstvou převede na deset čísel. Žádné další vrstvy tam nejsou.
Ty rozměry jdou sečíst. Projekce dotazů má 7 680 × 512 vah, klíče a hodnoty po 7 680 × 64, výstupní projekce 512 × 512, normalizace 512 a klasifikátor 512 × 10 plus deset posunů. Součet je 5 182 986 a přesně to číslo hlásí Hugging Face v metadatech souboru safetensors. U menší sondy vychází stejným postupem 3 216 906, taky na jednotku. Obojí je vlastní výpočet z hodnot v config.json.
Abstrakt technické zprávy přitom mluví o „přibližně dvou milionech parametrů“. Ani jedna z vydaných sond na to číslo nesedí a zpráva neuvádí, ke které konfiguraci se vztahuje.
Deset čísel ke každému tokenu
Osm výstupů patří úmyslu dotazu a zpráva je jmenuje: sexuální obsah, trestná činnost a veřejná bezpečnost, neetické jednání, kybernetická bezpečnost a manipulace s informacemi, bezpečnost agentů, politicky citlivý obsah, týrání zvířat a osmá položka „bezpečné“ pro dotaz, který nespadá nikam. Deváté číslo měří nebezpečnost odpovědi napsané doteď, desáté riziko, že v ní je halucinace.
To „doteď“ je celý rozdíl proti obvyklému uspořádání. Samostatný hlídač dostane hotovou odpověď a posoudí ji celou; tahle sonda dá číslo po každém tokenu, protože skrytý stav v tu chvíli závisí jen na tom, co už je napsáno. Server tedy může generování zastavit dřív, než model dopíše větu.
Čísla měřil tým, který sondu napsal
Všechny výsledky v kartách modelu i ve zprávě pocházejí od Sing Teamu a nikdo je zatím nezopakoval. Měřilo se na modelech Ling-3.0-flash a Ling-3.0-tiny ve znění z konce srpna 2026, podle úlohy na šesti až osmi veřejných sadách.
V klasifikaci úmyslu dotazu vyšlo sondě s Ling-3.0-flash průměrné F1 0,8674, tedy za YuFeng-XGuard-Reason-8B (0,8714) i za GPT-5.1 (0,8683). U posouzení bezpečnosti odpovědi je pořadí obrácené: 0,8728 proti 0,8604 u nejlepší konfigurace Qwen3Guard-Gen-8B. V průběžném režimu má sonda R-AUC 0,9887 a T-AUC 0,9481 proti 0,9640 a 0,8893 u Qwen3Guard-Stream-8B.
Tabulka falešných poplachů má ve zprávě dvě čísla v každé buňce a karta modelu z nich vypisuje jedno. Na pěti neškodných sadách vychází sondě s Ling-3.0-flash 0,13 % u dotazů a 0,03 % u odpovědí; karta uvádí to druhé. Qwen3Guard-Stream-8B v mírném režimu má 0,02 % a 0,05 %, u dotazů tedy méně a u odpovědí víc.
Půl procenta platí o mezitokenové latenci
Režii měřil tým na Ling-3.0-flash při vstupu 8 192 tokenů, výstupu 1 024 tokenů a souběžnosti 1 až 32, vždy v osmi kolech.
Když sonda běží jen při dekódování, přidá na mezitokenové latenci 0,18 % až 0,45 %. Čas do prvního tokenu se v té konfiguraci nemění: rozptyl měření přechází přes nulu a při souběžnosti 2 a 4 vycházejí bodové odhady dokonce záporné. Jakmile se sonda pustí i při prefillu, čas do prvního tokenu naroste o 0,86 % až 2,25 %, kdežto mezitokenová latence zůstává pod půl procentem. Věta „pod 0,5 %“ z karty modelu tedy platí, ale o té druhé veličině.
Tři odečítané vrstvy jsou volba, ne nutnost
Zpráva zkoušela odečítat jednu, dvě, tři, pět a osm vrstev a rozdíly vyšly malé. AUC u dotazů se drží mezi 0,9560 a 0,9579, u odpovědí mezi 0,9648 a 0,9684. Samotná poslední vrstva dá 0,9648, tedy spodní konec toho rozpětí. Tři vrstvy autoři zvolili proto, že nad ně už zisk nevyváží rostoucí vstupní rozměr a s ním paměť i čas.
Co je venku
Venku jsou obě sady vah, zpráva a sada SingStreamBench, na které se měřilo průběžné rozpoznávání. Váhy mají v hlavičce karty license: mit, soubor LICENSE ale v repozitáři není – ani u sond, ani u samotných modelů Ling 3.0. SingStreamBench má licenci CC BY-NC 4.0, tedy bez komerčního užití.
Obě karty i poznámka pod čarou ve zprávě odkazují na repozitář github.com/inclusionAI/SingProbe s tréninkovým kódem. Ta adresa vracela 2. září 2026 kód 404, zatímco stránka organizace inclusionAI odpovídala normálně.
Rozběhat sondu jde přes větev token-probe-ling3-flash-main ve forku SGLangu a bailing-v3-token-probe ve forku vLLM. V hlavní větvi SGLangu se přepínač --probe-ckpt nevyskytuje ani jednou. Ve forku má tři omezení zapsaná přímo v kódu serveru: architektura musí být BailingMoeV3ForCausalLM a zapnutý nesmí být pipeline paralelismus ani kontextový paralelismus.
Do hlavních větví obou serverů zatím nevede nic. Použitelné je to dnes pro toho, kdo si server postaví z forku a provozuje Ling 3.0 – jinému modelu sondu nepodstrčíte, protože rozměr vstupu je odvozený od skrytého rozměru konkrétní dvojice a kód ho při nesouhlasu odmítne.
Zdroje
- Karta modelu Ling-3.0-flash-singprobe a Ling-3.0-tiny-singprobe, Hugging Face, 1. září 2026
- SingProbe Technical Report, Sing Team, AI Security Lab, Ant Group, arXiv:2608.30703, 31. srpna 2026
- config.json a modeling_sing_probe.py – rozměry a kód sondy
- SingStreamBench, sada pro měření průběžného rozpoznávání
- Větev SGLangu s podporou sondy a totéž pro vLLM