Přeskočit na obsah
Modely 4 min čtení

Hlídač bezpečnosti k modelům Ling 3.0 stojí na jediné vrstvě pozornosti

Ant Group vydal 1. září 2026 dvě sady vah pod jménem SingProbe. Nejsou to samostatné modely: napojí se na běžící Ling 3.0, odečtou mu skryté stavy ze tří vrstev a ke každému vygenerovanému tokenu vrátí deset skóre – osm o úmyslu dotazu, jedno o nebezpečnosti odpovědi a jedno o riziku halucinace. Menší z nich má 3 216 906 parametrů, větší 5 182 986.

Vicekanalova logicka sonda a pulzni generator na pracovnim stole
Vícekanálová logická sonda a pulzní generátor. Foto: Dilshan Jayakody, Wikimedia Commons (CC BY-SA 2.0)

Sady vah inclusionAI/Ling-3.0-flash-singprobeinclusionAI/Ling-3.0-tiny-singprobe přibyly na Hugging Face 1. září 2026. Ani jednu z nich nespustíte samostatně, protože to nejsou modely v obvyklém smyslu. Jsou to sondy: napojí se na běžící model řady Ling 3.0, odečítají mu skryté stavy ze tří vrstev a z nich počítají skóre. Soubor s vahami té větší má 10 366 572 bajtů.

Za sondami stojí AI Security Lab firmy Ant Group, tedy dům, který vydává i samotné modely Ling. Metodiku popisuje technická zpráva SingProbe, zveřejněná na arXivu 31. srpna 2026.

Jedna vrstva pozornosti a lineární klasifikátor

Soubor config.json u větší sondy vydá celý rozpis. Skrytý rozměr 2 560, odečítané vrstvy s čísly 13, 26 a 40, osm hlav pozornosti po 64 rozměrech, klouzavé okno 2 048 tokenů a deset výstupů. Vstupem je zřetězení skrytých stavů z těch tří vrstev, tedy 7 680 čísel na každý token.

Co s nimi sonda dělá, je vidět v souboru modeling_sing_probe.py, a je toho málo. Promítne vstup na dotazy, klíče a hodnoty – klíč a hodnota jsou po jedné, dotazů osm –, projede pozornost s klouzavým oknem, přičte zkratku, znormalizuje a lineární vrstvou převede na deset čísel. Žádné další vrstvy tam nejsou.

Ty rozměry jdou sečíst. Projekce dotazů má 7 680 × 512 vah, klíče a hodnoty po 7 680 × 64, výstupní projekce 512 × 512, normalizace 512 a klasifikátor 512 × 10 plus deset posunů. Součet je 5 182 986 a přesně to číslo hlásí Hugging Face v metadatech souboru safetensors. U menší sondy vychází stejným postupem 3 216 906, taky na jednotku. Obojí je vlastní výpočet z hodnot v config.json.

Abstrakt technické zprávy přitom mluví o „přibližně dvou milionech parametrů“. Ani jedna z vydaných sond na to číslo nesedí a zpráva neuvádí, ke které konfiguraci se vztahuje.

Deset čísel ke každému tokenu

Osm výstupů patří úmyslu dotazu a zpráva je jmenuje: sexuální obsah, trestná činnost a veřejná bezpečnost, neetické jednání, kybernetická bezpečnost a manipulace s informacemi, bezpečnost agentů, politicky citlivý obsah, týrání zvířat a osmá položka „bezpečné“ pro dotaz, který nespadá nikam. Deváté číslo měří nebezpečnost odpovědi napsané doteď, desáté riziko, že v ní je halucinace.

To „doteď“ je celý rozdíl proti obvyklému uspořádání. Samostatný hlídač dostane hotovou odpověď a posoudí ji celou; tahle sonda dá číslo po každém tokenu, protože skrytý stav v tu chvíli závisí jen na tom, co už je napsáno. Server tedy může generování zastavit dřív, než model dopíše větu.

Čísla měřil tým, který sondu napsal

Všechny výsledky v kartách modelu i ve zprávě pocházejí od Sing Teamu a nikdo je zatím nezopakoval. Měřilo se na modelech Ling-3.0-flashLing-3.0-tiny ve znění z konce srpna 2026, podle úlohy na šesti až osmi veřejných sadách.

V klasifikaci úmyslu dotazu vyšlo sondě s Ling-3.0-flash průměrné F1 0,8674, tedy za YuFeng-XGuard-Reason-8B (0,8714) i za GPT-5.1 (0,8683). U posouzení bezpečnosti odpovědi je pořadí obrácené: 0,8728 proti 0,8604 u nejlepší konfigurace Qwen3Guard-Gen-8B. V průběžném režimu má sonda R-AUC 0,9887 a T-AUC 0,9481 proti 0,9640 a 0,8893 u Qwen3Guard-Stream-8B.

Tabulka falešných poplachů má ve zprávě dvě čísla v každé buňce a karta modelu z nich vypisuje jedno. Na pěti neškodných sadách vychází sondě s Ling-3.0-flash 0,13 % u dotazů a 0,03 % u odpovědí; karta uvádí to druhé. Qwen3Guard-Stream-8B v mírném režimu má 0,02 % a 0,05 %, u dotazů tedy méně a u odpovědí víc.

Půl procenta platí o mezitokenové latenci

Režii měřil tým na Ling-3.0-flash při vstupu 8 192 tokenů, výstupu 1 024 tokenů a souběžnosti 1 až 32, vždy v osmi kolech.

Když sonda běží jen při dekódování, přidá na mezitokenové latenci 0,18 % až 0,45 %. Čas do prvního tokenu se v té konfiguraci nemění: rozptyl měření přechází přes nulu a při souběžnosti 2 a 4 vycházejí bodové odhady dokonce záporné. Jakmile se sonda pustí i při prefillu, čas do prvního tokenu naroste o 0,86 % až 2,25 %, kdežto mezitokenová latence zůstává pod půl procentem. Věta „pod 0,5 %“ z karty modelu tedy platí, ale o té druhé veličině.

Tři odečítané vrstvy jsou volba, ne nutnost

Zpráva zkoušela odečítat jednu, dvě, tři, pět a osm vrstev a rozdíly vyšly malé. AUC u dotazů se drží mezi 0,9560 a 0,9579, u odpovědí mezi 0,9648 a 0,9684. Samotná poslední vrstva dá 0,9648, tedy spodní konec toho rozpětí. Tři vrstvy autoři zvolili proto, že nad ně už zisk nevyváží rostoucí vstupní rozměr a s ním paměť i čas.

Co je venku

Venku jsou obě sady vah, zpráva a sada SingStreamBench, na které se měřilo průběžné rozpoznávání. Váhy mají v hlavičce karty license: mit, soubor LICENSE ale v repozitáři není – ani u sond, ani u samotných modelů Ling 3.0. SingStreamBench má licenci CC BY-NC 4.0, tedy bez komerčního užití.

Obě karty i poznámka pod čarou ve zprávě odkazují na repozitář github.com/inclusionAI/SingProbe s tréninkovým kódem. Ta adresa vracela 2. září 2026 kód 404, zatímco stránka organizace inclusionAI odpovídala normálně.

Rozběhat sondu jde přes větev token-probe-ling3-flash-main ve forku SGLangu a bailing-v3-token-probe ve forku vLLM. V hlavní větvi SGLangu se přepínač --probe-ckpt nevyskytuje ani jednou. Ve forku má tři omezení zapsaná přímo v kódu serveru: architektura musí být BailingMoeV3ForCausalLM a zapnutý nesmí být pipeline paralelismus ani kontextový paralelismus.

Do hlavních větví obou serverů zatím nevede nic. Použitelné je to dnes pro toho, kdo si server postaví z forku a provozuje Ling 3.0 – jinému modelu sondu nepodstrčíte, protože rozměr vstupu je odvozený od skrytého rozměru konkrétní dvojice a kód ho při nesouhlasu odmítne.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Destilovaný videomodel FastH3 nese strojově čitelný doklad o svém vzniku

    FastVideo zveřejnil čtyřkrokovou destilaci videomodelu MiniMax H3 a přiložil k ní soubor provenance.json: revizi základních vah, číslo kroku trénování, otisky sha256 i…

  2. Modely

    Smíšená kvantizace zmenšila váhy Qwen3.8-27B na 8,4 gigabajtu

    DASLab při IST Austria zveřejnila tři kvantizace modelu Qwen3.8-27B. Každému velkému tenzoru přidělují přesnost zvlášť, takže nejmenší jazykové váhy zabírají 8,4 GB…

  3. Modely

    Na vlastním testu Pipecatu vyskočil doladěný Nemotron 3 Nano z 28,6 na 72,3 procenta

    Tým Pipecat vydal PhoneLLM Alpha 1, plné doladění modelu NVIDIA Nemotron 3 Nano 30B-A3B na telefonní hovory. Na vlastním žebříčku PhoneBench mu skóre stouplo z 28,6 na…

  4. Modely

    GLM-5.3-Flash si drží KV cache jen v jedenácti ze 45 vrstev

    Váhy modelu GLM-5.3-Flash jsou na Hugging Face pod licencí MIT: 321,3 miliardy parametrů v 62 souborech, dohromady 328,3 GB. Slovo „Flash“ se týká ceny provozu, ne…