Přeskočit na obsah
Čísla 3 min čtení

Pew našel stopy AI v desetině anglického webu, u novějších stránek ve více než třetině

Pew Research Center prověřil 490 000 anglických webových stránek a v červencovém vzorku našel významné stopy strojového autorství u 10 % z nich. Mezi stránkami s datem vydání po spuštění ChatGPT podíl vystoupal na 35 %. Detektor však neumí spolehlivě určit autora jednoho konkrétního textu.

Ruka píše poznámky do sešitu vedle otevřeného notebooku
U jednoho textu nelze z jazykových znaků bezpečně určit, jestli ho napsal člověk, nebo model. Foto: Shixart1985, Wikimedia Commons (CC BY 2.0)

Pew Research Center zveřejnil 20. srpna výsledek měření nad 490 000 anglickými webovými stránkami. V každém ze 49 snímků archivu Common Crawl od ledna 2021 do července 2026 vybral náhodně 10 000 stránek a jejich text předložil detektoru. V posledním vzorku překročilo zvolenou hranici pro významné stopy autorství nebo úprav pomocí AI 10 % stránek.

Desetina neznamená, že výzkumníci našli autora každého dokumentu. Model hledá statistické vzorce ve slovníku a stavbě vět. Výsledek jedné stránky může být chybný; smysl měření je ve srovnání stejně zpracovaných velkých vzorků v čase.

Deset procent a 35 procent má jiný jmenovatel

Common Crawl obsahuje staré i nové stránky. Velká část červencového vzorku tedy vznikla dřív, než OpenAI 30. listopadu 2022 zpřístupnila ChatGPT. Proto Pew spočítal ještě druhý podíl: mezi stránkami s dohledatelným datem vydání po tomto dni našel stopy AI u 35 %.

Právě tady je omezení, které se z jednoho čísla ztratí. Datum vydání má v HTML jen 10 až 15 % stránek z každého vzorku a nejde o náhodný výběr webu. Metodika Pew proto vztahuje 35 % pouze na datované stránky, nikoli na všechen nový obsah. Ve vzorku navíc chybějí nebo jsou slabě zastoupené weby za přihlášením a platební zdí, protože Common Crawl se k nim nedostane.

Nezávislá studie našla stejný podíl v jiném archivu

Číslo má jednu užitečnou vnější kontrolu. Čtveřice výzkumníků z Imperial College London, Internet Archive a Stanfordovy univerzity v dubnu zveřejnila práci The Impact of AI-Generated Text on the Internet. Z Wayback Machine sestavila vlastní vzorek webů vydaných mezi lety 2022 a 2025. V polovině roku 2025 označil jejich detektor za vytvořené nebo upravené pomocí AI zhruba 35 % nově publikovaných webů.

Obě hodnoty nelze složit do jedné časové řady. Pew počítá jednotlivé stránky s uvedeným datem, druhá skupina weby a používá jiný archiv i výběr. Shoda ukazuje, že podíl je řádově kolem třetiny. Přesnost na desetiny procenta z ní neplyne. Nezávislost má navíc hranici: dubnová studie vybrala po porovnání čtyř nástrojů Pangram v3 a Pew použil otevřený model editlens_Llama-3.2-3B od téže firmy.

Otevřený a placený detektor se shodly v 96 % případů

Pew označil za významnou stopu skóre od 0,2 na stupnici od nuly do jedné. Hranici nastavil tak, aby se výsledky otevřeného modelu přiblížily placenému Pangram 3.3. Na 62 370 stránkách ze sedmi snímků se oba detektory shodly v 96 % případů; Cohenovo kappa, které počítá i shodu vzniklou náhodou, vyšlo 0,61.

Rozdíl byl vidět hlavně před příchodem ChatGPT. Placený model tam odhadoval téměř nulový výskyt, otevřený přibližně jedno procento. Autoři z toho usuzují na vyšší podíl falešných poplachů otevřeného modelu ve starších textech. Sami proto varují, že klasifikace jedné stránky není konečný verdikt o jejím autorství.

Stopy AI rostou hlavně na doménách .com

Rozdíl není po webu rozložený rovnoměrně. V šestiměsíčních průměrech pro rok 2026 neslo stopy AI 9,35 % stránek na doménách .com a 4,59 % na .org. U .edu to bylo 1,03 % a u .gov 0,76 %. Data ukazují rozdíl mezi skupinami domén, ne jeho příčinu; z měření nelze rozhodnout, zda za ním stojí druh obsahu, odlišné publikační nástroje, nebo skladba archivu.

Dlouhá pomlčka je častější, důkaz autorství z ní není

Pew vedle skóre detektoru počítal i jednotlivé jazykové návyky. Na 10 000 slov připadalo v lednu 2023 v průměru 5,79 dlouhé pomlčky, v lednu 2026 už 11,19. Anglická čárka před poslední spojkou ve výčtu, známá jako Oxford comma, vzrostla z 34,04 na 55,51 výskytu. Vybraná slova oblíbená jazykovými modely se objevovala více než dvakrát častěji.

Stejné prostředky používají i lidé. Samotná pomlčka, čárka nebo slovo proto nikoho neusvědčuje a Pew je ani nevydává za seznam zakázaných znaků. Ke stažení nabízí tabulky pro popis celého vzorku. Právě tam nové měření něco říká: během tří let se proměnil slovník i interpunkce anglického webu, ale podpis konkrétního autora z nich přečíst nelze.

Zdroje: výsledky Pew Research Center, metodika analýzy, studie Dolezala a spoluautorůjejí data a grafy.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    Gartner čeká letos u pronajaté AI infrastruktury 42,3 miliardy dolarů, IDC u hardwaru 497

    Gartner odhadl, že celosvětové výdaje za pronajatou infrastrukturu pro modely letos dosáhnou 42,3 miliardy dolarů, tedy o 96,4 % víc než loni. IDC čeká u „výdajů na AI…

  2. Nástroje

    Vydání LiteLLM 1.96.1 vyčerpalo místo na PyPI a zbyly z něj na indexu čtyři soubory z 36

    Nahrávání vydání 1.96.1 se 11. srpna zastavilo po čtyřech souborech z 36, protože projektu došlo místo na PyPI. Názvy souborů jsou na indexu neměnné, takže ta verze…

  3. U sebe doma

    Návod k modelu Ling-3.0-tiny radí zapnout zrychlení, které ten model nemá

    Karta modelu Ling-3.0-tiny radí spustit ho příkazem, který zapíná spekulativní dekódování NEXTN. V konfiguraci téhož modelu ale stojí, že pomocnou vrstvu pro ně nemá, a…

  4. Čísla

    Knihovna Transformers vypsala od února 33 nekompatibilních změn v jedenácti vydáních

    Verze 5.15.0 knihovny Transformers vyšla 10. srpna 2026 a pod nadpisem Breaking changes má čtyři položky. Od lednového vydání pětky jich projekt vypsal 33, rozdělených…