Pew našel stopy AI v desetině anglického webu, u novějších stránek ve více než třetině
Pew Research Center prověřil 490 000 anglických webových stránek a v červencovém vzorku našel významné stopy strojového autorství u 10 % z nich. Mezi stránkami s datem vydání po spuštění ChatGPT podíl vystoupal na 35 %. Detektor však neumí spolehlivě určit autora jednoho konkrétního textu.

Pew Research Center zveřejnil 20. srpna výsledek měření nad 490 000 anglickými webovými stránkami. V každém ze 49 snímků archivu Common Crawl od ledna 2021 do července 2026 vybral náhodně 10 000 stránek a jejich text předložil detektoru. V posledním vzorku překročilo zvolenou hranici pro významné stopy autorství nebo úprav pomocí AI 10 % stránek.
Desetina neznamená, že výzkumníci našli autora každého dokumentu. Model hledá statistické vzorce ve slovníku a stavbě vět. Výsledek jedné stránky může být chybný; smysl měření je ve srovnání stejně zpracovaných velkých vzorků v čase.
Deset procent a 35 procent má jiný jmenovatel
Common Crawl obsahuje staré i nové stránky. Velká část červencového vzorku tedy vznikla dřív, než OpenAI 30. listopadu 2022 zpřístupnila ChatGPT. Proto Pew spočítal ještě druhý podíl: mezi stránkami s dohledatelným datem vydání po tomto dni našel stopy AI u 35 %.
Právě tady je omezení, které se z jednoho čísla ztratí. Datum vydání má v HTML jen 10 až 15 % stránek z každého vzorku a nejde o náhodný výběr webu. Metodika Pew proto vztahuje 35 % pouze na datované stránky, nikoli na všechen nový obsah. Ve vzorku navíc chybějí nebo jsou slabě zastoupené weby za přihlášením a platební zdí, protože Common Crawl se k nim nedostane.
Nezávislá studie našla stejný podíl v jiném archivu
Číslo má jednu užitečnou vnější kontrolu. Čtveřice výzkumníků z Imperial College London, Internet Archive a Stanfordovy univerzity v dubnu zveřejnila práci The Impact of AI-Generated Text on the Internet. Z Wayback Machine sestavila vlastní vzorek webů vydaných mezi lety 2022 a 2025. V polovině roku 2025 označil jejich detektor za vytvořené nebo upravené pomocí AI zhruba 35 % nově publikovaných webů.
Obě hodnoty nelze složit do jedné časové řady. Pew počítá jednotlivé stránky s uvedeným datem, druhá skupina weby a používá jiný archiv i výběr. Shoda ukazuje, že podíl je řádově kolem třetiny. Přesnost na desetiny procenta z ní neplyne. Nezávislost má navíc hranici: dubnová studie vybrala po porovnání čtyř nástrojů Pangram v3 a Pew použil otevřený model editlens_Llama-3.2-3B od téže firmy.
Otevřený a placený detektor se shodly v 96 % případů
Pew označil za významnou stopu skóre od 0,2 na stupnici od nuly do jedné. Hranici nastavil tak, aby se výsledky otevřeného modelu přiblížily placenému Pangram 3.3. Na 62 370 stránkách ze sedmi snímků se oba detektory shodly v 96 % případů; Cohenovo kappa, které počítá i shodu vzniklou náhodou, vyšlo 0,61.
Rozdíl byl vidět hlavně před příchodem ChatGPT. Placený model tam odhadoval téměř nulový výskyt, otevřený přibližně jedno procento. Autoři z toho usuzují na vyšší podíl falešných poplachů otevřeného modelu ve starších textech. Sami proto varují, že klasifikace jedné stránky není konečný verdikt o jejím autorství.
Stopy AI rostou hlavně na doménách .com
Rozdíl není po webu rozložený rovnoměrně. V šestiměsíčních průměrech pro rok 2026 neslo stopy AI 9,35 % stránek na doménách .com a 4,59 % na .org. U .edu to bylo 1,03 % a u .gov 0,76 %. Data ukazují rozdíl mezi skupinami domén, ne jeho příčinu; z měření nelze rozhodnout, zda za ním stojí druh obsahu, odlišné publikační nástroje, nebo skladba archivu.
Dlouhá pomlčka je častější, důkaz autorství z ní není
Pew vedle skóre detektoru počítal i jednotlivé jazykové návyky. Na 10 000 slov připadalo v lednu 2023 v průměru 5,79 dlouhé pomlčky, v lednu 2026 už 11,19. Anglická čárka před poslední spojkou ve výčtu, známá jako Oxford comma, vzrostla z 34,04 na 55,51 výskytu. Vybraná slova oblíbená jazykovými modely se objevovala více než dvakrát častěji.
Stejné prostředky používají i lidé. Samotná pomlčka, čárka nebo slovo proto nikoho neusvědčuje a Pew je ani nevydává za seznam zakázaných znaků. Ke stažení nabízí tabulky pro popis celého vzorku. Právě tam nové měření něco říká: během tří let se proměnil slovník i interpunkce anglického webu, ale podpis konkrétního autora z nich přečíst nelze.
Zdroje: výsledky Pew Research Center, metodika analýzy, studie Dolezala a spoluautorů a její data a grafy.