首頁LBank 新聞中心
Pew發現:ChatGPT時代後的網路內容有三分之一由AI撰寫
chatgpt-web-ai-written-pew
Pew發現:ChatGPT時代後的網路內容有三分之一由AI撰寫
皮尤研究院使用 AI 偵測器掃描了近 50 萬個網頁,發現這些痕跡主要集中在 .com 網域上,且正迅速增加。
2026-08-22 來源:decrypt.co

簡述

  • 皮尤研究中心分析了Common Crawl網路檔案庫中約49萬個英文網頁;2026年7月的快照中,有10%的網頁顯示出明顯的AI撰寫跡象。
  • 若僅限於ChatGPT於2022年11月推出後發布的網頁,此數字飆升至35%。
  • .com網域顯示AI撰寫跡象的比例約為.edu或.gov網域的10倍,後者約為1%,且約為.org網域(4.6%)的兩倍。

AI撰寫的內容無處不在,字面意義上的無處不在。

根據皮尤研究中心週四發布的一項研究,每10個英文網頁中就有一個顯示出明顯的AI撰寫跡象。如果將樣本範圍縮小到僅限於自2022年11月ChatGPT推出以來發布的網頁,該比例躍升至35%。

無數:OpenAI何時會發布GPT-6?點擊進行預測。

這些發現來自研究人員從Common Crawl網路檔案庫中提取了大約49萬個網頁,時間跨度從2021年1月到2026年7月,然後將這些文本透過Open Pangram這個AI偵測模型進行分析。

AI指紋的分佈並不均勻。.com網域顯示AI撰寫跡象的比例約為.edu或.gov網域的10倍,後者均接近1%,且約為.org網站(4.6%)的兩倍。

在2021年,這四種網域類型看起來幾乎相同。

皮尤如何發現機器撰寫的內容

該偵測器並非標記任何單一詞彙或片語,而是透過大量文本中的統計模式進行權衡。不過,自2023年以來,一些個別的標誌性特徵變得顯著更為普遍:常見的破折號(我們自己也很喜歡使用)現在出現的頻率大約是過去的兩倍,牛津逗號增加了63%,而AI偏愛的詞彙如「delve」(深入探討)、「interplay」(相互作用)和「testament」(證明)的出現頻率增加了一倍多。

「負面平行句」——例如「it's not just X, it's Y」(不只是X,更是Y)——自2023年以來增加了近三倍,儘管皮尤指出其整體而言仍然較為罕見。Decrypt先前也曾追蹤過這些相同的跡象,而韋氏詞典已於12月正式將「slop」(劣質內容)命名為其年度詞彙。

皮尤謹慎地指出這些限制:偵測模型可能在兩種情況下誤判個別網頁,「明顯的AI撰寫跡象」不代表該網頁完全由機器撰寫——其中許多文本可能只是AI輔助,而非完全由AI生成。

Open Pangram來自Pangram Labs,其偵測器也在今年的其他研究中發現,約9%的美國報紙文章(包括《紐約時報》等媒體的評論版)中存在AI生成的文本。

話雖如此,AI偵測未來可能會變得更容易,不是因為模式,而是因為底層技術。大型AI公司如Anthropic已經在開發模型層級的文本指紋技術,這將使AI文本更容易識別,同時最大限度地減少錯誤。

網域差距追蹤了發布者及其原因。學術和政府網站需要經過編輯審核、機構批准和較慢的發布週期;而.com網域則包羅萬象,從新聞編輯室到聯盟行銷內容農場,以人類編輯無法承受的速度大量產出網頁。

總體而言,趨勢線無論如何都相當陡峭:.com網域的AI撰寫率在五年內,從2021年1月的約1%攀升至2026年1月的9.35%。