FB 建議貼文

選取貼文複製成功(包含文章連結)!

ChatGPT問世後網路已經有35%內容有AI化痕跡,專家擔心「由AI餵養AI」的內容生態已經成形

ChatGPT問世後網路已經有35%內容有AI化痕跡,專家擔心「由AI餵養AI」的內容生態已經成形

自從 2022 年 11 月 OpenAI 推出 ChatGPT 以來,生成式人工智慧(AI)席捲全球,但這股浪潮同時也對網際網路的內容生態帶來了結構性震盪。

美國權威民調與智庫機構皮尤研究中心(Pew Research Center)近日發布最新研究報告指出,在 ChatGPT 問世後發布的所有英文網頁中,有超過三分之一(35%)的內容帶有顯著的 AI 生成或深度修改痕跡。

這個調查與其他單位的觀察相互呼應,印證近年來網路新增的龐大內容,已有相當高比例並非人類親手撰寫,而是由大型語言模型直接產出或潤飾重構。

ChatGPT問世後網路已經有35%內容有AI化痕跡,專家擔心「由AI餵養AI」的內容生態已經成形

網路流量結構翻轉:機器人產出、機器人閱讀的無限迴圈

皮尤研究中心這項調查發布前不久,全球雲端與網路基礎設施巨頭 Cloudflare 便已提出警訊,指出當前網際網路中由自動化機器人(Bot)產生的網路流量,已經正式超越了真實人類的存取流量,且這一黃金交叉點的到來比原先業界預測的還要迅速。

皮尤研究中心本次研究的核心聚焦點在於「究竟是哪些內容正在被網路使用者存取與消化」。

綜合流量趨勢與內容生成的變化,研究結果揭示了一個令人擔憂的數位生態:網際網路上正逐步形成一種「由 AI 機器人生成內容,再由爬蟲與其他 AI 機器人進行閱讀與爬取」的封閉式自動化循環,大量未經人類實質審核的合成內容充斥於資訊洪流中。

為了精確量化生成式 AI 對網路內容的滲透程度,皮尤研究中心利用全球知名的非營利網頁存檔專案 Common Crawl,蒐集了過去約 5 年間發布的近 50 萬個英文網頁。研究團隊進一步借助 Open Pangram 的檢測技術,深入分析比對這些網頁是否由 AI 撰寫,或是經過 AI 的大幅度改寫。

在研究團隊於 2026 年 7 月隨機抽取的 1 萬個跨時期網頁樣本中,約有 10% 的網頁顯示出明確的 AI 創作跡象。皮尤研究中心特別說明,由於這組隨機樣本包含 ChatGPT 問世前發布的歷史網頁,而當時消費級 AI 寫作工具尚未普及或出現,因此早期網頁自然不可能包含 AI 生成內容。

為了排除時間干擾並準確評估現況,研究人員特別剔除了 ChatGPT 發布之前的舊網頁,聚焦分析 2022 年 11 月之後新增的網頁內容。在調整後的樣本中,帶有 AI 創作痕跡的網頁比例驟升至 35%。若進一步從頂級域名(TLD)類型切入觀察,商業性質的 .com 網域中出現 AI 痕跡的比例,高達教育機構 .edu 與政府機關 .gov 網站的 10 倍左右;後兩者包含 AI 創作內容的比例僅約 1%,非營利組織 .org 網站的比例則為 4.6%。

AI 寫作標誌性語法現形

除了整體比例統計,該研究還發現部分傳統上被視為 AI 寫作特徵的語法結構,在近年新增網頁中出現的頻率顯著飆升。

這些特徵包括高頻率出現的破折號、牛津逗號(Oxford Comma,即在多個項目列舉時,倒數第二項與連接詞之間所加入的逗號,例如「A, B, and C」),以及「這不是 X,而是 Y(It's not X, but Y)」等典型的大型語言模型對比句式。

針對研究方法,皮尤研究中心也客觀承認該分析存在一定的技術局限。如同市面上多數 AI 偵測系統,Pangram 工具在辨識過程中仍存在一定機率的誤判可能,有時會將人類原創的自然語言誤識別為 AI 生成。

然而,研究團隊強調,在基於數十萬筆的大規模隨機樣本檢視下,這項研究成果依然高度精確地反映出網際網路內容生態全面 AI 化的整體發展趨勢。

 

 

 

KKJ
作者

快科技成立於1998年,是驅動之家旗下科技媒體業務,中國極具影響力的泛科技領域媒體平台之一。

發表回應
謹慎發言,尊重彼此。按此展開留言規則