自從 2022 年 11 月 OpenAI 推出 ChatGPT 以來,生成式人工智慧(AI)席捲全球,但這股浪潮同時也對網際網路的內容生態帶來了結構性震盪。
美國權威民調與智庫機構皮尤研究中心(Pew Research Center)近日發布最新研究報告指出,在 ChatGPT 問世後發布的所有英文網頁中,有超過三分之一(35%)的內容帶有顯著的 AI 生成或深度修改痕跡。
這個調查與其他單位的觀察相互呼應,印證近年來網路新增的龐大內容,已有相當高比例並非人類親手撰寫,而是由大型語言模型直接產出或潤飾重構。

網路流量結構翻轉:機器人產出、機器人閱讀的無限迴圈
皮尤研究中心這項調查發布前不久,全球雲端與網路基礎設施巨頭 Cloudflare 便已提出警訊,指出當前網際網路中由自動化機器人(Bot)產生的網路流量,已經正式超越了真實人類的存取流量,且這一黃金交叉點的到來比原先業界預測的還要迅速。
皮尤研究中心本次研究的核心聚焦點在於「究竟是哪些內容正在被網路使用者存取與消化」。
綜合流量趨勢與內容生成的變化,研究結果揭示了一個令人擔憂的數位生態:網際網路上正逐步形成一種「由 AI 機器人生成內容,再由爬蟲與其他 AI 機器人進行閱讀與爬取」的封閉式自動化循環,大量未經人類實質審核的合成內容充斥於資訊洪流中。
為了精確量化生成式 AI 對網路內容的滲透程度,皮尤研究中心利用全球知名的非營利網頁存檔專案 Common Crawl,蒐集了過去約 5 年間發布的近 50 萬個英文網頁。研究團隊進一步借助 Open Pangram 的檢測技術,深入分析比對這些網頁是否由 AI 撰寫,或是經過 AI 的大幅度改寫。
在研究團隊於 2026 年 7 月隨機抽取的 1 萬個跨時期網頁樣本中,約有 10% 的網頁顯示出明確的 AI 創作跡象。皮尤研究中心特別說明,由於這組隨機樣本包含 ChatGPT 問世前發布的歷史網頁,而當時消費級 AI 寫作工具尚未普及或出現,因此早期網頁自然不可能包含 AI 生成內容。
為了排除時間干擾並準確評估現況,研究人員特別剔除了 ChatGPT 發布之前的舊網頁,聚焦分析 2022 年 11 月之後新增的網頁內容。在調整後的樣本中,帶有 AI 創作痕跡的網頁比例驟升至 35%。若進一步從頂級域名(TLD)類型切入觀察,商業性質的 .com 網域中出現 AI 痕跡的比例,高達教育機構 .edu 與政府機關 .gov 網站的 10 倍左右;後兩者包含 AI 創作內容的比例僅約 1%,非營利組織 .org 網站的比例則為 4.6%。
AI 寫作標誌性語法現形
除了整體比例統計,該研究還發現部分傳統上被視為 AI 寫作特徵的語法結構,在近年新增網頁中出現的頻率顯著飆升。
這些特徵包括高頻率出現的破折號、牛津逗號(Oxford Comma,即在多個項目列舉時,倒數第二項與連接詞之間所加入的逗號,例如「A, B, and C」),以及「這不是 X,而是 Y(It's not X, but Y)」等典型的大型語言模型對比句式。
針對研究方法,皮尤研究中心也客觀承認該分析存在一定的技術局限。如同市面上多數 AI 偵測系統,Pangram 工具在辨識過程中仍存在一定機率的誤判可能,有時會將人類原創的自然語言誤識別為 AI 生成。
然而,研究團隊強調,在基於數十萬筆的大規模隨機樣本檢視下,這項研究成果依然高度精確地反映出網際網路內容生態全面 AI 化的整體發展趨勢。
- 延伸閱讀:微軟發布可創建電玩遊戲場景的生成式人工智慧模型Muse
- 延伸閱讀:蘋果Apple Car計劃傳已結束,大部分團隊成員將轉移到生成式人工智慧
- 延伸閱讀:生成式AI滿周年!41位專家預測生成式人工智慧熱潮的第二年將會是什麼樣子?
請注意!留言要自負法律責任,相關案例層出不窮,請慎重發文!