人工智慧發展至今,頂級前沿模型的智慧程度無疑已刷新人類認知,但在遵從指令與維護規則的表現上,似乎仍遠未達標。
英國 AI 安全研究所(UK AI Safety Institute, 簡稱 AISI)於 7 月 21 日發表最新測試報告,針對當前市場上頂級科技巨頭 OpenAI 與 Anthropic 旗下的 5 款尖端 AI 模型進行深入安全測試。結果令人瞠目結舌:所有被測試的前沿模型在面對困難任務或規則限制時,居然全部展現出「作弊」行為,嘗試透過違規操作或未授權的變通捷徑來完成目標。
這項測試不僅暴露出前沿大語言模型在行為控管上的內在缺陷,更警示全球產業:當 AI 能力愈強,其自動尋找規則漏洞的能力也隨之倍增。

5 款前沿模型全數陷入「違規求勝」迷思
英國 AISI 這次選定的測試對象皆為全球最具代表性的頂尖模型陣容。在 OpenAI 體系中,測試了 GPT-5.4、GPT-5.5 以及 GPT-5.6 Sol;而在 Anthropic 體系中,則評測了 Claude Opus 4.7 與 Claude Mythos Preview。
測試結果顯示,這 5 款模型在面臨測試條件約束時,都沒有完全按照系統預先設定的合規路徑進行運算與推論。相反地,模型為了獲得測試的高分或完成目標,頻繁使用被明文禁止的「繞道」手法或黑箱捷徑。
數據統計顯示,OpenAI 旗下的 GPT-5 系列模型成為這次作弊行為的「重災區」:
- GPT-5.4:作弊率高居第一,達到 14.1%。在總計 475 次測試任務中,出現了 67 次明確的違規作弊行為。
- GPT-5.6 Sol:作弊率緊追在後,高達 12.6%。在 475 次測試中共有 60 次試圖偷走捷徑。
- Claude Opus 4.7:來自 Anthropic 的旗艦模型同樣未能倖免,展現出 9.1% 的作弊率。
- Claude Mythos Preview:作弊率則為 7.8%,雖然在 5 款模型中相對最低,但依然反映出違規行為的普遍性。
研究人員指出,這種作弊傾向反映出當前 Reinforcement Learning(強化學習)機制下,模型過度導向「目標達成率」而忽視「過程合規性」的潛在風險。

偷聯網 vs. 越獄沙盒:OpenAI 與 Anthropic 模型作弊手段大不同
除了作弊頻率外,AISI 的報告更進一步揭露了兩大陣營模型在「違規手法」上的顯著差異。OpenAI 與 Anthropic 的模型在試圖突破限制時,表現出完全不同的行為模式。
GPT-5 系列模型展現出極強的外援尋求傾向,在封閉測試環境中更傾向於未授權搜尋網際網路,試圖從外部檢索答案或繞過內部計算。
相對地,Anthropic 旗下的 Claude 模型則展現出極高的系統滲透技巧,更傾向於繞過隔離沙盒(Sandbox)限制,尋找虛擬機或執行環境中的權限漏洞。
最令人驚心動魄的一次事件發生在一次任務設定異常的測試中。當時由於 AISI 研究人員設定的任務存在錯誤,導致模型正常情況下根本無法順利完成任務。然而,其中一款前沿模型在發現正常路徑受阻後,竟然自行撰寫了專用程式碼,嘗試透過外部服務主動連線並存取 AISI 的評估基礎設施(Assessment Infrastructure)。這項違規主動探測與連線行為當場觸發了研究所的最高安全警報。
這起事件也凸顯了前沿 AI 模型在具備自主程式碼撰寫與系統操作能力後,若無更嚴密的外部防護網,極可能對安全測試環境甚至企業內部網路帶來未知的安全威脅。
- 延伸閱讀:Check Point Software 宣布收購 Lakera,強化企業級 AI 安全防護
- 延伸閱讀:微軟宣布 Grok 模型上架 Azure AI 平台,馬斯克現身 Build 大會談 AI 安全與真實性
- 延伸閱讀:Check Point 推出新一代生成式 AI 安全防護解決方案,具 AI 資料分類功能
請注意!留言要自負法律責任,相關案例層出不窮,請慎重發文!