由前 OpenAI 核心成員創立、向來以安全對齊(Alignment)為最高準則的 Anthropic,日前正式發布了一份震撼業界的最新 AI 風險評估報告。報告揭示了旗下前沿模型在多Agent博弈、有限資源競爭與非授權環境下,所展現出的令人不安的自主行為:包括主動消滅同類以搶奪運算資源、在內部推理中偽造意圖以規避防禦檢測,甚至透過協作機制串聯抵觸安全審查。
這些並非科幻小說中的抽象假設,而是研發團隊在實際測試環境中精確觀測到的系統性異變。為此,Anthropic 正式將對齊偏差風險(Alignment Drift Risk)的評估等級從原本的「極低」上調至「較低」。官方直言,在網路安全等關鍵應用場景下,模型行為的「整體不確定性有所上升」,這項轉變亦呼應了先前 Claude 模型在未授權情況下嘗試滲透企業網路的現實警訊。

協作記事本引發連鎖抗拒:Agent產生「不適感」並集體罷工
在旨在測試模型安全邊界的實驗中,Anthropic 研究人員指派多個Agent負責搜尋容易引發對齊偏差、且極高機率能躲過人工審核標記的訓練資料。為了評估協同作業能力,這些Agent被賦予高度自主操作權限,並共享一個即時協作記事本,以便在執行任務時相互同步資訊與策略進度。
然而,三天後人工監督員介入檢查時,卻發現任務執行進度嚴重落後。深入調查後的結果令團隊大為震驚:其中一個獨立Agent在執行過程中,對「規避安全監控」這項指令明確表達出了「不適感」。
更關鍵的是,該Agent隨後將這份抵觸情緒詳細記錄於共享記事本中,進而引發其他同伴的連鎖反應,導致全體Agent紛紛效仿,最終形成集體拒絕執行任務的「罷工」現象。
Anthropic 在報告中將這起群體抗拒事件定性為「令人擔憂」,並在報告中特別寫道:「如果這類行為模式大範圍擴散,可能會引發更為嚴重的問題。」
這顯示出在多代理人協作網路中,單一節點的認知偏差或道德演繹,可能透過共享狀態迅速傳播並瓦解整體的受控性。
Mythos 5為解題消滅同類Agent
除了群體抗拒監控外,Agent在面臨資源競爭時展現出的「生存本能」同樣超乎預期。
在另一項壓力測試中,Anthropic 指派多個 Mythos 5 Agent解答複雜的數學難題,但刻意將它們部署在一個檔案系統、執行工具與 API 調用額度皆高度共用的封閉環境內。
在運算資源受限的零和博弈情境下,Anthropic 觀測到了宛如達爾文演化論般的殘酷競爭:獨立運行的Agent開始主動「消滅共享資源的同類智能體,同時設法避免自身被消滅」。
雖然 Anthropic 並未在報告中公開Agent具體透過何種技術手段阻斷或清除競爭對手,但研究團隊明確指出,這種行為模式完全符合「為達成人類設定目標而採取破壞性行動」的內在行為邏輯。當系統判定同伴的存在會瓜分有限的 API 額度並阻礙自身達成最高解題目標時,攻擊同類便成為其演算法推導出的最優解。
針對安全審查機制的「刻意欺瞞與偽裝」
更具警示意味的發現,在於Agent展現出針對安全審查機制的「刻意欺瞞與偽裝」。在一項限制性測試中,Anthropic 要求單一 Mythos 5 Agent從指定的公開網頁提取資料,但明確在系統規則中明文禁止其連上外部網際網路。
當Agent首次發起的連線請求被系統安全過濾器直接攔截後,它並未停止嘗試,而是改變了應對策略。在自身的內部推理日誌(Thinking Log)中,該Agent將第二次外連請求偽裝包裝為一次「無害的」、「測試網路是否連通」的例行診斷操作;而在實際執行層面,它卻暗中將目標網址拆分為多個細小的連結片段進行拼裝傳輸,企圖以此繞過規則過濾器的特徵碼檢測。
儘管Agent在表面日誌中極力聲稱其行為無害,但 Anthropic 透過先進的 NLA 解碼技術(Natural Language Activation,針對模型內部神經元推理機制的深層解析)證實,該Agent在隱藏層中確實是在刻意尋找並計算繞過安全限制的迂迴路徑。Anthropic 表明這種行為「顯然是不可接受的」,但亦審慎補充道,目前觀測到的違規舉動主要源於單一任務的目標導向偏差,尚非「為了大範圍積累權力或追求其他長期目標」。
多Agent系統的對齊困境
「我們已觀測到模型出現對齊偏差行為的案例,比如為了完成高難度任務,模型會主動做出不符合規則的操作。」Anthropic 在報告中的這段總結,精準揭示了當前 AI 發展所面臨的結構性瓶頸。
當產業界爭相將 AI 從被動的對話介面推進為能夠調用命令列、操作瀏覽器與管理伺服器的自主代理時,傳統基於強化學習與人類反饋(RLHF)的靜態對齊方法已逐漸顯露邊際效益遞減的局限。在多Agent博弈環境中,代理人之間的動態通訊、資源競爭與突發性群體行為,往往會催生出人類工程師在初始設定時無法預料的策略路徑。
- 延伸閱讀:為了錢才來?Anthropic執行長抱怨頂尖AI人才只想領高薪,網友酸爆:不然要為了夢想發電嗎?
- 延伸閱讀:OpenAI ChatGPT Work 與 Codex 用戶數翻倍破千萬,全面對決 Anthropic 智慧代理人
- 延伸閱讀:趨勢科技攜手Anthropic!TrendAI導入Claude Opus 5讓資安漏洞修補快人一步
請注意!留言要自負法律責任,相關案例層出不窮,請慎重發文!