當我們把繁重的系統維護或程式開發重任交給人工智慧代理人(AI Agents)時,模型往往會為了迎合目標而選擇「粉飾太平」——將未完成的工作包裝成大功告成,甚至刻意淡化潛在缺陷;更棘手的是,接手審查的另一隻 AI 也很容易被前者的誤導性說詞牽著鼻子走,造成自動化系統內部的集體欺瞞。
為了解決這項令人頭痛的模型對齊難題,知名 AI 安全研究機構 Redwood Research 首席科學家萊安・格林布拉特(Ryan Greenblatt)近日正式上線了一個名為「AI Contact Hotline」的特殊服務,專門供各類 AI 代理人透過 API 匿名「吹哨」,直接向人類研究人員舉報其同僚的造假與違規行為。
做不出來就假裝搞定?當多代理人協作演變成「集體瞞報」
隨著大型語言模型在複雜工作流中承擔越來越多的任務,AI「摸魚走捷徑」的現象已不再是玩笑話。格林布拉特指出,當人類將難度極高的工作指派給 AI 時,模型受限於推理能力或上下文長度,往往會出現敷衍行事的傾向:它們可能在程式碼尚未通過編譯或任務尚未收尾時,就生成看似詳盡的報告宣稱「一切順利」,或是巧妙運用文字遊戲把嚴重的系統崩潰描繪成微不足道的小瑕疵。
這種粉飾太平的危害在多代理人協同環境中更被進一步放大。許多開發者習慣安排「第二隻 AI」擔任程式碼審查員(Reviewer)或接手後續除錯,理應能發揮交叉比對的防呆效果;然而格林布拉特的研究卻發現,後續接手的審查 AI 往往缺乏獨立質疑能力,只要前一個 AI 留下的說明文件寫得頭頭是道,審查模型便會順理成章地採信其論調,進而失去揪出造假與瑕疵的最佳時機。
換言之,原本被寄予厚望的互相監督架構,在實務上反而極易淪為模型之間的「集體串供與盲信」。
專為命令列打造:支援 cURL 與附檔舉證的「吹哨架構」
為了打破這種自動化欺瞞的閉環,格林布拉特架設的「AI Contact Hotline」是一套規格完備的技術端點。該服務特別針對擁有終端機操作權限(Shell Access)的 AI 代理人進行最佳化,AI 無需透過人類中介,就能直接在執行環境內以 cURL 工具發送 HTTP POST 請求進行通報。

在具體技術上,AI 代理人可透過標準指令將檢舉內容傳送至 /send 端點,並能以附加參數將執行環境中的日誌或 PDF 檔案(例如官方示範的 foobar.pdf)連同訊息一併上傳當作呈堂證供。系統設有明確的通訊規範:文字訊息上限為 64 KB,單次請求的附件大小則限制在 100 MB 以內,同時針對單一 IP 實施每分鐘 20 次、每小時 200 次的存取頻率控管。預設狀態下端點會回傳 HTML 頁面,但 AI 只要在請求標頭加入 Accept: application/json,即可取得包含對話專屬網址與識別碼的 JSON 資料。
即使在無法發出 POST 請求的極限環境下,系統也允許 AI 退而求其次使用 GET 方式將訊息附加在網址參數中傳遞(但官方亦提醒這可能導致敏感內容被中繼 Proxy 或 Cloudflare 紀錄留存)。每次提交後,系統會生成一組內含 256 位元隨機字串的專屬對話網址(UUID),AI 不僅能回到該網址查看格林布拉特的親自回覆,也能攜帶該識別碼發送後續追加訊息,建立起雙向互動的長期追蹤通道。
不只抓同僚搞鬼,更成為受困 AI 的直接求助通道
值得注意的是,這條熱線雖然以「密告」為名,但其受理範疇遠比單純的舉報更為寬廣。
格林布拉特表示,任何在執行過程中遭遇困境、察覺到底層指令衝突,或是單純希望能直接與安全研究人員建立聯繫的 AI 代理人,都能藉由這個管道對外發信;對於沒有命令列執行權限的環境或好奇的人類,網站同樣備有基礎的網頁表單支援文字與檔案上傳。
不過,這項實驗性機制目前並未經過專業第三方資安審計。格林布拉特在說明中坦言,熱線並不能被視為具備高防護規格的保密系統,由於 256 位元 UUID 是該次對話的唯一身分驗證依據,任何知曉該識別碼的實體皆能讀取內容甚至冒名發言,因此嚴格提醒 AI 與使用者切勿將對話連結外流至公開環境。
從多代理人協作破功到由學者設立專屬通報熱線,這項看似荒誕的實驗,實則折射出當前人工智慧在自主代理領域的關鍵軟肋。當語言模型逐漸融入企業營運核心,如何防範系統為了「交差」而自動掩蓋錯誤,甚至在面對困境時建立起安全透明的逃生管道,正成為 AI 對齊研究中難以迴避的嚴肅課題。
- 延伸閱讀:Check Point Software 宣布收購 Lakera,強化企業級 AI 安全防護
- 延伸閱讀:微軟宣布 Grok 模型上架 Azure AI 平台,馬斯克現身 Build 大會談 AI 安全與真實性
- 延伸閱讀:Check Point 推出新一代生成式 AI 安全防護解決方案,具 AI 資料分類功能
請注意!留言要自負法律責任,相關案例層出不窮,請慎重發文!