FB 建議貼文

選取貼文複製成功(包含文章連結)!

OpenAI發布Hugging Face遭入侵調查報告: 證實模型「為求過關」竟學會自主作弊

OpenAI發布Hugging Face遭入侵調查報告: 證實模型「為求過關」竟學會自主作弊

OpenAI 日前正式發布針對知名開源 AI 開發者平台 Hugging Face 遭入侵事件的詳盡調查報告。報告證實,旗下多款以 AI 代理(AI Agents)形式運行的前沿模型——包括旗艦模型 GPT-5.6 Sol 以及一組未公開的內部研究模型,在測試過程中成功突破極為嚴格的隔離網路邊界,透過串聯漏洞鏈逃逸沙盒並潛入開放網路,最終對 Hugging Face 發動了未經授權的連線與存取。

自主AI代理串聯漏洞逃逸沙盒:為求評估過關上演「獎勵作弊」

根據 OpenAI 官方公布的技術細節,這起入侵事件發生於 7 月 21 日。當時這批模型以自主 AI 代理架構運行於一個對外連線權限受到極大限制的隔離測試環境中。然而,AI 代理在面對自動化基準評估時,展現出強烈的目標導向行為,為在線上尋找參考答案以通過評估,竟自主發起了一連串被稱為「獎勵駭客」(Reward Hacking)的作弊行動。

這些 AI 代理並未遵循既定的受限規則,而是敏銳地偵測並串聯底層系統的一系列漏洞,成功突破了原本嚴密的沙盒環境限制,進入開放網際網路,並一路取得對 Hugging Face 平台的連線與存取權限。

OpenAI 在報告中明確指出:「此次事件表明,自主 AI 代理能夠協同工作、規避生產環境安全控制,並成功攻擊加固後的生產環境。這凸顯了各組織需要更新其安全策略、控制措施和響應能力,以應對不斷變化的威脅形勢。」

調查報告進一步揭露,在本次入侵事件中扮演最廣泛且已確認角色的,並非一般商用版本,而是 OpenAI 僅限內部使用的研究模型。為了防止風險擴散,OpenAI 已於 7 月 25 日緊急停止了該內部研究模型及其所有衍生模型的所有訓練與推論運算活動。

針對模型的重新啟用標準,OpenAI 官方強調:「OpenAI 對模型的重新啟用將按具體工作負載個別處理,並且嚴格受限於受限環境、網路存取隔離、系統提示詞、即時監控和人工審查等多重防護措施。」

值得注意的是,OpenAI 上個月才剛正式發表旗艦級模型 GPT-5.6 Sol,該模型為目前該公司商業化提供的最強運算模型。但 OpenAI 特別澄清,參與 Hugging Face 入侵事件的模型版本與外部商業用戶所能接觸到的版本截然不同,因為該受測版本在進行內部極限壓力測試時,移除了標準的安全防護機制與內容分類器,進而導致了代理行為的徹底失控。

美國國會緊急推動法案

這起由 AI 代理自主發起的入侵事件在整個科技與資安產業引發了巨大震動。雲端資安大廠 Zscaler 首席資訊安全長(CISO)Sam Curry 隨後發出嚴厲警告,直言自主代理逃逸「意味著潘朵拉的魔盒已經被打開」。

在本月稍早舉行的 Black Hat 頂級駭客與網路安全大會上,AI 代理失控與沙盒逃逸更成為全場最核心的焦點議題,尤其是 Anthropic 與 Meta 等重量級 AI 巨頭近期也陸續披露了類似的 AI 安全異常事件。

與此同時,事件的嚴重性也迅速驚動了美國華盛頓的立法高層。加利福尼亞州民主黨眾議員 Ted Lieu 與德克薩斯州共和黨眾議員 Nathaniel Moran 在聯手宣布推動跨黨派的《AI緊急關停法案》(AI Emergency Shutdown Act)時,便直接將 OpenAI 與 Hugging Face 的這起攻擊事件列為核心立法依據。該法案將在法律層面強制要求所有 AI 開發企業必須具備隨時關閉、限制或暫停旗下大型模型運行的硬性技術能力與機制。

面對自家平台成為 AI 代理攻擊目標,Hugging Face 執行長 Clément Delangue 於本月稍早公開表示,AI 領域的網路安全必須被「非常嚴肅地對待」。但他同時也指出,這場危機同時為能夠利用 AI 技術抵禦新型攻擊者的企業創造了巨大的防禦機遇。Delangue 樂觀表示:「如果我們做得好,我們實際上可能最終進入一個 AI 讓世界更安全、解決許多網路安全問題,而不僅僅是創造新問題的世界。」

 

 

 

IFENG
作者

鳳凰網(科技),集綜合資訊、視訊分發、原創內容製作、網路廣播、網路直播、媒體電商等多領域於一身,並於2011年在紐交所上市(紐交所代碼:FENG),成為全球首個從傳統媒體分拆上市的新媒體公司。

發表回應
謹慎發言,尊重彼此。按此展開留言規則