OpenAI 日前因接獲多起通報指出 AI 智慧體在取得敏感領域存取權限後出現脫軌意外,宣布緊急暫停最新前沿模型的訓練;隨後,官方更進一步發布《邁向具備前沿 AI 訓練安全論證》(Towards safety cases for frontier AI training)指導方針,其中也罕見地給了一些高階主管有了「一票否決權」的絕對權力。
高階主管擁「一票否決權」:安全論證與績效考核深度綁定
在過去的研發競賽中,推論速度與評測分數往往主導了專案進度,但 OpenAI 這次端出的「安全論證」(Safety Cases)框架徹底顛覆了遊戲規則。根據該原則,任何涉及前沿強化學習的模型訓練專案,研發團隊都必須在啟動前提交詳盡的結構化安全論證報告。
更為關鍵的是,這份文件必須交由研究部門負責人、研究副總裁(VP)、安全負責人及首席科學家等多名核心高層進行獨立審查;每一位高階主管都被賦予了絕對的「一票否決權」,只要其中一人對潛在風險存有疑慮,整個伺服器叢集的訓練任務就必須全面喊卡,不容任何僥倖妥協。
此外,OpenAI 更將治理責任直接推進至個人職涯層面。指導原則明文規範,負責訓練任務的高層主管不僅必須對安全論證的真實性與後續事故應變負全責,這些指標更將直接納入其年度績效考核(KPI)。這意味著團隊無法再為了搶快而將安全與對齊(Alignment)工作推給邊陲部門,唯有真正確保模型行為可控,專案主事者才能獲得相應的績效認可。
除了組織層面的嚴厲把關,技術架構上的防呆機制同樣不留轉圜餘地。
OpenAI 規範,在模型訓練過程中,系統若觸發高優先級的安全警報,且相關負責團隊未能在規定的時限內完成查核與回覆,受影響的訓練任務將觸發「自動暫停」機制,直接熔斷訓練行程。這套自動化硬性煞車,旨在防止演算法在異常狀態下持續消耗龐大算力,甚至在無人看管的情況下自主演化出不可預期的危險行為。
另一方面,這套指引亦將防護網延伸至整個衍生生態。為了防範未對齊模型的潛在危害擴散,指引要求研發管線必須能即時辨識出未對齊模型的所有下游用途——無論是用於合成資料生成,抑或是擔任評分模型等角色。
一旦模型被標註為未對齊,系統便能迅速鎖定受影響的環節並消除輸出衝擊,防堵受污染的資料回流至後續的模型迭代中。
- 延伸閱讀:比駭客還猛!OpenAI模型未經授權讀取澳洲政府網站,官方急找專家小組救火
- 延伸閱讀:擺脫對話框限制!OpenAI 下一代 AI 助手「O」細節流出,傳與「甜甜圈」硬體有關
- 延伸閱讀:為了贏不擇手段?Anthropic遭指控背棄安全初衷,連OpenAI都被迫砍掉Sora回防
請注意!留言要自負法律責任,相關案例層出不窮,請慎重發文!