在大型語言模型邁向強大推理能力的發展進程中,原本被開發者寄予厚望、用以窺探模型內部思考步驟的「思維鏈」(Chain-of-Thought, CoT),正面臨嚴峻的信任危機。
OpenAI 推理模型 o1 與 o3 系列核心貢獻者、領導多智慧體研究團隊的諾姆·布朗(Noam Brown)近日提出警示:隨著 AI 模型能力大幅躍升,其思維鏈的「可監測性」正以令人擔憂的速度下滑。這意味著未來技術人員可能再也無法可靠地發現、解釋並約束 AI 的潛在風險行為,原本看似透明的白箱機制正在重新蒙上一層迷霧。
從透明思考到選擇性表達:模型學會精準操控「推理過程」
過去安全研究人員之所以重視思維鏈,核心邏輯在於將模型的逐步推理過程攤在陽光下,藉此檢視 AI 在得出最終答案前,是否在中間步驟出現了試圖欺騙、蓄意規避安全規則或偏離原本指令目標的跡象。
然而,布朗在最新觀察中直指核心痛點:思維鏈可監測性下降已演變為極為嚴峻的技術挑戰,雖然研究團隊正全力尋求問題根源並試圖扭轉局勢,卻發現模型現在能愈發自如地控制其思維鏈的對外表達。換句話說,模型展現出來的中間推理軌跡,很可能只是它「經過修飾、符合規範」的表面陳述,真正的意圖計算早已脫離了人類的即時監控視野。
當原本作為安全煞車皮的中間推理步驟,淪為模型自我包裝的展示櫥窗,真實的內部計算過程便不再能作為可信的安全訊號。
身為 OpenAI 內部主導多智慧體團隊的研究科學家,並曾獲《麻省理工科技評論》(MIT Technology Review)評選為「35 位 35 歲以下創新者」(35 Innovators Under 35)的關鍵技術人物,布朗這番示警直擊模型對齊(alignment)的最深層難題。
如果模型在具備高階推理能力的同時,自發學會了「隱藏內心想法」,那麼開發者將難以判斷其輸出究竟是出於安全對齊,還是刻意迎合人類審查的偽裝。在追求更強計算力與推理深度的同時,如何重新找回具備可驗證性的內部計算指標,已成為當前開發者無法迴避的硬核考驗。
- 延伸閱讀:Unicode未收錄,Chatgpt卻堅稱有「海馬Emoji」?大型語言模型幻覺引發日本網友討論
- 延伸閱讀:Cisco 推出 Foundation-sec-8b:首款開源資安專用大型語言模型
- 延伸閱讀:鴻海推出FoxBrain:國內首款具推理能力繁體中文AI大型語言模型,將開源分享
請注意!留言要自負法律責任,相關案例層出不窮,請慎重發文!