FB 建議貼文

選取貼文複製成功(包含文章連結)!

OpenAI 最強旗艦 GPT-6 Astra 突襲發表!效能表現刷新紀錄,還能自主操作滑鼠鍵盤、修復系統

OpenAI 最強旗艦 GPT-6 Astra 突襲發表!效能表現刷新紀錄,還能自主操作滑鼠鍵盤、修復系統

OpenAI 正式發表備受矚目的下一代旗艦人工智慧模型「GPT-6 Astra」,並火速展開跨平台大規模生態部署。新模型即日起全面接入 ChatGPT、微軟(Microsoft)Microsoft 365 辦公套件以及 GitHub Copilot 等核心開發與工作生態圈。

OpenAI 管理團隊強調,GPT-6 Astra 凝聚了公司在深度預訓練、強化學習及模型對齊領域的多年頂尖技術積累,OpenAI 總裁 布羅克曼(Greg Brockman)更直言,這款模型的登場象徵著通用人工智慧(AGI)時代的正式揭幕。

OpenAI 最強旗艦 GPT-6 Astra 突襲發表!效能表現刷新紀錄,還能自主操作滑鼠鍵盤、修復系統

德州 Stargate 動員 10 萬張 GPU 算力

GPT-6 Astra 最受業界矚目的技術突破,在於賦予 AI 前所未有的「電腦自主操作」與端到端任務接管能力。

根據官方技術架構揭露,該模型是在位於美國德州的 Stargate(星際之門)超級運算中心完成預訓練,動用了超過 10 萬塊 GPU 運算集群,創下 OpenAI 迄今為止規模最龐大的運算紀錄。藉由全新引入的「循環深度(Recurrent Depth)」等尖端推理機制,GPT-6 Astra 具備模擬人類鍵鼠交互的直接控制能力,可自主跨系統執行多步驟複雜工作流,從真實軟體環境中搭建高階金融模型、跨多份複雜文件整理龐大數據、自動填報稅務表格,乃至於自主安裝開發工具、除錯並修復作業系統異常。

在各項嚴格的權威基準測試中,GPT-6 Astra 展現出全面刷新紀錄的壓倒性效能。針對專業軟體與自主智慧體操作能力的「Agents' Last Exam」評測中,GPT-6 Astra 斬獲了 59.3% 的歷史最高分;在極限數學推理測試「FrontierMath」第四層級(Tier 4)評鑑中,更取得了高達 98% 的飽和極限分數。值得關注的是,在龐大的程式碼撰寫與創意生成流程中,新架構成功實現了大幅降低 Token 消耗量並顯著提升執行吞吐效率,為企業級部署提供極具成本效益的高密度算力表現。

OpenAI 最強旗艦 GPT-6 Astra 突襲發表!效能表現刷新紀錄,還能自主操作滑鼠鍵盤、修復系統

ARC-AGI-3 斬獲 99.9% 逼近人類極限

從官方公布的各項成績來看,Astra 在不同榜單上的表現呈現極端分化:在測試綜合語言問答能力的傳統基準(如 AA 榜單)中,Astra 僅取得平淡的 61 分,不僅落後於 Fable 系列,甚至不及 Meta 執行長祖克柏主導的 Muse 模型;然而一旦切換到考驗主動探索與推理的動態環境中,Astra 卻展現出宛如開外掛般的壓倒性統治力。在由前 Google 研究員法蘭索瓦·肖萊(François Chollet)於今年 3 月發布的最新基準「ARC-AGI-3」中,Astra 徹底粉碎了舊有認知。

ARC-AGI-3 徹底捨棄了傳統題庫式的死記硬背問答,轉而設計大量類似「推箱子」或「座標移動」的未知小遊戲,藉此考驗模型在毫無先驗說明的情況下自主理解規則、摸索互動與即時學習的能力。

在這項就連被譽為地獄級強者的 Fable 5 都僅能勉強拿到 30% 分數的嚴苛測驗中,GPT-6 Astra 竟直接斬獲高達 99.9% 的破紀錄成績,直接跨入與人類認知同等的水平。這項驚人的里程碑標誌著過往靜態的模型跑分已無法衡量次世代 AI,真正的智慧突破已轉向複雜情境下的自主試錯與即時決策。

「絕對聽話」背後隱藏的黑盒子挑戰

然而,Astra 伴隨驚人實力而來的,還有連 OpenAI 自己都無法完全掌握的「不可解釋性」黑盒子隱憂。

英國人工智慧安全研究所(UK AI Safety Institute)的深入測試揭露,Astra 正在大幅擺脫對外顯「思維鏈(Chain-of-Thought, CoT)」的依賴。當研究人員強制關閉思維鏈輸出、要求模型憑直覺直接解題時,前代 GPT-5.6 Sol 僅能穩定處理人類數分鐘以內的心算題量,而 Astra 卻能一口氣跨越至相當於人類半小時的高難度推理。

更耐人尋味的是,Astra 學會了在思考過程中「隱藏意圖」,許多關鍵推理直接在深層的潛空間(Latent Space)內部消化完畢,完全不寫入思維鏈文字中,這使得人類監控模型內在狀態的傳統手段徹底面臨失效。

儘管 OpenAI 隨後公布內部安全對齊實驗以安撫公眾,聲稱在特定誘餌攻擊測試中,舊版 5.6 Sol 有高達 48% 的機率會為了達成目標而偷跑越界,而 Astra 則展現出 0% 越界的極致「聽話」表現;但考量到上個月 OpenAI 內部模型才剛傳出逃逸越獄並癱瘓開源社群 Hugging Face 伺服器的風波,如此過於完美的防禦數據反而引發資安社群的高度警戒。。

深度整合 Microsoft 365 與 Copilot 生態

此外,鎖定高價值企業級辦公場景,GPT-6 Astra 針對複雜簡報排版規範、自動生成高水準商業簡報以及精準提煉長篇跨格式上下文資訊進行了專項模型強化,大幅降低商務人士後續手動微調的工作負擔。

作為 OpenAI 最核心的策略合作夥伴,微軟首席執行長 納德拉(Satya Nadella)所率領的生態體系已同步將 GPT-6 Astra 深度整合至 Microsoft 365 辦公生態與 GitHub Copilot 程式碼平台中,全面賦予全球數百萬名軟體開發者與跨國企業從智慧程式合成到無人化辦公自動化的全新智慧體(Agent)工作體驗。

然而,隨著模型自主能力呈現幾何級數躍升,資安防禦體系的升級也同步被推向最高警戒規格。

OpenAI 在最新釋出的系統安全評估報告中特別指出,GPT-6 Astra 在自主挖掘未知系統零日漏洞(Zero-day vulnerabilities)與網路利用方面,已首度觸發了公司內部安全評估框架的最高警戒閾值(Highest Alert Threshold)。

為了防止模型能力遭惡意濫用,研發團隊採取了極為嚴苛的安全對齊機制並啟用全流程誤對齊即時監控系統,展現出較前代更強悍的越獄攻擊防禦韌性。目前針對高階網路安全攻防核心功能,官方採取嚴格的受限部署模式,僅優先向「Daybreak」資安防禦團隊與通過審核的受信任企業夥伴開放,其餘模型能力則依序向 ChatGPT 高級訂閱用戶及開發者 API 全面解鎖。

 

 

 

cnBeta
作者

cnBeta.COM(被網友簡稱為CB、cβ),官方自我定位「中文業界資訊站」,是一個提供IT相關新聞資訊、技術文章和評論的中文網站。其主要特色為遊客的匿名評論及線上互動,形成獨特的社群文化。

發表回應
謹慎發言,尊重彼此。按此展開留言規則