當各大人工智慧實驗室仍熱衷於在微小的基準測試差距上爭奪技術虛榮時,馬斯克(Elon Musk)旗下的人工智慧團隊正式釋出了新一代大型語言模型 Grok 4.7。
然而這款被官方冠上「最強」稱號的新模型一亮相,社群評價卻陷入極端對立——不少眼尖的開發者與網友直接翻開跑分圖表,嘲諷其在多項指標上並未擊潰競爭對手,甚至諷刺為「差到根本不該發布的模型」。
用延長強化學習直擊長任務痛點
在過往的輔助寫作或代碼生成場景中,多數模型僅需應付局部的程式碼片段補全,哪怕邏輯稍有瑕疵也能靠人類工程師即時微調。然而隨著軟體開發全面轉向自主代理人架構,真正考驗模型能力的戰場已經演變成:能否在動輒數小時的漫長任務中,自主閱讀整個專案代碼庫(Repository)、拆解錯綜複雜的架構需求、精準修改跨模組的多個檔案,並自行在終端環境中執行測試與反覆偵錯。一旦模型在漫長的思考鏈中產生幻覺或「目標漂移」,前功盡棄的重試成本將徹底吞噬所有開發效率。
為了啃下這塊硬骨頭,Grok 4.7 換上了量體更龐大的基礎模型,並在預訓練與對齊階段大幅拉長強化學習(Reinforcement Learning)的週期。官方特別將需要數小時才能跑完的棘手任務納入訓練樣本,強迫模型建立極為嚴格的自我檢查(Self-checking)機制與長上下文(Context)管理能力。

這套工程底層的轉向直接反映在長任務基準測試上。專門考核長時間程式開發的 CursorBench 4.0 中,Grok 4.7 繳出 46.3% 的成績,較前代 Grok 4.6 的 40.4% 明顯躍升 5.9 個百分點;在講求深層推理的 DeepSWE v1.1 評測中取得 71.0%,而衡量多小時命令列環境操作的 Terminal-Bench 4.0 更是直接從 20.3% 翻倍衝上 38.0%。更關鍵的是,模型經過特別調校以原生理解 Grok Bot 運行架構,讓 AI 與開發工具、執行環境之間的協同作業更為流暢。
寫出一行驚艷的單行代碼早已不再稀奇;能夠在漫長的終端建置與編譯排錯中撐過數十輪迴圈而不當機,才是現代 AI 代理人能否落地營運的生存線。

走出工程師同溫層:從法律到醫療的跨領域多步驟作業考核
除了持續穩固程式開發基本盤,Grok 4.7 此次更顯著擴大了評測邊界,將目光移向高產值的專業白領領域。在聚焦於多步驟複合型工作的 AA-Briefcase 與 GDPval 測試中,模型面對的不再是單純的問答題,而是必須模擬律師、護理人員、金融分析師等職位,產出包含正式報告、試算表模型與專業簡報在內的整套可交付成果。
根據專業評測機構 Artificial Analysis 公布的數據,Grok 4.7 在 AA-Briefcase v1.1 拿下 1657 分,不僅超越前代的 1546 分,其「分析品質」更一舉攻上 1994 Elo,整體表現緊咬在頂尖梯隊之後;而在要求生成實際工作成果的 GDPval 測試中,它也以 1695 Elo 的成績大幅領先 GPT-6 Astra 的 1542 分,並逼近 Fable 5.1 的 1735 分。

這些跨領域數據的提升並非空穴來風。在針對電機工程專業的 EEBench 測試中,Grok 4.7 的成績由 53.0% 躍升至 64.0%;聚焦法律代理人作業的 Harvey Legal Agent Benchmark 自 15.8% 攀升至 19.6%;而在攸關臨床醫學推理的 HealthBench Professional 上,也從 48.5% 穩步成長至 56.7%。
在推進專業能力的同時,團隊亦同步重構了防護機制。Grok 4.7 不僅在生物安全基準 LatchBio 上以 62.4% 登頂,針對高風險與惡意任務的網路安全測試 HackerBench v0.3 中,高風險雙重用途提示詞的放行率僅有 3.3%,大幅壓低誤判正常資安研究的機率,並針對少數夥伴以受控模式開放邀請制紅隊防禦能力。
跑分爭議下的商業算盤
正是因為在部分高難度推理測試中,Grok 4.7 未能交出「全數登頂」的輾壓式數據,才引來部分社群開發者不留情面的酸言酸語,甚至被直接貼上「不如別發布」的標籤。

但若將這份跑分表擺進企業與獨立開發者的採購計算機裡,算盤打出來的結果卻截然不同。Grok 4.7 目前已全面進駐 Cursor 與 Grok Build,並開放 API、第三方框架與主流雲端平台調用,其標準版起價依舊維持每百萬輸入 Token 2 美元、輸出 6 美元。對照競爭對手同級旗艦動輒每百萬輸入 10 美元、輸出 50 美元的昂貴收費,Grok 4.7 的呼叫成本幾乎只有對手的三分之一甚至更低。

對於深度依賴自動化代理人與知識工作流的產品而言,模型的單次 Token 報價固然是表面成本,但執行一項複雜專案究竟需要歷經多少次除錯、消耗多少輪對話,才是決定營運生死的真實開銷。
Grok 4.7 的策略野心顯然不在於搶下跑分排行榜的短期光環,而是利用持平的超低價格,換取在長任務中「少走冤枉路、減少返工次數」的實戰競爭力。當高昂的旗艦算力讓人望而卻步時,這套用性價比死咬長任務工作流的打法,或許才是馬斯克眼裡最能刺痛對手的商業底牌。
- 延伸閱讀:馬斯克又放話!直指 Grok 5 就是 AGI 完成體,底層改用 C++ 軟體棧榨乾效能,Grok 4.7 到 5.0 戰力分佈一次看
- 延伸閱讀:馬斯克出招!SpaceX 全員數據成 Grok 秘密武器,員工竟要當 AI 的「父母」?
- 延伸閱讀:追平 GPT-5.6 Sol!Grok 4.6 旗艦模型正式登場,長程推理與寫 Code 實力大進化
請注意!留言要自負法律責任,相關案例層出不窮,請慎重發文!