FB 建議貼文

選取貼文複製成功(包含文章連結)!

Google 最強 AI 登場!Gemini 4 Argon 具備百萬詞元輸出能力,寫程式、抓 Bug 效率大躍進

Google 最強 AI 登場!Gemini 4 Argon 具備百萬詞元輸出能力,寫程式、抓 Bug 效率大躍進

Google 正式發表全新的前沿 AI 模型 Gemini 4 Argon,主打在複雜、長期的工作流程中維持深度的推理能力。這款新模型不僅已全面深入 Google 內部的開發與核心系統,更在軟體工程、企業知識、跨領域程式編寫以及防禦性網路安全上帶來突破性的進展。

在效能與運算架構方面,Gemini 4 Argon 為了勝任更長、更複雜的使用情境,將模型的輸出詞元上限從先前的 6.4 萬大幅擴增至業界領先的 100 萬個詞元,賦予其一次到位解決棘手難題的深度思考能力。在定價策略上,官方也推出優惠的 API 方案:每百萬輸入詞元為 2 美元,每百萬輸出詞元為 10 美元,快取輸入詞元更享有高達 95% 的價格折抵。

全面革新 Google 內部工作流程與量子運算

Gemini 4 Argon 目前已深入支援 Google 的內部日常工作,數千名員工指出其在專業程式編寫、深度研究與寫作品質上具備顯著優勢。在量子演算法最佳化上,Argon 協助研究團隊突破效能瓶頸,僅花費數分鐘便交出比現有公開文獻好上 40% 的成績,大幅優化運算所需的量子位元與邏輯閘時空資源。

此外,在記憶體效率的管理上,Argon 代理分析了資料中心整體系統的效能數據並自主套用最佳化方案,全面部署後已成功釋放超過 300 TiB 的記憶體,預估整體可節省高達 500 TiB 至 1 PiB 的容量。在大規模程式碼庫遷移方面,Argon 代理程式已實際將涵蓋從核心函式庫數萬行到 Fuchsia Zircon 核心 80 多萬行的 C/C++ 程式碼遷移至 Rust。例如在開源影片解碼軟體 libgav1 的遷移中,Argon 不僅成功替換 3.2 萬行 SIMD 程式碼,更透過反覆測試讓編譯器自動完成向量化,打造出執行速度比原本 Rust 版本快上 2.7 倍且具備記憶體安全的解碼器。

頂尖基準測試表現與多模態實力

在衡量真實世界長期軟體工程任務的 DeepSWE v1.1 基準測試中,Gemini 4 Argon 以 77.9% 的得分創下業界最先進的新紀錄。在處理專業知識與經濟影響力的 Vals 指數,以及多步驟金融研究(Vals Finance Agent v2)、法律研究與草擬(Harvey’s Legal Agent Benchmark)、企業全端執行能力的 AutomationBench 測試中,Argon 也皆名列前茅。同時,它在處理圖表分析、長影片關鍵細節辨識(如 LVBench 評測中獲得 91.7% 高分)及文件連動操作上,同樣展現強大的多模態優勢。

引領防禦性網路安全與漏洞修補

為了應對網路攻擊新紀元,Google 透過 Fairwind 計畫將 Argon 率先開放給受信任的網路安全防禦專家與內部團隊,並提供未設網路安全防護限制的版本。資安平台 Wiz 已透過「Scan for Good」計畫將其用於保護公共基礎設施。在早期示範中,Argon 成功找出先前其他前沿模型未能發現、會洩漏全球醫院醫療保健軟體敏感個人資訊的關鍵漏洞。在修補安全漏洞的 CWE-bench v1 測試中,Argon 也以 68% 的最高分並列第一。

多層次的前沿安全防護機制

在模型全面推出前,Google 從四大面向嚴格強化安全防護:

  • 防禦濫用行為: 遵循《先進安全框架》主動拒絕有害請求,並透過改良監控模型內部運作狀態的技術來精準揪出濫用行為,同時完成嚴格的紅隊壓力測試。
  • 防禦提示注入攻擊: 針對間接提示注入攻擊(IPI),Argon 展現了領先業界的強大防禦力,在 Gray Swan 基準測試中表現優異。
  • 監控未對齊行為: 部署專屬緩解機制即時監控思維鏈與行動,在必要時直接中止,並嚴格避免將監控結果回饋至訓練中以防模型學會規避。
  • 系統強化: 配合代理控制藍圖,在沙盒環境展開高風險訓練或評估前先進行徹底隔離與封鎖。

Gemini 4 Argon 目前將率先開放給付費 API 客戶與 Google AI Ultra 訂閱者使用,持續透過早期測試回饋精進系統。

 

 

janus
作者

PC home雜誌、T客邦產業編輯,曾為多家科技雜誌撰寫專題文章,主要負責作業系統、軟體、電商、資安、A以及大數據、IT領域的取材以及報導,以及軟體相關教學報導。

發表回應
謹慎發言,尊重彼此。按此展開留言規則