FB 建議貼文

選取貼文複製成功(包含文章連結)!

【Arm Tech Day 2026】CSS for Mobile 2帶來全新C2-Ultra CPU、G2-Ultra NX GPU,強化手機代理式AI與主機級光線追蹤遊戲體驗

【Arm Tech Day 2026】CSS for Mobile 2帶來全新C2-Ultra CPU、G2-Ultra NX GPU,強化手機代理式AI與主機級光線追蹤遊戲體驗

ADVERTISEMENT

Arm CSS for Mobile 2運算子系統包含C2-Ultra、C2-Pro等CPU(處理器),以及G2-Ultra NX GPU(繪圖處理器)、系統 IP、軟體及開發者工具,以完整平台的型式改善代理式AI應用體驗。

手機成為AI代理助手

Arm於北京舉辦的Arm Tech Day 2026說明會中發表為智慧型手機、平板電腦等 行動裝置設計的CSS for Mobile 2運算子系統,透過從整體系統層面進行最佳化設計的運算平台,在有限的電力與散熱預算下提供充沛的通用運算、AI、繪圖效能,以滿足代理式AI以及遊戲主機等級的光線追蹤遊戲體驗。

延伸閱讀:
Arm Lumex CSS平台搭配全新C1系列處理器,4種型號隨意混搭最高14核心效能怪獸
Arm發表全新Lumex CSS平台,C1 CPU與Mali G1 GPU為旗艦級手機帶來25%效能增長
Arm發表類神經網路升頻技術,NPU嵌入GPU藉AI提升繪圖效能並節省電力

Arm邊緣AI客戶端運算副總裁James McNiven在說明會中介紹CSS for Mobile 2的設計功能,隨後則由其他專家介紹全新C2系列CPU與G2系列GPU的架構細節,我們先在這篇文章中瞭解CSS for Mobile 2,並在後續文章中深入分析CPU與GPU。

回顧AI技術發展的各個階段,初期階段為功能有限的機器學習應用程式,例如影像辨識、物件分類等等應用,接著到了生成式AI階段,AI應用程式可以透過生成文字的型式回答使用者的問題,或是將參考提示詞進行圖像生成。

進入代理式AI階段後,AI代理系統進化為能夠自主感知、分析使用者的意圖與需求,並擬定解決方案,接著調用系統中的其他AI應用程式或傳統應用程式完成工作,最終將工作成果彙報給使用者。

為了完成上述工作,代理式AI會在使用者單次下達指令後,調用系統中的多個元件以完成意圖分析、資料檢索與處理、模型執行、記憶體存取以及操作應用程式等環節,因此系統需要具備常時在背景運作、充沛的AI運算效能、更多的處理器核心數等能力,以提供理想的使用體驗。

James McNiven將代理式AI的運作流程拆解為下列4個階段,筆者也將後續演說中提到以丈夫為妻子訂結婚10週年紀念晚餐的任務,整合於下列流程說明。

代理式AI運作流程

  1. 感知(Perceive):接收外界資訊並分析指令。例如使用者對手機說「幫我訂結婚10週年餐廳」
  2. 記憶(Remember):搜尋資訊與過去的互動。系統會搜尋手機中的行事曆、相簿等資料,確定結婚紀念日期,以及從過去的相片分析喜歡的餐廳風格與菜色
  3. 推理(Reason):規劃並決定最佳解決方案。系統自動上網搜尋適合的餐廳,並生成操作提示詞
  4. 行動(Act):自動執行提示詞與任務。系統自動完成餐訂位,將行程新增至行事曆,將活動提醒與導航資訊傳給妻子

在上述流程中,除了會進行AI推論運算之外,還有許多查尋資料、開啟App、操作網頁的工作,都會占用CPU的運算資源,而且統整各階段順利進行的編排(Orchestration)工作也仰賴CPU,另一方面也有部分AI運算也會直接交給CPU處理,因此在CPU在代理式AI的重要性不亞於GPU或NPU等運算單元。

Arm邊緣AI客戶端運算副總裁James McNiven在說明會分享AI技術發展的趨勢,並介紹CSS for Mobile 2運算子系統的設計功能。

Arm在AI轉型中扮演重要角色,不但有先前針對資料中心推出的Arm AGI CPU,也有適合應於機器人等物理AI與智慧型手機等邊緣AI的相關產品。

AI沿著單一功能、生成式AI、代理式AI的路徑發展至今,操作模式也由對提升詞反應、偶爾互動、產生回答、雲端優先,轉換為自主行動、持續互動、深度個人化、分散至終端裝置執行。

由於代理式AI需要更多「代理人」操作應該程式、AI工具,因此需要更多處理器核心與運算資源,James McNiven提出CPU是代理式AI中心的觀點。

CSS for Mobile 2整合CPU中的SME2引擎、GPU中的AI加速器,以及豐富的工具、AI模型、軟體,透過完整的軟體堆疊協助生態系夥伴加速AI轉型與部署。

行動裝置上的AI功能也從傳統的機器學習影像辨識轉進到生成式AI與代理式AI,讓體驗由「得到答案」進化到「自動完成工作」。

代理式AI的運作流成可以分為感知(Perceive)、記憶(Remember)、推理(Reason)、行動(Act)等階段,對CPU的運算資源需求隨之升高。而其中統整各階段順利進行的編排(Orchestration)工作也仰賴CPU進行。

Arm也推出更多藉由AI加速的神經繪圖功能,筆者將在後續文章中詳細介紹。

由AI加速的神經繪圖有助於提高遊戲的解析度、複雜幾何、逼真性,將桌上型電腦的遊戲體驗帶至行動裝置。

強化CPU的AI運算效能、也不忘GPU

James McNiven再次說明CPU在行動裝置執行AI應用程式的重要性。首先他提到目前有99%的行動裝置搭載Arm架構CPU,因此在CPU上進行AI推論運算有著明顯的相容性優勢,再加上CPU具有最高的可程式化性質,能夠透過軟體方式支援所有資料類型的浮點數運算,且因為資料可以直接在CPU完成運算,不需搬移至外部GPU或NPU(神經處理器),因此具有延遲較短的優勢。

Arm在CSS for Mobile 2中整合2組SME2引擎(Scalable Matrix Extension 2,第2代可擴展矩陣延伸指令集,主要功能為強化AI運算效能),較前代提供2倍的運算能量,對於AI應用程式有著絕對的助益。

另一方面,代理式AI也將推高系統對記憶體頻寬與延遲的需求,也需要流量控管、功耗、資安、擴展性等功能的改善,對此Arm也推出SI L2系統互連功能因應需求。它最大的改進為在保留支援DDR5、LPDDR5x記憶體的同時新增支援LPDDR6,能為客戶確保硬體搭配的彈性,也能搭配傳輸速度更快的記憶體以改善效能,SI L2也對PPA(Performance效能、Power功耗、Area晶片面積)最佳化,以改善系統的綜合效能並控制成本。

在軟體部分,CSS for Mobile 2同樣支援KleidiAI函數庫,提供與主流AI框架深度整合的開發環境,並可在程式執行時自動調用系統中最適合的CPU、SME2、GPU、NPU等不同的運算單元,充分發揮系統效能。

此外Arm也推出全新AI Portal工具,提供經過驗證且預先最佳化模型以及範例程式,協助開發者快速導入AI應用程式,加速從評估到部署的完整開發流程。對於自有模型而言,也可以透過早期預覽版(Early Access)模型最佳化工具,協助開發者對目標裝置進行最佳化。

回顧Arm CPU與GPU的發展軌跡,許多AI加速運算與光線追蹤繪圖等技術最終匯流至CSS for Mobile 2。

身為AI原生平台,CSS for Mobile 2運具有SME2加速功能的C2 CPU叢集、全新Mail G2-Ultra NX GPU。

CSS for Mobile 2中的C2 CPU叢集包含最新的處理器以及SME2單元,Mail G2-Ultra NX GPU具有更強大的執行單元、光線追蹤單元、神經加速器。而SI L2互連單元則專為行動裝置設計,帶來更高的頻寬與更低的延遲。

C2 CPU叢集搭配SME2能夠透過異質運的方式完成代理式AI的工作流程,還可搭配GPU、加速器(包含NPU或其他種類)、雲端算力等方式帶來更豐富的AI功能。

CSS for Mobile 2世代具有全新的C2-Ultra與改良的C2-Pro CPU核心,以及DSU動態分配單元(DynamIQ Shared Unit)。本世代並沒有新款「Nano」等級的輕量核心。

SME2單元相當適合執行裝置端的輕量AI運算,與前代產品相比,在特定運算負載的效能增益達到70%。

SME2能在搭配KleidiAI函數庫開發的AI應用程式發揮最佳化效能,包含GEMAprilMA4-E2B、Hunyuan HY-MT 1.5-1.8B-2Bit等模型也與SME2深度合作。(值得注意的弦外之音是能夠部署參數量達2B以及2Bit精度資料類型的AI模型)

活動中也展示在手機上進行英文語音翻譯為中文語音的展示,使用者對著手機說英文,系統能立刻輸出與原本語調接近的中文語音。過程在CPU上執行語音轉文字、文字翻譯、文字轉語音等3組AI推論運算。

根據Arm提供的數據,搭載2組C2-Ultra核心與8組C2-Pro核心的參考平台與前代產品相比,GeekBench 6.3的單、多核心效能增益達到15%、12%,網頁瀏覽與App啟動效能也提升15%、12%。

CSS for Mobile 2導入首款AI原生的Mali G2-Ultra NX GPU,具有全新執行單元、第3代光線追蹤單元、專為在1 W功耗條件下運作的神經加速器。

Mali G2-Ultra NX GPU提供NSS、NFRU、NSSD等升頻技術,透過超解析度與畫格生成等方式提升遊戲體驗與畫面流暢度。

同時使用NFRU、NSSD升頻技術後,能讓遊戲FPS效能提高至4倍,將記憶體頻寬用量降低至30%,耗電量降低至25%。

根據Arm提供的數據,Mali G2-Ultra NX平均效能提升達20%,遊戲效能提升最高達14%,光線追蹤的記憶體頻寬用量降低13%。

代理式AI會帶來高頻寬、低延遲、流量控管、功耗、資安、擴展性等挑戰,對系統的互連也是一大考驗。

SI L2系統互連針對PPA進行最佳化,除了支援DDR5、LPDDR5x之外,也支援LPDDR6,有助於提高記憶體頻寬。

做為CPU與統一架構記憶體中介的SI L2系統互連,能在執行代理式AI時降低45%記憶體延遲,有助於改善效能表現。

Arm也推出AI Portal工具,不但提供預先最佳化模型以及範例程式,也具有代理式AI效能最佳化工具。

開發者可以直接使用AI Portal提供針對SME2、NX GPU、Ethos-U NPU等運算單元最佳化的模型,也可以自行針對不同軟硬體使用情境微調。

整體而言,CSS for Mobile 2帶來最高1.7倍代理式AI效能與4倍遊戲FPS效能,並透過完整軟、硬體堆疊協助生態系夥伴加速AI部署。

在這篇文章中瞭解CSS for Mobile 2的特色後,筆者也會在後續文章中繼續介紹C2-Ultra、C2-Pro等CPU以及G2-Ultra NX GPU,請讀者參考下方目錄繼續閱讀。

Arm Tech Day 2026系列文章目錄
CSS for Mobile 2帶來全新C2-Ultra CPU、G2-Ultra NX GPU,強化手機代理式AI與主機級光線追蹤遊戲體驗(本文)
C2-Ultra CPU進化支援台積電2奈米製程,強化更接地氣的代理式AI助手功能(工作中)
G2-Ultra NX GPU搭配多種神經繪圖升頻技術,在2 W功耗條件下帶來電腦級遊戲體驗(工作中)

國寶大師 李文恩
作者

電腦王特約作者,專門負責硬派內容,從處理器、主機板到開發板、零組件,尖端科技都一手包辦,最近的研究計畫則包括Windows 98復活與AI圖像生成。

發表回應
謹慎發言,尊重彼此。按此展開留言規則