FB 建議貼文

選取貼文複製成功(包含文章連結)!

【Arm Tech Day 2026】C2-Ultra CPU進化支援台積電2奈米製程,強化更接地氣的代理式AI助手功能

【Arm Tech Day 2026】C2-Ultra CPU進化支援台積電2奈米製程,強化更接地氣的代理式AI助手功能

ADVERTISEMENT

Arm CSS for Mobile 2運算子系統包含C2-Ultra、C2-Pro等CPU以及SME2單元,強化通用與AI運算效能,帶來更豐富的語音處理、資訊檢索、AI推論等使用體驗。

強化AI效能、相容TSMC N2製程

Arm邊緣AI CPU產品管理總監Daniel Lu於北京舉辦的Arm Tech Day 2026說明會上詳細介紹CSS for Mobile 2運算子系統的CPU(處理器)特色,其中包含C2-Ultra、C2-Pro等CPU核心,以及能夠強化AI運算效能的SME2(Scalable Matrix Extension 2,第2代可擴展矩陣延伸指令集)運算單元,最高能夠帶來15%、12%單、多執行緒效提升以及1.7倍AI推論效能,強化代理式AI工作流程各環節的表現同時更快的網頁瀏覽和應用程式啟動速度,進一步縮短了存取服務與執行任務花費的時間。

延伸閱讀:
Arm Lumex CSS平台搭配全新C1系列處理器,4種型號隨意混搭最高14核心效能怪獸
Arm發表全新Lumex CSS平台,C1 CPU與Mali G1 GPU為旗艦級手機帶來25%效能增長
Arm發表類神經網路升頻技術,NPU嵌入GPU藉AI提升繪圖效能並節省電力

CSS for Mobile 2運算子系統的開發重點包含強化代理式AI的效能,以因應行動裝置的AI功能逐漸進化為AI原生行為的趨勢,使用者不再需要手動操作、輸入指令與裝置互動,而是可以透過語音直接指揮裝置完成多種工作。

在製程技術方面,Arm表示CSS for Mobile 2最高能夠支援TSMC(台積電)N2節點製程,並且也可搭配其他晶圓廠之製程(筆者注:應指Intel與Samsung)。

考量行動裝置的電源與散熱預算相當有限,裝置尺寸能容納的晶片面積也很有限,不能完全參考筆記型電腦、桌上型電腦可以搭配規模更大的GPU(繪圖處理器)或NPU(神經處理器)來改善A I運算,因此使用CPU進行A I運算就相當重要。

相較於GPU或NPU而言,CPU雖然的A I運算效能沒那麼突出,但是有著可以完全程式化的優勢,當出現使用新的資料類型精度的AI模型時,CPU只需透過更新軟體方式就能支援,而且CPU具有最高的普及率(99%的行動裝置搭載Arm架構CPU),並搭配SME2引擎加速A I運算(較舊的CPU則可使用NENO指令集),具有比更高的相容性與程式的可移植性。

另一方面在CPU中進行AI運算,也有著不必將資料搬遷到外部運算單元的優勢,能夠縮小A I運算的延遲,提供更靈敏的使用體驗。

而與在雲端進行AI運算相比,在本機CPU執行有著資料不必往外傳輸的資安優勢,尤其對於需要處理更多行事曆、照片、通訊錄等個資的情境,具有更高的安全性。

Arm邊緣AI CPU產品管理總監Daniel Lu說明全新CSS for Mobile 2運算子系統與C2系列處理器的架構與特色。

CSS for Mobile 2運算子系統的一大重點為將AI功能進化為AI原生行為,例如透過代理式AI與使用者互動,取代傳統需要手動操作、輸入指令的互動模式。

在行動裝置上利用CPU執行AI負載有著程式易移植、易開發,以及執行延遲低、安全性高、資料留於本地等優勢。

代理式AI的感知(語音轉文字)、記憶(搜尋本機資料)、推理(產生指令提示詞)、行動(執行前述提示詞或其他應用程式)等不同階段,以及統整各階段的編排工作都仰賴CPU運算資源。

根據Arm提供的數據, C2-Ultra CPU的單、多核心效能比前代產品提高,15%、12%,網頁瀏覽與App啟動效能則提升15%、12%,特定AI模型的推論效能增益甚至可達70%。

CSS for Mobile 2運算子系統可以搭配DSU(DynamIQ Shared Unit,動態分配單元)組合多種不同核心組態,旗艦級機種可以選擇2組C2-Ultra搭配6組C2-Pro的核心配置。其中C2-Ultra與C2-Pro為本世代新產品,C1-Permium、C1-Ultra、C1-Pro、C1-Nano則為前世代產品。

DSU的拓樸設計可以容納時脈各異的Ultra、Pro、Nano等3種類型核心,以及2組SME2引擎,各核心具有獨立的L2快取記憶體,並共享容量更大的L3快取記憶體,藉此提高快取命中率,降低對SI L2互連上的系統級快取(System Level Cache,SLC)以及主記憶體的存取需求。

C2-Ultra中更大的執行引擎、改良的資料搬移機制與亂序執行功能,可以帶來超過15%的峰值效能提升。

C2-Ultra的執行管線改良分枝預測的精準度與預取,並提升預測錯誤的回復速度。

其中的手段包括擴大執行窗口以搜尋非相依的運算,以及改善預測以優先進行後後方有相依性等待中的任務,達到用更短運算週期完成工作的效果。

C2-Ultra同時也透過優先讀取、擴大存取容量、智慧型預取等方式降低資料存取延遲,以提高處理器利用率。

與前代C1-Ultra相比,C2-Ultra在相同效能表現時可以節省38%,將電力供應拉滿則可領先15%效能。

C2-Ultra在多種運算負載中最高可以領先C1-Ultra達15%,平均值也來到12%。AI運算部分最高可以領先70%。

C2-Ultra的關鍵數據包含70% 的AI推論效能以及15%、12%的單、多核心效能提升,以及38%電力效率改善。

C2-Ultra如何改善代理式AI效能

Daniel Lu以丈夫為妻子訂結婚10週年紀念晚餐的任務說明代理式AI的在4個階斷的運作流程,以及執行的工作內容,並與前代產品進行效能對照。筆者於下分列出運作流程,搭配圖文方式說明。

代理式AI運作流程

  1. 感知(Perceive):接收外界資訊並分析指令。例如使用者對手機說「幫我訂結婚10週年餐廳」
  2. 記憶(Remember):搜尋資訊與過去的互動。系統會搜尋手機中的行事曆、相簿等資料,確定結婚紀念日期,以及從過去的相片分析喜歡的餐廳風格與菜色
  3. 推理(Reason):規劃並決定最佳解決方案。系統自動上網搜尋適合的餐廳,並生成操作提示詞
  4. 行動(Act):自動執行提示詞與任務。系統自動完成餐訂位,將行程新增至行事曆,將活動提醒與導航資訊傳給妻子

在上述流程中,除了會進行AI推論運算之外,還有許多查尋資料、開啟App、操作網頁的工作,都會占用CPU的運算資源,而且統整各階段順利進行的編排(Orchestration)工作也仰賴CPU。

以「丈夫為妻子訂結婚10週年紀念晚餐」為例說明代理式AI的運作流程,可以拆解為感知、記憶、推理、行動等4個階段。

在感知階段中,系統會透過語音轉文字的AI模型接收外界資訊並分析指令。2組C2-Ultra核心搭配SEM2引擎的效能比前2組C1-Ultra核心搭配SEM2引擎的組合提升40%。

記憶階段則會搜尋手機中的行事曆確定結婚紀念日期,從相簿分析喜歡的餐廳風格與菜色,C2-Ultra組合效能提升41%。

推理階段系統自動上網搜尋適合的餐廳,並生成操作提示詞,C2-Ultra組合在多種AI模型中效能平均提升25%。

行動階段則是執行前面生成的提示詞與任務,完成餐訂位等工作。

除此之外,代理式AI的編排工也仰賴CPU協助,以及進行傳統程式基於規則(Rules Based)的決策、資安、權限、判斷於本機或雲端執行AI等工作。

與2組C1-Ultra核心相比,使用2組C2-Ultra核心加上SEM2引擎執行上述工作能夠縮短24%整體時間,幅度達到24%。

細看各階段的工作,差異最大為AI運算量較高的推理階段。SME2搭配2 Bit精度資料類型模型能較INT4模型提升76%提示詞處理(編碼)效能。而使用查找表指令(Lookup Table Instructions,LUTi)則可提升76%文字(解碼)效能。

CSS for Mobile 2擁有完善的軟體生態系,搭配KleidiAI API能為軟體提供最佳化執行路徑,並充分發揮SME2的效能優勢,透過完整的軟體堆疊帶來更好的效能與使用體驗。

筆者將於下篇文章繼續介紹G2-Ultra NX,請讀者參考下方連結回到系列文章目錄。

Arm Tech Day 2026系列文章目錄

國寶大師 李文恩
作者

電腦王特約作者,專門負責硬派內容,從處理器、主機板到開發板、零組件,尖端科技都一手包辦,最近的研究計畫則包括Windows 98復活與AI圖像生成。

發表回應
謹慎發言,尊重彼此。按此展開留言規則