FB 建議貼文

選取貼文複製成功(包含文章連結)!

輝達重啟 Rubin CPX 專用 AI 加速器:捨棄 GDDR7 改搭 168GB HBM4,專攻超長上下文預填充架構

輝達重啟 Rubin CPX 專用 AI 加速器:捨棄 GDDR7 改搭 168GB HBM4,專攻超長上下文預填充架構

ADVERTISEMENT

隨著大型語言模型(LLM)與智慧體(AI Agent)參數量正式邁向兆級門檻,傳統通用 GPU 在處理龐大 Context Window 時面臨嚴重的頻寬與運算瓶頸。

根據天風國際知名供應鏈分析師郭明錤(Ming-Chi Kuo)最新透露的產業消息指出,輝達(NVIDIA)先前曾一度暫緩的「Rubin CPX」專用 AI 加速器專案已正式重啟。為了解決巨量輸入帶來的效能痛點,輝達全面推翻原先規劃的 128GB GDDR7 顯示記憶體方案,轉而改採容量高達 168GB 的次世代 HBM4 高頻寬記憶體,為長文本輸入與 KV 快取帶來革命性的硬體架構轉型。

預填充與解碼解耦架構:專攻 KV 快取的高密度機架配置

在大語言模型的推論流程中,主要區分為「預填充(Prefill)」與「解碼(Decode)」兩大階段。

傳統架構由同一顆 GPU 同時承擔這兩項性質截然不同的任務,容易導致資源搶占並拖慢 Token 生成吞吐量。輝達在 Rubin 世代大膽導入「解耦推論(Disaggregated Inference)」設計理念,將巨量輸入 Context 與龐大 Key-Value(KV)快取的預處理工作全數移交給專門定製的 Rubin CPX GPU,常規 Rubin GPU 則專注於逐字生成與輸出解碼。在標準叢集規劃下,負責解碼的機架中 CPX GPU 與常規 Rubin GPU 將維持 1:1 的黃金配比,顯著優化整體 Token 的傳輸與交付速度。

在具體的資料中心部署層面,Rubin CPX 將被模組化配置於獨立機架之中,單一機架可依據算力需求靈活擴充至 64 至 256 顆獨立 CPX GPU。在標準配置下,一個配備 8 顆 CPX GPU 的機架托盤(Rack Tray)即可一口氣吞吐高達 1.34TB 的超長上下文預填充資料與關聯 KV 快取。

得益於全新 168GB HBM4 帶來的極致記憶體頻寬,系統能以接近硬體極限的速度載入並檢索海量快取,徹底解放生成式 AI 在處理超長對話、多輪 Agent 規劃與全代碼庫理解時的延遲瓶頸。

30 PFLOPS 極致運算與 CoWoS 封裝:整合多媒體編解碼的多工單晶片

在晶片微架構方面,Rubin CPX 採用單晶片(Monolithic)設計,能提供高達 30 PFLOPS(千萬億次浮點運算)的 NVFP4 頂級推論算力,為低精度推論負載帶來倍增的效能能效比。

值得注意的是,由於記憶體子系統全面升級為 HBM4,原本針對 GDDR7 記憶體的基板與封裝設計必須全面翻新。市場預期輝達將進一步深化與晶圓代工龍頭台積電(TSMC)的合作,採用其業界領先的 CoWoS-S 或 CoWoS-L 先進封裝製程,以實現邏輯晶片與 HBM4 堆疊之間的高密度微凸塊互連與散熱平衡。

除了強大的 Transformer 推論引擎之外,Rubin CPX 內部還直接整合了 4 組 NVENC 視訊編碼引擎與 4 組 NVDEC 視訊解碼引擎。這項特殊的硬體配置使加速器在處理龐大的多模態(Multimodal)影片、語音與影像輸入時,無需頻繁經由 PCIe 匯流排呼叫主機端 CPU 介入轉碼,直接在 GPU 內部完成硬體級加速解碼與前處理。在面對兆級參數智慧體與複雜多模態應用的未來戰局中,Rubin CPX 無疑展現了輝達在 AI 專用晶片領域精準切分算力戰場的深厚野心。

 

 

 

 

IFENG
作者

鳳凰網(科技),集綜合資訊、視訊分發、原創內容製作、網路廣播、網路直播、媒體電商等多領域於一身,並於2011年在紐交所上市(紐交所代碼:FENG),成為全球首個從傳統媒體分拆上市的新媒體公司。

發表回應
謹慎發言,尊重彼此。按此展開留言規則