ADVERTISEMENT
AMD正式發布AMD ROCm 10,標誌著AMD軟體堆疊邁入10週年的重要里程碑,並同步宣布ROCm.AI正式全面上線(GA)。ROCm.AI於Advancing AI 2026年度大會中首次亮相,為一套AI原生軟體體驗,旨在提升AMD硬體上的開發效率與效能最佳化能力。
ROCm.AI匯聚三大核心開發體驗:AMD Skills、ROCm CLI以及AMD Hyperloom,將AMD專業技術與代理式工作流程整合於開發人員現有工具中,讓創新得以隨著AI演進的速度持續推進。
透過對核心(Kernels)、記憶體管理與排程進行AI驅動的最佳化,在相同硬體上,配置ROCm.AI的系統相較於ROCm 7,推論效能平均提升3.3倍,訓練效能平均提升2.4倍註1、2。
ROCm.AI涵蓋AI開發流程的三大環節,為開發人員提供支援:最佳化推論效能、運用AMD專業技術進行開發,以及執行AI工作負載。

透過AMD ROCm Hyperloom實現端對端推論最佳化
作為ROCm.AI的核心元件,ROCm Hyperloom是一套自主代理式系統,能夠對主機端程式碼(Host code)與GPU核心(Kernels)的端對端推論工作負載進行最佳化。
Hyperloom能對工作負載進行分析、識別瓶頸、探索最佳化方案、進行針對性的調整、執行效能基準測試,並驗證效能與正確性。
隨著ROCm 10的推出,Hyperloom擴大對AMD Instinct™ GPU的支援,並整合對vLLM與SGLang的支援。開發人員可對HIP、Triton及FlyDSL進行最佳化,系統將提供報告,詳細說明建議的程式碼變更方案,以及實測或預期的效能提升。
Hyperloom可透過獨立工作流程或AMD Skills兩種使用方式,為開發人員提供多元管道,將代理式最佳化能力整合於其開發流程中。

運用AMD專業技術進行開發
AMD Skills將經過整理的AMD專業知識與經過驗證的工作流程,整合至Claude Code、Cursor與Codex等受支援的AI程式編寫代理中,讓開發人員能在現有的工具中取得AMD專屬指引。隨著ROCm 10的推出,AMD Skills目錄進一步擴展至三大領域:
- 客戶端原生工作流程:適用於本地AI與應用程式整合。
- 跨堆疊工作流程:適用於診斷、路由、回放分析與最佳化。
- 伺服器原生工作流程:專為AMD Instinct GPU與AMD EPYC™處理器設計,涵蓋服務部署、效能分析與效能評估等。
在Advancing AI年度大會中預覽的AMD Skills,現已透過Claude Code、Codex與Cursor市集正式上線,亦可透過GitHub開放目錄取得。每項正式發布的AMD Skills在上線前都會通過結構與行為測試,以確保提供一致且可靠的工作流程。

以更簡化的工作流程執行
ROCm CLI為ROCm.AI的技術預覽(Technology Preview)元件,提供穩定且統一的命令列介面,用於在AMD硬體上設定、管理與執行AI工作負載。
開發人員可透過手動操作、AI程式編寫代理,或是持續整合(CI)環境中,使用相同的工作流程。透過單一介面,即可檢視系統、安裝與管理ROCm環境、部署模型服務、執行診斷、更新元件以及控制執行階段(runtime)。
ROCm CLI提供適用於Windows與Linux的預先編譯二進位檔(Prebuilt binary),無需預先安裝ROCm即可使用。它能提供託管式ROCm環境,可同時管理多個並存的Runtime,並支援Runtime的啟用與回復(rollback),同時整合模型服務與引擎管理功能。目前的轉接器已支援在部分AMD客戶端系統上使用Lemonade,以及透過vLLM在AMD Instinct GPU上進行部署。
CLI內建ROCm Console(原名為“dash”)可即時呈現系統狀態與工作負載活動。開發人員能監控ROCm執行階段的健康狀況、模型服務狀態、GPU使用率以及基準測試遙測數據。在支援的AMD Instinct系統上,更可查看高頻寬記憶體使用量、功耗以及每瓦每秒Token數等指標。
作為技術預覽版,ROCm CLI提供橫跨不同ROCm版本的無縫使用體驗,從ROCm 7.13軟體版本開始提供支援,並即將在ROCm 10中提供正式支援。

基於ROCm 10軟體堆疊進行建構
以上開發體驗建立於更廣泛的ROCm 10軟體堆疊之上,其中包含ROCm Core SDK,為在AMD平台建構與執行AI工作負載提供更具模組化的基礎。
ROCm 10同時帶來函式庫、編譯器、框架、工具、模型支援、效能及硬體平台等方面的更新。
請注意!留言要自負法律責任,相關案例層出不窮,請慎重發文!