長久以來,人工智慧(AI)與高效能運算領域幾乎是輝達(NVIDIA)的天下,其憑藉深耕多年的 CUDA 軟硬體生態系築起極高壁壘,讓許多手持超微(AMD)顯示卡的 Windows 個人用戶與小型開發者只能望洋興嘆。
科技媒體《Tom's Hardware》報導,獨立開發者 Speedstu 近日在 GitHub 推出了名為「CUDA-for-AMD-Windows」的開源專案,透過自動化配置與中介轉譯技術,成功讓 AMD Radeon 顯示卡在 Windows 環境下直接調用 CUDA 加速庫,甚至在完全不修改底層程式碼的情況下跑通深度學習模型,引發開源社群熱烈討論。
借道 ZLUDA 與 HIP 橋接:PowerShell 腳本如何騙過驅動層?
輝達的 CUDA 之所以能成為業界壟斷級的標準,關鍵在於其包辦了編譯器、執行階段(Runtime)、除錯工具以及高度最佳化的數學加速庫。要讓非綠營硬體理解 CUDA 語法,過去往往需要繁瑣的程式碼改寫或重構移植。
而 Speedstu 開發的這套工具本質上是一組可重現的 PowerShell 自動化腳本,其巧妙結合了開源轉譯層 ZLUDA(v6-preview.69)與 AMD 原生的 HIP / ROCm 架構。當應用程式發出 CUDA 呼叫時,系統會在驅動層進行動態攔截,直接將 nvcuda 相關請求映射至 AMD 本地已安裝的數學運算庫。

根據目前專案釋出的實作進度,包含 cuBLAS、cuBLASLt、cuSPARSE 以及 cuFFT 等常見的密集與稀疏矩陣、快速傅立葉變換運算,都能無縫轉發給 AMD 的 rocBLAS、hipBLASLt 與 rocSPARSE 處理,為 Windows 平台上的跨架構運算開闢了一條快捷通道。
端到端跑完 220 萬參數模型:RX 9060 XT 實測吞吐量破萬
這套轉譯工具並非單純停留在理論概念,而是已經完成可實際驗證的端到端運算測試。開發者直接拿出一張 AMD Radeon RX 9060 XT 顯示卡,在未修改任何 CUDA 原始碼的前提下,成功完成了一套擁有 220 萬參數的 PPO(近端策略最佳化,Proximal Policy Optimization)強化學習神經網路訓練。
在效能評測環節中,專案詳細列出了官方標準配置與自訂修訂路徑的 A/B 對比數據。在搭配官方 ZLUDA 與 AMD HIP SDK 6.4 的「公開上游路徑」下,RX 9060 XT 跑出了中位數 13,278.46 SPS(每秒步數,steps per second)、平均 13,172.49 SPS 的運算輸送量;相較之下,若採用混入舊版客製化組件的自訂路徑,中位數吞吐量則下滑至 12,875.80 SPS,且推論與學習耗時皆明顯拉長。這項數據證明,只要搭配標準且公開的軟體組件,AMD 顯示卡透過轉譯層就能維持相當穩健且高效的執行效率。
離日常主力應用還有多遠?
儘管這項專案在技術概念上令人振奮,但一般用戶若期待立即用 AMD 顯示卡完全取代 NVIDIA 進行日常 AI 開發,恐怕仍言之過早。
從專案目前的執行階段相容性清單來看,現代深度神經網路最核心的加速庫 cuDNN,在穩定的 Windows 版 AMD HIP SDK 中依然處於無法支援(unavailable)的狀態。這意味著大量依賴卷積與深度特徵提取的主流電腦視覺和大型語言模型(LLM),在現階段仍無法藉由這套工具順暢運作。
更深層的挑戰則來自商業專利與生態博弈。輝達過去曾多次修訂使用者授權合約,嚴格限制非官方轉譯層對 CUDA API 的相容模擬;加上 Windows 平台長期缺乏 AMD 官方健全的 ROCm 支援,讓這類民間專案多半遊走在實驗與概念驗證階段。
然而,在算力成本居高不下的今天,每一次針對 CUDA 護城河的嘗試,都在提醒市場:硬體生態的閉門造車,終究會面臨來自開源社群的強力突圍。
- 延伸閱讀:輝達 CUDA 遇到對手了?AMD ROCm 開源大軍來襲,貢獻量翻 10 倍要讓 AI 跑更順
- 延伸閱讀:RTX 6090 傳搭載近 2.9 萬 CUDA 核心:效能提升 30%、售價也要跟著漲?
- 延伸閱讀:NVIDIA 重磅宣布:CUDA 將支援 RISC-V 架構!
請注意!留言要自負法律責任,相關案例層出不窮,請慎重發文!