微軟宣布GitHub Copilot 將於本月底前支援本機人工智慧模型推理,開發者可在雲端與裝置端模型之間自動或手動切換。同步發表的 MAI Code 1.1 Flash 混合專家模型,總參數 1370 億、活躍參數 68 億,在 Surface Laptop Ultra 上解碼吞吐每秒最高達 63 個 Token。
協調器自動編排雲端與本機模型分工
GitHub Copilot 是微軟的 AI 程式設計助手,可整合進 Visual Studio Code、CLI 等工具,依程式碼上下文產生補全、解釋或重構建議。目前 Copilot 完全依賴雲端託管模型,由協調器依效能、成本與準確性路由每一次請求。本月底起,這套機制將擴展到本機模型。
微軟給使用者兩種偏好:自動編排,或強制只用裝置端模型,都能在 Copilot CLI、Copilot 應用與 Visual Studio Code 內設定。
本機模型可指定供應商、模型或端點:透過 Windows ML 選 MAI Code 1.1 Flash,也能接 OpenAI 相容的本機端點,調用那邊暴露的模型。

混合專家模型靠量化推測解碼壓低延遲
MAI Code 1.1 Flash 是微軟同步推出的「混合專家」模型,總參數 1370 億,單次活躍參數僅 68 億。
它用量化與推測解碼技術,壓縮回應速度與記憶體占用,讓千億級參數不必全數上陣。

在 Surface Laptop Ultra 上實測,複雜任務的峰值記憶體使用率、Token 利用率與處理速度都明顯提升。解碼吞吐測試裡,提示長度從 2K 拉到 256K Token,吞吐落在每秒 40 到 63 個 Token 之間。
推理下沉到裝置端,正式成為 Copilot 預設可選的路由選項。微軟預計本月底前開放,實際可調用的本機模型範圍與切換細節,端待官方陸續釋出。

- 延伸閱讀:AMD 顯卡也能跑 CUDA 了!GitHub 神人釋出自動化腳本,實測 RX 9060 XT 跑 AI 模型效率驚人
- 延伸閱讀:挑戰微軟 GitHub 霸權!Cursor 啟動次世代 Git 代管平台「Origin」內測
- 延伸閱讀:GitHub 淪陷?研究顯示 4 成工程師說話越來越像 AI,Claude 慣用語成主流
請注意!留言要自負法律責任,相關案例層出不窮,請慎重發文!