Google 旗下人工智慧實驗室 DeepMind 正式推出多語言手語轉文字模型。這項創新一舉突破了過往手語辨識僅能停留在實驗室研究或專用輔助輔具的限制,首度將強大的視覺翻譯能力下放至行動終端。藉由該模型,Google 率先在 Pixel 11 系列智慧型手機的 Gboard 鍵盤與 Live Transcribe 應用程式中導入手語轉文字功能,宣告手語人工智慧正式邁入消費級產品時代。
肢體動態的機器翻譯突破:從逐字對應到空間語法解讀
許多人誤以為手語只是將傳統口語或文字透過手勢進行逐字視覺化對映,其實手語是具備獨立文法結構、複雜詞彙系統與獨特空間語法的自然語言。跨語言的手語翻譯不能單純依賴單字或手勢的線性轉換,而必須進行真正意義上的機器翻譯,精準捕捉手語使用者在三維空間中的手勢軌跡、面部表情、頭部運動以及軀干姿勢的多部位同步動作。
為了克服極高維度的視覺運算挑戰,Google DeepMind 採用的手語轉文本模型,投入了涵蓋超過 50 種手語、累計高達 10 萬小時的龐大資料集進行深度訓練。在技術架構上,該團隊放棄了過往學界與業界廣泛採用的「中間文本註釋」轉譯路徑,選擇直接解讀空間幾何資訊,大幅降低了中間層轉譯帶來的語義累積誤差與延遲。
此外,考慮到手語影像涉及使用者即時鏡頭畫面,隱私防護成為終端落地的重中之重。DeepMind 演算法在前端即時將手語者的動態影像轉化為一系列去識別化的姿態特徵點位置資訊,所有關鍵特徵運算均能在裝置端高效完成,無需將原始視訊流上傳至遠端伺服器,在確保極高翻譯精準度的同時,打造了嚴密的個人隱私安全屏障。
從實驗室走向 Pixel 11 終端:消費級無障礙體驗的新範式
全球目前約有 7000 萬名聽力障礙人士,使用著超過 200 种各具特色的手語系統。過去,聽障使用者在智慧型手機上進行文字通訊時,主要依賴虛擬鍵盤逐字打字,不僅輸入速度受到限制,也無法完全表達手語母語者的自然語感。DeepMind 新模型在 Pixel 11 系列上的實裝,初期以美國手語為主,未來將循序漸進擴展至更多手語語系與 Android 生態系裝置。
根據內部實測數據顯示,使用者透過美國手語進行即時轉譯輸入,其溝通效率與輸入速度均顯著超越傳統的鍵盤英文打字,呈現出更為流暢、自然且令人愉悅的互動體驗。這一功能在 Gboard 與 Live Transcribe 中的整合,讓手語輸入獲得了與語音輸入同等的系統級入口支援。
總結來說,Google DeepMind 將手語人工智慧引導至消費級智慧型手機,不單單是一次無障礙功能的升級,更是多模態人工智慧在複雜視覺空間理解與邊緣端運算上的極致展示。擺脫了過去對昂貴硬體與龐大雲端算力的依賴,手語轉文本技術正式深入大眾日常生活,為全球廣大聽障族群開啟了無縫溝通的全新數位時代。
- 延伸閱讀:Google DeepMind Genie 3開放美國用戶使用!AI世界模型進化,24fps即時探索,未來遊戲就長這樣?
- 延伸閱讀:跳槽到微軟卻猛挖老東家同事,蘇萊曼今年又繼續「掏空」Google DeepMind 核心團隊
- 延伸閱讀:Google DeepMind 開放 AlphaFold 3 原始碼,引領藥物研發和分子生物學新時代
請注意!留言要自負法律責任,相關案例層出不窮,請慎重發文!