FB 建議貼文

選取貼文複製成功(包含文章連結)!

Google 推出 Gemini 3.5 Transcribe 語音專用模型,自動去贅字、支援 85 種語言還能辨識不同說話者

Google 推出 Gemini 3.5 Transcribe 語音專用模型,自動去贅字、支援 85 種語言還能辨識不同說話者

Google 正式發表專為語音轉文字打造的全新專用模型「Gemini 3.5 Transcribe」,在大幅降低背景雜音干擾的同時,顯著提升專業術語與複雜詞彙的辨識準確度。

官方數據顯示,Gemini 3.5 Transcribe 在非串流(Non-streaming)環境下的平均詞錯誤率(WER)已壓低至 2.6%,而在即時串流辨識場景中錯誤率亦僅有 4.0%。這項新技術目前已率先導入 macOS 平台的 Gemini 應用程式以及 Android 平台 Gboard 鍵盤的 Rambler 語音輸入功能,並開放開發者透過 API 建構語音智慧體與各類即時轉錄工作流。

Google 推出 Gemini 3.5 Transcribe 語音專用模型,自動去贅字、支援 85 種語言還能辨識不同說話者

捕捉自然語音節奏:自動自我修正、過濾贅字並支援跨模型協作

Google 指出,Gemini 3.5 Transcribe 的核心設計初衷是精準捕捉使用者最自然的說話習慣與口語節奏,藉此深入理解說話者的真實語意意圖。模型不僅能敏銳辨識自訂詞彙,還能協助使用者直接透過語音下達指令並流暢完成各項任務。

在處理能力與文本輸出層面,Gemini 3.5 Transcribe 導入了多項專門針對語音辨識痛點的優化機制:

1. 自動自我修正與口語過濾:模型能動態過濾對話中的「嗯」、「啊」等贅字與口語填充詞,並在發現前後文語意不符時即時自我校正。

2. 智慧排版與格式化:輸出文字時會自動補齊標點符號、段落換行與數字規格,大幅減少後期人工潤稿與校對成本。

3. 多模型協同工作流:新模型具備任務委派機制,能將複雜的文件深度分析、程式碼除錯或圖像生成等要求,無縫分派給其他 Gemini 系列模型處理,打造更完整的多模態 AI 協作體驗。

此外,針對吵雜街頭、會議室回音等嚴苛環境,Gemini 3.5 Transcribe 具備更強大的抗噪表現,並針對長串訂單編號、郵遞區號等英數字混合的關鍵資料強化了辨識權重,有效杜絕關鍵資訊漏字或辨識錯誤的問題。

支援 85 種語言與三方對話標記,Chrome 網頁語音輸入即將登場

在多語言與多場景適應力方面,Gemini 3.5 Transcribe 目前支援高達 85 種語言,且具備強大的地區口音與方言辨識能力。針對預先錄製的會議或訪談音訊,模型最多可為三位不同的說話者進行語音歸屬辨識(Speaker Diarization),並精確附帶時間戳記,便於產出清晰的發言者逐字稿。同時,開發者與企業可匯入自定義詞彙表,確保模型精準理解特殊的行業專有名詞、品牌代號及縮寫拼寫。

目前,開發者已可透過 Google AI Studio 以及 Google Antigravity 中的 Gemini API,以公開預覽(Public Preview)形式呼叫 Gemini 3.5 Transcribe,廣泛應用於構建語音助理智慧體(Voice Agents)、會議即時字幕工具以及通話後分析(Post-call Analytics)系統。一般使用者除了已能在 Android 與 macOS 平台搶先體驗外,Google 亦計畫將此模型深度整合至 Chrome 瀏覽器,未來使用者在任何網頁輸入框中皆能直接啟動語音輸入。

近期 Google 全面加速 Gemini 產品線的技術落地與生態布局,除了推出 Gemini 3.7 Flash 迎戰日趨白熱化的模型價格戰,Gemini in Chrome for Android 也已正式向全美用戶開放,旗下 Gemini 助理更已進駐 Waymo 新一代自駕計程車隊,展現全面覆蓋多模態人機互動的強烈企圖心。

 

 

 

IFENG
作者

鳳凰網(科技),集綜合資訊、視訊分發、原創內容製作、網路廣播、網路直播、媒體電商等多領域於一身,並於2011年在紐交所上市(紐交所代碼:FENG),成為全球首個從傳統媒體分拆上市的新媒體公司。

發表回應
謹慎發言,尊重彼此。按此展開留言規則