Google 發表全新 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 語音對話模型,旨在大幅強化人工智慧的即時推理能力與自然語音互動體驗。Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 這兩款模型針對不同的應用場景與複雜度進行設計,為開發者、企業以及一般使用者提供更具效率與互動性的語音代理支援。
Gemini 3.8 Live 兩大模型定位
在模型定位方面,Gemini 3.8 Live 主要聚焦於規模化應用與成本效益的平衡。它結合深度的對話理解、流暢的自然互動,以及能夠即時處理視覺輸入的視覺接地(Visual Grounding,視覺定位)能力,讓使用者在對話過程中可以直接透過畫面傳遞情境。此外,Gemini 3.8 Live 模型也具備自動偵測並在對話中切換 97 種支援語言的能力,同時還能在背景執行工具與 API 呼叫,確保對話過程不被中斷。

Gemini 3.8 Live Extended Thinking 則專為高複雜度任務所打造,具備強化的多步驟推理能力。它能在背景默默執行工具與 API 呼叫的同時維持對話的流暢度,並透過「同時思考與說話」的機制,在處理複雜非同步任務時提供口語進度說明,或是利用早期口語提示自然地回應使用者。

Extended Thinking 語音品質指數位列第一
在效能與實際應用表現上,Extended Thinking 版本在多項基準測試與分析中展現出色的成果,不僅在語音對話品質指數獲得高分,也具備優異的代理任務執行能力。此外,所有由 Google 語音產品所產生的內容皆會透過 SynthID 技術加入數位浮水印,以確保生成的音訊內容可被辨識,降低虛假資訊帶來的風險。

目前這兩款模型已自即日起逐步向各界推出。開發者可以透過 Gemini API 與 Google AI Studio 進行存取與建置;企業用戶則可在 Gemini Enterprise 中使用預覽版本;一般使用者也將陸續在 Search Live、Gemini Live 以及 Google Workspace 的訂閱方案中體驗到相關功能。
- 延伸閱讀:Google 推出 Gemini 3.5 Transcribe 語音專用模型,自動去贅字、支援 85 種語言還能辨識不同說話者
- 延伸閱讀:Gemini 3.5 Live Translate 登場,打開 Google 翻譯 App 就能即時語音翻譯
- 延伸閱讀:Google Gemini Live 迎來重磅升級:整合 Spark AI 智慧體與 Gmail 跨應用工作流,語音對話打造無縫生產力
- 延伸閱讀:Mac 版本 Gemini 推出「語音聽寫」功能,可自動過濾贅字、並支援搭配推理能力使用
- 延伸閱讀:OpenAI 發表 GPT-Live 全新語音模型,ChatGPT Voice 升級即時雙向對話體驗
請注意!留言要自負法律責任,相關案例層出不窮,請慎重發文!