FB 建議貼文

選取貼文複製成功(包含文章連結)!

Google 發表 Gemini 3.8 Live、Extended Thinking 語音模型,支援即時影音與多步驟推理

Google 發表 Gemini 3.8 Live、Extended Thinking 語音模型,支援即時影音與多步驟推理

Google 發表全新 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 語音對話模型,旨在大幅強化人工智慧的即時推理能力與自然語音互動體驗。Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 這兩款模型針對不同的應用場景與複雜度進行設計,為開發者、企業以及一般使用者提供更具效率與互動性的語音代理支援。

Gemini 3.8 Live 兩大模型定位

在模型定位方面,Gemini 3.8 Live 主要聚焦於規模化應用與成本效益的平衡。它結合深度的對話理解、流暢的自然互動,以及能夠即時處理視覺輸入的視覺接地(Visual Grounding,視覺定位)能力,讓使用者在對話過程中可以直接透過畫面傳遞情境。此外,Gemini 3.8 Live 模型也具備自動偵測並在對話中切換 97 種支援語言的能力,同時還能在背景執行工具與 API 呼叫,確保對話過程不被中斷。

Google 發表 Gemini 3.8 Live、Extended Thinking 語音模型,支援即時影音與多步驟推理

Gemini 3.8 Live Extended Thinking 則專為高複雜度任務所打造,具備強化的多步驟推理能力。它能在背景默默執行工具與 API 呼叫的同時維持對話的流暢度,並透過「同時思考與說話」的機制,在處理複雜非同步任務時提供口語進度說明,或是利用早期口語提示自然地回應使用者。

Google 發表 Gemini 3.8 Live、Extended Thinking 語音模型,支援即時影音與多步驟推理

Extended Thinking 語音品質指數位列第一

在效能與實際應用表現上,Extended Thinking 版本在多項基準測試與分析中展現出色的成果,不僅在語音對話品質指數獲得高分,也具備優異的代理任務執行能力。此外,所有由 Google 語音產品所產生的內容皆會透過 SynthID 技術加入數位浮水印,以確保生成的音訊內容可被辨識,降低虛假資訊帶來的風險。

Google 發表 Gemini 3.8 Live、Extended Thinking 語音模型,支援即時影音與多步驟推理

目前這兩款模型已自即日起逐步向各界推出。開發者可以透過 Gemini API 與 Google AI Studio 進行存取與建置;企業用戶則可在 Gemini Enterprise 中使用預覽版本;一般使用者也將陸續在 Search Live、Gemini Live 以及 Google Workspace 的訂閱方案中體驗到相關功能。

ycr
作者

T 客邦網站、PChome 雜誌編輯,同時負責 T 客邦影新聞 YouTube 頻道及 FB、IG 等社群平台短影音製作。專注於 AI 應用、產業趨勢與軟體教學等科技內容報導。(大頭貼為 AI 生成)

發表回應
謹慎發言,尊重彼此。按此展開留言規則