FB 建議貼文

選取貼文複製成功(包含文章連結)!

Google 以 Gemini Robotics ER 2 打造反應敏捷的智慧機器人,能邊做邊想、告別停頓

Google 以 Gemini Robotics ER 2 打造反應敏捷的智慧機器人,能邊做邊想、告別停頓

Google DeepMind 於推出全新「embodied reasoning」(具身推理)模型 Gemini Robotics ER 2。Gemini Robotics ER 2 這項技術旨在突破現有機器人在真實物理世界中的局限,不僅具備升級的空間與影片理解能力,更主打即時決策與多機器人協作,為實體 AI 的應用開啟全新篇章。

結合直覺與速度的高階大腦

在日常環境中協助人類,機器人需要的往往不只是精準的空間定位,更需要像人類一樣快速反應、掌握時機。Gemini Robotics ER 2 被定位為機器人的「高階大腦」,專門負責對話、理解物理世界以及規劃多步驟任務,並將低階的動作執行交由視覺-語言-動作(VLA)模型處理。

新一代模型整合了 Gemini Live API,透過雙向串流端點大幅降低延遲。這讓機器人能夠在執行動作的同時同步進行思考,擺過去常見的「停頓與思考」延遲感。Google DeepMind 也與波士頓動力(Boston Dynamics)合作展示相關應用,透過 Spot APIs 指揮 Spot 執行拿取爆米花等互動任務。

Google 以 Gemini Robotics ER 2 打造反應敏捷的智慧機器人,能邊做邊想、告別停頓

Google 以 Gemini Robotics ER 2 打造反應敏捷的智慧機器人,能邊做邊想、告別停頓

精準掌握任務進度與時間點

機器人過去面臨的一大難題是「如何判斷任務已經完成」。Gemini Robotics ER 2 在影片理解與進度追蹤上有顯著躍升,帶來兩大核心能力:

  • 連續進度分類(Progress Classification):透過分析影片畫面的五個階段(0% 至 100%),讓機器人擁有即時的現場情境意識,能在發生失誤時即時調整或重試,無須重啟整個工作流程。
  • 精準時刻尋找(Precision Moment-Finding):能夠以高達 91.3% 的準確度和極低的時間誤差(0.96 秒平均絕對距離),精準鎖定關鍵事件發生的影格(例如倒咖啡的最佳停止時機),以次秒級的反應速度確保操作安全。

Google 以 Gemini Robotics ER 2 打造反應敏捷的智慧機器人,能邊做邊想、告別停頓

多機協作與強化的安全機制

單一機器人難以應付所有環境需求,Gemini Robotics ER 2 因此支援多機器人協作,讓不同型態的機器人(如輪式機器人與雙足人形機器人)透過共用的語意理解來互相交接並完成複雜任務,例如串聯 Apptronik 的 Apollo 2 與 Franka F3 Duo 共同作業。

此外,在安全性方面,新模型在「安全指令遵循」與「人類鄰近度」評測中表現優異。當偵測到人類靠近時,人形機器人能夠自動暫停,並在區域安全後自動恢復作業,大幅提升人機協作的安全性。

目前 Gemini Robotics ER 2 已透過 Gemini API 與 Google AI Studio 向開發者全面開放,並在 Gemini Enterprise Agent Platform 提供私人預覽。

資料來源:Google Blog

ycr
作者

PC home 雜誌、T 客邦編輯,也負責 T 客邦影新聞 YouTube 頻道影音製作。關注 AI 相關應用、產業趨勢等消息,並有軟體教學報導。(大頭貼為 AI 生成)

發表回應
謹慎發言,尊重彼此。按此展開留言規則