Google Gemini Robotics ER 2 讓機器人邁向高階大腦時代:5 大突破揭密

Google 在 30 日宣布推出全新機器人 AI 模型 Gemini Robotics ER 2,這是目前 Google 最先進的「具身推理(Embodied Reasoning)」模型,可視為機器人的「高階大腦」。相比前一代 Gemini Robotics ER 1.6,新版本在連續影片理解、任務進度追蹤、工具調度以及多機器人協作能力等方面有了顯著提升。

事實陳述

Gemini Robotics ER 2 的最大突破在於導入了連續影片理解能力,使機器人能夠持續觀看攝影機畫面,即時掌握任務完成進度、判斷執行過程是否出錯,並根據環境變化隨時調整策略。此外,新模型還加入了進度分類功能,可將影片中的每一個畫面依任務完成程度分為五個階段,藉此判斷工作進行到哪裡、是否偏離流程,以及是否需要採取補救措施。

各方反應

Google 表示,Gemini Robotics ER 2 在進度分類任務中的準確率約 57.4%,優於前一代模型。另一項重要升級則是關鍵時刻辨識能力,新模型在這項測試中的準確率達 91.3%,平均時間誤差僅 0.96 秒。Google 也展示了與波士頓動力(Boston Dynamics)的合作成果,透過 Gemini Robotics ER 2 整合 Spot 四足機器人的導航 API 與機械手臂控制能力,使用者只需以自然語言下達指令,Spot 便能自主導航、尋找目標物並完成取物。

此外,Gemini Robotics ER 2 也全面提升空間理解能力,包括成功/失敗偵測、儀器讀值及視覺問答等方面。在安全性方面,新模型在人員接近偵測及安全指令遵循兩項測試中,表現均優於前一代模型。

背景補充

Google 強調,若要讓機器人在真實世界中協助人類,光具備精準的空間推理能力仍然不夠,更大的挑戰在於,機器人能否即時理解現場狀況、判斷下一步該採取什麼行動,並在執行任務的過程中,根據環境變化隨時調整策略。因此,Gemini Robotics ER 2 被定位為機器人的「高階大腦」,主要負責與人類對話、理解周遭物理環境、規劃多步驟任務,並可呼叫 Google Search 等工具取得資訊,或串接開發者自訂的函式與 API。

為了實現多機器人協作,不同類型的機器人各有所長,例如輪式機器人擅長室內導航,人形機器人則更適合跨越崎嶇地形。Gemini Robotics ER 2 可讓不同機器人共享語意理解能力,彼此分工、交接任務,共同完成單一機器人無法獨立處理的複雜工作流程。

從產業面來看,Gemini Robotics ER 2 的推出標誌著機器人技術邁向新的里程碑。這不僅提升了機器人在真實世界中的操作能力,還為多機器人協作開創了新的可能性。未來,我們可以期待更多機器人應用在工業、服務業等領域,為人類帶來更多的便利與效率。

Gemini Robotics ER 2 已透過 Gemini API(可於 Google AI Studio 使用)開放開發者;企業版則以 Private Preview 形式於 Gemini Enterprise Agent Platform 提供。對於開發者和企業來說,這是一次不容錯過的技術升級機會。

本文改寫整理自公開新聞來源,原始報導由自由時報發布。

常見問題 FAQ

Gemini Robotics ER 2 的主要功能有哪些?

Gemini Robotics ER 2 的主要功能包括連續影片理解、任務進度追蹤、工具調度、多機器人協作以及空間理解能力。

Gemini Robotics ER 2 與前一代相比有哪些改進?

Gemini Robotics ER 2 在進度分類、關鍵時刻辨識、空間理解能力以及安全性方面都有顯著改進。

Gemini Robotics ER 2 如何實現多機器人協作?

Gemini Robotics ER 2 通過共享語意理解能力,使不同類型的機器人可以分工、交接任務,共同完成複雜的工作流程。

※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。