星途科讯 2小时前
DeepMind发布Gemini Robotics 2,赋能多机协同与人形控制
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

Alphabet 旗下人工智能研究实验室 Google DeepMind 今日正式发布 Gemini Robotics 2 系列模型,该系列专为驱动人形机器人优化,旨在实现多台自主机器协同完成复杂任务。据官方介绍,新模型可自动化处理包含数百个步骤的家务劳动。

突破 " 双系统 " 架构局限

现有人形机器人多采用 " 双系统 "AI 架构:由具身推理算法制定高级计划,再交由视觉 - 语言 - 动作(VLA)模型转化为电机底层命令。Gemini Robotics 2 系列的核心亮点在于其具身推理模型—— Gemini Robotics ER 2。

ER 2 支持用户通过自然语言下达指令,能够规划并执行耗时数分钟、包含数百个步骤的长程任务。该模型具备工具调用能力,可访问外部云服务(如 Google 搜索)以澄清模糊指令。此外,ER 2 能将冗长任务拆解并分配给多个机器人并行处理,从而显著提升执行效率。

针对任务执行中的容错需求,ER 2 引入两项关键功能:一是基于摄像头画面的进度跟踪,若执行出错,模型可识别最后正确步骤并从断点继续,无需从头重来;二是更精准的任务完成判定,帮助机器人更快进入下一环节,优化纠错流程。

Google 工程师 Steven Hansen 和 Peng Xu 在官方博客中表示:" 通过观看连续视频流,机器人现在可以跟踪进度、实时调整,并确切知晓何时进入下一步。"

两款 VLA 模型协同作业

在 ER 2 生成执行计划后,指令将被发送至系列中的两款 VLA 模型之一,由其转化为机器人的底层控制信号。

首款模型为 Gemini Robotics 2。与早期版本仅控制手部不同,新模型可操控人形机器人的全身组件,通过优化重心最大限度降低跌倒风险,并支持更广泛的机械手类型。

第二款模型为 Gemini Robotics On-Device 2,专为在人形机器人机载计算机上直接运行而设计。DeepMind 表示,该模型仅需数小时训练即可适配新型人形机器人硬件。

开发者访问与安全基准

目前,开发者可通过 Google Cloud、Gemini API 和 Google AI Studio 访问 ER 2 模型。伴随模型发布,DeepMind 同步推出了名为 ASIMOV-Agentic Benchmark 的新具身 AI 安全基准,用于评估人形机器人在避免碰撞及其他潜在风险方面的能力。

【星途科讯 图文丨欧阳布布 首发于 ZAKER 科技,转载请注明出处】

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

deepmind 机器人 google zaker 云服务
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论