Gemini Robotics 2 模型族实现全身智能控制
DeepMind 发布 Gemini Robotics 2 系列,含 VLA、ER 2 和端侧模型,实现人形机器人全身智能控制与多步任务规划。ER 2 已通过 Gemini API 开放,端侧模型支持快速适配与多机协同。
发生了什么
2026年7月30日,谷歌 DeepMind 发布 Gemini Robotics 2 系列模型,包含视觉-语言-动作(VLA)模型、具身推理模型 ER 2 和端侧模型,首次实现人形机器人从脚到指尖的全身智能控制。系列针对不同环节分工:VLA 执行动作,ER 2 负责规划,端侧模型专注于本地快速适配。
核心能力
ER 2 可规划持续数分钟、上百次决策的多步任务,作为机器人的高层规划器。端侧模型仅需不到 200 个示例,在几小时内适配全新机器人硬件,大幅降低定制门槛。系列还支持多机器人协作,不同类型机器人可协同完成单机难以完成的复杂任务。随模型一同推出的 ASIMOV-Agentic 安全基准让 ER 2 在有人靠近时自动触发安全停止。
对开发者意味着什么
ER 2 已通过 Gemini API 和 Google AI Studio 开放,开发者可直接集成高层任务规划。端侧模型的少样本特性可加速机器人原型迭代,但多机器人协作场景需要额外解决分布式协调与通信容错。ASIMOV-Agentic 基准能用于测试流程,但其具体评估指标尚未公开。
当前边界
VLA 和端侧模型的许可证、定价及开放时间尚未说明,支持的硬件平台、操作系统与仿真环境也未提及。端侧模型所需的最低计算资源(如 GPU 或 TPU 规格)不明。安全基准的测试场景与开源状态未披露,早期合作伙伴的提供方式和后续公开计划仍需等待详细信息。



