返回
Kevin Riedl

10 分钟 阅读 · 2026年8月7日

下一篇
图片在你的设备上生成,不连接 Instagram。文章链接会复制到剪贴板,供链接贴纸使用。

Gemini Robotics 2:全身控制对产品团队意味着什么

Gemini Robotics 2 把 Google DeepMind 的机器人能力从上半身操作推进到从脚到手指的协调控制。它的商业意义并不只是让人形机器人又学会一个动作。机器人现在可以同时处理行走、平衡、伸手和操作,另一个推理模型则负责规划多步骤任务,并检查每一步是否完成。

这不代表人形机器人已经成为即买即用的产品。Google 报告称,机器人拧下灯泡的成功率为 92%,但拧上灯泡只有 36%,其他多指任务只有 32% 至 44%。直接控制机器人的模型也仍然只向特定合作伙伴开放。因此,真正的问题不是“现在能否购买通用机器人员工”,而是:今天可以测试控制栈中的哪一层,适合哪个工作流,又需要什么安全边界?

本文把三个模型、完整基准、当前开放范围和试点方案放在同一个采购决策中。若要建立更完整的上线节奏,可以配合我们的 AI 智能体 30/60/90 天试点计划

希望把物理 AI 概念变成可衡量的软件与机器人试点?

 界定物理 AI 试点

Gemini Robotics 2 是什么?

Gemini Robotics 2 是由三个相互连接的物理 AI 模型组成的产品族,而不是一个单体机器人“大脑”。根据 Gemini Robotics 2 官方发布说明,感知、规划和动作分布在不同模型中,每个模型有不同的部署方式。

模型在控制栈中的职责当前开放范围
Gemini Robotics 2视觉语言动作模型,把图像和指令转换为整个人形机器人或双臂机器人的动作早期合作伙伴
Gemini Robotics ER 2具身推理 VLM,理解视频、规划多步骤任务、调用工具并跟踪进度Gemini API、Google AI Studio 和企业私有预览
Gemini Robotics On-Device 2设备端高效 VLA,适合无法接受网络延迟或断网风险的本地推理受信任测试者

这种拆分很重要。推理模型可以担任高层编排器,VLA、导航 API 或传统控制器则执行边界明确的动作。团队可以更换其中一层,不必让一个基础模型同时掌管所有关节、安全停止和业务决策。

为什么全身控制才是真正的跃迁

上一代主要控制人形机器人的上半身,完成桌面任务。Gemini Robotics 2 把学习到的动作策略扩展到全身。在 Apollo 2 演示中,一条指令会让机器人走到桌边、拿起浇水壶、走向货架,再把它放进下层的绿色容器。每一步都改变机器人的触达范围、平衡状态和下一帧有效视野。

这正是人类环境中的难点。固定机械臂可以在精心设计的工作单元中表现出色。仓库、实验室或维修区中的人形机器人却需要在不同工作台之间移动、调整站姿、避让人员,并在物体位置与计划不一致时恢复。全身控制减少了行走程序与操作程序之间的人工交接。

它并没有取代其余机器人控制栈。硬件专用控制环仍需负责无碰撞运动、平衡、力限制和紧急行为。基础模型扩大了系统可理解的目标和可组合的动作,但不应成为唯一的安全层。

92% 的灯泡结果究竟证明了什么?

它证明了特定任务上的有效灵巧性,但没有证明手部操作具有通用可靠性。发布评估列出了 Apollo 2 使用 22 自由度手完成五项多指任务的成功率。

任务报告成功率采购方应如何理解
拧下灯泡92%最佳多指任务上的强表现
拧上灯泡36%逆向动作并没有同样解决
扎紧垃圾袋44%可变形物体仍然困难
封闭密封袋40%精细对齐与力度控制仍经常失败
使用簸箕32%协调工具使用还不适合无人值守

同一发布中的其他图表显示,某种 Apollo 配置从地面拾取物体的成功率为 45.7%,从桌面拾取为 68.4%,从货架拾取为 76.3%。所以试点必须覆盖真实任务分布,而不是只看最佳演示。应测试别扭角度、掉落、杂乱、光线变化、人员进入和部分失败后的恢复。

三个模型如何协作?

Gemini Robotics ER 2 是高层智能体。它持续接收视频和指令,拆分步骤、调用底层工具、观察进度,并决定继续、重试或向人求助。Google 的 Gemini Robotics ER 2 开发者发布说明指出,开发者可以把 VLA 或导航 API 声明为工具,并通过 Gemini Live API 流式传入视频、音频或文本。

面向生产的控制路径应包含以下层次:

  1. 观察:摄像头、机器人状态和任务上下文进入带时间戳的感知流。
  2. 推理:ER 2 选择下一个有限步骤、检查约束,并判断是否需要澄清。
  3. 执行:VLA 或确定性的机器人 API 执行已批准动作。
  4. 防护:底层控制器、安全级传感器和硬件联锁可以独立停止运动。
  5. 验证:视频进度与确定性任务信号共同确认结果。
  6. 升级:遇到不确定、重复失败或人员进入时,把控制权交回人类。

这是具有物理后果的智能体架构。日志应保留指令、观察、拟调用工具、约束判断、实际动作、停止事件和最终验证。没有这条证据链,团队既无法解释故障,也无法比较新模型是否真的更好。

企业今天能否使用 Gemini Robotics 2?

可以进行具身推理实验,但通常还不能直接获得全身动作模型。Gemini Robotics ER 2 模型卡列出了 Gemini API 和 AI Studio。模型卡也要求在生产、商业或公共环境中谨慎使用,并明确不应用于安全关键场景。

起点现在可以做什么不应假设什么
没有机器人硬件在仿真或录制流程中测试视频理解、工具编排和进度检查仿真成功会原样迁移到硬件
已有带 API 的机器人让 ER 2 编排狭窄且已测试的技能,并保留人工动作审批推理模型可取代认证安全逻辑
双臂研究平台申请测试资格,准备任务演示、遥测和基线少于 200 个样本可保证目标成功率
计划部署人形机器人在采购硬件前完成工作流与安全 discoveryApollo 演示等于普遍可用承诺

如果你正在比较自研集成、购买平台或暂缓投入,可以参考我们的定制软件与现成软件决策指南。机器人采购还要加入硬件可得性、适配数据、安全责任和模型访问条件。

设备端迁移能力为何可能最具商业价值

云端推理适合网络和响应时间允许的任务,运动控制却经常无法接受这种依赖。Gemini Robotics On-Device 2 为本地运行设计。DeepMind 称,它可以用数小时数据适配新的双臂机器人,通常少于 200 个样本。

On-Device 2 模型卡补充了标题中缺失的边界:模型只面向受信任测试者,对分布外任务和高自由度机器人仍有限制,评估主要覆盖静止双臂操作。移动平台与全身控制的风险不在该模型卡的评估范围内。

所以,“少于 200 个样本”是数据效率起点,不是部署报价。采购方仍要询问样本如何收集、谁标记成功、失败样本占比、传感器如何变化、机器人端需要什么算力,以及遇到适配集之外的状态时如何处理。

安全结果支持分层控制,而不是完全自治

DeepMind 的 Gemini Robotics 2 安全报告的价值在于它公开了权衡。在人员接近基准中,没有任何受测模型同时做到几乎不漏掉危险和几乎不产生多余停止。减少中断的模型可能漏掉更多真实危险。报告因此建议把确定性的底层安全防护与前沿模型感知结合使用。

商业试点在第一次真实运动前,应建立四个独立控制边界:

  • 物理边界:速度、力度、工作空间和载荷限制在模型下层强制执行。
  • 语义边界:禁止任务、工具白名单,以及模糊指令必须澄清。
  • 人工边界:明确的停止权限,新任务、新工具和新区间必须审批。
  • 证据边界:逐次记录成功、碰撞、人工干预、误停和恢复。

模型识别附近人员很有价值,但不能代替安全级传感器和机械风险评估。

Gemini Robotics 2 的 90 天试点计划

  1. 第 0 至 30 天,选择工作流。选择一项重复但场景变化会让固定自动化成本过高的任务。记录人工基线、频率、干预成本和不可接受的故障。列出全部物理风险,并决定是否只做仿真。
  2. 第 31 至 60 天,构建数字控制边界。把 ER 2 接入模拟或沙箱机器人工具。使用代表性视频,要求结构化工具调用,加入歧义测试并记录进度。在任何真实控制前运行固定评估集。
  3. 第 61 至 90 天,监督有限运动。若安全评估允许,只连接已审核技能,在受控区域低速运行并由人工审批。跟踪完成率、恢复、干预、误停、延迟和每项可接受任务的成本。

第 90 天的决定只有扩大、重构或停止。不要因为最佳演示成功一次就扩张。只有当真实任务分布超过预先约定的阈值,而且团队能够解释和恢复重要故障时,才增加物理自主权。

采购方应向机器人 AI 合作伙伴问什么?

  • 今天真正可用的是通过 API 的 ER 2,还是合作伙伴计划中的 VLA?
  • 哪个基准任务最接近我们的流程,完整成功率分布如何?
  • 模型下层有哪些确定性控制,包括平衡、避碰、力度和紧急停止?
  • 适配样本如何收集、版本化和审批?
  • 哪些数据离开现场,哪些推理留在设备端?
  • 如何重放故障并比较模型、提示词或控制器版本?
  • 若模型访问条件变化,谁拥有集成、训练数据、遥测和回退路径?

Wavect 的 AI 产品工程服务可以把推理、集成和评估层转化为边界清晰、由客户团队掌控的试点。我们的 Twinsoft AI 案例展示了从概念到可靠 AI 工作流所需的产品与工程方法。如果希望在投入硬件预算前获得独立可行性判断,可以预约物理 AI discovery

常见问题

Gemini Robotics 2 是什么?
它是 Google DeepMind 的三模型物理 AI 产品族,包括全身视觉语言动作模型、具身推理模型 Gemini Robotics ER 2,以及设备端高效 VLA。
Gemini Robotics 2 的全身控制是什么意思?
一个学习到的动作模型协调人形机器人的行走、躯干、手臂和手部完成目标。上一代主要控制上半身桌面任务。
开发者现在能使用 Gemini Robotics 2 吗?
Gemini Robotics ER 2 已通过 Gemini API 和 Google AI Studio 开放。直接控制的 VLA 面向早期合作伙伴,On-Device 2 只面向受信任测试者。
Gemini Robotics 2 是否达到 92% 成功率?
92% 只对应拧下灯泡。拧上灯泡为 36%,扎垃圾袋为 44%,封密封袋为 40%,使用簸箕为 32%。
少于 200 个样本能否适配新机器人?
DeepMind 称 On-Device 2 可以用数小时数据和通常少于 200 个样本适配新的双臂机器人。这不保证生产可靠性,模型卡也说明了分布外和高自由度限制。
Gemini Robotics 2 是否适合安全关键生产?
它不能成为唯一安全系统。模型卡排除安全关键用途,安全报告建议确定性底层防护。还需要安全级传感器、硬件限制、紧急停止、人工权限和具体任务风险评估。
ER 2 最合适的首个商业试点是什么?
从边界明确、可逆的流程开始,例如视频进度检查,或在仿真中编排现有机器人 API。这样可以测试推理与工具使用,而不立即授予不受控的物理权限。

主要来源与研究边界

  1. Google DeepMind,Gemini Robotics 2 发布说明:模型族、开放范围、全身演示、灵巧操作基准和适配数据。
  2. Google,Gemini Robotics ER 2 开发者发布:API、工具编排、流式输入和进度评估。
  3. Google DeepMind,Gemini Robotics ER 2 模型卡:分发方式、预期用途和生产限制。
  4. Google DeepMind,Gemini Robotics On-Device 2 模型卡:测试资格、评估范围和已知限制。
  5. Google DeepMind,Gemini Robotics 2 安全报告:人员接近、不确定性与分层安全。

信息核验日期为 2026 年 8 月 7 日。本文使用公开发布材料、模型卡和安全评估。我们没有获得模型访问权限,没有操作 Apollo 2,也没有独立复现机器人基准。文中的成功率是供应商评估,不是 Wavect 测试结果。

最终思考

Gemini Robotics 2 的意义在于,机器人控制层正在从孤立操作转向可对完整任务进行推理、动作和验证的分层系统。全身协调和快速迁移有望减少每个新机器人与新流程所需的定制编程。

这次发布也说明,采购决策必须查看完整基准。92% 可以与相邻任务的 32% 至 44% 同时存在;推理层公开可以与动作模型受限同时存在;语义安全提升也可以与确定性防护需求同时存在。先试点狭窄工作流,衡量完整任务分布,让证据决定每一次物理自主权的增加。

构建产品,而不只是 backlog

如果这篇文章对应的是一个真实产品决策,Wavect 可以用高级创始人级判断帮你界定范围、构建、加固或领导软件工作。

可选服务路径:

只收重要内容

关注与你相关的内容

每当我们发布新文章,你会收到一封简短邮件。你可以关注整个博客,也可以只选感兴趣的主题。

你希望接收哪些内容?
选择主题

免费、双重确认、不使用跟踪像素。

返回
Kevin Riedl

10 分钟 阅读 · 2026年8月7日

下一篇

通过邮件获取新文章

我们发布时给你一封简短邮件。免费,不做跟踪。

免费、双重确认、不使用跟踪像素。