资讯模型与产品··来源: Thenextweb·原文 →

Google DeepMind 发布 Gemini Robotics 2:单一 AI 大脑控制人形机器人全身运动

Google DeepMind 发布 Gemini Robotics 2 模型家族,首次实现从视觉到动作的全身人形机器人控制,可协调多台机器协同作业并在数小时内适配新机器人本体。系统包含三个模型层级,但在精细操作成功率和执行速度上仍存在明显短板,灯泡拧卸成功率 92%,而封口袋仅 40%。

Google DeepMind 发布 Gemini Robotics 2:单一 AI 大脑控制人形机器人全身运动
[广告位 · 上线后接 AdSense]

机械臂out!全身协调才是真未来:DeepMind这次玩大了

谷歌DeepMind刚刚扔出王炸——Gemini Robotics 2模型家族!这波直接把机器人控制技术从"局部操作"升级到"全身运动"时代。最狠的是,这套系统首次打通了从"看得到"到"动得了"的全链路,现在人形机器人不仅能走能蹲,还能在狭小空间里精准操作物体。

实测环节直接看呆:Apptronik家的Apollo 2人形机器人,听到一句"把浇水壶放进底层架子的绿色箱子里",自己就哐哐完成了整套动作——走过去、抓起来、弯腰、精准投放。DeepMind机器人负责人Carolina Parada放话:"我们要让AI杀进物理世界,打造所有机器人都能用的智能底层。"

三层架构拆解:从动手到动脑

Gemini Robotics 2其实是模型全家桶,包含三个段位:

  1. 执行层(Gemini Robotics 2):把机器人的视觉听觉信号直接转化成动作指令,专门负责动手。这代模型牛在能操控Apollo的5指22关节机械手玩打结、封口袋这些精细活,换个双指夹爪也能适配。

  2. 大脑层(Gemini Robotics ER 2):负责高端局——拆解复杂任务+实时监控进度。实测中它能边干活边调用谷歌搜索,甚至能指挥Boston Dynamics的Spot机器狗帮忙拿零食。更骚的是支持不同机器人组队开黑(比如轮式+人形搭配),现在已开放给开发者调用。

  3. 离线版(On-Device 2):没网也能跑!适配新机器人只需200个样本+几小时训练,直接破解机器人届的技能迁移难题。

翻车数据曝光:精细操作还是菜

DeepMind这次罕见自曝短板。据Bloomberg实测,拧灯泡成功率92%,但到了精细活就拉胯:Chosun Daily数据显示,扎垃圾袋成功率仅44%,封口袋更是只有40%

动作速度也是硬伤——机器人每个动作前都要"思考人生",而人类根本不用过脑子。DeepMind机器人主管Kanishka Rao坦白:"真正的灵活操作还很远,机器人学习效率被人类吊打。"这其实是行业通病,各家搞机器人基础模型的初创公司都在撞这堵墙。

安全牌怎么打?ASIMOV基准+人类检测

随着机器人开始满屋乱窜,DeepMind把安全牌拉满。Gemini Robotics ER 2号称"史上最安全",能敏锐检测人类靠近立即暂停,确认安全区没人才继续干活。

他们还搞了个ASIMOV-Agentic基准测试(名字取自科幻大佬Isaac Asimov),专门检测机器人会不会拒绝危险指令,或者主动喊人来帮忙。虽然名字中二,但针对的核心风险——机器人乱执行错误指令——确实是实打实的工程难题。

硬件供应链的魔幻现实

最尴尬的来了:谷歌只做软件不造硬件,但机器人硬件正在变敏感。Axios爆料,美国刚出台政策禁售中国产机器人,可很多能跑这套系统的机器人本体偏偏Made in China。

谷歌现在抱紧西方伙伴大腿,包括Apptronik、Boston Dynamics、Agile Robots等,还有100+测试合作方。但对手也没闲着:OpenAINvidia都在憋大招,目标都是"一个模型,通吃所有机器人"。

阶段性胜利而已

DeepMind很清醒,这次只是"里程碑"不是终点。Gemini Robotics 2确实让机器人更实用了,但也清楚告诉我们:离人类随手整理房间的水平还差十万八千里。对中国玩家来说,这既是技术对标物,也提示了本土企业在硬件制造+软硬结合上的机会窗口。


本文基于 GNews:TNW 报道, 由 AiDuo123 AI 编辑翻译改写。原文链接: https://thenextweb.com/news/gemini-robotics-2-whole-body-humanoid-control

常见问题

Gemini Robotics 2 与之前的机器人模型主要区别是什么?
之前的 DeepMind 机器人模型主要控制上半身完成桌面任务,Gemini Robotics 2 首次实现全身控制,可驱动人形机器人行走、下蹲、平衡并在狭窄空间操作物体,同时支持异构机器人协同作业。
为什么封口袋成功率只有 40% 但灯泡拧卸能达到 92%?
精细双手协调任务(如封口袋需要两手配合施力控制)比单手旋转动作(拧灯泡)复杂得多。业内普遍认为,类人灵巧操作仍是当前机器人技术的最大瓶颈,涉及触觉反馈、力控制和实时调整等多维难题。
On-Device 2 模型'数小时适配新机器人'对开发者意味着什么?
传统方法中,将 AI 能力迁移到新机器人本体可能需要数周甚至数月的数据采集和训练。On-Device 2 仅需不到 200 个示例和数小时即可完成,这大幅降低了多机型适配的时间和成本门槛,对小团队尤其有价值。
美国禁售中国制造机器人对 Gemini Robotics 2 有何影响?
Google 不制造机器人硬件,依赖合作伙伴提供本体。美国政策可能限制其在中国制造硬件上的部署,目前 Google 主要与 Apptronik、Boston Dynamics 等西方厂商合作。这对中国开发者而言,反而可能是发展本土软硬一体化方案的机会。
普通开发者现在能用 Gemini Robotics ER 2 吗?
可以。Gemini Robotics ER 2(推理层)已通过 Gemini API 和 Google AI Studio 向开发者开放,可用于多步骤任务规划、工具调用和多机器人协同场景的原型开发。
[广告位 · 上线后接 AdSense]
标签:#谷歌

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

美国父母借助 ChatGPT 协助诊断女儿罕见病:AI 医疗应用的真实案例

美国父母借助 ChatGPT 协助诊断女儿罕见病:AI 医疗应用的真实案例

一位生物技术行业从业者母亲在医生未能确诊女儿反复生病原因时,将孩子的症状和实验室检测数据输入 ChatGPT,AI 在数秒内给出可能的免疫缺陷诊断方向。这一案例折射出 AI 聊天机器人在医疗咨询中的快速普及——美国四分之一人口已用其诊断症状,但专家强调需谨慎使用并注意隐私与准确性风险。

应用与案例OpenAI
Windows 11 最新更新破坏 WSL 与 Claude Cowork 功能

Windows 11 最新更新破坏 WSL 与 Claude Cowork 功能

微软确认 Windows 11 九月安全更新 KB5124008 导致基于 Hyper-V 的 Linux 虚拟机中 Plan9 主机文件夹共享失效,直接影响 WSL 和 Claude Cowork 无法读取共享文件夹,应用可能显示"未挂载 Plan9 驱动器共享"错误。微软已将其列为已知问题并正在修复,但暂无补丁或临时解决方案。

行业动态微软
Anthropic工程师警告AI或致人类灭绝 为何仍加速开发

Anthropic工程师警告AI或致人类灭绝 为何仍加速开发

Anthropic研究员Jacob Coxon因担忧递归自我改进AI系统的风险而辞职,该公司安全主管随后表示确信AI可能导致人类灭绝概率超10%。尽管以安全为使命,Anthropic仍在推进自主智能体开发并筹备估值2万亿美元IPO,其"谨慎推进反而更危险"的逻辑引发争议。

行业动态Anthropic
Meta 因 AI 训练数据与人脸识别系统遭集体诉讼

Meta 因 AI 训练数据与人脸识别系统遭集体诉讼

美国伊利诺伊州和加州的多名用户向 Meta 提起集体诉讼,指控其未经同意使用 Facebook 和 Instagram 照片训练未发布的人脸识别系统 NameTag 及生成式 AI 模型 Emu 和 Muse Image,违反州生物识别隐私法。诉讼索赔金额可能达数十亿美元,这是 Meta 继 2020 年和 2024 年生物识别数据和解案后再次面临重大隐私诉讼。

政策与安全Meta