One Brain, Any Body: Google DeepMind's Keerthana on Gemini Robotics 2, Cross-Embodiment & Humanoids
Cognitive Revolution "How AI Changes Everything" · 2026-10-05

Google DeepMind 的 Kanishka 说机器人还在 GPT-2 阶段:能跑赢博尔特,但叠衣服、跨机型通用都还做不到。
人形机器人跑得比博尔特快、视频全网疯传,但 Google DeepMind 的 Gemini Robotics 研究负责人说,脚速根本不是机器人有没有用的瓶颈。她给整个行业的进度打分:还停在 GPT-2。这期讲清楚了三件事——为什么跑步这类技能在仿真里最好练、Gemini Robotics 三个模型各自干什么、以及机器人真正走进家庭还卡在哪。
跑赢博尔特,其实是最容易的那部分
中国那场机器人运动会刷屏时,Kanishka 的爸爸和她在印度的朋友都在转,但她的判断和大众相反:跑步是仿真最容易练的技能,不是机器人有没有用的关键。
- 跑步、走平路这类任务在仿真里最好练,因为地面和墙都是刚体,接触模型简单,可以整机训练;而叠衣服难,因为布料有摩擦、会变形,仿真一碰接触就崩。
- 脚速不是瓶颈。Kanishka 的原话是:我和我很多朋友都是很有产出的人,但我们都不比博尔特跑得快——机器人也一样,跑得快不等于有用。
- 她推测这些跑步机器人用的是运动模仿加强化学习训出来的控制器,可能还带点导航,但基本跳过了高层推理,纯粹是"速度演示"。
Gemini Robotics 拆成三个模型:一个大脑、一个动作、一个小号随身版
Google 今夏放出的这套东西分三层,像一块三层蛋糕:最上面负责想,中间负责动,最下面塞进机器人本机。
- Gemini Robotics ER 2 是"系统 2 大脑",基于 Gemini Flash,负责通用推理和场景理解,已经开放 API,开发者可以像给数字 Agent 定义工具一样,给它定义机器人能做的动作。
- Gemini Robotics 2 是 VLA 动作模型,把 ER 2 的高层指令翻译成机器人关节动作,现在能控制从手指到脚的整机,支持多种机型,但只对受信任测试者开放。
- On-Device 版是塞进机器人本机的小模型,不依赖云端,能力接近大版本但体积小得多;128K 上下文约等于 3 分钟记忆,Kanishka 建议用文本摘要压缩历史,而不是全存图像。
为什么说机器人还在 GPT-2 阶段
Kanishka 承认进度比她预期快,但坚持整个领域还没到 GPT-3,卡在两个地方:少样本学习和跨机型通用。
- GPT-3 的标志是少样本学习真正好用,而机器人现在只能对一小部分任务做到"看一遍就会",比如抓放;换成"演示一遍怎么扎垃圾袋",还早得很。
- 跨机型是 GPT 从没遇到过的问题。同一个模型换台机器人就可能完全失灵——GPT 在 Mac、Linux、手机上行为一致,机器人做不到,这说明还没有真正的"通用大脑"。
- 通用性和精通度是两条正交的轴。做窄 AI 也能把一两件事做到极致,但做第 N 件事的成本和第一件一样高;先做通用基线,再微调到精通,才是 LLM 已经验证过的路径。
带走一句话
"我和我很多朋友都是很有产出的人,但我们都不比博尔特跑得快。"
- 如果你在做机器人或具身 Agent,优先把 ER 2 当"高层大脑"接进现有系统,用 API 定义工具让它调度,而不是自己从零训一个端到端模型——它已经开放,且能直接复用 Gemini 的工具调用能力。
- 评估机器人任务时,别只看成功率,先看任务对失败的容忍度:LLM 里 50% 成功率还能用,机器人掉个东西可能就摔坏了,所以 pick-and-place 这类可容错任务会先落地,精细操作要等更久。
