● Feed Monitor · 每天替你盯顶级英文播客

Why Robotics Still Isn't Solved - But Could Be Soon | YC Paper Club

Y Combinator · 2026-08-09

Why Robotics Still Isn't Solved - But Could Be Soon | YC Paper Club
一句话摘要

Stanford、Whimo 团队用“多尺度记忆”“自举推理”“模拟到现实”三招,让机器人能自适应长任务、解释决策、零样本用新工具。

机器人长任务推理仿真训练
结构化解读

机器人缺的不是大模型,而是一层皮肤

这场 YC Robotics Club 的讨论,把“机器人何时走出 demo”拆成了一组更具体的工程问题。嘉宾包括斯坦福 PhD、曾在 Physical Intelligence 实习的 Marcel,Waymo 任职的斯坦福 PhD 学生 Milan,以及 Rerun 联合创始人兼 CEO Niko;讨论还延伸到 Tyler Lum 的 sim-to-real 研究,以及 YC 公司 General Instinct 对世界动作模型基础设施的实践。有人讲记忆,有人讲仿真,有人讲客户现场,但他们都在解释同一件事:机器人不是把模型接到机械臂上,就自动获得了在现实中持续工作的能力。

这期回答了 7 个问题:

  1. 机器人已经能做出炫酷 demo,为什么仍然无法可靠地完成日常工作?
  2. 为什么没有记忆的机器人,会把洗碗和做三明治做成死循环?
  3. 具身推理是不是越详细越好,还是应该主动删掉大部分“思考”?
  4. 一套策略如何不为每种工具重训,仍能零样本完成新任务?
  5. 为什么先用遥操作赚钱,反而是机器人创业更稳的起点?
  6. 仿真训练的灵巧策略,为什么会卡在水、拉链和被遮挡的小物体上?
  7. 世界动作模型怎样从昂贵的多步扩散,变成机器人跑得起的实时系统?
1. 机器人真正的缺口不是更大模型,而是感知皮肤

被问到为何“明年机器人就解决了”的承诺一再落空时,主持人没有先怪算法,而是把问题指向身体。今天较好的配置,可能也只是每个指尖装一个“coin FT”力传感器,再配一颗腕部相机;这已算前沿。可人的身体不是这样工作的:神经末梢遍布皮肤,能同时感到法向力,也就是按压有多重;切向力,也就是物体是否在横向打滑;还包括湿度、温度、振动,甚至能大致判断摩擦系数。

这套能力在日常里很不起眼。手伸进背包找充电器时,人不必看见包内物品,摸到线材、硬壳、布料的质感和形状,就能知道里面有什么。机器人却往往只能从镜头里“看”物体,再让两根手指去碰它。主持人的结论很直接:"And so, there's no way we have robots that can do that now because we don't have an epidermis."(所以,机器人现在根本不可能做到这一点,因为我们没有给它们一层表皮。)

这意味着,瓶颈不只是把视觉—语言—动作模型继续做大。模型要决定该抓多紧、杯子是否在滑、布料是否潮湿,前提是这些状态得先进入系统。感知带宽不够,动作策略再聪明,也像蒙着手套修钟表。边界也很清楚:即使视频世界模型能在模拟环境里规划,它们仍可能不尊重真实物理;仿真到真实世界的差距,至今没有被真正填平。

2. 没有记忆的机器人,会把一次失误变成无限循环

Marcel 被问到为何要给视觉—动作策略加入长短期记忆时,先摆出一个时间尺度的落差。Physical Intelligence 训练出的灵巧任务里,最长大约两分钟:解锁积木、整理衣物、做花生酱三明治,已经足够惊艳。但完整做饭、收拾一间卧室、做完再清理厨房,都是数十分钟起步。机器人若每一时刻只看当前画面,就没有“我做到第几步”的概念。

无记忆策略的失败很像卡住的录音机。洗碗机器人不知道自己已经洗了多久,会持续冲洗;做 grilled cheese 的机器人不知道食物已在锅里多久,最后把三明治烤焦。更糟的是,抓筷子失败或拉不开冰箱门时,它会重复同一个动作。Marcel 描述这种状态:"they are going to keep making the same mistake over and over and they are incapable of reacting to the mistake they did."(它们会一遍又一遍地犯同一个错,而且无法对自己刚犯的错作出反应。)

MAM 的做法是分层:低层策略读取密集的短期视觉记忆,负责接触和抓取;高层策略读取压缩成文本的数分钟长期记忆,负责判断下一步。于是抓筷子第一次偏高后,机器人会把手放低再试;从一侧开冰箱失败后,会换另一侧。这意味着长程任务真正难的,未必是单次抓取,而是维护“刚才发生了什么、失败意味着什么”的内部状态。代价是,长期记忆该存什么仍需人工预设和标注;文本便于监督、调试,却未必是最接近人类记忆的形式。

3. 具身推理越全未必越强,关键是只保留能预测动作的信息

Milan 讨论机器人是否该像语言模型那样,每一步都显式输出一长串推理时,先指出一个常被忽略的问题:正确的描述,不一定能帮助动作。机器人可以罗列画面中的桌子、杯子、障碍物和机械臂位置;这些文字未必错误,却可能把真正重要的信号淹没。特别在自动驾驶里,车在空路上直行时,每帧都重新规划、重做反事实分析,本身就是冗余,还会吃掉延迟预算。

他的 R&B Encore 让一个 reasoning proposer 生成多种候选推理,再由 reasoning validator 筛选。筛选标准有三个:是否简洁,是否不是空话,以及最关键的——能否预测接下来的动作。在机械臂任务中,“移动意图 + 夹爪位置”这类推理有帮助;把场景里所有物体都复述一遍的感知式推理,反而干扰策略。该方法覆盖操作、足式导航、自动驾驶三类场景,以及从 10 亿到 300 亿参数的视觉—动作模型。Milan 的概括是:"selective reasoning is way more important than exhaustive reasoning. Even if that reasoning is valid, it's not necessarily useful."(选择性推理远比穷尽式推理重要。即使一段推理是正确的,也不代表它有用。)

这意味着,具身推理不是为了让机器人看起来“会思考”,而是训练时的一种信息预算:只留下会改变动作的内容。面对自动驾驶的实时要求,团队还提出 action forcing,让推理在训练时提供增益,部署推理时则可移除。边界在于,这不等于规划、反事实、感知推理都该删除;不同身体形态,要重新找出各自真正有效的推理类型。

4. 通用灵巧不必为每个工具重训,目标轨迹就能充当提示词

Tyler Lum 解释为何不从遥操作模仿学习出发,而是把工具操作统一成“目标到达”问题时,给出了另一种拆法。遥操作要让人精确演示多指手操作,既慢又难:人和机器人身体不一样,力反馈也有限,连简单的手内旋转都需要谨慎控制。于是他的团队干脆在 GPU 加速模拟器中并行运行数万个机器人,以约实时 1,000 倍的速度积累经验,几天收集数十年的交互数据。

策略训练时只看随机生成的原始物体和随机目标,不学习“刷子”“锤子”“扫地”这些任务标签。它在 60 Hz 下同时控制 22 自由度手和 7 自由度机械臂,核心要求只是:把物体从当前姿态移动到目标姿态。部署时,人类视频不提供机器人动作,也不用于微调;系统借助 FoundationPose 和 SAM,从视频提取物体应遵循的目标姿态序列。Tyler 特别强调:"It only specifies the desired object trajectory for the frozen policy to track."(它只负责指定冻结策略需要追踪的目标物体轨迹。)

这意味着,一套系统可拆成两层:底层是一次训练的连续控制能力,上层是部署时替换的目标轨迹,后者很像给冻结策略输入提示词。团队用同一策略测试了 12 类训练中没见过的工具和目标行为,新任务无需再开一轮训练。反面是,这只把难题从“重训策略”转为“可靠地产生目标轨迹”;论文里轨迹来自人类视频,如何自动生成普适目标,仍没有现成答案。

5. 机器人公司的护城河不在通用模型,而在客户现场的运营闭环

Rerun 联合创始人兼 CEO Niko 被问到机器人创业该从哪里开始时,给出的路线并不浪漫:找一个客户愿意付费的单点问题,先拿现成硬件和遥操作交付,再逐步训练模型、替换人工。他甚至建议创业者先别急着做通用基础模型。原因是实验室里能列出的失败模式,远少于客户现场会出现的失败模式。"the physical world is brutal right everything that you do is going to break"(物理世界非常残酷:你做的每一样东西都会坏。)

Niko 用一个纸飞机工厂的假设说明部署会逼出什么问题:商业上到底需要每天产出多少架完美纸飞机?失败品能否自动分拣?遥操作员是否要练 20 小时才达标?换一个纸盘,是否就能让抓纸失败率下降 50%?客户真正重视的,可能是新纸飞机款式的上线速度,而不是某个模型榜单分数。这些变量决定数据该怎么采、任务该如何切分、哪些环节值得自动化。

他观察过所有真正交付产品的机器人公司:办公室里都有客户现场的复制品,用来高频测试。这意味着护城河不是一份通用权重,而是客户环境复刻、失败分类、数据回流、维修支持和快速迭代构成的运营闭环。能够稳定交付的公司往往“100% supply constrained”——需求不是主要问题,制造、部署和支持能力才是。先遥操作不是逃避自动化,而是避免在不知道客户为何付费前,盲猜数据规模和模型路线。

6. 仿真再快,也绕不过看不见和模拟不了的现实

Tyler 被问到 sim-to-real 策略怎样扩展到更多真实物体时,没有把仿真说成万能解。他的系统在刷子、锤子等新工具上表现出零样本灵巧性,但故障分析显示,超过一半、约 60% 的失败纯粹来自物体姿态跟踪。小物体尤其麻烦:机械手一遮挡,追踪器就看不清;重工具也更容易掉落。长柄刷子特征多、画面里更容易辨识,小记号笔却可能随时被手挡住。

这揭示出一个现实:控制策略也许知道“若物体在这里,该怎么转”,但它不一定知道物体此刻究竟在哪里。更宽的边界来自物理本身。Tyler 明确列出,水、拉链、打开一罐 Bubbly 这类对象和过程,目前不在模拟能力范围内:"That kind of stuff I think is not currently in the realm of simulation."(我认为那类事情目前还不在仿真的能力范围之内。)

这意味着,仿真产生的灵巧先验不会自然覆盖开放世界。要让策略继续工作,系统得在真实环境中持续改进,同时补齐遮挡、形变和接触状态估计,还要具备“不该相信模拟器时就停下来”的安全机制。团队也遇到机械臂持续扭转、最后缠死的失败模式,Tyler 直接承认不确定确切解法。仿真可以让机器人快速学会“怎么玩”,但水、软物、遮挡和结构变化会逼着它重新面对现实经验。

7. 世界动作模型若跑不进实时硬件,再强也难以商业化

General Instinct 的 Bill 和 Guan Ming 讨论世界动作模型时,先区分了它和普通视觉—动作模型的思路。后者根据当前画面直接预测动作;世界动作模型的中心是 diffusion transformer,同时预测未来画面和未来运动学,再据此产生动作。它像先在脑中预演“这个瓶子松手后会如何下落”,再决定手该怎么动。预测未来物理,理论上能给动作更多约束,但账单也很吓人。

他们提到,DreamZero 一类模型即使优化后仍要两张 GB200 才能运行,每张约 7 万美元。常规推理为了生成一个动作块,要做约 50 步、甚至 100 步 flow matching;每一步都在从噪声逐渐还原未来状态。团队把这段过程蒸馏为 1 到 2 步:"we made it to down to one or two steps which is immediately 50 times of speed up"(我们把它降到了 1 到 2 步,这立刻带来 50 倍加速。)

他们还缩小 VAE 与 DiT,把视频和动作的 DiT 分开,并尝试让动作 transformer 通过 cross-attention 读取视频 transformer 的隐藏世界表征,而非每次完整解码未来视频帧。这意味着下一轮竞争不只是谁预测未来更像真的,而是谁能把“想象未来”压缩到实时硬件跑得动。边界是,丰富世界表征究竟该保存在像素、潜变量、mask 还是 flow 中,尚无定论;不同媒介要在物理信息、动作质量和延迟之间重新算账。

把这 7 条放在一起看

“机器人真正的缺口不是更大模型,而是感知皮肤”和“机器人公司的护城河不在通用模型,而在客户现场的运营闭环”,表面上一个讲传感器,一个讲商业,实际上都在反对同一种错觉:以为模型在屏幕上完成一次动作,就等于系统获得了可靠能力。

没有皮肤,机器人不知道杯子是不是在滑;没有记忆,它不知道自己是否已经把盘子洗完;没有选择性推理,它会把计算耗在与动作无关的复述上;没有可靠目标轨迹,再通用的灵巧控制也不知道下一步该去哪。即便策略在仿真中练出漂亮动作,遮挡、水、拉链和机械臂缠绕仍会把它拉回现实。即便世界动作模型能预测未来,两张约 7 万美元的 GB200 也会让它难以进入大规模部署。

所以,判断一个机器人方案时,不妨少问一句“它的 demo 有多酷”,多问几句更扫兴但更关键的话:它碰到失误后会不会改?看不见物体时知道自己不知道吗?客户现场换了一个托盘、一个光照、一种物料后,团队多久能定位问题并修复?如果答案仍停在模型参数量和演示视频上,那么它距离“会做”或许不远,距离“不可靠地做”却还很近。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02