● Feed Monitor · 每天替你盯顶级英文播客

Why Robotics Still Isn't Solved - But Could Be Soon | YC Paper Club

Y Combinator · 2026-08-09

Why Robotics Still Isn't Solved - But Could Be Soon | YC Paper Club
一句话摘要

机器人专家承认2026年“机器人元年”又跳票了,卡在物理建模、触觉、数据采集四堵墙上;斯坦福团队用“记忆”让机器人学会纠错,不再重复犯错。

机器人具身智能VLA强化学习
结构化解读

机器人演示很炫,离上岗仍隔四堵墙

这是一场横跨具身智能研究、仿真强化学习与机器人创业落地的 YC 圆桌。Marcel 是 Stanford 博士生,曾在 Physical Intelligence 实习;Milan Gennai 是 Stanford 博士生,在 Waymo 工作;Rerun 联合创始人兼 CEO Niko 则有近十年物理世界机器学习与计算机视觉产品经验。有人在解决“机器人怎么记住刚才发生了什么”,有人在研究“机器人到底该想什么”,也有人已经站在客户工厂里,处理机械臂坏了、数据采错了、交付卡住了这些没法靠 demo 掩盖的问题。

这期回答了 7 个问题:

  1. 为什么机器人已经会做三明治,却仍然无法可靠地做完一顿饭?
  2. 比起继续扩大模型,机器人更缺的是“皮肤”、记忆,还是不会老化的身体?
  3. 为什么让机器人把场景里所有东西都想一遍,反而会降低表现?
  4. 能否不靠人类遥操作示范,直接在仿真中练出通用的灵巧操作?
  5. 机器人创业为什么应该先卖人工遥操作服务,而不是先训练基础模型?
  6. 水、拉链和易拉罐这些真实世界细节,为什么仍是仿真的盲区?
  7. 世界-动作模型的未来瓶颈,究竟是智能不够,还是推理成本太高?
1. 机器人缺的不是又一个算法,而是能长期相信的数据来源

被问到为什么从 AlphaGo、MuJoCo 到 diffusion policy,行业已经喊了许多轮“明年机器人就解决了”,主持人先泼了一盆冷水:MuJoCo 里,机器人约 3,000 次迭代就能学会走路;到了现实,能进家的“Rosie the robot”仍没出现。2026 年过了一半,能预订 Neo 1X,却还买不到 Figure 机器人,工位场景虽有进展,家用机器人依然遥远。"it's definitely the year of the demos."(这肯定是演示之年。)

问题不只是模型没见过足够多的视频。用手腕相机、小夹爪做遥操作数据采集,本身就“极其困难”且挑剔;如果路线是把这种数据疯狂扩容,采集端会先撞墙。主持人列出四个缺口:仿真与现实的物理差距;动作空间如何表示;遍布身体的触觉缺失;以及身体老化造成的 embodiment drift,也就是执行器的实际出力会随时间漂移。灰尘、腐蚀、海边的盐雾、电池衰减,都会让“同一个动作”逐渐对应不同结果。

人把手伸进背包找充电器,不必看,就能凭压力、摩擦、形状判断里面有什么。机器人最好的配置,可能也只有每根指尖一个 coin FT 传感器和一台手腕相机。这意味着,机器人真正缺的不是又一条演示数据,而是一个能长期成立的数据来源:传感器、身体和动作结果之间的对应关系不能很快失效。边界也很清楚:旧的遥操作数据会因身体漂移而变“陈旧”,严重时甚至要重新采集数据、重训整个视觉—语言—动作模型。

2. 没有记忆的机器人,动作再灵巧也做不完长任务

被问到机器人既然已经能解锁积木、折反面衣服、做花生酱三明治,离清理整间卧室还有多远时,Marcel 给出的尺度很具体:他展示的灵巧任务,最长也只有约 2 分钟。清理卧室不只是铺床或叠衣服,而是要知道哪些衣服还没收、哪些区域还没整理;做一顿饭也不只是把食材处理好,还要等火候、收拾厨房。这些都是持续数十分钟、会被中途错误打断的任务。

多数现有策略在每一个时间步只看新观察,没有此前上下文。后果很直观:无记忆的洗碗机器人不知道自己已经洗了多久,于是会一直洗;无记忆的烤奶酪机器人不知道食物已经在锅里多久,于是会把它烤焦。Marcel 提出的 MAM,也就是 multiscale embodied memory,把记忆拆成两层:低层策略保留短期、稠密的视觉记忆,用来做抓取和接触;高层策略保存压缩成语言的数分钟记忆,用来判断任务推进到哪一步。

这意味着,长任务的关键不再只是“下一步手该怎么动”,而是维护一个任务状态:已经做完什么,失败在哪里,接下来该切换什么动作。语言记忆比连续图像省 token,也更容易调试;机器人能把第一次开冰箱失败记下来,下一次改从另一侧尝试。但它也有硬伤:长期记忆当前靠监督微调(SFT,即按人工标注继续训练),标注者必须事先定义哪些信息重要。机器人会记什么,仍是人替它规定的。未来可能要在记忆空间里做强化学习,或者转向难以直接阅读的 latent memory,也就是隐藏向量记忆。

3. 机器人不是想得越多越聪明,而是要学会只想与动作有关的事

被问到具身机器人该怎样“推理”时,Milan Gennai 先指出一个尴尬事实:大语言模型有海量文字和现成的思维链数据,机器人没有。没有人能把人类从看到画面到手指发力之间的思考过程完整剖出来,作为标准答案喂给模型。于是,他的 R&B Encore 把推理看成观察和动作之间一个看不见的 latent variable:先让模型为同一段轨迹提出不同推理,再用验证器筛选。

筛选标准有三个:够不够简洁,是不是非平凡,以及最重要的——能否预测动作。在机械臂操作中,“移动意图加夹爪位置”是有用推理;把画面中所有物体逐一罗列出来,反而会塞进大量干扰信息。在腿足导航中,结构可供性,也就是“哪里能踩、怎么通过”,以及移动方式更关键;地形描述和反事实推演没那么重要。自动驾驶标注也一样,可以删掉无用的人类描述和模型凭空编出的经验。"even if that reasoning is valid, it's not necessarily useful."(即使某段推理是成立的,也不代表它一定有用。)

这意味着,机器人推理不是通用模型那种“把所有可能都展开讲一遍”。它更像开车时的注意力分配:直路上没有新情况,就没必要每一帧都重新规划十步之后的路线。推理必须按身体形态、任务阶段和延迟预算来取舍。为此,Milan 团队提出 action forcing:训练时让文字推理提供额外监督,部署时把推理文本拿掉,避免文字生成拖慢控制回路。边界是,这些结论依赖 benchmark;反事实推理不是永远没用,只是在车辆直行、场景稳定时,逐步展开它显得冗余。

4. 通用灵巧操作不必先模仿人手,目标轨迹可以替代动作示范

被问到高自由度机械手为何难以靠遥操作规模化训练时,Tyler Lum 把问题换了个问法:与其让人精确示范每个关节、每次手指接触,不如只告诉机器人“这个物体最后要去哪里”。他的 Sim to Real 系统在 60 Hz 控制回路中,同时控制一只 22 自由度机械手和一条 7 自由度机械臂。它在训练期间没有见过部署时的刷子、锤子、螺丝刀,也没有见过对应任务。

训练发生在仿真中:系统只使用圆柱体、长方体等 primitive objects,也就是简单几何体,随机采样目标位姿,再用大规模并行强化学习训练一个 goal-conditioned policy。部署时,人类视频不提供机器人关节动作,更不用于微调模型;Foundation Pose 和 SAM 只从视频中提取物体应追踪的一串目标位姿。冻结不动的同一个策略,在 12 种没见过的工具和目标行为上测试。新任务的定义不再是“重新训练一个扫地策略”,而是“给出新的位姿序列”。

这意味着,学习分工可以重排。低层策略负责学会通用本领:抓住物体、在手中重定向、保持和恢复接触;高层只要在部署时给出目标轨迹。人不必当每个关节的操纵员,而更像规定结果的导演。训练中加入随机外力后,策略甚至会在锤子掉落时重新抓取,因为它已经在仿真里见过“物体被推掉”的情况。不过这不是万能接口:更重的工具容易掉,小物体易被遮挡,失败中约六成来自位姿追踪;碗和剪刀这类无法用可抓取 bounding box 简化描述的物体,也还不适合这套方法。

5. 机器人创业的护城河,不是先造基础模型,而是先接管一个脏活累活

被问到如果重新做一家机器人公司该如何起步时,Rerun 的 Niko 给出的路径很反直觉:不要从基础模型和泛化问题起步,先找一个单一、客户愿意付费的问题,用现成硬件和人工遥操作尽快卖出去。这样的 robotics application companies,正在数据中心管理、建筑、仓储和制造中出现。它们不急着自研所有硬件,而是端到端接管一项业务,先用 teleop 把服务跑通,再用数据微调模型逐步替人。

为什么要先卖服务?因为实验室里想不到真实世界的失败模式。Niko 去过许多真正已经交付机器人的公司办公室,“没有见过一家”不在办公室复刻客户环境:团队必须反复测试客户现场的台面、物料、流程和限制。"the physical world is brutal right everything that you do is going to break."(物理世界很残酷:你做的每一样东西都会坏。) 他用折纸飞机工厂举例:可能要日产 1,000 架合格飞机才赚钱;加一个纸张托盘,就能减少 50% 的失败;操作员可能要练 20 小时才能达到客户要求;便宜的研究机械臂用一段时间就会坏。

这意味着,护城河并不只是模型参数,而是把客户环境复刻下来、定义“客户眼中的成功”、给失败分类、不断回收数据、处理装配和售后支持的能力。能稳定造出机器人的团队往往是“100% supply constrained”——需求很好填满,真正卡住的是稳定交付。边界也不能忽略:这条路径的前提是任务能先靠 teleop 跑起来。Niko 的判断是,能被遥操作完成的事情通常能训练出模型,但“通常”不等于必然。

6. 仿真不是现实的替代品,只是进入真实数据循环的跳板

被问到 Sim to Real 怎样扩展到工具之外,面对可动物体和复杂物体怎么办时,Tyler 没有把仿真说成万能答案。剪刀或许还能继续建模,但真实世界里有大量东西难以充分模拟:水的流动、拉链齿的咬合、打开一罐 Bubbly 时罐盖、气压和液体的连锁变化。"That kind of stuff I think is not currently in the realm of simulation."(我认为那类事情目前还不在仿真的能力范围内。)

这不是一句笼统的“现实很复杂”。Sim to Real 当前的策略,是把任务规约为“当前位姿到目标位姿”的逆动力学问题:知道物体在哪里、要去哪里,再学习怎样施力移动它。可毛巾这类柔性物体不能由一个刚体位姿描述;更一般的对象可能需要关键点,最终甚至要由视频目标来定义“完成后的状态”。但新问题随之出现:部署时谁来生成这些关键点或视频目标?这仍然很难。

这意味着,仿真的位置更像驾驶模拟器,而不是现实的复制品。它能以低成本、大规模并行的方式,让机器人先练出抓取、重定向、恢复等运动先验;真实世界再用水、拉链、遮挡、材料变化这些失败样本,决定下一轮该往哪里微调。仿真跑得再快,也不能自动告诉模型纸张湿了以后摩擦会怎样变。Tyler 没有给出复杂物体的通用解法,只说自己的路线很可能是:先把仿真中学到的灵巧先验带到真实世界,再持续 fine-tune。真正昂贵的数据,不该被仿真替代,而该被用在仿真最不知道的地方。

7. 世界模型再会想象未来,推理成本过高也无法成为机器人能力

被问到世界—动作模型为什么要预测未来画面和运动学时,General Instinct 的 Bill 与 Guan Ming 给出的理由是:普通视觉—语言—动作模型主要根据当前观察直接输出动作;world-action model 则让中心 diffusion transformer 同时预测未来画面与未来运动学,强迫模型显式学习“这个动作之后物理上会发生什么”。拿起水瓶再松手,模型不只看到当前瓶子,还要学会预测它在未来画面中下落的轨迹。

但这类能力的账单很吓人。以 Nvidia DreamZero 为例,即使做过优化,运行仍需要两张 GB200,每张约 7 万美元。常规 flow matching 推理还可能要 50 步,甚至 100 步,才能从噪声中生成一个未来动作块。"economically for robotics as an industry, this is not scalable."(从机器人作为一个产业的经济性来看,这不可扩展。) 对一台要规模化部署的机器人而言,模型不只是“能不能做对”,还要看每一次动作能否承受这笔算力、延迟和功耗。

他们的处理方式是压缩推理链路:把原本 50 到 100 步的采样蒸馏到 1 至 2 步;把视频 transformer 与动作 transformer 拆开,用 cross-attention 把视频侧隐藏的世界表征交给动作侧,避免把所有未来视频帧都显式解码出来。这样做出的系统可在 Jetson Orin 上实现每个动作块约 500 毫秒、一次输出 16 个动作。这意味着,未来具身模型的竞争,不只是预测未来够不够丰富,也是谁能把这种未来压缩到边缘设备跑得动。边界在于:不生成完整视频后,怎样保留足够丰富的世界表征,仍要在像素、latent、mask 和 flow 等不同表示之间不断权衡。

把这 7 条放在一起看

“机器人缺的不是又一个算法,而是能长期相信的数据来源”和“机器人创业的护城河,不是先造基础模型,而是先接管一个脏活累活”,表面上一个在谈传感器与执行器,另一个在谈商业模式,实际上说的是同一件事:机器人不是在静态数据集上考一次试,而是在不断变化的物理世界里持续上班。

Marcel 的记忆解决的是任务状态会丢失的问题;Milan 的选择性推理解决的是有限延迟不能浪费在无关信息上的问题;Tyler 的仿真训练和真实微调,则承认有些世界细节只能撞上去才知道。最后,世界—动作模型又把问题推到工程账本上:如果理解未来需要两张 7 万美元的 GPU,它即使更聪明,也还不是可部署的能力。

对正在做机器人、自动驾驶、工业视觉或物理 AI 的读者来说,最该先问的也许不是“模型能不能做出更炫的演示”,而是:它失败时,能否知道为什么失败?传感器变了、工具换了、机械臂旧了之后,数据还能不能继续用?客户愿意为哪一个结果付费?当这些问题被接入同一条数据、评估、部署和维护的闭环,机器人做成一顿饭,才不只是视频里的两分钟。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02