What does the next training paradigm look like?
Dwarkesh Patel · 2026-06-26

当前AI实验室押注的“通过海量可验证任务RL训练就能通向AGI”的路径,可能因忽视样本效率与持续学习这两个核心瓶颈而失败,真正的突破在于让AI能从真实世界的稀疏反馈中“在职学习”。
这期内容适合所有关注AI前沿发展、尤其是对AGI实现路径有好奇心的从业者、研究者和产品经理。它值得花时间看,因为它直击当前AI领域最核心的争论:RLVR(基于可验证奖励的强化学习)是否足以通向AGI?作者不仅指出了这条路径的潜在缺陷——样本效率低下、无法处理非确定性环境,还提出了一个极具启发性的替代方案:通过“在职学习”和“梦境模拟”让AI从真实世界的稀疏反馈中持续进化。最值得注意的冲突在于,实验室的“可复现环境”训练与真实世界的“非重置、非平稳”特性之间存在根本性鸿沟,而作者认为后者才是AGI必须跨越的坎。
这期内容围绕一个核心命题展开:当前AI实验室(如OpenAI、Anthropic)押注的“通过RLVR(基于可验证奖励的强化学习)训练AI完成数百万个可验证任务,从而构建AGI”的路径是否可行。作者首先承认这条路径的吸引力——它通过规模化训练解决了数据效率和持续学习的问题,但随后通过分析“计算机使用”领域进展缓慢的现象,揭示了RLVR的根本局限:它要求任务必须是“可复现”和“可并行回放”的,而这在真实世界中几乎不可能。接着,作者深入探讨了“样本效率”和“持续学习”这两个相互关联的瓶颈,指出当前AI在部署中积累的海量经验无法被有效利用,因为梯度更新的样本效率极低。最后,作者提出了两种可能的解决方案:一是“在策略自蒸馏”(OPSD),通过将上下文中学到的知识压缩回权重;二是更激进的“梦境模拟”,让AI在自建的环境中反复练习。最终,作者描绘了一个未来场景:AI通过RLVR获得基础能力,然后在真实世界中通过持续学习不断扩展技能边界。
- RLVR的“可复现性”要求是致命短板:计算机使用进展缓慢,不是因为不可验证,而是因为无法像编程那样构建“可并行回放”的模拟器。真实世界的任务(如创业、打官司、竞选)无法在数据中心内复现,RLVR的规模化无法解决这个问题。
- 样本效率是AI能力扩展的根本瓶颈:当前AI在训练时的样本效率仅为人类的百万分之一。虽然实验室认为训练成本可以摊销,但真实世界中许多领域的训练数据是稀疏、非结构化的,AI必须能从少量交互中高效学习。
- 持续学习的关键在于“压缩回权重”:AI在部署中积累的宝贵经验(如组织运作方式、常见失败模式)目前被浪费了,因为推理计算没有用于改进模型。真正的持续学习需要像人类一样,将经验压缩成直觉和知识,而不是无限扩大上下文缓存。
- 在策略自蒸馏(OPSD)是比RLVR和SFT更优的持续学习方案:OPSD不需要外部可验证奖励,而是通过让基础模型模仿“有经验的教师模型”的预测,提供更密集的监督信号。同时,它保留了RL的“稀疏更新”特性,避免覆盖模型已有的知识。
- “梦境模拟”可能成为第四维度的扩展:如果AI能构建对现实的高保真模拟,并在其中反复练习,就能在相同时间内获得数量级更多的训练样本。这类似于EfficientZero在Atari游戏中的做法,但构建“世界模拟器”的难度远高于游戏模拟器。
- 未来AI的进化将主要来自部署后的“在职学习”:RLVR只是让AI获得“足够胜任”的基础能力,真正的能力扩展将来自其在真实世界中的广泛部署和持续学习。每一次交互都会让AI变得更聪明,因为它不仅从你的会话中学习,还从所有用户的交互中学习。
“RLVR训练只是让AI获得了一张‘入职门票’,真正的能力增长来自它被部署到真实世界后,能否从稀疏的反馈中‘在职学习’——而目前,我们连这个学习机制都还没设计出来。”
这期内容对AI从业者的核心启发在于:不要迷信“规模化训练”能解决所有问题。当前许多AI产品团队在构建Agent时,过度依赖预训练和RLVR,却忽视了部署后的“持续学习”机制。这导致了一个尴尬的局面:你的AI Agent在测试集上表现优异,但在真实用户场景中却无法从错误中学习,每次交互都是“从零开始”。
具体到产品设计,这意味着:
- 构建“可复现”的反馈回路:如果你在做AI客服或AI编程助手,不要只关注模型在基准测试上的表现。思考如何设计一个系统,让模型能从每次用户交互中提取“可蒸馏”的经验。例如,记录用户对AI建议的接受/拒绝率,并定期用这些数据做微调或OPSD。
- 重视“稀疏更新”的价值:不要试图让模型记住所有对话历史。相反,设计一种机制,只让模型从那些“改变了结果”的关键交互中学习。这类似于RL的稀疏更新,能避免灾难性遗忘。
- 探索“梦境模拟”的轻量级版本:对于特定领域(如代码生成、文档处理),可以构建一个“沙盒环境”,让AI Agent在其中反复尝试不同的策略,并自动评估结果。这不需要构建一个完整的“世界模拟器”,但足以让模型在特定任务上获得数量级更多的训练样本。
- 警惕“上下文窗口无限大”的幻觉:虽然技术正在扩展上下文窗口,但依赖无限上下文来存储所有经验是不可持续的。真正的持续学习必须回到“权重更新”上,这需要架构和损失函数的创新。
总之,这期内容提醒我们:AGI的瓶颈不在算力,而在“学习机制”。如果你在做AI产品,现在就应该开始思考:你的AI如何从真实世界的稀疏反馈中“在职学习”?
