⚡️Every product of the future will be a living system — Ronak Malde, Trajectory.ai
Latent Space · 2026-06-21

Trajectory 的创始人 Ronuk 认为,AI 的下一个重大突破不是更强大的模型,而是让模型从用户每一次使用中持续学习,而他们正在为所有企业搭建这个基础设施。
这期内容适合所有关注 AI 产品落地、模型训练和下一代 AI 基础设施的从业者。值得花时间看的原因是,Trajectory 团队来自 Windsurf 和 DeepMind,他们亲身经历了代码生成领域从零到一的爆发,现在正试图将同样的“持续学习”范式复制到法律、金融等垂直行业。最值得注意的冲突在于:大多数公司还在用“静态模型”做产品,而 Trajectory 认为,用户每一次的修正、每一次的编辑,都是被浪费掉的金矿——谁能把这些信号变成模型持续进化的燃料,谁就能在下一波竞争中拉开差距。
这期节目是 Len Space 对 Trajectory 创始人 Ronuk 的深度访谈。Ronuk 分享了他在 Windsurf(后被 Google DeepMind 收购)的经历,以及他为何放弃巨额收购回报,与两位斯坦福同窗创办 Trajectory。核心话题围绕“持续学习”展开:为什么这是 AI 的下一个范式,Trajectory 如何通过自蒸馏策略优化(SDPO)和开源训练框架“Continuous LoRA”来实现这一目标,以及他们如何与 Harvey、Clay 等企业客户合作,将这一能力落地到法律、GTM 等非代码领域。
- 静态模型是巨大的浪费:当前 AI 产品使用的模型是“静态”的——今天犯的错误,明天还会再犯。用户每一次的修正、编辑、反馈,都没有被用来改进模型。持续学习的核心就是把这些“被浪费的信号”变成模型进化的燃料。
- 二进制反馈(点赞/点踩)是噪声:大多数用户不会认真给反馈,而是“全盘接受”。真正有价值的是用户对 Agent 输出结果的具体修改——比如律师改动了合同中的某一段落,或者开发者把按钮从左边移到了右边。这些“编辑轨迹”才是高质量的训练数据。
- 自蒸馏策略优化(SDPO)是持续学习的关键算法:传统 RL 把整个轨迹压缩成一个奖励分数,丢失了大量信息。SDPO 的思路是:用“特权信息”(比如用户最终的修改结果)作为“提示”给教师模型,然后让学生模型去匹配教师模型的输出。这样模型学到的不只是“好/坏”,而是“应该怎么做”。
- 训练基础设施需要重新设计:持续学习意味着训练不再是“启动-完成-停止”的线性流程,而是多个训练任务并发、数据不断流入的动态过程。Trajectory 开源的 Continuous LoRA 框架,通过将采样和训练池分离,实现了多任务并行,大幅降低了持续学习的工程门槛。
- 垂直行业的“80% 等于零”:在代码领域,用户能容忍 Agent 犯一些错误,自己手动修正。但在法律、金融等专业领域,80% 的准确率等于完全不可用。这意味着这些行业更需要持续学习——模型必须从每一次专家修正中快速进化,才能达到可用标准。
“用户每一次对 Agent 输出的修改,都不是 bug,而是模型下一次进化的训练数据。”
对于做 AI 产品的团队来说,Ronuk 的分享提供了一个非常务实的视角:不要只盯着模型参数和基准测试,你的产品本身就是一个巨大的数据生成器。 很多团队在收集用户反馈时,只关注“点赞/点踩”这种粗粒度信号,却忽略了用户对 Agent 输出的具体编辑行为——这些行为才是最高质量的“隐式标注”。如果你在做 AI 原生应用,建议从第一天起就设计好“轨迹捕获”机制:记录用户对 Agent 输出的每一次修改、每一次撤销、每一次重试。这些数据不仅能用来做产品改进,未来还能成为你训练垂直领域小模型的核心资产。另外,Trajectory 选择与 Nvidia 的 Nemotron 合作而非中国开源模型,也提示了一个现实:在合规敏感行业(法律、金融),模型的“出身”和可控性可能比单纯的性能更重要。
