● Feed Monitor · 每天替你盯顶级英文播客

What Your AI Stack Needs Before Agents Can Learn | Arjun Karanam, Trajectory

Sequoia Training Data · 2026-08-14

What Your AI Stack Needs Before Agents Can Learn | Arjun Karanam, Trajectory
一句话摘要

Trajectory 创始人提出“经验鸿沟”:模型 IQ 再高,第一天上班也是菜鸟。他们用真实交互数据做持续学习,让 Agent 越用越强,训练一个模型只需 15 分钟。

持续学习AgentAI训练创业
为什么值得看

手里有个 Terence Tao 级别的天才,但他第一天到会计事务所上班,大概率连账都平不了。这就是 Arjun 说的“经验鸿沟”——模型 IQ 再高,没有实战经验就是菜鸟。Trajectory 想用被丢弃的 Agent 交互数据来填补这个鸿沟,让模型越用越顺手。这篇讲清楚了他们怎么捕捉数据、怎么训练、以及给 Agent 生态的四个具体建议。

结构化解读
模型 IQ 再高,第一天上班也是菜鸟

现在的模型每周都在变聪明,但每次对话都像第一天上班。IQ 只是其中一个轴,另一个被忽视的轴是“经验”。Trajectory 要做的,就是收集 Agent 干活时产生的海量交互数据(这些数据现在大多被扔掉),用来训练模型,让它从“聪明的新人”变成“熟练的老手”。

  • 核心产品是“持续学习平台”:从捕捉交互数据开始,提炼成“模型规格”(Model Spec),再用强化学习算法(如 SDPO)训练模型,同时优化“外挂工具”(Harness),最后部署回生产环境。
  • 一个关键判断:学到的事实(比如“某公司已退市”)应该放进 Harness 的上下文,而不是训练进模型的权重里,这样更新快、成本低。
给 Agent 生态的四个愿望:从追踪到模型

Arjun 用阿拉丁神灯的比喻,给当前 Agent 生态提了四个具体建议,每个都对应一个待解决的工程问题。

  • 愿望一:追踪要完整:不仅要记录主任务,还要记录子 Agent 和工具调用的完整轨迹。更重要的是,产品要设计好反馈机制,别只搞“点赞/点踩”——用户真正有价值的反馈是“纠正行为”,比如编辑、撤销、重试。
  • 愿望二:评估要贴近真实:评估数据应该来自真实用户流量,而不是人工构造的测试集。理想状态是“评估环境 = 训练环境 = 生产环境”,并且要能把用户的操作录下来回放。
  • 愿望三:Harness 要放权:别再把 Harness 当成“防跑偏”的紧箍咒,而应该把它变成“工具箱”,提供搜索、私有数据等原语,让 Agent 自己编排。同时,Agent 的接口要尽量和用户界面一致,工具返回的信息要详细,别只回一个“完成”。
带走一句话

“我们不再思考该把文件存在内存还是硬盘,那是被抽象掉的问题。模型、Harness 和上下文,也该是这样。”

AI 视角启发
  • 重新审视你的反馈机制:如果产品里只有“点赞/点踩”,那数据价值很低。去记录用户的“撤销”和“重试”操作,那才是纠正模型行为的高质量信号。
  • 别急着微调模型:遇到新知识,先判断它是“全局事实”还是“个人偏好”。前者值得训练进模型,后者放进上下文或 Harness 就够了,能省下大量训练成本。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02