Owning Your Intelligence Starts With the Harness | Harrison Chase, LangChain
Sequoia Training Data · 2026-08-14

LangChain CEO 拆解 Agent 三要素:模型、上下文、harness,建议先用现成工具,再用 Harbor 跑评测、LangSmith Engine 自动找 bug。
Harrison 把 Agent 拆成模型、上下文、harness 三块,并给出一个反直觉建议:别急着自建 harness,先用现成的。他现场演示了 LangSmith Engine 如何自动从 traces 里挑问题、改代码,还透露了用 Codex 的“小脚本战术”反向优化自家产品的细节。
Agent 不是黑盒,拆开就三块:模型、上下文、harness
Harrison 认为,所谓“拥有自己的智能”,就是这三块都得自己说了算。模型可以换(避免锁定),上下文(记忆、知识、历史对话)要自己攒,而 harness 是真正决定 Agent 表现的部分——它的核心工作,就是在对的时间把对的上下文喂给模型。
- harness 的本质是一个循环:请求进来 → 模型生成 → 如果要调工具就调 → 把结果反馈给模型 → 再生成。所有主流 Agent(Claude Code、Codex)都是这个循环,区别在于你在循环的哪个环节插入了什么。
- 定制 harness 不用推倒重来:LangChain 的 Deep Agents 就是在这个基础循环上,通过“中间件”加东西——在模型调用前做摘要、在工具调用后做上下文卸载、接入文件系统和子 Agent。这跟代码编辑器里的 hooks 和插件是同一个思路。
什么时候该自建 harness?看你的任务“偏离分布”多远
Harrison 给了一个判断标准:任务越偏离模型训练时的数据分布,越值得自建 harness。但即便自建,也要把模型最擅长的部分留给它。
- 现成 harness 适合起步:Claude Code、Codex 这些开箱即用的工具,对大多数基础任务已经够好,能最快看到价值。Harrison 建议先用它跑通,再逐步加自己的逻辑。
- “偏离分布”不等于全部重写:比如做法律 AI,整个任务模型不熟,但“编辑文件”这个动作是模型被重点训练过的。所以自建 harness 时,应该用模型最擅长的那个编辑文件实现——Deep Agents 里的“模型配置文件”就是干这个的,根据模型切换不同的编辑工具。
评测和可观测性,是让智能“复利”的引擎
Agent 出错,多半不是模型不行,而是喂给它的上下文不对。所以看清上下文是怎么累积的,比盯着模型本身更重要。而评测(eval)则是定义“什么算好”的唯一标准。
- Harbor 是新的评测标准:一个开源评测运行器,每个任务都跑在独立的 Docker 沙箱里,自带环境、验证脚本和 prompt。你可以拿它对比不同 harness、不同模型在同一批任务上的准确率、延迟和成本。
- LangSmith Engine 是自动化的数据飞轮:它本身是个 Agent,后台跑着,自动翻你的 traces,找出共性问题并生成“issue 报告”,甚至直接给出修改建议(改 prompt、改上下文、改 harness 代码)。LangChain 自己就在用 Engine 跑 Engine,还专门建了个 benchmark 来评测它。
- 用便宜模型当裁判:每条 trace 都用 Opus 打分太贵。LangChain 微调了小型语言模型(SLM)来做 LLM-as-a-judge,成本大幅下降,效果接近大模型。
带走一句话
“The more out of distribution you get, the more you're going to want to customize the harness.”——任务偏离模型训练分布越远,你就越需要定制自己的 harness。
- 给 Agent 建评测集时,别只盯准确率,把延迟和 token 成本也设成指标,否则优化会跑偏。
- 与其手动翻日志找 bug,不如直接让一个 Agent 去读 traces 并生成报告,把“找问题”这件事也自动化。
