RL Environments Explained: How AI Agents Learn Real-World Work | Brendan Foody, Mercor
Sequoia Training Data · 2026-08-13

Mercor 联合创始人 Brendan 分享:RL 环境正成为 AI 训练新前沿,专家小时数 Q2 达 250 万,GLM-5.2 和 Kimi K3 已登上评测榜。
RL 环境正在取代人工标注,成为训练下一代模型的关键。Mercor 从 1 到 20 亿美元营收只用了 4 个月,靠的就是为各大实验室构建这些"虚拟工作场景"。这期讲透了 RL 环境是什么、怎么建、怎么定价,以及为什么人类专家仍是不可替代的一环。
RL 环境是什么?就是给 AI 造一个"虚拟办公室"
RL 环境分三层:世界(邮件、文档、表格)、应用(Salesforce、Office 365 的高保真克隆)、任务(提示词+验证器)。目标是覆盖经济中所有岗位的工作场景,让 AI 学会用我们日常的工具。
- 人类专家是核心:Mercor 的专家网络 Q2 贡献了 250 万小时,用来构建这些环境。因为大多数领域(如做 PPT)没有标准答案,模型无法自我判断对错,需要人类像教授批改论文一样制定评分标准。
- 验证器是技术难点:要覆盖所有可能的正确路径和常见错误,防止模型"刷分"。Mercor 通过"轨迹分析"(roll out 10 条模型轨迹并人工审查)来保证评分准确。
数据怎么定价?从 50 到 10000 美元不等
Mercor 的定价逻辑是"倒推法":客户想要达到某个评测榜的领先位置,Mercor 就倒推需要多少任务、每个任务值多少钱。成本结构也重要:一个任务若需专家 10 小时(时薪 150 美元),成本就是 1500 美元,再加利润率。
- 三种数据售卖模式:按任务定制(如某实验室每月买 5 万个任务,单价 2000 美元)、现成数据集(Mercor 自建,卖给多家客户,新实验室更倾向这种)、纯专家外包(按小时计费,已非重点)。
- 合成数据是主流:RLVR 本身就是"合成数据"——让模型跑出大量轨迹,再打分学习。但人类仍不可替代,因为人类需要定义模型能力边界之外的东西,模型自己无法可靠地评判自己。
为什么 RL 环境现在才火?下一步是什么?
2024 年之前是"深度研究"范式,只有搜索这一个工具。2025 年转向"应用环境",因为大家意识到瓶颈在于模型不会用我们电脑上的各种软件。
- 超长任务:现在训练的任务不超过 10 小时,要扩展到 100-1000 小时,让 AI 能一口气完成更复杂的工作。
- 虚拟同事:工作中 60-70% 的任务需要与人协作,但评测中只有约 1% 涉及社交互动,这是巨大的空白。
带走一句话
"人类几乎定义性地需要存在,因为要测量超出模型能力前沿的东西。"
- 评估你的数据策略:哪些任务可以靠"模型跑轨迹+自动评分"完成,哪些必须引入人类专家制定验证器?后者才是真正的护城河。
- 检查你的评测集:如果 60-70% 的工作涉及协作,而你的评测只有 1% 覆盖社交互动,这就是巨大的改进空间。
