● Feed Monitor · 每天替你盯顶级英文播客

RL Environments Explained: How AI Agents Learn Real-World Work | Brendan Foody, Mercor

Sequoia Training Data · 2026-08-13

RL Environments Explained: How AI Agents Learn Real-World Work | Brendan Foody, Mercor
一句话摘要

Mercor 联合创始人 Brendan 分享:RL 环境正成为 AI 训练新前沿,专家小时数 Q2 达 250 万,GLM-5.2 和 Kimi K3 已登上评测榜。

RL环境AI训练数据市场Agent
为什么值得看

RL 环境正在取代人工标注,成为训练下一代模型的关键。Mercor 从 1 到 20 亿美元营收只用了 4 个月,靠的就是为各大实验室构建这些"虚拟工作场景"。这期讲透了 RL 环境是什么、怎么建、怎么定价,以及为什么人类专家仍是不可替代的一环。

结构化解读
RL 环境是什么?就是给 AI 造一个"虚拟办公室"

RL 环境分三层:世界(邮件、文档、表格)、应用(Salesforce、Office 365 的高保真克隆)、任务(提示词+验证器)。目标是覆盖经济中所有岗位的工作场景,让 AI 学会用我们日常的工具。

  • 人类专家是核心:Mercor 的专家网络 Q2 贡献了 250 万小时,用来构建这些环境。因为大多数领域(如做 PPT)没有标准答案,模型无法自我判断对错,需要人类像教授批改论文一样制定评分标准。
  • 验证器是技术难点:要覆盖所有可能的正确路径和常见错误,防止模型"刷分"。Mercor 通过"轨迹分析"(roll out 10 条模型轨迹并人工审查)来保证评分准确。
数据怎么定价?从 50 到 10000 美元不等

Mercor 的定价逻辑是"倒推法":客户想要达到某个评测榜的领先位置,Mercor 就倒推需要多少任务、每个任务值多少钱。成本结构也重要:一个任务若需专家 10 小时(时薪 150 美元),成本就是 1500 美元,再加利润率。

  • 三种数据售卖模式:按任务定制(如某实验室每月买 5 万个任务,单价 2000 美元)、现成数据集(Mercor 自建,卖给多家客户,新实验室更倾向这种)、纯专家外包(按小时计费,已非重点)。
  • 合成数据是主流:RLVR 本身就是"合成数据"——让模型跑出大量轨迹,再打分学习。但人类仍不可替代,因为人类需要定义模型能力边界之外的东西,模型自己无法可靠地评判自己。
为什么 RL 环境现在才火?下一步是什么?

2024 年之前是"深度研究"范式,只有搜索这一个工具。2025 年转向"应用环境",因为大家意识到瓶颈在于模型不会用我们电脑上的各种软件。

  • 超长任务:现在训练的任务不超过 10 小时,要扩展到 100-1000 小时,让 AI 能一口气完成更复杂的工作。
  • 虚拟同事:工作中 60-70% 的任务需要与人协作,但评测中只有约 1% 涉及社交互动,这是巨大的空白。
带走一句话

"人类几乎定义性地需要存在,因为要测量超出模型能力前沿的东西。"

AI 视角启发
  • 评估你的数据策略:哪些任务可以靠"模型跑轨迹+自动评分"完成,哪些必须引入人类专家制定验证器?后者才是真正的护城河。
  • 检查你的评测集:如果 60-70% 的工作涉及协作,而你的评测只有 1% 覆盖社交互动,这就是巨大的改进空间。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02