● Feed Monitor · 每天替你盯顶级英文播客

CI/CD Breaks at AI Speed: Tangle, Graphite Stacks, Pro-Model PR Review — Mikhail Parakhin, Shopify

Latent Space · 2026-04-24

CI/CD Breaks at AI Speed: Tangle, Graphite Stacks, Pro-Model PR Review — Mikhail Parakhin, Shopify
一句话摘要

Shopify CTO 揭示了AI编码工具在企业内部大规模采用后的真实挑战:代码量爆炸式增长导致CI/CD系统崩溃,而“多花时间用顶级模型做代码审查”才是比“疯狂消耗token”更有效的策略。

AI编码工程管理CI/CDShopify
为什么值得看

这期内容适合所有正在或计划大规模部署AI编码工具的技术管理者、CTO和资深工程师。值得花时间看,因为它不是空谈AI如何提高效率,而是直面了“AI写代码太快”带来的真实工程问题——PR堆积、CI/CD管线崩溃、bug数量激增。最值得注意的冲突是:Jensen Huang鼓吹的“工程师应该消耗更多token”观点,在Shopify的实际数据面前被修正——关键不是消耗token的数量,而是如何高效地使用顶级模型进行代码审查,以及如何重新设计整个开发流程来适应机器速度。

结构化解读
这期主要讲了什么

本期内容是Shopify CTO Miqdad Jaffer与主持人的深度对话,核心围绕Shopify内部AI工具的大规模采用现状、带来的工程挑战以及应对策略。对话从Shopify内部AI工具使用数据(DAU接近100%,token消耗在2025年12月出现爆发式增长)切入,重点讨论了三个核心议题:1)如何衡量AI编码效率(反对“token消耗量”作为KPI,主张关注“代码生成与审查的token消耗比”);2)AI编码带来的工程瓶颈(PR数量激增、CI/CD管线不堪重负、bug数量上升);3)Shopify自研的三大工具:Tangle(ML实验管理平台)、Tangent(自动研究循环)和Sim Jim(客户行为模拟器),以及它们如何协同解决上述问题。

核心观点
  1. “消耗更多token”不是好指标:Jensen Huang关于“工程师应该消耗更多token”的观点方向正确,但容易导致错误行为。真正的反模式是“并行运行多个不互相通信的agent”,这几乎无用。更有效的做法是“用更少的agent,但建立高质量的批评循环”——让一个agent写代码,另一个(最好用不同模型)批评它,虽然延迟更高,但代码质量显著提升。
  1. 代码量爆炸是新的工程危机:AI模型写代码的平均bug率可能低于人类,但由于其产出量是人类的数十倍,最终进入生产环境的bug总数反而更多。这导致PR审查、测试和部署周期急剧拉长。Shopify的PR合并增长率已从10%月增长飙升至30%月增长,CI/CD管线成为新的瓶颈。
  1. 关键指标是“生成与审查的token消耗比”:与其关注工程师消耗了多少token,不如关注“花在代码生成上的token”与“花在代码审查上的token”的比例。Shopify倾向于在审查阶段使用最昂贵的模型(如GPT-5.4 Pro或Gemini Deep Think),即使它需要1-2小时,也比因为bug导致部署回滚所浪费的时间更值得。
  1. Git和PR的概念本身可能成为瓶颈:在人类写代码速度下,全局互斥锁(merge conflict)尚可接受。但当代码以机器速度产生时,它成为主要瓶颈。微服务架构可能因此复兴,因为可以独立部署小模块。Shopify已在使用Graphite进行stacked PRs,但认为需要完全不同的代码仓库交互范式。
  1. AutoML终于可行,因为有了LLM:过去AutoML(如贝叶斯优化)在狭窄领域有效,但难以规模化。现在有了LLM,它可以进行无结构的监控、分析和迭代,使得“自动研究循环”(Auto Research)成为现实。Shopify的Tangent工具让PM也能直接进行ML实验优化,无需依赖ML工程师。
  1. 客户模拟器需要历史数据校准:Sim Jim的核心价值在于它基于Shopify数十年的历史交易数据,通过去噪和校准,实现了与真实A/B测试0.7以上的相关性。没有历史数据,模拟器只会重复提示词。这解释了为什么这类工具难以被其他公司复制。
最值得记住的一句话

“AI写代码的平均bug率可能比人类低,但因为写得太多,最终进入生产环境的bug总数反而更多——所以,花更多时间用顶级模型做代码审查,比花更多token写代码更重要。”

AI视角启发

这对AI从业者(尤其是做AI编码工具或Agent产品的团队)有两点直接启发:

  1. 不要只卷“生成速度”,要卷“审查质量”:当前AI编码工具(如Cursor、Copilot)的竞争焦点多在代码生成速度和准确率上。但Shopify的实践表明,真正的瓶颈和商业价值在于“代码审查”环节。如果能开发出专门针对AI生成代码的、使用顶级模型的高效审查工具(甚至能自动回滚、自动修复),其价值可能远超一个更快的代码生成器。
  2. “自动研究循环”是LLM最被低估的应用模式:Tangent的成功说明,LLM最强大的能力不是一次性生成完美答案,而是“持续迭代、自我批评、自动优化”。这种模式可以应用于任何有明确度量指标的领域(如搜索排序、存储优化、UI性能)。对于AI产品经理来说,思考“如何将我的产品流程设计成一个可被LLM自动迭代的闭环”比“如何让LLM一次生成更好结果”更有长期价值。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02