The AI Infra Stack: DeFlash, Auto Endpoints, RDMA, and Sandboxes — Akshat Bubna, Modal CTO
Latent Space · 2026-07-09

Modal CTO 称其 SDK 团队已从关注开发者体验转向关注 Agent 体验(AX),因为 Agent 读数百个 K8s 文件不如改几行装饰器。
从开发者体验到 Agent 体验
- Modal 已将 SDK 团队目标从开发者体验(DX)改为 Agent 体验(AX),核心逻辑是:Agent 读数百个 Kubernetes 文件写 YAML 效率极低,不如在代码装饰器里改几行,就能获得自配置运行时,实时看到变更效果。
- 与客户交流发现,Agent 在 Modal 上运行比在其他基础设施上快得多,因为基础设施需求与代码同位置,Agent 无需理解复杂配置。
- 尽管代码可能被 Agent 黑盒化,可观测性(dashboard/CLI)反而比代码本身更重要,人类仍需解读 Agent 行为并做判断。
产品演进:从通用云到 AI 专用平台
- Modal 定位为“为 AI 应用从头构建原语的云平台”,覆盖推理、训练、批处理、沙箱,但明确不竞争传统 Web 服务器场景(如 Render)。
- 早期 PMF 来自“自定义模型的弹性推理”,服务 Suno(音频)、Runway(视频)、机器人、计算生物公司,这些公司流量模式极不可预测(发布日暴增),且需多区域部署。
- 2023 年 5 月就构建了沙箱原语,首个示例是将 Small Developer 放入循环让 Agent 自我迭代——当时模型还不支持工具调用和自纠正,10 次迭代后就会发散。
- 2023 年中期已预判 RL 训练会需要 10 万个沙箱做 rollout,这是极端突发负载。
推理优化:开源与自动缩放
- Modal 在推理层开源了基于块的推测解码(Dflash),相比仅优化 kernel(仅提升几个百分点),增加接受长度可带来 2-4 倍加速,且无质量损失(从不接受更差 token)。
- 推出 Auto Endpoints:用户无需写代码,从 UI/CLI 即可创建端点,内置 Dflash 等优化,且完全透明(提供代码,用户可随时“弹出”到完整 Modal 体验)。
- 弹性缩放是核心差异化:通过 GPU 快照技术实现冷启动加速;跨 17 个云提供商(含 NeoClouds)构建容量池,在软件层做可靠性(如 GPU 掉线时用户工作负载不受影响)。
- 多节点训练支持 RDMA 网络(3Tbps 内部带宽),专为中小规模后训练(post-training)设计,如微调中型 Qwen 模型。
容量管理与未来方向
- 设有“计算策略”团队,负责预测容量、平衡 1 年/3 年预留、跨 GPU 类型和区域调度,类似航空公司对冲燃油。
- 计划推出“批处理层”:对延迟不敏感的客户(如计算生物公司的大批量任务)提供更便宜价格,24 小时内返回结果。
- Agent 侧正在构建新原语:沙箱支持 sidecar(多容器 pod)、出站网络控制(如中间人代理做 RL 日志)、跨节点通信(IPv6 覆盖网络),这些需求来自生产级 Agent 客户。
- 内部已用“自动推理”Agent:自动跑 Nvidia Nsight Profiler、调配置、换 GPU 型号(H200→B200),自动化了 FTE 工程师的工作。
带走一句话
> “我们让 SDK 团队从关注开发者体验转向关注 Agent 体验——为什么让 Agent 读数百个 Kubernetes 文件写 YAML,而它只需改几行装饰器就能获得自配置运行时?”
- 做 Agent 基础设施的团队可以照抄 Modal 的“AX”思路:把基础设施需求(GPU 类型、缩放策略)直接写在代码装饰器里,而非 YAML 配置,Agent 操作代码比操作配置文件高效得多。
- 推理优化的最大杠杆不在 kernel 而在推测解码:提升接受长度可带来 2-4 倍加速,且无质量损失。做推理服务的团队应优先投资训练/适配 draft model,而非死磕 CUDA 优化。
- Agent 时代需要新的网络原语:沙箱间私密通信、出站流量控制、中间人代理——这些在传统云上难以实现,但正是生产级 Agent(如 RL 训练、多 Agent 协作)的刚需。
