Inside OpenAI DevDay: Superhuman Computer Use, Decisions API, and the AI Cloud — Ari & Nikunj
Latent Space · 2026-10-02

OpenAI 把 Codex 的电脑操作能力开放成 API,GPT-5.1 跑电脑操作成本只有 Astra 的五分之一,速度还快 7 倍。
一个反常识的数字:订一份健身餐,Ari 自己花两小时,交给电脑操作 Agent 只用 15 分钟。这期 OpenAI Dev Day 后的对谈里,产品负责人 Ari 和 API 负责人 Nikunj 把"AI 替你点鼠标"这件事拆到了底——它现在到底能干什么、卡在哪、开发者该从哪下手。
电脑操作现在到底能干什么
Ari 说电脑操作完成任务的速度已经超过普通人,下一个目标是超过熟练用户。他举的例子很具体:订健身餐要精确到"多少克鸡肉、多少克米饭",自己弄两小时,Agent 15 分钟搞定,快 8 倍。
- 每个 Dot 配一台云端 Linux 虚拟机,能跑完整桌面软件,不只是浏览器。这是它和之前产品的区别——以前只能给你一个云浏览器,或者接管你自己的电脑。
- Agent 现在会写 JavaScript 代码一次执行多个动作,不再是一步一步点。以前截图、滚动、再截图,现在能直接看到整页内容,批量操作。
- Appshot 不是截图:双击 Command 抓取的是应用里的完整文本和无障碍信息,链接指向哪、日历事件全名是什么,模型都拿得到,截图里这些全是缺的。
卡点不在模型,在等网页加载
Ari 说现在很多时间不是花在 AI 思考上,而是花在等网站自己加载完。比如在 DoorDash 上跑任务,大量时间是在等 DoorDash 页面打开。
- 能事件驱动就事件驱动,浏览器有加载事件,但有些场景没法用——比如等客服回复,可能 30 秒也可能 3 分钟。
- 模型训练用的是 OpenAI 自己的电脑操作框架,所以开发者自己搭一套框架,在速度和准确率上可能吃亏。
- 安全上要主动设计:涉及付款这类有后果的操作,要先问用户;按任务需要,只开放必要的网站和应用权限。
决策 API 是抄 Grok 抄来的
Nikunj 直接承认:决策 API 是被 Grok 启发的,四个月前这东西根本不在计划里。OpenAI 内部有人被"nerd sniped"(被一个问题勾住),拿现成的 Luna 权重搭了个原型,跑通了,现在全队在死磕延迟。
- 它没有训练新模型,就是在 Luna 权重上做约束:结构化输出、并行推理、关掉推理链,换来极快速度。代价是处理长链条复杂任务的能力弱一些。
- 和 GPT Live 搭配:GPT Live 负责"说话"和快速分派,决策 API 负责快速判断,Astra 在后台干重活。以前 GPT Live 调工具很慢,现在顺多了。
- 缓存有硬保证:响应 API 现在承诺 30 分钟内缓存命中,还给某个用户上线了 12 小时缓存窗口,个人 Agent 隔几小时回来接着用,成本照样低。
带走一句话
"三四年前我们害怕把大模型接到网上和我们的设备上,现在我在让它帮我配 DNS、付账单,几万美元的东西直接交给它,能出什么最坏的事呢。"
- 如果你在做需要操作第三方网站的产品,先评估用 OpenAI 的 Agents API 而不是自建框架——模型是在官方框架上训练的,自建在速度和准确率上可能双重吃亏。
- 做个人助理类 Agent 时,把缓存策略当成一等公民:用预加热(pre-warming)提前付缓存费,让长线程隔几小时回来还能命中缓存,这是目前压成本最直接的手段。
