OpenAI Decisions API:把 agent 的"分支判断"变成一次 150ms 的调用
DevDay 2026 上 OpenAI 发布了 Decisions API:不生成自由文本,只从预设选项里选一个答案并附概率,宣称一次决策约 150ms、定价只收输入 token。有意思的是,这个"决策模型"品类是小创业公司 TypeSafe AI 的 Jev 先定义的——比 OpenAI 早了两周。对 vibe coder 来说,它真正的意义是把 agent 循环里最烦人的分支判断,变成一次没有格式漂移的 API 调用:成本和可靠性双降。

发生了什么
9 月 29 日的 DevDay 2026 上,OpenAI 发布了一个新 API:Decisions。目前处于 limited preview,官方说几天内会扩大范围;开发者文档里已经上线了 decisions 指南页(10 月 1 日)。
Sam Altman 在主题演讲里现场演示了它:用 Decisions API 驱动了一个 computer-use agent——agent 每一步"接下来干什么"的判断,都走这个接口。10 月 6 日,Simon Willison 基于官方文档写了 llm-openai-decisions 插件,做了第一批独立实测,普通开发者现在可以自己动手验证官方的说法了。
先给结论:这不是又一个"更聪明的聊天模型",而是一个"只做判断、不闲聊"的专用接口。理解了这个定位,后面所有的细节都顺了。
文档指南页把定位写得很清楚:Decisions 不是 chat 模型的"简化版",而是独立的产品线——输入输出 schema 都是为"判断"专门设计的。这意味着它不会跟你聊天、不会解释理由(至少在这个接口里不会),它只回答:选哪个,概率多少。
它到底是个什么东西
一句话:把 GPT-6 Luna 的智能,聚焦到"回答一个你定义好的问题"这件事上。
它不生成自由文本。你给它一个问题 + 一组预设答案,它只从预设答案里选一个返回,并附上每个选项的概率。输入支持文本和图像。
官方定义了三种问题类型:yes/no(二元判断,比如"这条用户消息是不是在要求退款?")、choices(多选一,比如"把这条工单路由到哪个队列:技术支持 / 账单 / 销售?")、scores(打分,比如"这条评论的毒性按 1-5 打几分?")。用途也写得很直白:内容分类、请求路由、决定 agent 的下一步动作。
定价:$0.10 / 百万输入 token,只收输入、不收输出。速度:官方宣称一次决策约 150ms,大约是标准 Luna 调用的 10 倍速。注意,"约 150ms"和"10 倍"是发布方的数据,独立、大规模的实测还没跟上——先打个问号,文末细说。
这个品类不是 OpenAI 发明的
有意思的背景:"决策模型"这个品类,开创者不是 OpenAI,而是一家叫 TypeSafe AI 的小创业公司。它的产品 Jev 在 9 月 15 日左右发布——比 OpenAI 早了大约两周。
Jev 的参数:$0.042 / 百万输入 token、输出免费、70-500ms 延迟、纯文本输入、每个选项给概率、6.4 万 token 上下文。对比 OpenAI 的版本:输入价格是 Jev 的两倍多($0.10 vs $0.042),但支持图像输入、背靠 GPT-6 Luna 的底座能力。
巨头跟着一家小创业公司定义的品类走,这事值得玩味。它说明两件事:第一,"决策"这个需求是真实存在的,不是某个大厂拍脑袋造出来的伪需求——小公司先验证了 PMF,大厂才跟进;第二,AI 基础设施的创新节奏已经快到"品类定义权"不再垄断在大厂手里。一个几十人的团队定义一个 API 品类,两周后 OpenAI 就官宣跟进——这种剧本在云计算时代是不可想象的。
对独立开发者来说,这是个好消息:你所在的生态位,离"定义下一个 API 品类"并不遥远。Jev 的团队规模可能和你的差不多。
价格账值得细算:Jev $0.042 / 百万输入、输出免费;OpenAI $0.10 / 百万输入、输出同样免费(因为根本没有输出)。差价买的是两样东西:图像输入能力,和 GPT-6 Luna 的底座智能。对纯文本分类场景,Jev 今天就能用还更便宜;对需要看图的判断(比如审核用户上传的图片该进哪个类目),OpenAI 是目前唯一的选择。选型的时候别被发布会光环晃了眼,看输入类型和延迟要求做决定。
对 vibe coder 的意义:控制流变成一次 API 调用
现在回头看 agent 开发里最烦人的部分。写一个 agent 循环,里面总有几十个分支判断:用户这句话是不是想取消订单?这条报错要不要重试?下一步该调用哪个工具?今天的做法是:每个判断都烧一次完整的 LLM 调用——写 prompt、等模型生成、解析输出、处理格式漂移、漂移了就重试。
有经验的 agent 开发者都干过这些脏活:让模型"只输出 JSON"、用正则从回复里抠字段、输出不是合法 JSON 就重试一次。整个 agent 的可靠性,经常就死在这些分支判断的格式漂移上。你调了三天 prompt engineering,最后发现线上 3% 的失败都来自模型某天心血来潮多输出了一个换行。
Decisions 把这一整套脏活压缩成一次 API 调用:问题 + 选项发过去,回来的是一个结构化的选择 + 概率。没有自由文本,就没有格式漂移;150ms 级延迟,分支判断不再是 agent 循环里的慢瓶颈;只收输入 token,成本账也好算。
这是"成本和可靠性双降":成本降在 token 单价和无输出费用上,可靠性升在"输出空间被锁死"这个设计上。一个只能从 5 个选项里选的模型,不可能给你返回一段散文——而"不可能返回散文",正是无数个深夜调试里最想要的保证。
更深一层想:这其实是 LLM API 在"分化"。过去几年,所有任务都走同一个 chat 接口——写诗和做分类用的是同一把锤子。现在锤子开始分家了:生成归生成模型,决策归决策模型。接口分化的背后,是"智能"正在被拆成可定价、可度量的标准件。对 builder 来说,标准件意味着可组合、可替换、可比价——这是生态成熟的标志,也是独立开发者最喜欢的市场结构:没有哪一家能靠一个黑盒接口锁死你。
还有一个容易被忽略的点:概率输出。Decisions 返回每个选项的概率,这意味着你可以设阈值——高置信度自动执行,低置信度转人工或升级给完整模型。这是一种"优雅降级"的工程模式:以前你要自己写采样、投票、阈值的逻辑,现在接口直接给你概率,分支策略变成配置而不是代码。agent 的行为从"代码里写死的 if-else"变成"可调参的策略",这是可维护性上的一大步。
先别急着重构:几个问号
第一,150ms 和"10 倍速"是 OpenAI 自己宣称的。Simon Willison 的插件实测刚出来,独立、大规模的延迟数据还没见到。在你的场景里到底是 150ms 还是 500ms,得自己测。发布会数字和 P99 延迟之间,永远隔着一个真实世界。
第二,limited preview。今天能调通,不代表下周你的 key 就在白名单里。生产环境的迁移计划,等 GA、或者至少等"几天内扩大"兑现了再说。Preview 阶段的 API,breaking change 是家常便饭。
第三,价格。$0.10 / 百万输入是 Jev 的两倍多。如果你要做的是纯文本分类,Jev($0.042、输出免费)今天就能用,还便宜。OpenAI 的优势在图像输入和 Luna 底座——按需选择,别为 logo 付费。
第四,也是最重要的:决策模型锁死输出空间,换来的是表达能力的上限。需要 nuanced reasoning 的判断——比如"这段代码评审意见到底在质疑架构还是实现"——可能还是得走完整模型。Decisions 替代的是"分支判断",不是"思考"。分清楚哪些判断是"分类",哪些是"推理",是接入前最重要的一课。
务实的姿势:先拿你 agent 里最痛的那个分支判断开刀——通常是路由和分类。跑一周,对比一下:延迟降了多少?格式漂移的重试消失了吗?token 账单变了吗?数字会告诉你,这东西是真有用,还是又一个发布会 demo。好工具不怕实测,怕实测的都不是好工具。
原始来源
相关文章

10 月 3 日,Sites in ChatGPT 以约 209 点赞、218 评论冲上 HN 前页。这不是发布,而是一场清算:提示词直达 URL,到底是玩具、原型托管,还是生产力?四个争论焦点、文档实锤的技术事实(D1/R2、登录、自定义域名),以及给 vibe coder 的三个判断。

10 月 3 日,工程师 Kevin Liao 发表檄文冲上 HN 前页:记忆插件是一场 RAG 片段抽奖,Agent 需要的是文档工作区。本文拆解他的诊断、开源的 Operator Memory 插件、两个最强的反方质疑,以及今晚就能开始的最小实践。

Gergely Orosz 走访 OpenAI、Anthropic、Cursor、Ramp 后写下的 2026 行业现状:近 100% 代码由 AI 生成、Agent PR 八个月涨近 10 倍、code review 沦为表演、IDE 被判为遗产产品。本文提炼报告要点,并给出 vibe coder 的三个判断与四件本周可做的事。