DevDay 2026:OpenAI 把 Codex 从“结对搭子”升级成“自主作业员”
9 月 29 日 OpenAI DevDay 2026 的主角不是新模型,而是 Codex:可复用云环境、常驻安全扫描、Computer Use、Decisions API、Ultrafast 极速档。Codex 正在从“聪明的笔”变成“能干的手”——自主性每升一级,可观测性就得跟一级。

9 月 29 日,OpenAI 在旧金山开了 DevDay 2026。和往年不同,这次大会的主角不是新模型,而是一个老熟人:Codex。从可复用的云环境、常驻安全扫描、"Sign in with ChatGPT",到能直接操作软件的 Computer Use,OpenAI 用一整套更新回答了一个问题——当"AI 会写代码"已经不稀奇,Codex 接下来要变成什么?
答案是:一个更自主、更快、也更需要被盯着的"作业员"。这篇把发布清单、三个关键判断、横向对比和一份冷静清单一次讲透。
发布清单:信息量很大,逐条过
- 可复用的 Codex 云环境。团队可以沉淀一套带共享配置和权限的开发环境,任务从电脑或手机发起,直接在云端跑。环境不再是一次性的——"用完即焚"的临时沙盒时代结束了,取而代之的是可以长期维护的"云端工位"。
- 带语音控制的 CLI。Codex 命令行现在可以用语音下指令。对终端重度用户来说,这不是噱头:长会话里"说句话让它继续"比切窗口打字自然得多,review 代码时口述修改意见也更符合直觉。
- ChatGPT 桌面端的 Code Review。代码评审被做进了桌面 App。评审从"某个插件的附加功能"变成"桌面工作流的一等公民",说明 OpenAI 认为 review 是高频刚需,值得一个原生入口。
- Codex Security Cloud。这次最重磅的一块:常驻应用安全服务。接上 GitHub 仓库后,它会全量扫描、持续盯着新提交、调查漏洞、去重,最后把修复方案准备好等人确认。研究预览版面向 Pro、Business、Enterprise 和 Edu 用户,默认附带 Daybreak Blue 的网络安全模型能力,不用单独申请。
- Agents API 的 Computer Use。Agent 不再只生成代码,可以真的去"点"软件、操作系统。值得注意的是,它 9 月 11 日就已经在 beta 了——OpenAI 显然把它当基础设施在铺,而不是拿出来试水。
- Decisions API。基于 GPT-6 Luna,专为"单选题"式任务设计:分类、打标、快速判断。模型开始按任务形态分化,而不是一个大模型包打天下——这是成本优化走到深水区的标志。
- GPT-6 Astra Ultrafast。新的极速档:Codex 里最高 300 tokens/秒,API 速度最高 6 倍。代价是 token 更贵——"快"第一次被明码标价。
- ChatGPT Pro 500。美国区每月 500 美元,包含 Ultrafast 和 25 倍于 Plus 的用量。订阅价格的天花板又被捅高了一截,重度用户的付费意愿已经被摸得透透的。
- Sign in with ChatGPT。Plus 和 Pro 用户可以把自己的订阅额度花在 16 个合作伙伴工具里,包括 Cognition 的 Devin、Vercel、Notion。ChatGPT 账号正在变成 AI 工具圈的统一身份和计费层——这一步的野心不比任何模型发布小。
判断一:Codex 的身份变了,从"笔"变成"手"
从"帮你写代码的搭子"变成"能自己操作软件的作业员",这是一次自主性跃迁。Computer Use 意味着 Agent 的动作空间从"文本"扩展到了"界面":它能点的、能改的、能搞砸的东西,都变多了。
这个比喻值得展开:笔写错了,你看得见——diff 就在眼前;手做错了,你可能看不见——它在你没盯着的时候改了三个文件、调了一个 API、还顺手关了个窗口。Codex 的进化方向,恰恰是从"看得见的错"走向"看不见的错"。这不是反对自主性,而是说:自主性每升一级,可观测性就得跟一级,否则就是在给未来的自己埋雷。
判断二:安全从"功能"变成了"常驻服务"
Codex Security Cloud 的思路值得玩味。它不像传统扫描器那样对着规则库比对,而是"像安全研究员一样工作":读整个代码库、跑测试、推演攻击路径、在隔离环境里验证漏洞再上报。AI 写代码的时代,"谁来保证 AI 写的代码安全"是个真问题,OpenAI 的回答是:再派一个 AI,7×24 小时盯着。
以子之矛攻子之盾,听起来很对,但也把信任链条拉长了一截:你现在要信任的不仅是写代码的模型,还有审查它的模型,以及两者之间的协作协议。务实的姿势是:把 Security Cloud 的报告在初期当"可疑线索"而不是"定论"来读,至少跑一个季度,统计它的误报率和漏报率,再决定放多少信任进去。任何安全工具的第一课都是:先校准,再依赖。另外注意它的覆盖边界——"像安全研究员一样工作"不等于"有安全研究员的责任心",最终对生产环境负责的还是你,签字发布之前,关键路径的代码建议还是人肉过一遍。
判断三:巧合太多,就不是巧合——全行业在往同一个方向挤
把时间线拉开看会发现,DevDay 不是孤立事件。9 月 10 日 Cursor 发布了 Projects(协调者 Agent 调度数千个子 Agent);9 月 23 日 GitHub Copilot 给桌面端加上了本地沙盒 public preview;9 月 24 日 Cursor 的更新日志里出现了 Rollouts(部署监控)和 Security Reviewer。同一周里,三家大厂同时在解决同一组问题:Agent 越自主,越需要围栏、越需要审计、越需要"出事能回滚"。
这说明行业已经形成了共识:2026 年下半场的竞争,不再是"谁的 Agent 更聪明",而是"谁的 Agent 更可信"。聪明是入场券,可信才是护城河。对选型的人来说,这意味着评估维度要变了——以前比的是补全准不准、上下文长不长,以后要比的是权限粒度、审计日志、回滚能力。
冷静清单:发布会越热闹,这几条越要记牢
有个不舒服的真相:OpenAI 发布自主性功能的速度,一直快过"验证 Agent 到底干了什么"的工具成熟速度。Security Cloud 会自动准备修复、Computer Use 会直接操作系统——每一次"不用你操心"的背后,都是一次"出了事你都不知道"的风险敞口。
- 云环境复用之前,先定权限边界。可复用是好事,但"沉淀下来的环境"也意味着"沉淀下来的权限"。给云环境最小必要权限,定期 review 它的 credential。
- Ultrafast 是止痛药,不是营养品。300 tokens/秒很爽,但如果你的瓶颈是需求不清晰、测试覆盖低,加速只会让你更快地写出错误的代码。先解决正确性,再购买速度。
- Pro 500 适合谁?算笔账:500 美元/月 ≈ 25 倍 Plus 用量。如果你现在的 API 账单稳定超过这个数,或者你是靠"快"吃饭的(比如 live coding、现场演示),才值得。否则 Plus + 按需 API 更划算。
- Sign in with ChatGPT 的隐藏议题是锁定。统一身份很方便,但当你的 Devin、Vercel、Notion 都挂在一个 ChatGPT 账号下,迁移成本也在悄悄变高。方便和锁定永远是一体两面。
横向看:DevDay 在 2026 编程工具大战里的位置
把 DevDay 放进 9 月的完整拼图里,OpenAI 的打法就清楚了。Cursor 在 9 月 10 日推出了 Projects——一个"协调者 Agent",自己不写代码,专门规划任务、调度成千上万个子 Agent,还能在你合上笔记本之后继续在云端跑;9 月 24 日的更新日志里又跟上了 Rollouts(部署监控,发现回归自动开 revert PR)和 Security Reviewer(每个 PR 自动做漏洞检测)。GitHub Copilot 则在 9 月 23 日给桌面端上了本地沙盒的 public preview:文件、网络、凭证三类权限可以按项目配置,默认关闭,企业可强制执行,顶不住就 fail-closed。
三家在同一周干的事,翻译成一句话都是:Agent 的自主性已经够用了,现在拼的是"管得住"。OpenAI 的解法是"再派一个 AI 盯着"(Security Cloud)+"把操作收进围栏"(云环境);Cursor 的解法是"分层调度"(协调者只规划不执行)+"部署后监控"(Rollouts);GitHub 的解法是"操作系统级沙盒"。路线不同,方向一致:2026 年下半场的编程工具竞争,已经从"谁更聪明"转向"谁更可信"。
对用户来说这是好事:可信度的竞争,最终会沉淀成行业标准——就像当年的 HTTPS 一样,"Agent 操作必须可审计、必须可回滚"迟早会变成默认配置。但过渡期会有阵痛:各家的围栏互不兼容,你在 Cursor 里配好的权限策略,搬到 Codex 云环境里得重来一遍。选型时多问一句"它的安全策略能不能导出、能不能迁移",能省掉很多未来的麻烦。
对 vibe coder 的三条直接影响
如果你是一个人加 AI 做产品,这次更新有三条会落到你头上:第一,云环境可复用意味着你的"一人工作流"可以沉淀下来,不用每次从零搭——早点把环境配置代码化,复利很高。第二,Security Cloud 这类常驻扫描随着 Pro 档下放,个人开发者的安全水位有机会整体抬高,以前"请不起安全团队"的独立开发者,现在可以用 AI 审查 AI。第三,Decisions API 这种"小任务专用模型"的出现提示我们:以后的架构可能是"大模型做规划、小模型做杂活",成本结构会更细,prompt 里"杀鸡用牛刀"的写法要改改了。
一句话总结:Codex 正在从"聪明的笔"变成"能干的手"。笔的时代比的是字好不好看,手的时代比的是——你敢不敢让它在你不看的时候干活,以及它干完之后,你有没有办法知道它干了什么。
最后给一份"本周就可以做"的行动清单:去把你的主力仓库接上 Codex Security Cloud 的研究预览,跑一次全量扫描,重点看"高置信度"之外的那些中危项——那才是你平时 review 最容易漏掉的部分;如果你在用 Codex CLI,把 0.159 的 draft recovery 打开(长会话崩溃丢稿是真的疼);至于 Computer Use,先在一个一次性的云环境里试,别直接给它你主机的权限。工具越强大,试用的姿势越要保守。
原始来源
相关文章

2026 年 10 月 8 日,Google Cloud 在 Gemini at Work 2026 大会上发布 Gemini agent:为工作而生的统一 Agent,拿目标自己规划、按任务在 Gemini 和 Claude 模型之间自动选择,并推出拥有独立邮箱、calendar 和通讯录席位的「同事 Agent」。四点判断:Agent 竞赛的下半场是「更像同事的 Agent」。

Gergely Orosz 走访 OpenAI、Anthropic、Cursor、Ramp 后写下的 2026 行业现状:近 100% 代码由 AI 生成、Agent PR 八个月涨近 10 倍、code review 沦为表演、IDE 被判为遗产产品。本文提炼报告要点,并给出 vibe coder 的三个判断与四件本周可做的事。

2026 年 10 月 7 日,Google Developers 发布 Developer Knowledge API 生态:Google Cloud、Firebase、Android 等官方文档变成程序化事实来源,配 gcloud CLI 入口、官方 Agent Skill(一行安装)、MCP server 和多语言客户端库。为什么「文档 API 化」能连根拔掉 vibe coding「模型记错 API」的经典翻车。