Codex 立下「28 天军令状」:每天一个改进,做不到就全员重置用量
OpenAI Codex 工程负责人 Tibo 10 月 4 日立下公开约定:28 天内,每天为大多数 Codex 与 ChatGPT Work 用户交付一个明确改进;交不出的日子,所有人拿一次用量重置。Day 1 是 GPT-6 Astra / 6.1 Sol 默认提速约 50%,Day 2 是 Auto-review 对 ChatGPT 登录用户免费,Day 3 是 GPT-6 进聊天框。这是一场把产品迭代变成连续剧的运营实验。

一纸"军令状":28 天,每天一个改进
10 月 4 日,OpenAI Codex 工程负责人 Thibault Sottiaux(大家叫他 Tibo)在 X 上立了一个罕见的公开约定:从当天起 28 天,每天为大多数 Codex 或 ChatGPT Work 用户交付一个明确的改进;如果某天交不出,所有人获得一次用量全额重置(full reset)。注意这个设计的巧妙之处——"惩罚"不是道歉信,而是直接给用户发福利:团队没交付,用户白拿额度。这是一种把压力完全放在自己身上的承诺机制。
10 月 5 日,OpenAI 开发者社区开出官方跟踪帖,每天更新交付内容。截至 10 月 7 日,已经公布的交付清单是:Day 1,GPT-6 Astra 和 GPT-6.1 Sol 订阅默认提速约 50%;Day 2.1,Auto-review 对 ChatGPT 账号登录用户免费;Day 2.2,简化 API 速率限制资格;Day 2.3,会议记录 Meetings 插件;Day 2.4,Decisions API 进入公开 beta;Day 2.5,全员速率限制重置;Day 3,GPT-6 进入 ChatGPT 聊天框,附带全新的 Intelligent UI。
为什么这件事值得单独写一篇?因为它不是一次普通的产品更新,而是一场把"迭代速度"本身变成营销事件的运营实验。AI 编程工具的竞争,已经从"谁的模型分更高"蔓延到"谁的交付节奏更让人上瘾"。
Day 1:GPT-6 Astra / 6.1 Sol 默认快约 50%
军令状的第一天交出的是一次纯粹的性能改进:GPT-6 Astra 和 GPT-6.1 Sol 在订阅渠道默认快约 50%。官方说法是推理侧的优化,用户侧不需要改任何配置,更新在两小时内陆续生效。
覆盖范围值得注意:不只 Codex 和 ChatGPT,而是所有支持 Sign in with ChatGPT 的合作伙伴产品——官方点名的包括 OpenCode、Pi、Amp 和 Devin。这意味着你在这些第三方工具里用 ChatGPT 账号登录,同样吃到提速。对 vibe coder 的现实意义是:模型提速的红利正在从 OpenAI 第一方 App 向整个"ChatGPT 登录生态"扩散,选工具时"支不支持 ChatGPT 登录"正在变成一个隐形加分项。
社区里已经有人拿出实测数据。一位用户跑 DIGBENCH 对比了提速前后:GPT-6.1 Sol 在 P-1 任务上从 34 分 36 秒 / 4520 万 token 降到 9 分 40 秒 / 640 万 token——时间和 token 双降,说明不只是解码更快,推理路径本身也变短了。当然这是单一样本,但方向和官方口径一致。
Day 2:Auto-review 免费,第二双眼睛不花钱了
第二天的交付是安全侧的重磅:Codex 的 Auto-review 功能对 ChatGPT 账号登录用户免费,且不再计入 plan 用量。开启路径是 Settings → General → Permissions → Auto-review,CLI 用户可以在 config.toml 里配 approval_policy = "on-request" 搭配 approvals_reviewer = "auto_review"。
先解释一下 Auto-review 是什么。当 Codex 需要做"跨出沙箱边界"的事——发起被拦截的网络请求、操作指定目录之外的文件、调用有外部效应的工具——它本来会停下来等你人工批准。Auto-review 派第二个 agent来替你审这批请求:它会结合你的原始需求、当前环境和动作的可能影响做判断,审查四类风险——私密数据发往不可信目标、探测凭证或 token、持久性地削弱安全、不可逆的破坏性操作。沙箱内部本来就允许的动作不会被加审,避免打扰。
这个功能 4 月底就已经发布,但之前审查也要消耗你的 plan 额度——相当于"请保镖还要自己付工资",很多人干脆关掉。现在免费了,OpenAI 等于把"默认安全"从口号变成了默认配置。
效果数字来自 OpenAI 对齐团队 4 月 30 日的评估:内部 3 月数据显示,开启后需要人工审批的打断比纯手动模式少了约 200 倍,99.1% 的跨边界请求被放行;合成测试里 99.3% 的 prompt 注入尝试被拦截,90.3% 的"过度热心"行为(agent 好心办坏事、超出用户本意的操作)被拦下,MonitoringBench(Hard)96.1%。一个 1 万次内部动作的快照很直观:9280 次动作根本没出沙箱、无需审查;720 次送审,713 次通过,7 次被拒——其中 4 次 agent 自己找到了更安全的替代路线,只有 3 次最终转人工。
但 OpenAI 自己也打了预防针:Auto-review 不是安全保证。红队测试发现 reviewer 可能被误导,它防不住刻意隐藏意图的模型。它只是在"审批"这个环节加了一道检查,不能替代人的最终把关。对 vibe coder 的建议很直接:免费之后就去打开,但别把它当免死金牌——让 agent 删库之前,你的备份和权限配置才是最后一道墙。
Day 3 之后:GPT-6 进聊天框,与 4000 万用户基本盘
10 月 7 日的 Day 3 把战火烧到了 ChatGPT 本体:GPT-6 进入 Chat 对话标签页,同时上线 Intelligent UI——对话可以直接返回图表、表单、可点击控件等交互元素,而不只是文本。这是"聊天框"向"工作台"演进的关键一步,也和 Codex 共享同一套模型底座。
同一天 Tibo 在 X 上抛出了另一个数字:Codex 与 ChatGPT Work 合计达到 4000 万活跃用户。口径需要拆开看:6 月官方说 Codex 周活用户超 500 万;8 月 25 日 Tibo 在采访中说 ChatGPT Work 达到 2000 万用户。这次的 4000 万是两个产品的合并口径,且没有说明统计周期——它证明的是 OpenAI 围绕 agent 建立的用户基本盘规模,而不是某个产品的独立增速。即便如此,4000 万这个数字本身,就是"28 天军令状"敢立的底气:基本盘越大,每日交付的边际成本越低,口碑放大的杠杆越长。
社区的两副面孔:实测党 vs 质疑党
官方跟踪帖的评论区是观察这场实验成色的最好窗口,大致分成两派。
实测党在认真验证每一天的交付:有人贴出提速前后的 benchmark 对比,有人确认合作伙伴产品确实生效,有人把"性能改进"解读为推理侧优化的胜利。这派人的逻辑是——不管营销话术如何,东西是真的,体验是真的变好了。
质疑党则盯着含金量:Day 2 一天塞进五个"2.x"小项(2.1 到 2.5),被吐槽是在凑数;有人指出这本质上是"给订阅产品的促销推文做转播";还有开发者借机喊话——"与其每天整 UI,不如修修 Codex VS Code 的任务队列 bug,社区都出了第四版补丁了"。这派人的逻辑同样成立:当"每日交付"变成 KPI,团队会倾向于交付"容易交付的东西",而不是"最难但最有价值的东西"。
两派其实指向同一个问题:28 天之后呢?如果这只是一次性的营销冲刺,热度退潮后一切照旧;如果它沉淀成团队的交付节奏,那才是真正的组织能力升级。现在下结论太早,但第 28 天的交付质量,会比第 1 天更能说明问题。
容易被忽略的细节:审查用的模型也换了
Auto-review 免费的背后还有一层成本账。据 AI 媒体 AICatchup 梳理,OpenAI 开发者账号曾在 X 上透露,ChatGPT App 和 Codex CLI 里的 auto-review 正在从 GPT-5.4 升级到 GPT-5.6 Luna,配合 Luna 本身的新定价,预期能让审查成本再降约 10 倍——不过这个"10 倍"目前只有 X 上的官宣口径,尚无可独立复核的一手来源,听个方向即可。
但方向本身值得玩味:安全审查这类"高频、低单次价值"的任务,正在被定向迁移到更便宜的模型上。这和 Zed 1.22 那篇我们写过的"给每个子 Agent 配不同的大脑"是同一个逻辑——难的任务用强模型,脏活累活(包括安全审查)用便宜模型。OpenAI 把这套"模型分级"做进了自己的产品里:主 agent 跑 GPT-6 Astra/Sol,审查 agent 跑 Luna。vibe coder 可以直接抄这套分工:你的 CI 里跑安全扫描的 agent,没必要和写代码的 agent 用同一个贵模型。
另外一个小提醒来自官方文档的措辞:免费的是"ChatGPT 账号登录用户"的 auto-review,API 直接调用、或企业 workspace 有单独策略限制的,不一定在免费范围内。免费不等于无条件,落地前看一眼自己账号的 plan 说明,别想当然。
我们的判断:Agent 工具的竞争进入"运营密度"时代
把"28 天军令状"放在 2026 年下半年的坐标系里,一个变化很清晰:AI 编程工具的竞争维度,正在从"模型能力"转向"运营密度"——谁的更新更频繁、谁的反馈闭环更短、谁让用户感觉"这个工具每天都在变好"。Cursor 靠高频发版建立过这种体感,现在 OpenAI 用更极端的形式(公开立约 + 全员监督)把它推向了高潮。
对 vibe coder 有三条直接启示。第一,押注 Codex 生态的时机到了:提速 50%、审查免费、合作伙伴全覆盖,订阅的含金量在这 28 天里是肉眼可见地涨。第二,Auto-review 免费后请默认开启,但记住它的边界——它是"减少打扰",不是"替代备份"。第三,关注"Sign in with ChatGPT"这个生态位:OpenAI 正在把订阅变成跨产品的通行证,你用的第三方 agent 工具支不支持这个登录方式,会直接影响你吃不吃得到这类红利。
最后留一个观察位:第 28 天,Tibo 是会交出一份漂亮的成绩单,还是不得不给全员发一次"没交作业"的重置福利?无论哪种,对用户都是赚的——这恰恰是这纸军令状最高明的地方:它把"团队交付"和"用户获益"绑成了同一件事。做产品的同学,这套机制值得抄作业。
原始来源
相关文章

2026 年 10 月 8 日,Google Cloud 在 Gemini at Work 2026 大会上发布 Gemini agent:为工作而生的统一 Agent,拿目标自己规划、按任务在 Gemini 和 Claude 模型之间自动选择,并推出拥有独立邮箱、calendar 和通讯录席位的「同事 Agent」。四点判断:Agent 竞赛的下半场是「更像同事的 Agent」。

2026 年 10 月 7 日,Google Developers 发布 Developer Knowledge API 生态:Google Cloud、Firebase、Android 等官方文档变成程序化事实来源,配 gcloud CLI 入口、官方 Agent Skill(一行安装)、MCP server 和多语言客户端库。为什么「文档 API 化」能连根拔掉 vibe coding「模型记错 API」的经典翻车。

2026 年 9 月 30 日,Bitdefender 宣布 AI Guardian 进入公开 beta:给自主 AI Agent 加的安检门,每一次工具调用、文件访问、密钥使用都要先拿到 allowed / flagged / blocked 裁决。首批 macOS 独占、beta 期免费,支持 Claude Code 与 OpenClaw。为什么这道「Agent 行为防火墙」来得正是时候。