返回探索
资讯VibeFix 编辑部更新于 2026年10月1日

Codex CLI 九月两连更:语音、全屏 TUI 之后,0.159 开始教你“打断”AI

9 月 22 日的 0.156 带来语音模式、全屏 TUI 与用量仪表盘;9 月 29 日的 0.159 主打“控制感”:instant_interrupt、草稿恢复、更紧的沙盒。终端 Agent 的竞争,从“智能”转向“可控”。

深色终端窗口概念插画,代码与 AI 光标

9 月的 OpenAI 属于 DevDay 的大新闻,但如果你只盯着发布会,会错过另一条线:Codex CLI 在 9 月 22 日和 29 日连发了两个版本——0.156 和 0.159。没有发布会,没有 keynote,只有 changelog 里密密麻麻的条目。但恰恰是这些条目,暴露了 2026 年终端 Agent 竞争的真实战场:不是谁更聪明,而是谁更好"相处"——更好打断、更好恢复、更好管住手。

这篇逐条拆解两个版本,再聊聊"终端 Agent 的体验军备竞赛"意味着什么。

0.156(9 月 22 日):语音、全屏 TUI 和用量仪表盘

0.156 是 Codex CLI 几个月来最大的一次功能投放,几个点值得展开:

  • 语音模式默认开启。F8 一键开关,/voice 里调设置,Linux 和 Windows 自带音频运行时。语音在终端 Agent 里的意义被低估了:当你盯着 diff 思考时,"说"比"打字"更符合大脑的工作节奏。OpenAI 把它做成默认开启,说明内部数据证明了它的使用率——否则不会冒这个险。
  • 全屏 TUI(/tui)。可选的全屏终端界面:transcript 搜索、鼠标选中文本、右键复制,6 套新主题,回复里支持 Mermaid 图表和数学公式。终端 Agent 的老用户都懂:transcript 一旦长了,找三天前的一句话比登天还难。搜索和选择,是把"会话"变成"资产"的第一步。
  • /usage 用量仪表盘。查账号用量、token 总数、插件/skill 活跃度。账单透明化是规模化使用的前提——当 Agent 开始替你烧 token,你得知道烧在哪了。
  • worktree 会话默认开启。可以从 agent command center 直接开 worktree 会话。多任务并行时,一人开几个 worktree 让 Agent 分头干,已经是 2026 年的标准姿势,做成默认只是时间问题。
  • 沙盒隔离补洞。堵上了 Windows 入站连接和 macOS 文件句柄写入的隔离缺口。终端 Agent 的权限边界一直是暗坑,这次补的是真漏洞。
  • 0.156.1 热修复:同一天跟进,把 GPT-6 Sol 和 GPT-6 Luna 加进了 Codex 自己的模型选择器(注意:和它们进 GitHub Copilot 是两回事),rate limit 切换提示现在会推荐 Luna 作为便宜 fallback。模型分层的逻辑,在 CLI 里也落地了。

0.159(9 月 29 日):这次的主角是"控制感"

如果说 0.156 是"加功能",0.159 就是"加工感"。发布说明里最抓眼球的是 instant_interrupt:opt-in 的能力,允许在模型回复中途或长代码调用进行时,用新输入"引导"(steer)Codex。

注意措辞:"steer"不等于"安全取消所有操作",不等于"撤销文件变更",不等于"验证任务正确性",更不等于"回滚半执行的计划"。保守的解读是:它改善的是一个 turn 之内的交互控制,而 Git checkpoint、权限边界、diff review、沙盒策略、回滚流程这些工程纪律,一件都不能少。把 instant_interrupt 理解成"方向盘",而不是"刹车+安全气囊+保险"。

但这恰恰是 0.159 最有价值的地方:它承认了一个现实——长任务里,人最需要的不是"更聪明的 AI",而是"随时能插话的 AI"。以前的模式是:你下指令,Agent 跑,你干等,跑完了发现方向偏了,全部重来。instant_interrupt 把"纠偏"的时机从"跑完之后"提前到了"跑的过程中"。别小看这个变化,它把一次长任务的期望浪费从"整个任务"降到了"一个 turn"。

同版本的其他条目也在讲"控制感":更干净的启动屏、更可预测的告警行为、更好的 transcript 导航、原生 Mermaid 渲染、app-server 客户端的线程历史分页、Windows 启动修复、transcript 复制改进、draft recovery(草稿恢复)、以及 approved 命令周围更紧的文件系统保护。draft recovery 值得单独拎出来:长会话崩溃丢稿,是每个终端 Agent 用户都经历过的疼,能恢复草稿,意味着"会话"开始被当成"工作现场"而不是"聊天记录"来对待。

深挖:为什么"打断"这么难,又这么重要

instant_interrupt 看起来是个小功能,工程上却是个硬骨头。模型生成是流式的,工具调用是异步的,文件变更是不可逆的——在"正在发生"的中间态插入人的意图,需要把三个时钟域对齐:生成的时钟(token 流)、执行的时钟(工具调用)、人的时钟(你什么时候意识到偏了)。对得越齐,体验越顺;对不齐,就会出现"我都喊停了它还在写文件"的灵异事件。

OpenAI 选择做成 opt-in 是明智的:这功能的行为边界还在打磨,默认开启会让所有人一起踩坑。但方向是对的。回想一下:2024 年我们争的是"补全准不准",2025 年争的是"上下文长不长",2026 年争的是"好不好相处"——能打断、能恢复、能审计、能回滚。Agent 的体验竞争,正在从"智能"转向"可控"。这和 DevDay 的 Security Cloud、Cursor 的 Rollouts、Copilot 的沙盒,是同一枚硬币的不同面。

那么,什么样的"打断"算好打断?可以立三个验收标准:第一,跟手。从你发出打断意图到 Agent 停下,延迟应该在秒级,而不是"等它把这段写完"。秒级以下的打断才有意义,否则你喊停的时候它已经把错的东西写进文件了。第二,状态干净。打断之后,transcript 里要有一条清晰的"在此处被打断"标记,而不是半截工具调用悬在那儿,让下一轮的模型看得一头雾水。第三,可继续。打断不是"掀桌",而是"换方向"——打断后你应该能接着说"刚才那个思路不对,换 X 方案",而不是一切重来。拿这三条去验收任何一家号称"可打断"的 Agent,基本能筛掉一半的营销话术。

给终端重度用户的升级建议

第一,0.159 值得升,但 instant_interrupt 先开给"实验项目"。任何改变"人机权力关系"的功能,都值得先在小范围试。开两周,记录几次"我打断了它,省了多少返工",再决定是否全开。用数据决定,而不是用新鲜感决定。

第二,把 draft recovery 和 Git checkpoint 配成"双保险"。draft recovery 保的是"会话不丢",Git checkpoint 保的是"代码可回"。前者是体验问题,后者是安全问题。建议的纪律:让 Agent 每完成一个子任务就 commit(可以用 hook 自动做),这样即使 instant_interrupt 没拦住,git reset 也能兜底。

第三,用量仪表盘每月看一次。/usage 不是摆设。重点看两个数:哪个 skill/插件烧得最多,以及"杂活"任务是不是在用贵的模型。把杂活切到 Luna(0.156.1 已经支持),账单会好看很多。

第四,语音模式试试,但别强求。语音在"边看边想"的场景下是神器,在开放办公室里是社死现场。工具是为人服务的,不是为发布会服务的——适合自己的才是最好的。

对照:同一周,友商的终端也没闲着

Codex CLI 的两连更不是孤立事件。9 月 23 日,Anthropic 推了 Claude Code v2.1.281——一个纯稳定性版本:修了"unexpected tool_use_id"重试卡死的自愈、MCP over http 五分钟超时、auto 模式在安全检查拒绝后无限重试,以及 Write 调用参数名稍有偏差就校验失败的问题。没有新功能,全是"让它别在关键时刻掉链子"的修复。

GitHub 那边,Copilot CLI 也在同一周强化了本地沙盒(/sandbox enable 等命令),Linux 上甚至要求装 slirp4netns/nsenter/iptables 才能开——为了隔离,连系统依赖都敢要,态度很坚决。

三家的终端更新拼在一起,画面很清楚:2026 年 9 月的终端 Agent 竞赛,比的不是"谁先长出新胳膊",而是"谁的胳膊最听使唤"。Claude Code 修稳定性,Codex 加控制感,Copilot 加沙盒——"可控性"三件套(稳定、可打断、可隔离)正在成为终端 Agent 的标配。选终端工具的时候,别只看它支持哪个模型,问三个问题:崩了能不能恢复?跑偏了能不能打断?权限能不能管住?三个都答得上来,再谈智能。

附:如何读一份 Agent 产品的 changelog

最后分享一个方法论,适用于所有 Agent 工具的更新日志。读的时候把条目分成四类:

  • 能力类(新增了什么):比如语音模式、全屏 TUI。这类决定"上限",看看就好,别急着追。
  • 控制类(更好管了):比如 instant_interrupt、draft recovery、沙盒。这类决定"下限",值得第一时间升级——它们降低的是"出事"的概率。
  • 可观测类(更透明了):比如 /usage 仪表盘、transcript 搜索。这类决定"你能不能管",是规模化使用的前提。
  • 修复类(补洞):比如沙盒隔离缺口、MCP 超时。这类最无聊,也最重要——它告诉你厂商在"还技术债"还是"装看不见"。

一个健康的 Agent 产品,四类应该都有,且控制类和修复类的占比不应该太低。如果一份 changelog 全是能力类、没有控制和修复,那不是"发展快",那是"债欠得多"。0.156/0.159 的健康度不错:能力、控制、可观测、修复四类齐全,而且把"打断"这种硬骨头啃了——这比多支持一个模型值得尊敬得多。

一句话总结

0.156 和 0.159 没有改变 Codex 能做什么,但改变了"和 Codex 共事是什么感觉"。从语音到全屏 TUI,从用量仪表盘到一键打断,整条 changelog 都在回答同一个问题:当 AI 开始替你干长活,你最需要的不是它更聪明,而是你随时能说了算。

2026 年的终端 Agent 竞赛,早就不是比谁的模型大了。比的是:谁的 transcript 最好找,谁的草稿最不会丢,谁的打断最跟手,谁的权限最老实。这些"小事"加起来,就是"敢不敢把长活交给它"的全部答案。DevDay 负责讲宏大叙事,changelog 负责讲真实生活——而真实生活里,魔鬼和天使都藏在"能不能打断"这种细节里。下次看到一份更新日志,别只看新增了什么模型,多看看"控制类"和"修复类"条目写了什么,那才是厂商真实的技术品味。毕竟,决定你一天工作体验的,从来不是发布会上的 keynote,而是每天打交道的那些细节。

原始来源

浏览项目广场发布你的项目

相关文章

Google 开发者文档变成结构化 API,向 AI 编程 Agent 输送最新知识
资讯
别再让 Agent 背过期文档写代码:Google 把官方文档变成 API,gcloud 一行查、Skill 一行装

2026 年 10 月 7 日,Google Developers 发布 Developer Knowledge API 生态:Google Cloud、Firebase、Android 等官方文档变成程序化事实来源,配 gcloud CLI 入口、官方 Agent Skill(一行安装)、MCP server 和多语言客户端库。为什么「文档 API 化」能连根拔掉 vibe coding「模型记错 API」的经典翻车。

AI 编程实践开发工作流产品发布