0.13 秒听完、0.15 秒开口:微软语音三件套补齐语音 Agent 的最后一块拼图
2026 年 10 月 1 日,微软 AI 一次发布三个语音模型:MAI-Transcribe-2-Streaming(流式转写,Artificial Analysis 流式榜准确率第一,2.5% 词错率、说话结束 0.13 秒出终稿)、MAI-Voice-2.1(23 语言同音色跨语言)与 2.1-Flash(45 秒音频、端到端 150ms)。听、说两端凑齐,纯微软技术栈的语音 Agent 一轮对话可以压进 1 秒内。

2026 年 10 月 1 日,微软 AI 一次甩出三个语音模型:MAI-Transcribe-2-Streaming(流式语音转写)、MAI-Voice-2.1(多语言语音合成)与 MAI-Voice-2.1-Flash(低延迟极速版)。官方新闻的标题很直白——流式转写模型在 Artificial Analysis 一登场就拿了第一。这不是一次普通的模型更新:听、说两端凑齐之后,语音 Agent 终于有了一套「全微软原生」的完整管线。
为什么这件事值得单独写一篇?因为语音 Agent 的体验瓶颈从来不在「聪明」,而在「快」。跟 AI 打电话之所以总有股「对讲机味」,是因为链条太长:听到你说话 → 转成文字 → 想好回复 → 合成语音,每一步都在花时间。微软这次发布的三个模型,就是冲着把这条链的每一毫秒都榨干去的。
听:MAI-Transcribe-2-Streaming,0.13 秒的转写
先看最硬核的数字。MAI-Transcribe-2-Streaming 是微软第一个流式(streaming)转写模型——此前的 MAI-Transcribe-2 是批处理式的,等你说完才给全文;流式版不等你说完,话音未落文字已经出来了。
官方给出的关键指标:支持 60 种语言、说话中途切换语言自动识别(continuous language detection);收到音频 100 多毫秒就吐出第一批「partial」(临时转写假设),随后一边听一边修正,说话结束 0.13 秒提交稳定终稿。在 Artificial Analysis 的流式语音转写榜上,它的最终词错率 2.5%,第一名——而且第一批 partial 的准确率和终稿一样高。
「partial 和终稿一样准」这句值得展开。传统流式转写的 partial 是猜测,错得多、修正频繁,Agent 不敢提前行动;MAI 这次的 partial 质量高到 Agent 可以在用户还没说完时就开始推理、调工具。微软内部测试称,实时听写场景下文字出现速度是最近竞品的 2 倍。对语音 Agent 来说,这意味着「思考」和「听」可以并行——省下来的不是 0.1 秒,而是整个串行等待。
价格:每音频小时 0.54 美元, introductory 价到 2026 年底。Public preview,无 SLA——微软的老规矩,尝鲜可以,上生产等 GA。
说:MAI-Voice-2.1 与 Flash,同一个人说 23 种语言
转写解决「听」,两个语音合成模型解决「说」。MAI-Voice-2.1 支持 23 种语言、26 个 locale,主打一个能力:同一个音色,跨语言保持同一个人——让它说英语,再说普通话,再说德语,听起来是同一个人自然切换了口音,而不是换了三个配音演员。对做多语言客服、教学应用的团队,这是品牌一致性的刚需。
MAI-Voice-2.1-Flash 则是为高并发、低延迟 workload 准备的极速版:45 秒音频、端到端延迟约 150 毫秒,推理快 55%、便宜约 60%,每百万字符 15 美元(标准版 22 美元)。两个模型都支持声音克隆(几秒参考音频即可),同时内置了防滥用的 consent guardrails——2026 年了,声音克隆不带同意机制根本发不出来。
1 秒定律:语音 Agent 的体验分水岭
把三个模型拼起来算一笔账:听 0.13 秒 + 模型思考约 0.35 秒 + 开口 0.15 秒,纯微软技术栈的语音 Agent,一轮对话可以压进 1 秒以内。1 秒是条心理线:超过它,对话像对讲机——你说完,对方"过"一下才回;压进 1 秒,对话开始像打电话。
微软在官方新闻里把这句话说得很透:「语音 Agent 是个 loop:听、理解、决策、说,必须在人类还觉得这是『对话』的时间窗口里完成。每个组件要么帮你在这个窗口里省时间,要么花你的时间。」MAI-Transcribe-2-Streaming 和 MAI-Voice-2.1-Flash 一个在开头省、一个在结尾省,省出来的时间还给中间的 Agent 去推理、调工具、检查答案。
微软还顺手做了个叫 Chatter 的演示,放在 MAI Playground 里,三个模型配成一个能实际对话的 Agent——想验证 1 秒定律的可以直接去玩。
给 vibe coder 的三点判断
第一,语音 Agent 的选型逻辑变了。 过去做语音 Agent 要拼三个供应商:转写一家、LLM 一家、TTS 一家,延迟和账单都散。现在微软、OpenAI(Realtime API)、Cartesia 都在推「一站式语音栈」。一站式不一定最强,但延迟预算最好算、故障排查最省心——对独立开发者,省心经常比极限性能重要。
第二,partial 质量是新的选型指标。 以后评估流式转写,别只看最终词错率,多问一句:「partial 准不准、稳不稳?」Agent 能不能提前行动,全看这个。MAI 这次把 partial 准确率做到和终稿持平,等于重新定义了这条赛道的及格线。
第三,先算钱,再尝鲜。 0.54 美元/音频小时是 introductory 价,年底到期;preview 无 SLA。语音是按量烧钱最凶的模态之一,上线前先用 Chatter 这类 demo 摸清楚真实用量,再决定架构——别让 demo 的流畅度替你做了财务决策。
横向对比:三家语音栈,延迟、准确率、价格怎么选
微软不是一个人在跑。根据 Artificial Analysis 流式转写榜单及多家媒体报道,主流选择的取舍大致如下:MAI-Transcribe-2-Streaming(2.5% 词错率、说话结束 0.13 秒出终稿,榜单第一);xAI 的 Grok Voice Transcribe 2.0(2.7%,0.49 秒);Muse Voice Transcribe(3.1%,0.16 秒);Deepgram Flux(7.4%,0.02 秒);Cartesia Ink-2(4.0%,0.07 秒)。
读这张榜要抓住两个维度:准确率和延迟是跷跷板。Deepgram 和 Cartesia 把延迟压到 0.02-0.07 秒,代价是词错率 4-7%;微软和 xAI 走另一端:多花 0.1 秒,词错率压到 2.5-2.7%。选哪边取决于场景:实时字幕、语音指令这类「听错比慢更糟」的场景,MAI 的路线更对;超低延迟的打断式对话,Cartesia 那端更有优势。没有银弹,只有取舍。
价格维度:MAI 转写 0.54 美元/音频小时是 introductory 价(年底到期),正式价未公布;语音合成按字符计费(标准版 22 美元、Flash 15 美元每百万字符)。对比 OpenAI Realtime API 的按分钟计费,做选型时建议用你自己的真实通话量(平均通话时长 × 日通话数)分别算一遍——demo 阶段的体感在账单面前不作数。
榜单方法论:Artificial Analysis 测的是什么
多说一句方法论,免得被「第一名」带偏。据报道,AA 的流式榜用约 8 小时音频混合测试(Agent 对话、议会演讲、财报电话按比例混合),延迟从语音结束(VAD 检测)开始计时。也就是说,它测的是「理想条件下的转写质量」,不包含真实通话里的网络抖动、口音、背景噪音——榜单第一不等于你的场景第一,上线前拿自己的真实音频跑一遍才是正经评估。
Chatter:在 MAI Playground 里亲手验证
微软在 MAI Playground 里放了个叫 Chatter 的演示,把三个模型串成一个能实际对话的 Agent。如果你正在选型,花 10 分钟亲手玩一下,重点感受三件事:打断它,它多久能停下来听你说(barge-in 体验);中英混说,它切语言顺不顺;连续聊 5 分钟,延迟有没有爬升。demo 不会告诉你价格,但会告诉你体验上限——如果 demo 的体验你都接受不了,API 也救不了。
不同角色的行动建议
独立开发者:先别急着重构。花一个下午做三件事:去 MAI Playground 玩 Chatter,确认 1 秒对话的体感;拿你自己的真实音频(带口音、带背景音的那种)调一次转写 API,看词错率和 demo 差多少;按你过去 30 天的用量把三家(微软/OpenAI/Cartesia 系)各算一遍账。选型结论应该来自你的数据,不是发布会。
小团队:语音链路建议做「供应商抽象层」——转写和 TTS 各包一层接口,底层可换。这波语音模型的迭代速度是按月算的,今天锁死某一家,三个月后想换就得重写。抽象层的成本是一天,换供应商的成本是一周。
内容创作者/教育者:MAI-Voice-2.1 的「同音色跨语言」值得重点关注。过去做多语言视频要么换配音、要么忍受 AI 腔,现在一个音色讲 23 种语言且保持同一个人——配上 consent guardrails,正规商用链路已经通了。这是 2026 年多语言内容生产力释放最直接的一次。
补充一个时间线细节:微软把转写的 introductory 价格定到 2026 年底才到期,基本等于明示「GA 与正式定价在年底前见」。结合 MAI 团队自称 lean、fast-moving lab 的定位,这条线的迭代只会更快——选型时给供应商留好替换接口,比押注某一家更重要。
一句话总结:微软这次不是发布了三个模型,而是发布了一条「1 秒对话」的流水线。当语音 Agent 的延迟压进 1 秒,「对讲机感」消失之后,拼的就是 Agent 本身的智商了——而那,恰恰是 vibe coder 最擅长的战场。
原始来源
相关文章

Tavus 于 10 月 1 日发布 Griffin——首个"人类交互模型"(HIM),全双工 video-to-video,盲测中 48% 的参与者以为在和真人视频,而上一代系统最高只有 2%。能骗过人恰恰是它暂不全面上线的理由:这篇文章讲清技术为什么不一样、形态为什么分叉,以及 vibe coder 该怎么用它。

2026 年 10 月 8 日,Google Cloud 在 Gemini at Work 2026 大会上发布 Gemini agent:为工作而生的统一 Agent,拿目标自己规划、按任务在 Gemini 和 Claude 模型之间自动选择,并推出拥有独立邮箱、calendar 和通讯录席位的「同事 Agent」。四点判断:Agent 竞赛的下半场是「更像同事的 Agent」。

OutSystems 于 10 月 7 日在拉斯维加斯 World Tour 上宣布 Agent Experience 全面可用:把低代码平台开放给 Claude Code、Cursor、Codex、Kiro 等任意 AI 编程 Agent——Agent 在设计层面工作,平台确定性地生成代码,内置安全、自动测试与生命周期治理。这是「vibe coding 进企业」的标准剧本:对抗 shadow AI,给 Agent 一条合规的路。但 74% 的返工数据是厂商调研,要打折看;真正的账,是平台锁定的隐性成本。