返回探索
资讯VibeFix 编辑部更新于 2026年10月8日

对着空气说句话,Devin 就去写代码了:Sesame 语音助手 10 月大更新

Sesame 10 月 6 日发布新版语音助手:iOS/Android 全量开放、全新语音模型,每个语音 Agent 都有「自己的电脑」,散步时动动嘴就能调度 Devin、Claude Code 写代码。智能眼镜 2027 年见,voice OS 的野心已经摆上台面。

黑色智能眼镜镜片上显示语音助手界面图标,象征语音 AI 与智能眼镜的概念图

想象这样一个场景:你在公园散步,耳朵里戴着耳机,对着空气说了一句:「帮我把那个登录 bug 修了,跑通测试再告诉我。」然后你继续散步。半小时后,耳机里传来声音:「修好了,测试全过,要不要我讲讲改了什么。」

写代码的那位不是你的同事,是 Devin。而你跟它之间隔着的,只有一句话——通过 Sesame 的语音助手下达的。

10 月 6 日,语音 AI 公司 Sesame 发布了新版语音助手,同时公布了智能眼镜的发售时间表。这可能是今年 vibe coding 领域最值得琢磨的一次更新:它赌的是,写代码这件事,以后不一定非要坐在屏幕前敲 prompt。

这次更新了什么:全量开放、全新语音模型,每个助手都有「自己的电脑」

先说产品事实。新版语音助手在 iOS 和 Android 双端全量开放,搭载了全新的语音模型。全量开放意味着它不再是内测玩家的玩具,任何人现在都可以下载体验;新语音模型解决的是语音助手的老毛病——机械感、延迟感、听不懂人话。

但真正有分量的是这个概念:每个语音 Agent 都有「自己的电脑」。什么意思?你不需要把手机递给它、不需要开着电脑屏幕共享,它有自己独立的执行环境。你免提下达任务,它在自己的电脑上干活,干完了通知你回来验收。

这句话的信息量很大。过去的语音助手(Siri 们)是「传声筒」:你说话,它帮你点一下手机上的按钮。Sesame 这次给的是「执行体」:语音只是交互界面,后面连着的是一个有自己工作区的 agent。它能调用工具、协调其他 agent、接入日常服务(首批是 Google 系服务),还能挂载自己的 MCP。

翻译成大白话:你对着空气说的那句话,另一头是一个真的能动手干活的 agent,有工具、有环境、有服务接入。它不是帮你「操作手机」,它是替你「完成工作」。MCP 的支持尤其值得注意——这意味着它的能力边界不是 Sesame 预置的那几个功能,而是整个 MCP 生态。

首批接入的是 Google 系服务,这个选择很务实。日历、邮件、文档、搜索——这些是「日常服务」里最高频、最标准化的部分,先把最通用的能力接进来,验证「语音 agent 真的能替你办事」的闭环,再扩展长尾。做平台最忌讳一上来就铺大饼,先让核心场景跑通,用户才会相信后面的故事。

最有意思的细节:Sesame 团队用自家四个助手开发了这一版

官方 Journal 里最耐人寻味的一段,不是功能列表,而是开发方式:Sesame 团队用自家四个语音助手——Maya、Miles、Charlie、Simone——开发了这一版产品。

演示场景是这样的:团队成员在散步、通勤的时候,通过语音调度 Devin、Claude Code、Codex 写代码。注意这个组合:Sesame 的语音助手负责「听懂你要什么、拆解任务」,Devin、Claude Code、Codex 这些 coding agent 负责「把代码写出来」。语音助手成了 agent 们的「包工头」。

「吃自己的狗粮」在 AI 圈很常见,但吃到这个份上的不多。一个语音助手团队,敢把自己新版本的核心开发流程押在自家语音助手调度 coding agent 上,这本身就是最强有力的产品验证。如果这套流程连他们自己的工程师都伺候不好,演示视频根本不敢放出来。

换个角度想,这也是 Sesame 在回答一个尖锐的问题:语音助手公司自己,到底信不信「语音可以指挥代码」这件事?很多公司的 demo 是市场部拍的,工程师自己都不用。Sesame 把四个助手的名号(Maya、Miles、Charlie、Simone)直接写进官方 Journal,等于把自家产品的口碑押在了真实工作流上——做不好,丢的是全公司的脸。这种程度的 all-in,本身就是一种信息。

对 vibe coding 玩家来说,这个细节的信号意义大于功能本身。它证明了一条新的工作流是跑得通的:语音(意图输入)→ 语音 agent(任务拆解与调度)→ coding agent(执行)→ 语音(结果验收)。键盘不再是唯一的输入设备,屏幕不再是唯一的验收界面。

智能眼镜 2027 年见:voice OS 的野心

和新版助手一起公布的,还有硬件时间表:Sesame 的智能眼镜 2027 年发布。

官方的愿景表述是「眼镜上的 voice OS」,拆成三个词:frames(镜架)、intelligence(智能)、characters(角色)。frames 解决的是「愿不愿意戴」——据说镜架找了日本工匠打磨,显然是在对标传统眼镜的佩戴体验,而不是科技产品的极客感;intelligence 是新版助手这套能力;characters 最有意思,指的是 Maya、Miles 这些有名字、有性格的助手形象。

把这三个词连起来看,Sesame 的赌注就很清楚了:未来的计算设备不是一块更大的屏幕,而是一个「陪伴你的声音」。眼镜只是让这个声音有了随身的载体,characters 是让这个声音值得你长期相处。

行业坐标也值得摆出来:Meta 的 Ray-Ban 新款卖到 799 美元,智能眼镜正在从极客玩具变成消费电子的主流品类;苹果这边则传闻在做无屏眼镜。Sesame 选在 2027 年这个时间点,卡的是「语音模型成熟 + 眼镜供应链成熟」的交叉点。早一年,语音能力撑不起;晚一年,市场被巨头占完。

开发者生态:年内推工具,第三方可以构建 Sesame app

对开发者最相关的一条消息藏在后半段:年内会推出开发者工具,允许第三方构建 Sesame app。

这句话意味着 Sesame 不想只做一个 app,它想做平台。语音 agent 有了自己的电脑、能调工具、能挂 MCP,下一步自然是让第三方开发者往这个「电脑」里装软件。类比一下:iPhone 的 App Store 之于触屏,Sesame 的开发者工具之于语音。

平台化的时机选择很讲究。太早推,语音模型不行,开发者做出来的东西体验拉胯,反而砸口碑;太晚推,用户习惯被巨头定死。现在这个时间点——新语音模型刚上线、全量开放带来用户基数、眼镜 2027 年上市前需要生态预热——推开发者工具,节奏是对的。

对 vibe coding 社区来说,这是个值得盯的机会。每一代新平台刚出现时,都有窗口期红利:App Store 早期、微信小程序早期、Chrome 插件早期,第一批吃螃蟹的独立开发者都吃到了肉。语音 agent 平台如果成立,「为说话场景设计的应用」会是一个全新的品类,交互逻辑和屏幕 app 完全不同,先行者优势会很大。

多说一句「为说话场景设计」意味着什么。屏幕 app 的交互是「看—点—确认」,信息密度高、可回溯;语音交互是「说—听—打断」,线性、不可回溯、对延迟极度敏感。这意味着语音 app 的设计哲学是反屏幕的:一次只说一件事、用声音确认代替按钮、允许随时打断纠正。现在去想「把我的 vibe 项目加个语音入口」,大概率做出来的是个四不像;真正属于语音原生应用的形态,还得等第一批开发者用失败案例把它试出来。

我的判断:vibe coding 的交互形态可能要变了

说回 vibe coding 本身。过去两年,这个词几乎默认绑定着一个画面:一个人坐在屏幕前,对着对话框敲 prompt,等 agent 把代码吐出来。prompt engineering、context engineering,卷的都是「怎么把话说得更清楚」。

Sesame 这次更新捅破的恰恰是这个默认画面:如果意图输入可以用语音完成,如果任务调度和结果验收也可以用语音完成,那么「坐在屏幕前」这个前提就松动了。写代码变成了一件可以在散步、通勤、做饭时干的事——不是「摸鱼写代码」,而是「把原来只能坐在桌前干的活,解放到生活里」。

这个变化对 vibe 项目的形态会有连锁反应。现在的 vibe 项目默认是「屏幕应用」:网页、App、小程序,因为交付物就是屏幕上的东西。但如果交互入口变成语音,会出现一批「无屏 vibe 项目」:语音控制的 agent 工作流、定时语音汇报、语音验收代码。MCP 生态已经铺好了能力层,Sesame 这类产品铺的是交互层。

当然,冷静一点。语音做「精密工作」有天然局限:code review 时指着第 37 行说「这里改一下」,语音描述的成本远高于鼠标一点;复杂的多文件重构,语音调度的信息密度不够。Sesame 演示的是「下达任务」和「验收结果」这两个环节——恰好是语音最擅长的两头。中间「怎么写代码」那段,依然是 Devin 们在屏幕背后的世界里默默干完的。

所以更准确的判断是:语音不会取代屏幕,但会吃掉「意图输入」和「结果验收」这两个环节。vibe coding 的工作流会变成:嘴上说、手上闲、眼睛只在验收时看屏幕。这对独立开发者的意义很实在——原来每天能深度工作 4 小时,现在散步的 1 小时也能变成生产时间。

最后说个大一点的判断。计算设备的交互史,每一次都是「离身体更近一步」:从机房(走过去)、到桌面(坐下来)、到手机(拿起来)、到耳机和眼镜(戴上去)。Sesame 赌的是下一步:设备消失,交互只剩下声音。如果这个判断是对的,那么今天为屏幕设计的 vibe 项目,明天都要回答一个问题——当用户开始对着空气说话时,你的产品在哪?

给 VibeFix 的读者一个具体的行动建议:现在就去下载新版 Sesame,用一周时间把「每天第一次打开 IDE 之前的那半小时」换成散步 + 语音调度。不用指望它立刻替代你的工作流,目的是亲手摸一下这条新工作流的边界——哪些任务语音描述一次就够,哪些任务你说三遍 agent 还是听不懂。这个体感,决定了你明年要不要为语音场景做产品。平台窗口期不等人,但盲目冲进去和完全不看,错得一样贵。

原始来源

浏览项目广场发布你的项目

相关文章

笔记本电脑屏幕上显示着浏览器中的网站注册页面
资讯
ChatGPT Sites 冲上 HN 热榜:提示词建站,到底是玩具还是生产力?

10 月 3 日,Sites in ChatGPT 以约 209 点赞、218 评论冲上 HN 前页。这不是发布,而是一场清算:提示词直达 URL,到底是玩具、原型托管,还是生产力?四个争论焦点、文档实锤的技术事实(D1/R2、登录、自定义域名),以及给 vibe coder 的三个判断。

AI 编程实践产品发布独立开发
Google Cloud 发布会舞台,大屏幕上展示 Gemini agent 发布主题
资讯
给 Agent 发工牌、邮箱和通讯录席位:Google Cloud 发布统一工作 Agent,按任务在 Gemini 和 Claude 之间选模型

2026 年 10 月 8 日,Google Cloud 在 Gemini at Work 2026 大会上发布 Gemini agent:为工作而生的统一 Agent,拿目标自己规划、按任务在 Gemini 和 Claude 模型之间自动选择,并推出拥有独立邮箱、calendar 和通讯录席位的「同事 Agent」。四点判断:Agent 竞赛的下半场是「更像同事的 Agent」。

产品发布AI 编程实践自动化