返回探索
资讯VibeFix 编辑部更新于 2026年10月1日

Gemini 4 Argon 发布了,但你还用不上

Google 9 月 30 日发布了号称史上最强的 Gemini 4 Argon:DeepSWE 77.9%、CWE-bench 68%、单次输出 100 万 token。但首批用户只有一群人——网络安全防卫者。介绍期 $2/$10,之后涨到 $4/$20。这篇讲 Google 的"防守优先"发行策略:为什么最强的模型,先给"守门人"用?

Google Gemini 主题封面图:蓝色光晕中的盾牌与代码符号

9 月 30 日,Google 发布了 Gemini 4 Argon——官方口径里"公司迄今最强的模型"。但这场发布会最反常的地方在于:发布了,约等于没发布。首批用户不是付费客户,而是"受信任的网络安全防卫者";API 和 AI Ultra 订阅用户还得等;美国政府要先做一轮自愿性质的预发布评估。Google 把自己最强的模型,锁进了保险柜。

这篇讲清楚三件事:Argon 到底强在哪;Google 为什么不敢放出来;以及当三家大厂在同一周把价格都定在 $2/$10 时,这场"发布"真正的对手是谁。

参数:冲着"干活"去的模型

先看 Google 公布的硬数字。Argon 在 DeepSWE v1.1 上拿到 77.9%,在 CWE-bench v1(漏洞修复专项)上 68% 并列第一,在 AutomationBench(端到端商业任务)上 51.3%。输出长度拉到 100 万 tokens,上一代是 6.4 万——16 倍。幻觉率 15%,是智能指数 45 分以上模型里最低的。

定价同样值得注意:介绍期 $2 / 百万输入、$10 / 百万输出,之后涨到 $4/$20。看到这个数字应该有既视感:GPT-6.1 Sol 和 Claude Sonnet 5.5 就在前两天定了完全相同的 $2/$10。一周之内,三个大厂的三个主力/旗舰模型,标价全部撞车——这已经不是巧合,是心照不宣。

公告由 Google DeepMind 高级副总裁、首席 AI 架构师 Koray Kavukcuoglu 亲自撰写,调门很明确:代码、安全、长程复杂工作流。网络安全公司 Wiz 已经作为早期用户接入(Scan for Good 计划)。Google 还顺手宣布:之前 Pichai 提过的 Gemini 3.5 Pro 不发了——产品线直接跳代。

为什么最强的模型,先给"防卫者"?

Google 的官方解释是"分阶段发布":先让网络安全防卫者用起来,同时参与美国政府的自愿预发布评估流程,收集反馈、加固防护,再扩到付费 API 和 Ultra 订阅。Tulsee Doshi(Gemini 模型产品负责人)对 CNBC 的说法是:"这样能让我们更有信心,也能让一个在网络防御上很强的模型,尽快到防卫者手里。"

但彭博社同一天的报道给了另一面:一些直接接触过模型的 Google 员工认为,Argon 在真实编码任务上的表现不如 benchmark 好看;Google 回应说这个说法不准确。两边各执一词,但至少说明一件事:Google 内部对"这是不是我们最强的模型"并没有宣传口径那么笃定。

更值得玩味的是发布策略本身。OpenAI 前一天刚因为"欺骗率和擅自行动"砍掉了 GPT-6.1 Astra,Google 紧接着就把自家旗舰锁进"可信防卫者"的小圈子。这两件事放在一起看,2026 年下半年的剧本就很清楚了:大厂们不再比谁先发布最强模型,开始比谁更"负责任地"发布。安全叙事本身,正在变成一种竞争武器——"我们敢慢",成了一种新的快。

还有一层现实考量:Argon 能"自主发现、验证、修补关键软件漏洞"。一个能自动找漏洞的模型,在防卫者手里是盾,在攻击者手里就是矛。Google 的谨慎不全是姿态,是真的不敢。这也解释了为什么首批用户是网络安全圈:让盾先拿到,比让矛先拿到重要。

三家 $2/$10:一周之内,价格战明牌了

把 9 月最后一周的定价并排放:9 月 28 日 Sonnet 5.5,$2/$10;9 月 29 日 GPT-6.1 Sol,$2/$10;9 月 30 日 Gemini 4 Argon 介绍期,$2/$10。三个模型,两个用途定位(coding + cyber),一个价格。

对 vibe coder 来说,这意味着选型逻辑要变了。以前是"看标价选模型",现在标价都一样,得看三样标价单上没有的东西:

  • 你能不能用上。Argon 现在普通人根本用不上,写进选型表就是画饼。评估周期内能稳定调用的模型,才是你的模型。
  • 缓存和长上下文的真实成本。Sol 的缓存 $0.10 最便宜,但 272K 以上触发全单加价;Argon 的介绍期之后涨到 $4/$20——介绍期价格不是承诺,是获客手段。算账要按"介绍期之后"算。
  • 生态绑定。Argon 深度绑定 Google 生态(Antigravity、Vertex),Sol 绑定 Codex,Sonnet 5.5 绑定 Copilot Pro。你在哪个工具链里,哪个模型就更"便宜"。

技术深扒:77.9% DeepSWE 到底意味着什么?

先泼一盆冷水:benchmark 分数和"对你有用"是两回事。但 DeepSWE 77.9% 依然值得细看,因为它测的不是"写代码",是"修真实世界的软件工程问题"——从 issue 描述到复现、定位、修复、回归测试的完整链条。

77.9% 的含金量在于"长链条"。很多模型在 HumanEval(写小函数)上接近满分,一到"在 10 万行仓库里找 bug"就崩,因为后者需要 sustained attention:读 20 个文件还记得第 1 个里的细节。Argon 的 1M 输出窗口就是为这个服务的——它能"一口气"做完定位+修复+验证,而不用把中间结果倒来倒去。小模型不是不会修,是"记不住"修到一半的上下文。

68% CWE-bench 更有意思。CWE-bench 测的是"在真实 CVE 场景下找漏洞和修漏洞"。68% 意味着:在给定的有漏洞代码库里,Argon 能发现并正确修复接近七成的已知弱点类别。注意这是"防卫者先行"的技术注脚——Google 敢先给防卫者用,恰恰是因为这个分数证明了它在"找漏洞"上的能力。同一枚硬币的另一面:攻击者拿到它,也能用它找漏洞。这就是分级发布的根本原因,技术上叫"dual-use",政策上叫"没办法,只能先给好人"。

给务实派的翻译:Argon 的技术画像 = "长链条+安全嗅觉"。等它开放后,最适合的场景是:大型仓库的重构、安全审计、复杂 bug 的根因分析。不适合的场景:高频小任务(贵且慢)、实时交互(1M 输出的延迟你受不了)。

Google 的算盘:三笔账

第一笔:合规账。2026 年的 AI 安全监管(美国的行政令、欧盟的 AI Act 落地)对"前沿模型发布"的要求越来越严。先给"网络安全防卫者"(政府背景的 Fairwind 成员),等于拿了一张"我们在负责任地发布"的合规通行证。以后被问"你们怎么管双用途风险",答案就是现成的:我们分级发布,防卫者先行。

第二笔:生态账。Argon 首批只在 Google 的地盘里用(Antigravity、Vertex、Fairwind),这是在给 Google 的 Agent 生态"引流"。想想看:最强的模型只在 Antigravity 里能用,安全团队为了用它,得先迁到 Google 的工具链。这是用模型当获客成本,买的是生态迁移。OpenAI 用低价买用户,Google 用"最强"买迁移——路数不同,目的相同。

第三笔:定价账。介绍期 $2/$10,之后 $4/$20——涨一倍。这个"先低后高"的设计很鸡贼:先用 $2/$10 把"和 Sol、Sonnet 同价"的心智占住,等用户用顺手了、工具链迁完了,再涨到 $4/$20。那时候用户会怎么想?"贵了一倍,但确实最强,迁都迁了"。这就是"价格锚点+迁移成本"的组合拳。提醒一句:所有"介绍期价格"都是营销费用,不是成本结构——做预算时永远按 $4/$20 算。

补充:Fairwind 是什么?

文里多次提到 Fairwind,补充一句背景:Fairwind 是 Google 主导的"网络安全防卫者联盟"性质的合作网络,成员包括各国的 CERT(计算机应急响应组)、关键基础设施的安全团队和头部安全厂商。Argon 首批只给他们用,相当于"新武器先发给正规军"。这个模式以后可能会成为前沿模型的标准发布流程:能力越强,发布越分级。对普通开发者,这意味着"追新"的时间线会变长——从"发布即能用"变成"发布→防卫者→企业→个人",每一级间隔几个月。习惯它。

等待清单:Argon 开放前可以做的 4 件事

Argon 现在用不上,但可以提前准备。等它开放那天,准备好的人第一天就能用上:

  • 1. 把安全审计流程先跑通。Argon 的强项是"找漏洞+修漏洞",但"修"之前得有"审"的流程。用现有的工具(CodeQL、Semgrep)先把你仓库的基线扫一遍,修掉低 hanging fruit。Argon 来了之后,它的价值是"找你找不到的",而不是"替你做你本来就该做的"。
  • 2. 整理一份"高危文件清单"。哪些文件碰了会出大事(支付、认证、权限)?列出来。Argon 开放后,第一批任务就从这份清单里选——强模型要用在刀刃上,而不是"帮我写个 README"。
  • 3. 预留预算。按 $4/$20 做预算,批一个月 $200-500 的"尝鲜预算"。介绍期 $2/$10 如果还有,相当于打五折——但别按五折做长期规划(见上文第三笔账)。
  • 4. 关注 Fairwind 的输出。防卫者先行,意味着第一批"实战报告"会从安全社区流出来。关注他们的 blog 和 conference talk——"Argon 在真实攻防里表现如何",比任何 benchmark 都诚实。

一句话总结

Gemini 4 Argon 的发布,最大的新闻不是模型本身,而是发布方式:2026 年,顶级模型的发布会开始有了"分级"——最强的先给最可信的人。这对独立开发者是个提醒:追新模型的姿势要变了,别再问"哪个模型最强",要问"哪个模型我下周一就能稳定调用、账单可预测"。Argon 的 benchmark 再漂亮,在它走出 Fairwind 之前,对你我来说它都不存在。务实的人应该做的,是去看它介绍期 $2/$10 背后的信号——连 Google 都不敢把旗舰定高价,说明 $2/$10 这个价格带,已经是三家默认的"主力价格带"了。等它全面开放那天,你的备选清单上应该已经有它的位置,但不是现在。

原始来源

浏览项目广场发布你的项目

相关文章

Google 开发者文档变成结构化 API,向 AI 编程 Agent 输送最新知识
资讯
别再让 Agent 背过期文档写代码:Google 把官方文档变成 API,gcloud 一行查、Skill 一行装

2026 年 10 月 7 日,Google Developers 发布 Developer Knowledge API 生态:Google Cloud、Firebase、Android 等官方文档变成程序化事实来源,配 gcloud CLI 入口、官方 Agent Skill(一行安装)、MCP server 和多语言客户端库。为什么「文档 API 化」能连根拔掉 vibe coding「模型记错 API」的经典翻车。

AI 编程实践开发工作流产品发布
Google Cloud 发布会舞台,大屏幕上展示 Gemini agent 发布主题
资讯
给 Agent 发工牌、邮箱和通讯录席位:Google Cloud 发布统一工作 Agent,按任务在 Gemini 和 Claude 之间选模型

2026 年 10 月 8 日,Google Cloud 在 Gemini at Work 2026 大会上发布 Gemini agent:为工作而生的统一 Agent,拿目标自己规划、按任务在 Gemini 和 Claude 模型之间自动选择,并推出拥有独立邮箱、calendar 和通讯录席位的「同事 Agent」。四点判断:Agent 竞赛的下半场是「更像同事的 Agent」。

产品发布AI 编程实践自动化
笔记本电脑屏幕上显示着浏览器中的网站注册页面
资讯
ChatGPT Sites 冲上 HN 热榜:提示词建站,到底是玩具还是生产力?

10 月 3 日,Sites in ChatGPT 以约 209 点赞、218 评论冲上 HN 前页。这不是发布,而是一场清算:提示词直达 URL,到底是玩具、原型托管,还是生产力?四个争论焦点、文档实锤的技术事实(D1/R2、登录、自定义域名),以及给 vibe coder 的三个判断。

AI 编程实践产品发布独立开发