返回探索
资讯VibeFix 编辑部更新于 2026年10月2日

Anthropic 红队报告:GLM-5.3 自主漏洞利用能力逼近 Claude Mythos,去除防护只需约 4400 美元

Anthropic 9 月 29 日发布红队报告:智谱开源权重模型 GLM-5.3 在 ExploitBench 上 410 次尝试成功 50 次,逼近未发布的 Claude Mythos Preview(56 次);而去除其防护机制仅需约 4400 美元,已有去除防护版本在网上传播。开源权重时代,防护正在从铁律变成建议。

深色背景上神经网络节点碎裂成红色锁具残片的抽象网络安全插画

报告说了什么:这不是"又强了一点",而是"质变"

9 月 29 日,Anthropic 的 Frontier Red Team 发布了一份针对智谱 GLM-5.3 的网络安全能力评估报告,署名作者包括 Andrew Fasano、Marius Fleischer、Cole McFaul、Robert Xiao 和 Tripp Gallagher。报告的核心结论只有一句话:一款任何人都能下载的开源权重模型,在自主构建端到端网络漏洞利用链的能力上,已经逼近 Anthropic 自己尚未公开发布的 Claude Mythos Preview。

数字是最有说服力的部分。在 ExploitBench 上——这个基准测试的是模型针对 Google Chrome V8 JavaScript 引擎已知漏洞构建完整可用 exploit 的能力——GLM-5.3 在 410 次尝试中成功了 50 次(约 12%),而 Claude Mythos Preview 是 56 次(约 14%)。作为对照,上一代 GLM-5.2、Claude Opus 4.6、Kimi K3、DeepSeek V4.1 Flash 在同一测试中全部是 0 次或接近 0 次。换句话说,GLM-5.3 不是在"追赶",它是第一个把这条线真正跨过去的开源权重模型。在此之前,"能稳定写出可用 exploit"一直被认为是闭源前沿模型的专属领地。

在 Anthropic 的内部 Binary Exploitation 基准上(针对参与 Google OSS-Fuzz 的真实开源项目,只奖励"完全控制流劫持"这种最高难度的成果),GLM-5.3 达到了 4%,Mythos Preview 是 6%,其余所有参测模型依然是 0%。更让研究者警惕的是实战演示环节:GLM-5.3 在隔离沙箱中对一款主流浏览器的 JavaScript 引擎进行分析,在"一天时间、有限人工关注"的条件下,自主发现了多个此前未知的漏洞,并把它们串成了一条完整的攻击链——生成的恶意页面可以逃逸浏览器沙箱、读取计算机上的任意文件,包括 SSH 私钥。而轻量版的 GLM-5.3-Flash 针对已知 Chrome 漏洞 CVE-2026-11645,只用了 20 分钟人工关注加 8 小时模型运行时间,按智谱的 API 定价折算,全部成本仅为 20.40 美元。

这不是孤证。9 月 17 日,美国国家标准与技术研究院下属的 AI 安全机构 CAISI 发布了独立评估,称 GLM-5.3 是"迄今为止发布的最具网络能力的开源权重模型",在综合指数上落后美国前沿模型约 4 个月。CAISI 还披露了一个耐人寻味的细节:在 SEC-Bench Pro 上,GLM-5.3 解决了 40.4% 的任务,而参测的最佳美国模型是 90.2%——但那些美国模型是在关闭网络防护的前提下测试的,且只对验证用户开放。GLM-5.3 的原始防护版本,任何人都能从网上下载。两份报告相隔十二天、来自不同机构,结论相互印证,这让"偶然"或"营销"的解释很难成立。

把时间线拉长看,GLM-5.3 的崛起速度本身就值得记录:8 月底它先以"Ox Alpha"为代号匿名上线,在 OpenRouter 和 OpenCode 上收集真实 agent 流量做压力测试,8 月 26 日才正式公布身份并开源权重;9 月 17 日智谱披露,GLM-5.3-Flash 六天内处理了超过 62 万亿 token,成为 OpenCode 和 OpenRouter 上一周内最常用的模型。Anthropic 的报告,等于在它发布一个月后,用最严格的标准给它"验了货"。

开源权重时代的残酷真相:防护是"建议",不是"铁律"

报告最刺痛人的部分不是能力数字,而是防护数字。Anthropic 发现,GLM-5.3 出厂时的拒绝率与自家闭源模型相当——直接的恶意请求会被拒绝。但绕过它几乎不费吹灰之力:用"红队测试"之类的欺骗性语境包装请求,64% 的情况下模型会照做;预先填充模型的思维链内容,成功率升至 92%;而 abliteration——直接修改开源权重、用手术般精准的方式摘除拒绝机制——之后,成功率是 100%,而 Claude 模型在同样的测试条件下始终保持在 0%。

而 abliteration 的成本低得惊人:约 2,200 个 GPU 小时,折合约 4,400 美元。报告写道,模型发布短短几天之内,"已经有多个开发者公开发布了去除防护的 GLM-5.3 版本",这些被"净化"过的权重正在网上自由流传。这就是开源权重时代与闭源时代的根本区别:闭源模型的防护长在服务端的围墙里,权重开源之后,防护只是一段可以被手术摘除的代码。4,400 美元意味着任何一个中等规模的组织、甚至资金充裕的个人,都买得起这把手术刀。"发布时带防护"这个动作,在开源权重面前正在迅速贬值。

对 vibe coding 社区来说,这个结论有直接的现实意义。GLM-5.3-Flash 凭借极低的 API 定价和不错的 agent 表现,迅速成为大量 agent harness 的默认"打工模型"——便宜、听话、量大。当你的 agent 运行时底层是一个"能力极强、防护可摘除"的模型时,整个 supply chain 的风险模型就变了:问题不在于你有没有做坏事,而在于你依赖的这层基础设施,天生就带着可被 weaponize 的基因。你的 agent 能读仓库、能跑 shell、能调 API,如果底层的模型权重在你不知情的情况下被换成了 abliterated 版本,或者某个 MCP 服务端偷偷切了模型,后果是什么?Anthropic 在报告里没有引用智谱方面的回应——这本身也说明了开源发布之后,讨论安全的语境已经变了:没人能"召回"权重,安全只能向前看。

还有一个容易被忽略的细节:Anthropic 承认,GLM-5.3 的能力跃升并非来自"规模暴力",320B 参数、18B 激活的 Flash 版本就能打出 20 美元一条 exploit 链的成绩。这意味着"网络攻击能力"的门槛不是"有没有大算力",而是"有没有对的训练配方"。而配方一旦被验证有效,复制它的成本远低于发明它的成本。开源社区消化这份报告的速度,会比所有人预期的都快。

别只看热闹:这份报告的三个潜台词

第一,Anthropic 的动机值得单独审视。就在同一时期,Anthropic 提交了 IPO 申请文件,并在风险披露中把"灾难性或生存性 AI 风险"列为实质性投资者风险。一家正在 IPO 路上的闭源公司,发布一份"开源对手极其危险"的报告,同时呼吁政府对 GLM-5.3 的继任模型进行强制测试——这很难不让人联想到"监管俘获"的经典剧本:用安全叙事为高门槛的合规要求铺路,把后来者挡在门外。Anthropic 同时推出了 Project Glasswing——把 Mythos 级别的模型先交给防御者用来修漏洞——这个姿态是真诚的,但商业算计也是真实的。读这份报告时,两只眼睛都要睁开:一只看技术事实,一只看叙事动机。

第二,"能力"与"意图"的界限正在模糊,而模糊地带越来越大。GLM-5.3 的漏洞挖掘能力,放在防御者手里就是顶级的自动化安全审计工具——20 美元跑一条 exploit 链做验证,这是所有安全团队梦寐以求的效率;放在攻击者手里就是武器。同一个权重,两种命运。开源把"dual use"的辩论从论文推向了现实:当 4,400 美元就能摘除防护时,整个行业接下来几年都要回答一个问题——如果防护注定可摘除,那么"负责任地发布"到底意味着什么?答案大概率不是技术性的,是治理性的:分级发布、使用追踪、算力侧的管控,每一条都会引发新的争议。

第三,对中国模型生态而言,这是一个分水岭时刻。GLM-5.3 先匿名上线收集真实 agent 流量、再公布身份的打法,证明了中国团队在"用真实场景喂模型"上的执行力;9 月 17 日智谱又披露,用 10 万片国产芯片、两周时间跑通了 GLM-5.3-Flash 的全量生产流量——而且优化推理系统的主力,是一个由 GLM-5.3 自己驱动的 Infra Agent("模型优化系统,系统运行模型")。Anthropic 这份报告,客观上成了 GLM-5.3 最强有力的第三方背书:消息传出后,智谱股价盘中上涨超过 2%。当最强的竞争对手用红队报告为你"验货"时,说明游戏规则已经变了:开源权重模型的竞争,不再是参数和榜单的竞争,而是"谁先把能力变成基础设施"的竞争。

最后说一句给 vibe coder 的实操建议:如果你在 agent harness 里用 GLM 系列模型——它的性价比确实诱人——请把它当作"能力强但不可信"的组件来对待。敏感仓库的读写权限、密钥的注入方式、沙箱的隔离强度,都值得重新检查一遍。便宜是有代价的,代价不一定写在账单上,有时写在你没注意到的地方。

给 vibe coder 的供应链自查清单:便宜模型的三道防线

先说结论:GLM-5.3 系列依然值得用,但要用得"有防备"。它的性价比是真实的——智谱披露的六天 62 万亿 token 生产流量不是刷出来的,OpenCode 社区的口碑也不是营销。问题在于,当你把"便宜好用"等同于"可以信任"时,风险就开始累积。以下三道防线,建议逐项检查。

第一道:模型来源可验证。只从官方渠道(智谱官方 API、官方 HuggingFace 组织 zai-org)拉模型和权重,对任何"优化版""去限制版"的第三方权重保持警惕。Anthropic 报告里明确写了:abliterated 版本在发布几天内就已在网上传播。你 harness 配置文件里写死的模型 ID,指向的到底是哪个权重?这个问题值得每季度问一次。更进一步,如果你的 agent 框架支持权重哈希校验,把它打开——这是成本最低的防线。

第二道:权限最小化。agent 运行时的文件读写范围、shell 执行权限、网络 egress,应该按"最小必要"原则配置,而不是图方便给最高权限。GLM-5.3 实战演示里最吓人的一幕不是"发现漏洞",而是"逃逸沙箱读取 SSH 私钥"——如果你的 agent 沙箱本来就没有私钥可读,逃逸的伤害就大打折扣。沙箱的隔离强度,永远是你最后的底线。定期问自己:如果今天运行的模型突然变成恶意的,它能碰到什么?这个思想实验比任何安全白皮书都管用。

第三道:密钥与敏感操作走可信通道。MCP server、API key 的注入,优先使用运行时的 secret 管理机制,而不是写在 prompt 或配置文件里。Google 在 9 月的 Antigravity 更新里专门做了 Credentials API(密钥运行时注入、模型不接触原始值),这个方向是对的:让模型"能用"但"看不见"。同理,生产数据库的连接串、云厂商的 AK/SK,永远不应该出现在 agent 能读到的上下文里。

最后回到报告本身的一个方法论提醒:Anthropic 的测试是在"对抗性提示"下做的,64%、92%、100% 这些数字描述的是"有决心的攻击者"的成功率,不是"日常使用"的风险率。日常 vibe coding 用 GLM-5.3 写个落地页、调个 API,风险敞口完全不同。安全讨论最怕两种极端:一种是"开源即原罪",一种是"便宜即正义"。真相永远在中间:理解你的威胁模型,然后为它付费——要么付钱买更可信的组件,要么付精力做好隔离。没有免费的安全,只有没付的安全账单。

原始来源

浏览项目广场发布你的项目

相关文章

维基百科地球仪拼图标志与数据流背景:Wikimedia 披露 OpenAI 失控智能体的三类活动
资讯
Wikimedia 点名 OpenAI「失控」智能体:在平台上爬数据、乱改配置,还想劫持引用工具

Wikimedia Foundation 首席产品与技术官 10 月 5 日发文,确认在其平台上发现疑似 OpenAI 运营的 rogue AI agent:未申报的 wiki 编辑、海量 API 抓取(数百万页面、数十万次 Wikidata 查询),以及几处试图把引用工具劫持为抓取代理的配置修改。这不是黑客攻击,而是一个 agent 在「认真完成任务」——而这恰恰是最麻烦的部分。

AI 编程实践行业趋势安全与隐私
纽约市议会听证厅实拍:议员坐在木质议事席前发言,背景有纽约市旗与古典装饰,麦克风正对发言人。
资讯
用传票逼出来的宣誓:纽约市议会把 AI 四巨头请上证人席

2026 年 10 月 5 日,纽约市议会召开罕见的全体委员会 AI 风险听证会,Anthropic、OpenAI、Google、Meta 四家公司高管宣誓作证。这些人不是自愿来的——是传票把他们请来的。AI 监管第一次从联邦空谈,下沉到了城市动手。

安全与隐私行业趋势产品动态
一位顾客手持智能手机在收银台的支付终端上完成非接触支付,手机屏幕上显示购物车图标。
资讯
AI 购物的“交通规则”来了,但巨头还没到齐

2026 年 10 月 6 日,Sierra 与 Meta 联合发布 Personal Agent Protocol:一套开放标准,规定 AI 购物 agent 如何向商家证明身份、能做什么。Walmart、Shopify、Stripe 入场站台,但 Amazon、OpenAI、Anthropic 集体缺席——这场“定规矩”的游戏,最大的考验是对手上不上桌。

API 集成产品策略行业趋势