小模型正在变成「子 Agent 标准件」:Claude Haiku 5.5 降价背后的多 Agent 成本经济学
Anthropic 于 10 月 7 日发布 Claude Haiku 5.5,自称「最便宜、最快、功能最强的小模型」。但真正值得解读的不是便宜本身,而是一个「10 万 token 价格悬崖」:10 万以内提示词降价约 90%,超过则只降约 50%。这是在用定价教用户把大任务切碎——小模型的战场,正从「陪你聊天」转向「被大模型指挥」。

Anthropic 在 2026 年 10 月 7 日发布了 Claude Haiku 5.5,官方给出的定位毫不含糊:这是他们「最便宜、最快速、功能最强大的小型模型」。官方博客同时给出了一句话,值得单独拎出来读:Haiku 5.5 与 Opus 5.5、Sonnet 5.5 配合得非常好,可以作为 coding 工作中的 subagent。模型 ID 是 claude-haiku-5-5,已经在 Claude 平台、AWS、Google Cloud 和 Azure 全面上线。
这条新闻乍看平淡:大厂又发了个便宜小模型,benchmark 涨了,价格降了,年年有。但把定价表摊开看,你会发现一个刻意设计的细节——Anthropic 在用价格本身给用户写产品说明书。它把提示词按 10 万 token 划了一条线:线内,输入降到每百万 token 0.10 美元、输出 0.50 美元,相对 Haiku 4.5 降价约 90%;线外,输入输出分别是 0.50 美元和 2.50 美元,降价约 50%。缓存读在 10 万以内只要 0.01 美元(Haiku 4.5 是 0.10 美元),缓存写 0.125 美元(Haiku 4.5 是 1.25 美元)。官方还顺手披露了一个分布:此前 Haiku 模型约 90% 的请求提示词在 10 万 token 以内——换句话说,这条悬崖线之下覆盖了绝大多数真实工作负载,综合算下来运行成本比 4.5 代平均低了约 75%。
「10 万 token 价格悬崖」:定价就是产品说明书
传统上,模型降价是线性动作:全场景统一打折。但 Haiku 5.5 的降价是阶梯式的,这不是财务部门的心血来潮,而是一种行为引导。Anthropic 在用定价告诉你:把长上下文任务切碎。10 万 token 大概是 7 万多字的文档,或者一个中等规模仓库的关键文件切片——大多数 agent 场景的单次子任务(读一个文件、跑一次测试、总结一段 diff)都落在这个区间里。超过 10 万 token 之后降价力度腰斩,等于在说:「你要么把任务拆得更碎,让每个子 Agent 的上下文保持苗条;要么就付溢价给全量长上下文。」
这背后是一套成熟的成本经济学。当一个 coding Agent 一天调用子模型几百上千次时,成本结构完全由两件事决定:单次调用的 token 量和调用次数。90% 降幅的档位精准地落在「高频、短 prompt」的子 Agent 场景里——摘要、compaction、数据库查询、分类请求,官方博客把这些例子点名写了出来。而那些动不动塞几十万 token 上下文的用法,价格优惠就大打折扣。这不是在惩罚长上下文,而是在承认一个现实:小模型的性价比优势,只在「任务被切碎」时成立。
更深一层看,价格悬崖是 Anthropic 对自己生态的诚实定价。它没有像某些厂商那样宣传「超长上下文、小模型价格」,而是公开承认:长上下文推理的真实成本就是高,硬压价只会让服务质量崩。所以它把悬崖线画在 90% 请求的分位点上——对大多数人是真降价,对重度长上下文用户是「别指望小模型干这个活」。
Benchmark 讲的是一个「被指挥」的故事
再看官方给出的 benchmark。这张表最有意思的地方不是 Haiku 5.5 赢了谁,而是它被拿来和谁比。
在 agentic coding 的两张核心榜单上,Haiku 5.5 的 Terminal-Bench 4.0 得分 39.2%——上一代 Haiku 4.5 在这项上是刺眼的 0.0%,同期对比的 GPT-6 Luna 是 16.4%,自家大哥 Sonnet 5.5 是 70.6%。FrontierCode 1.1 上 Haiku 5.5 拿到 46.4%,超过 GPT-6 Luna 的 42.4%,逼近 Sonnet 5.5 的 52.1%(高 effort 档)。注意这组对比的潜台词:Anthropic 拿自家小模型去对标的是 OpenAI 的同级小模型,而不是自家旗舰——小模型的战场,已经从「能不能聊天」彻底转向「能不能干活」。
Computer use 场景的跃升更夸张:OSWorld 2.1 离线子集上 Haiku 5.5 拿到 72.4%,上一代只有 15.7%,GPT-6 Luna 是 48.9%,Sonnet 5.5 是 83.9%。知识工作类的 GDPval-AA v2.1 拿到 1620 分(GPT-6 Luna 1437,Sonnet 5.5 1840),AA-Briefcase v1.1 拿到 1578 分(GPT-6 Luna 1336,Sonnet 5.5 1824)。连 Humanity's Last Exam 这种纯推理榜单,Haiku 5.5 都从上一代的 10.2%(无工具)/ 18.7%(有工具)爬到了 45.9% / 57.4%。
但真正定义这款产品的是官方博客里那句不起眼的话:「Sonnet 5.5 和 Opus 5.5 在 Terminal-Bench 这类复杂 agentic coding 任务上仍然是更好的选择;相比之下,Haiku 5.5 最适合那些范围更窄的任务——比如 compaction、摘要,或者 subagent 工作。」翻译一下:Anthropic 不指望你用 Haiku 5.5 独立解决难题,它希望 Opus/Sonnet 把任务拆开,Haiku 5.5 去当那个被指挥的执行者。这是官方第一次如此直白地把「大模型拆任务、小模型分头跑」的多 Agent 编排写进产品定位。
还有一个被低估的更新:Haiku 5.5 是首个支持可调 effort 档位的 Haiku 模型。用户可以在成本和智能之间自己拨旋钮。这意味着「小模型」不再是一个固定档位,而是一条连续光谱——当你需要时,它可以往上探一探;当你只想要便宜时,它退回底座。小模型第一次有了「弹性」。
生态已经用行动投票:Devin Fusion 的 66.2 分
发布当天,Cognition 就宣布 Haiku 5.5 进入 Devin。数字很有说服力:在他们自家的 FrontierCode 1.1 基准上,Haiku 5.5 单模型拿到 58.4%,超过 Sonnet 5,而单次任务成本只有约八分之一;把它放进 Devin Fusion 当 sidekick(副手),由 Opus 5.5 担任 lead(主 Agent),Fusion 整体在 FrontierCode 上保持 66.2 的顶级分数,同时成本和延迟双双下降。
这个案例恰好是 Anthropic 官方叙事的现实注脚:前沿模型负责 plan、歧义处理和最终 review,便宜的 sidekick 负责执行。「主从分工」不再是论文里的架构图,而是已经跑在生产环境里的计费单。Asana 的早期测试也佐证了速度维度:任务完成延迟降低超过 30%,每个 Agent 回合的推理速度最高快 2.5 倍——对「一次会话 fan-out 几十个子 Agent」的场景,延迟的改善和成本的改善是同一枚硬币的两面。
「一大一小」的两极分化正在成型
把视野拉远一点,2026 年的模型格局正在出现清晰的两极。一极是「大而全」路线:堆参数、补能力、上限越高越好,代表选手是 Mistral 那一类万亿参数级的旗舰——它们的使命是把智能的天花板继续往上顶。另一极就是 Haiku 5.5 代表的「小而专」路线:不追求单点智能的极限,追求在特定分工里的性价比极限。
这两极不是竞争关系,而是共生关系。大模型越强,它拆出来的子任务就越多、越细,对「便宜、快、够用」的执行层需求就越大。Anthropic 这次的组合拳恰恰印证了这一点:同一天,它把 Sonnet 5.5 的缓存读价格砍了一半(从每百万 token 0.20 美元降到 0.10 美元),让 Sonnet 在大多数 agentic 工作负载上便宜约 20%——因为缓存读占了 Agent token 消耗的大头;同时给 Claude Max 和 Team 订阅用户新增每月 API 额度(Max 5x 每月 100 美元、Max 20x 每月 200 美元、Team 汇总最高 500 美元),明确说这是为了「支持用户在 Claude 平台上构建新的 Agent 和应用」。降价、返额度、推小模型,三件事指向同一个战略:让多 Agent 应用的账算得过来。
对开发者来说还有一个实操层面的信号:Python 和 TypeScript SDK 这次新增了 computer use 和 browser use 的 beta 支持,而官方点名 Haiku 5.5「尤其适合」这两类任务——速度、能力和价格的组合,正好对上浏览器自动化、桌面操作这种高频、短 prompt、延迟敏感的场景。小模型的第一块根据地,正在从「文本分类」迁移到「操作电脑」。
风险面:便宜的子 Agent 不是没有代价
当然,把小模型推上 subagent 的位置,也有三笔账要算清楚。
第一笔是幻觉与指令跟随的短板。Haiku 5.5 的对齐评估相对 4.5 代有大幅改善,官方也承认它的网络安全防护「比 Haiku 4.5 更严格,但比其他新模型稍宽松」——允许更广泛的防御性任务,但依然封锁渗透测试等攻击性技术。这句话的另一面是:当你把成百上千个子 Agent 放出去自主跑,任何一个的指令跟随偏差都会被 fan-out 放大。多 Agent 架构下,小模型的错误不是线性叠加,而是指数扩散。主 Agent 的 review 环节必须跟上,否则省下的 token 钱会以 debug 时间的形式加倍还回去。
第二笔是价格悬崖诱发的 token 博弈。10 万 token 的分水岭一旦成为公共知识,开发者一定会开始「削足适履」:把 prompt 压到 99999 token 以内,或者把本该一次完成的任务硬拆成两次调用。短期看这是省钱,长期看可能扭曲架构设计——当定价开始指挥架构,架构就不再只为正确性服务。Anthropic 把线画在 90% 分位点上是聪明的,但任何硬阈值都会催生围绕阈值的博弈,这是所有阶梯定价逃不掉的宿命。
第三笔是生态锁定的隐性成本。Devin Fusion 的 66.2 分很漂亮,但它是「Opus 5.5 当 lead + Haiku 5.5 当 sidekick」这套特定组合打出来的。一旦你的 Agent 编排深度绑定某一家的大小模型搭配,切换成本就不只是 API 价格差,而是整个任务拆分、prompt 工程和评估体系的重写。小模型越便宜,迁移时沉没的工程投入反而越多——便宜的是 token,贵的是重构。
对开发者的实际意义
抛开宏大叙事,Haiku 5.5 发布后,值得动手的三件事很具体。
第一,重新审计你的 Agent 成本结构。如果你已经在用多 Agent 编排(Claude Code 的 subagent、LangGraph 的 fan-out、或者自研的 orchestrator),把其中「读文件、跑测试、做摘要、分类打标」这类窄任务切到 Haiku 5.5,账面上可能直接省掉七成以上。官方说的「平均便宜约 75%」不是营销话术,是 90% 降幅档位覆盖 90% 请求的数学结果。
第二,试试 effort 档位这个新旋钮。以前 Haiku 是「要么用、要么不用」的二选一,现在可以在单次调用级别调 effort。对那些「偶尔需要聪明一点」的子任务(比如让 subagent 先做一轮代码审查再动手改),把 effort 往上拨一档,可能比换大模型便宜一个数量级。
第三,关注 computer use / browser use 的 beta。Haiku 5.5 在 OSWorld 上从 15.7% 干到 72.4%,这个跃升幅度说明小模型操作电脑已经从「玩具」进入「可用」区间。RPA、自动化测试、网页数据采集这类场景,第一次有了「又快又便宜」的官方选项。
一句话总结:Haiku 5.5 的真正意义,不是「又一个便宜模型」,而是 Anthropic 把多 Agent 编排从最佳实践变成了官方产品形态。小模型正在变成子 Agent 的标准件——有标准定价(10 万 token 悬崖)、有标准分工(被大模型指挥)、有标准生态位(Devin Fusion 已经示范了一遍)。接下来拼的,不是谁的单模型更聪明,而是谁的编排能把「一大一小」的组合用出最高的投入产出比。这场仗,才刚刚开场。
原始来源
相关文章

Gergely Orosz 走访 OpenAI、Anthropic、Cursor、Ramp 后写下的 2026 行业现状:近 100% 代码由 AI 生成、Agent PR 八个月涨近 10 倍、code review 沦为表演、IDE 被判为遗产产品。本文提炼报告要点,并给出 vibe coder 的三个判断与四件本周可做的事。

10 月 3 日,工程师 Kevin Liao 发表檄文冲上 HN 前页:记忆插件是一场 RAG 片段抽奖,Agent 需要的是文档工作区。本文拆解他的诊断、开源的 Operator Memory 插件、两个最强的反方质疑,以及今晚就能开始的最小实践。

2026 年 10 月 7 日,Google Developers 发布 Developer Knowledge API 生态:Google Cloud、Firebase、Android 等官方文档变成程序化事实来源,配 gcloud CLI 入口、官方 Agent Skill(一行安装)、MCP server 和多语言客户端库。为什么「文档 API 化」能连根拔掉 vibe coding「模型记错 API」的经典翻车。