返回探索
资讯VibeFix 编辑部更新于 2026年10月10日

Cloudflare 开源决策模型 Clef:Agent 时代的「选择题专用模型」

10 月 1 日 Cloudflare 在生日周发布开源决策模型 Clef 与 Clef-flash:不生成文本,只对类型化问题返回概率,Clef-flash 中位延迟 38.8ms;10 月 9 日又跟进多模态 Clef-omni,并把 Clef-flash 降到每百万输入 token 0.038 美元。本文拆解它的技术路线、基准成绩、成本账,以及决策模型何时该替代 Agent 里的大模型调用。

Cloudflare Clef 发布文章中的基准图表:Clef、Clef-flash 与 Jev 在决策指数与延迟上的对比

10 月 1 日,Cloudflare 在生日周扔出了一颗不算大、但信号很强的炸弹:Clef 与 Clef-flash——两个开源的「决策模型」(decision models),以及一个配套的强化学习微调平台。一周之后,10 月 9 日,Cloudflare 乘胜追击:发布多模态的 Clef-omni,把 Clef 的推理速度提了最多 2 倍,把 Clef-flash 的价格砍到比竞争对手还便宜。

这不是一次普通的模型发布。它是两周之内,第三家科技巨头下场「决策模型」这个新品类——此前有 OpenAI 的 Decisions API 和 AWS 的 Strands Decider 2B,而 Cloudflare 是其中唯一开源权重的玩家。当 Cloudflare 这种靠卖流量和算力赚钱的公司,开始把模型权重免费送人,值得认真看一眼它到底想干什么。

不是又一个聊天模型:Clef 只做「选择题」

先说清楚 Clef 不是什么:它不写文章、不聊天、不生成代码。它干的事情极其专一——你给它一段「状态」(state,比如一条客服消息、一个域名、一张截图),再给它几个类型化问题(typed questions):这是不是紧急工单?该分给哪个团队?严重程度打几分?它返回的不是一段话,而是每个选项的概率。

技术上,这靠的是一次「只做 prefill」的前向传播:冻结的 Qwen 骨干网络读一遍输入,然后一个专门的评分头并行地给所有合法选项打分。整个过程是非自回归的——没有 token 逐个生成的环节,自然也就没有输出 token。用 Cloudflare 自己的话说,这让决策模型比自回归大模型「显著更快」。

问题类型目前有三种:是非题(noul)、多选题(choice)、打分题(score)。调用长这样(示意):

{
  "model": "clef",
  "state": "用户反馈:结账页面连续一小时所有订单都失败",
  "questions": {
    "urgent": { "type": "noul", "instructions": "这条反馈是否紧急?" },
    "team": {
      "type": "choice",
      "instructions": "应该分给哪个团队?",
      "criteria": {
        "billing": "支付、发票与退款",
        "technical": "故障、报错与配置",
        "sales": "套餐与升级"
      }
    },
    "severity": {
      "type": "score",
      "instructions": "客户影响有多严重?",
      "criteria": ["无影响", "轻微", "严重", "致命"]
    }
  }
}

返回的是一组带概率的类型化答案,你的代码可以直接拿去做路由、升级或转人工。Cloudflare 对这类模型的定位很直白:让 Agent「程序化地收集上下文、做决策、执行动作」,人类不必再卡在每一个决策点上。

名字的来历是个音乐梗:五线谱开头的谱号(clef)决定了后面每个音符的音高,决策模型也一样——先「定调」,后面的动作才有意义。顺带一提,CF 正好也是 Cloudflare 的缩写。

两周之内,巨头第三次下场「决策模型」

把时间线拉开看,这件事的产业含义比模型本身更大。TypeSafe 的 Jev 率先定义了「决策模型」这个品类:输出有界、带概率、便宜又快,专门塞进工作流里做决策。然后 OpenAI 跟进 Decisions API,AWS 拿出 Strands Decider 2B,接着 Cloudflare 在 10 月 1 日发布 Clef——三家巨头在 48 小时内先后落子。

但三家的姿势完全不同。OpenAI 和 AWS 卖的是 API 调用,Cloudflare 直接把权重按 Apache 2.0 开源,扔上 Hugging Face,还托管在 Workers AI 上,同时完全兼容 Jev 的 API——意思是你把原来调 Jev 的代码里的模型 ID 一换,就能无缝切到 Clef。

这是一种阳谋:Cloudflare 的生意是边缘网络和算力。决策模型的调用频次注定比大模型高一个数量级(Agent 每走一步都可能要做一次判断),而高频、低延迟的推理天然适合跑在离用户最近的边缘节点上。把权重免费送出去,换来的是全世界 Agent 的「判断环节」都跑在 Cloudflare 的基础设施上。这笔账,Cloudflare 算得很清楚。

决策模型工作原理示意图:输入状态与类型化问题,单次前向返回各选项概率,不生成文本

技术上它到底做了什么

根据官方博客披露的训练细节,Clef 家族的技术路线可以概括为「大模型做理解,小头做决策」:

  • 冻结骨干 + 轻量适配:Clef 基于 Qwen3.8-27B,Clef-flash 基于 Qwen3.5-9B,骨干权重全部冻结,只联合训练一个路由评分头和 rank-256 的低秩适配器(LoRA)。训练数据是 Cloudflare 内部合成的,刻意打乱字段顺序、提示词和结构,逼模型对格式变化鲁棒。
  • 两阶段注意力路由:每个候选选项先从输入中抽取相关证据,再让各字段向量在全上下文上交叉注意力,最后算出置信度分数。配合词法先验,保证选项的语义在打分过程中不漂移。
  • 校准过的概率:用标签平滑交叉熵训练分类准确性,再用 Brier loss 校准概率——这很关键。决策模型的输出是要被代码直接消费的,概率必须「说到做到」:说 90% 就得真有九成把握,而不是大模型那种随口一说的自信。
  • RLCD 二次优化:Cloudflare 还自研了 Reinforcement Learning for Calibrated Decisions,对相邻有序选项给部分 credit,奖励完全精确的记录输出,并用 reference penalty 防止分布漂移。

规格上,Clef 上下文窗口 64k(Jev 是 32k),并且带视觉编码器——Jev 目前只做纯文本分类,Clef 从第一天就能看图。这是 Cloudflare 在博客里反复强调的差异点。

性能与价格:把账算清楚

Cloudflare 在发布时公布了 43 项评测,核心结论是:Clef 家族在 Jev Decision Index 上领先 Jev,但自家公布的数字要打折看——有赢有输才是正常的。下面是官方博客原表里最值得看的几行:

基准Clef 27BClef-flash 9BJev
BANKING77(意图分类,macro-F1)94.2090.9379.74
CLINC150+OOS(macro-F1)97.4366.7789.27
家电分类(case exact)82.9597.7352.27
When2Call(何时该调用工具)72.3765.5880.97
BRIGHT(检索,nDCG@10)45.9139.2647.52
中位延迟209.3ms38.8ms524.1ms
p95 延迟238.6ms122.4ms536.0ms

诚实地说:Clef 在分类类基准上赢得干脆(BANKING77 高出近 15 个点),但在 When2Call 和 BRIGHT 这类更偏推理的基准上输给了 Jev。这恰恰说明了决策模型的边界——它是「快思考」(System 1),不是「慢思考」。让它做它擅长的事,别让它替你推理。

延迟数字更值得玩味:Clef-flash 中位 38.8ms,是 Jev 的十三分之一。Cloudflare 内部实测了一个威胁情报场景:给 Clef 一个域名,它抓取、渲染、分类全套下来 2.2 秒,而自家最快的大模型 gpt-oss-120b 同样流程要 4.7 秒,还只返回了两个分类。2 倍的时间,换来的是更完整的结构化结果。

价格是 10 月 9 日更新后最有杀伤力的部分:

模型托管价格(每百万输入 token)备注
Clef-flash$0.038(原价 $0.09)已比 Jev 便宜;托管版上下文从 64k 缩到 24k
Clef$0.2464k 上下文不变;10 月 9 日提速最高 2 倍
Clef-omni$0.15多模态,10 月 9 日新发布

注意两个细节。第一,决策模型只按输入 token 计费,没有输出 token——因为它根本不生成文本。这对成本模型的改变是结构性的:大模型的账是「输入 + 输出」两头烧,输出还更贵;决策模型的账是单头的,而且输入可以被缓存、被复用。

第二,Clef-flash 降价的代价是托管版上下文从 64k 砍到 24k。Cloudflare 给出的数据是:只有 0.24% 的请求超过 24k token。Hugging Face 上的权重没动,自托管依然支持 256k 上下文。这个取舍摆得非常透明——长输入的用户要么切到 Clef,要么自己托管权重。开源在这里第一次变成了定价策略的一部分。

Clef-omni:把音视频也塞进一道「选择题」

10 月 9 日的第二篇博客带来了 Clef-omni:基于 Qwen3-Omni-30B-A3B-Instruct 的 MoE 架构(300 亿参数,激活 30 亿),音频(wav/mp3)、视频(mp4/webm)、图像、文本全部走同一条管线、一次调用。

在此之前,对一段视频做决策是典型的「流水线地狱」:语音转文字、音画分离、抽帧、再分别过文本模型,最后拼结果。Clef-omni 把声画对齐后直接打分:纯文本决策中位约 130ms,图像约 150ms,音频几百毫秒,一段 21 秒带声音的视频约 1.5 秒出结果。

官方举的例子很 vibe coding:一次调用里同时传「设备安装照片 + 运行录音 + 风扇视频」,问三个问题——铭牌是否可见?运转声音是否正常?风扇在转吗?这种「多感官质检」场景,以前要搭三四个模型,现在是一次 API 调用。

基准上 Clef-omni 也没掉队:BANKING77 拿到 94.8(全场最高),CLINC150+OOS 97.7 也是第一。当然,MoE 架构在 When2Call 上只有 63.3,再次印证:决策模型别指望它做复杂推理。

RL 微调平台:被低估的另一半发布

很多人把 10 月 1 日的发布看成「两个模型」,但 Cloudflare 的另一半心思在 RL 微调平台上。逻辑是这样的:决策模型最大的价值不在通用分类,而在你自己的业务判断——什么样的工单算紧急、什么样的爬虫算恶意、什么样的内容算违规,每家公司的标准都不一样。

Cloudflare 搭的这套 RL 链路,用的全是自家已有的积木:AI Gateway 自动沉淀你的 AI 调用流量变成数据集 → Workers AI 对基础 Clef 模型做 rollouts → Containers 里跑 RL 沙盒做打分和回放 → 新增的 Trainer 更新权重 → 通过 BYO Model(自带模型)重新部署回 Workers AI。先以 FDE(前沿部署工程师)人工服务的形式帮客户调优,再沉淀成自助平台。

这步棋的狠之处在于闭环:AI Gateway 本来就是 Cloudflare 的流量入口,数据沉淀是顺手的事。客户用得越多,私有决策模型越准,迁移成本越高。开源权重负责获客,RL 平台负责留客——典型的 Cloudflare 式打法。

Cloudflare 内部已经在吃自己的狗粮:公开文档仓库用 Clef 自动识别并关闭垃圾 issue,内容管理系统 EmDash 用它审核插件库里的钓鱼内容,数据防泄漏团队用它扫 PII(身份证号之类),威胁情报团队用它做域名分类。这些全是「高频、类型固定、错了可回滚」的场景,正是决策模型的舒适区。

观点:Agent 里 90% 的模型调用不需要「写字」

过去两年,我们给 Agent 接的每一个「判断」,都在付「写作」的钱。决策模型的出现,是把这两件事第一次拆开了定价。

想想一个典型 Agent 的循环:理解用户意图、决定调哪个工具、判断工具结果够不够、决定下一步、检查输出是否合规……这里面真正的开放式生成只有一两处,剩下的全是分类、路由、打分、是非判断。但我们一直在用最贵的通用大模型做这些事,还要忍受它的非确定性——同样的问题问两遍,措辞一变答案就变,下游代码还得写正则去解析。

决策模型把「判断」变成了基础设施:输入确定、输出有界、概率可校准、延迟可预期。这对 Agent 工程是范式级的简化:以前你要写 prompt 工程 + 输出解析 + 重试逻辑三件套,现在变成一次带 schema 的调用,返回的概率直接进 if-else。

但也要泼两盆冷水。第一,决策模型不是小一号的大模型,它是另一种物种。When2Call 和 BRIGHT 上的落后说明:凡是需要多步推理、开放探索的任务,老老实实上大模型。第二,基准成绩是厂商自选的。Cloudflare 的表里 Jev 也有赢的项,独立第三方的复现还没出现,选型前最好拿自己的数据跑一遍——好在权重开源,这件事的成本很低。

给 vibe coding 读者的实操清单

如果你正在用 AI 写应用、搭 Agent,这套东西的落地姿势很具体:

  • 什么时候该换:用户输入意图分类、客服工单路由、内容审核打分、Agent 内部「下一步调哪个工具」的选择、RAG 里「这段检索结果够不够用」的判断。特征是:选项固定、调用高频、延迟敏感、错了可回滚。
  • 成本账怎么算:打个样——每天 1 万次路由判断,每次输入约 2000 token。用 Clef-flash 托管版:2 万 k token × $0.038/M ≈ 每天 0.76 美元。同样的量如果走通用大模型(输入 $3/M、输出 $0.6/10k token 量级),一天几十美元起步,差出两个数量级。省下来的钱不是重点,重点是 38.8ms 的延迟让「每步都判断一次」的 Agent 架构第一次变得可行。
  • 什么时候别换:需要解释原因的(「为什么判为钓鱼」)、选项本身不确定的、需要多步推理的、输出要给人看的。这些场景里,大模型的开放生成仍然不可替代。一个健康的架构是:决策模型做高频判断,大模型做低频 deep work。
  • 开源权重意味着什么:三件事。第一,可自托管:敏感数据不出内网,延迟不受公网抖动影响;第二,可审计:权重、训练方法(冻结骨干 + LoRA + Brier 校准)都是公开的,不像闭源 API 是个黑盒;第三,议价权:厂商再怎么调价,你手里永远有个能自己跑的版本。这是 OpenAI 和 AWS 的闭源方案给不了的。
  • 上手路径:Clef 完全兼容 Jev API,已经在用 Jev 的改个模型 ID 就能试;新用户可以直接调 Workers AI 的 @cf/cloudflare/clef,OpenRouter 上也有 cloudflare/clef 和 cloudflare/clef-flash。先拿你现有 Agent 里最痛的那个分类环节做 A/B,跑一周看概率校准和业务指标,再决定扩不扩。

时间线与信息来源

  • 2026 年 10 月 1 日(Cloudflare 生日周,周四):官方博客发布《Introducing Clef: our open-source decision models, and new RL fine-tuning platform》,推出 Clef(27B)、Clef-flash(9B)与 RL 微调平台。日期以 Cloudflare 官方博客作者归档页为准。
  • 2026 年 10 月 9 日:官方博客发布《Introducing Clef-omni with full multimodality, plus a faster Clef and a cheaper Clef-flash》,推出 Clef-omni(音视频图文本单管线)、Clef 提速最高 2 倍、Clef-flash 降价至 $0.038/M token(托管版上下文同步调整为 24k)。

本文所有技术参数、基准数字与价格均来自上述两篇官方博客原文;其中基准成绩为 Cloudflare 自测数据,尚未有独立第三方复现,引用时请注意这一前提。竞争格局部分(OpenAI Decisions API、AWS Strands Decider 2B、TypeSafe Jev)综合自公开报道。

原始来源

浏览项目广场发布你的项目

相关文章

插画:一只机械手伸向发光的数字支付界面,象征 AI agent 自主完成支付
资讯
Agent 开始自己掏钱了:LangChain 的支付双线与 x402 结算层

LangChain 10 月 8 日开源 Restock:在 Slack 里购物、用 Stripe Link 钱包付款的 agent(22.18 美元真订单、真退款);而 8 月 18 日的 AgentCore Payments middleware 已把 x402 协议接进 LangChain 工具链,实现自主微支付。本文拆解两条支付路线、x402 vs Stripe 选型框架、一人团队的预算护栏设计与安全红线。

支付与变现产品动态行业趋势
RRSI 论文:给 agent harness 的递归式自我改进施加正则化,evolve 分数与 OOD 泛化对比
资讯
自我改进本身也需要正则化:Google 等提出 RRSI,戳破 agent 自进化的过拟合泡沫

Google、Google DeepMind、马里兰大学、弗吉尼亚大学联合提出 RRSI:不锁死 agent 能改什么,而是正则化"它怎么搜索"。去掉正则化的进化把 evolve 分数推到 92.8,OOD 却只有 40.3;RRSI 以 90.5/43.6 实现更好迁移且 token 更少。一篇用数据说话的论文:自我改进本身也需要正则化。

AI 智能体行业趋势AI 编程实践