一个字都不生成,38.8 毫秒就把"下一步该做什么"算完了。
10 月 1 日,Cloudflare 把这样的决策模型开源了,两款权重直接放到 Hugging Face,顺手把配套的微调服务也摆上自家货架。同一天,Amazon 也放出了一款。
它为什么能比聊天模型快这么多?又为什么说,"开源"只是这步棋的前半句?
一天两家出手,决策被单独拆成了一个模型
事情的起点不在 Cloudflare。9 月中下旬,TypeSafe AI 的 Jev 把这个品类带火:它自称"System One"模型,不生成任何文本,只对预先声明好的问题返回带置信度的概率结果。公开接口有三种原语:从候选集里挑一个、在有序等级上打分、判断一个是非命题成立的概率。
厂商公布的典型延迟是 70 到 500 毫秒,并给出最高约 193 倍加速、444 倍成本优势。这些数字来自厂商自己的工作流评测,任务、输入长度、对照对象都会影响结论,不能外推到通用能力对比。
热度一起来,跟进就密集了。9 月下旬,Liquid AI 上线了同类的 d1 决策模型 API;vLLM 合并了一个结构化生成模式,让文本扩散模型 DiffusionGemma 也能按"决策模型"的方式跑,测试里一台 DGX Spark 在 32 并发下每秒处理约 54 次请求,也就是约 162 次判断;国内也很快出现了基于开源权重的跨平台复现。
然后就是 10 月 1 日这一天。Cloudflare 发布 Clef 和 Clef-flash:权重按 Apache 2.0 在 Hugging Face 公开,同时在自家 Workers AI 上提供托管版。Clef 由 Qwen3.8-27B 后训练而来,Clef-flash 的底座是 Qwen3.5-9B;前者原生带视觉编码器,能直接看图做判别,上下文窗口开到 64k,接口兼容 Jev-API,开发者可以拿现有调用直接替换测试。
同一天,Amazon 放出开源决策模型 Strands Decider 2B。
一天两家下场,这个品类当天就从"某家公司的付费接口",变成了云厂商货架上的通用件。
它到底怎么决策:不写文本,直接给概率
一句话说清:决策模型不干写作的活,只回答有限选项里的判断题。
拆开看,调用方式是——你给它一段状态,比如一段日志尾巴、一屏界面文字、一条工单;再给一组预先声明好的问题。而问题只有三种形式:是或否、从候选集里挑一个、在有序列的等级上打分。模型不逐字生成,而是一次前向计算之后,直接给出每个选项的概率和置信度。
它消掉的是工程摩擦。过去要求聊天模型"严格输出 JSON",本质还是在生成字符串,结构约束得靠解码器或者调用层去补,格式错误、字段缺失、枚举越界要反复兜。决策模型把输出空间在接口层就限定死了,调用方直接消费概率分布。
代价同样存在。候选项越多、输入越长、语言越边缘,概率越容易失准;那个置信度只是概率分布的集中程度,不等于准确率。以 Jev 的公开文档为例,单次请求的上下文上限是 32K token,选择类问题最多支持 255 个候选项,非英语场景的稳定性要自己在业务数据上验。它的底层架构、参数量、训练数据至今没有公开,社区复现里的输出头和损失函数都属于工程假设,不能当成官方实现。
最要紧的一条边界是:它不能写解释、不能写代码、不能做摘要,也扛不了需要多步推理、答案空间要临时发现的任务。
放到 agent 里,它该站在哪一层
一个 agent 一晚上要跑几百次判断,大部分并不是"想问题",而是"这一步该点哪个按钮""这条消息现在回还是排队""这个任务算卡住了还是还在跑"。这些判断过去靠聊天模型加正则硬凑,现在能压成一次很小的前向计算。
比较稳的分工是这样四层:通用模型负责理解目标、拆任务、生成内容;决策模型负责工具路由、动作选择、状态判断、风险分级;策略层负责阈值判断、权限校验、人工复核;最后才是工具和业务系统真正执行。
这个结构的适用边界很明确:只适合高频、答案空间有限、错了还能被拦下来的判断。凡是需要开放性推理,或者正确答案会随着执行过程变化的任务,交给它就是自找麻烦。反过来,如果一段判断同时满足"高频、选项封闭、错误可控",把它留在生成式模型里就是纯粹的浪费。
答案有限的判断,不值得花生成式模型的钱。
数字很漂亮,先看清是谁测的
Cloudflare 自评的结果是:在 Decision Index 0.2.1 上排首位,延迟中位数 Clef 209.3 毫秒、Clef-flash 38.8 毫秒,对比 Jev 的 524.1 毫秒;p95 这一档,Clef-flash 是 122.4 毫秒,Jev 是 536.0 毫秒。分类任务上差距也不小,BANKING77 宏 F1 是 94.20 对 79.74,BFCL case-exact 是 98.47 对 95.75。
但同一份自评里,GPQA Diamond、MMLU-Pro 这类通用知识推理题,Jev 仍然在前面。换句话说,这个"第一"是 Cloudflare 自己那套决策口径下的第一,不是全科第一。至于那个能把 9B 都算进去的视觉能力,目前对手确实只有文本输入,这是实打实的差异。
独立实测更值得看。10 月 1 日,有开发者拿 42 条真实 agent 决策样本,把 9B 的 Clef-flash 放进一张 3090 上跑,对上按次付费的接口:总体准确率 71.4% 对 66.7%,42 条里它错了 14 条。
可拆开任务看是另一回事。动作选择类两边都是 10/10,包括两个"正确做法就是别动"的陷阱题;状态监督 8/12 打平,连错的两条都一样;差距集中在消息分诊,12 对 10。延迟上,本地 p50 是 315 毫秒,比走网络的那 225 毫秒慢 90 毫秒,两者在 42 条里有 35 条给出同样的答案。
他还踩到两个现实门槛:27B 版本用 bf16 跑大约要 54GB 显存,一张消费级卡装不下;社区 GGUF 量化只覆盖语言骨干,真正的决策头目前还跑不进 llama.cpp,要用就得走 PyTorch 和自定义模型代码。
三个最容易看错的地方
第一个,权重开源了,等于能白嫖一整套决策服务。
常见说法是"模型都放出来了,等于白送"。这有一定道理,Apache 2.0 确实允许自托管、商用、改造,授权费一分不用交。
但它解释不了 Cloudflare 为什么同一天还要发布强化学习微调服务。决定准确率的往往不是基座,而是用你业务里那批高频判断做微调,而这项服务要做的,正是把采集数据、微调、重新部署串在自家平台上:先由前场工程师陪跑,再走 AI Gateway 加 Workers AI 加 Containers 的自助流程。不卖模型,卖的是这条管道。
更准确的理解:开源的那一层正在变成通用件,稀缺的是你手里那批带标签的决策数据。
第二个,输出不会非法,就不会犯错。
有限选项确实杜绝了非法输出,但选错照旧发生。上面那份实测里,42 条它错了 14 条,错的位置还和付费接口不完全重合。
更准确的理解:置信度是概率分布的集中程度,0.9 不等于九成把握。阈值要在自己的数据上验,付款、删除、改权限这类不可逆动作,得由策略层和人工复核兜底,而不是交给一次前向计算。
第三个,决策模型会取代大模型。
这个说法抓住了"更快更便宜"的部分,也确实有不少判断不需要语言能力。
但它解释不了为什么 Cloudflare 把上下文开到 64k、还加视觉编码器,却依然要求配套通用模型来做规划。决策模型处理的是已经收敛的问题,问题怎么来、答案空间怎么定,仍然由上游的通用模型和人来负责。
更准确的理解:它不是替代,是给执行层加了一个便宜的零件。装错层,两边都变慢。
对做 agent 的人来说,该动的是调用清单
过去一年,两种完全不同的活被压给了同一个模型:开放问题的理解与生成,和封闭选项的判断。前者非它不可,后者一直在花生成式模型的钱。
可操作的做法是把自家 agent 的调用清单拉出来,按"答案空间是否有限、错了能不能被拦住"分成两堆。有限的那堆先换决策模型,同时记录自动化率和误执行率,再决定哪些调用还值得为细微差别付费。那位实测者最后留下的正是这个结论:分诊这种需要细品的前沿判断继续付钱,动作选择与状态监督换成本地 9B。
还有一个细节值得留意:Qwen 又一次成了别人做专用模型的底座,只是这次拿它做决策头的,是西方基础设施厂商。
如果觉得有用,点个在看让我知道;也欢迎转发给在学 AI 的朋友。
关注我,每天陪你聪明看世界 —— 看懂热搜,玩懂AI。