本文内容
Cloudflare Clef 与 Jev:价格、基准测试与迁移
Cloudflare Clef 面向需要类型化 AI 决策、开放权重和多模态输入的团队,是 Jev 的一种替代方案。它不是通用聊天机器人。应用提供证据和允许的答案,模型为这些答案评分,而不是生成自由文本。Cloudflare 于 2026 年 10 月 1 日发布 Clef 和 Clef-flash。官方名称是 Clef,不是“Clev”。Cloudflare:Clef 发布公告
我们的判断:当图像、部署控制或延迟成为现有决策流程的瓶颈时,Clef 值得认真试点。但它不是 Jev 的自动升级版,两款 Cloudflare 模型的公开输入单价也都更高。最重要的迁移发现藏在细节里:JSON 字段相同,不代表置信度含义相同。
审查日期:2026 年 10 月 4 日。本文基于一手文档与公开代码,不是 Wavect 自行运行的模型基准测试,也不代表我们已为客户部署 Clef。价格与托管接口是这一日期的快照,建议部分属于我们的工程判断。
Clef、Clef-flash 与 Jev:真正改变了什么?
Clef 使用 Qwen3.8-27B 基础模型和联合决策头。决策头对整个问题模式中的允许答案评分,而不是生成解释。Clef-flash 则基于 Qwen3.5-9B。两款 Cloudflare 模型都发布了 Apache-2.0 权重。Cloudflare:Clef 模型卡与评估 Cloudflare:Clef-flash 模型卡
TypeSafe 目前列出的是 jev-1.13.0,通过托管 System One API 接收文本。文档区分了整个请求的 64k token 预算,以及状态加最长问题的 32k 预算。把 Jev 简化成“32k”,再说 Clef 的上下文“翻倍”,会掩盖这个差别。TypeSafe:Jev 型号、价格与限制
| 决策因素 | Clef | Clef-flash | Jev 1.13 |
|---|---|---|---|
| 每百万输入 tokens 公开价格 | 0.24 美元 | 0.09 美元 | 0.042 美元 |
| 部署方式 | Workers AI 或自托管权重 | Workers AI 或自托管权重 | TypeSafe 托管 API |
| 原生视觉证据 | 支持;托管与本地接口不同 | 支持;托管与本地接口不同 | 不支持;需预先转为文本 |
| 纳入试点的理由 | 图像依赖的决策与部署控制 | 延迟敏感、边界清晰的决策 | 已验证的行为与更低的公开输入成本 |
Cloudflare 的价格来自 Workers AI 定价表,而不是宣传估算。表中的试点理由是我们的建议,不是性能保证。Cloudflare:Workers AI 定价
Jev 的基础接口请参阅Jev 技术评测。开放模型与基准来源问题由Laya 与 Jev 的对比单独讨论。本文聚焦一个具体问题:用 Cloudflare Clef 替换已有 Jev 集成,是否值得承担迁移成本与风险。
有价值的变化不是“又一个聊天机器人”。设想一个退货流程,同时有客户消息和破损包裹的照片。Clef 试点可以一起评估这些证据,在 damage_review、delivery_review 和 manual_review 之间选择。纯文本方案则需要先加入明确的图像转文本步骤。这只是架构示例,不是实测的 Clef 部署。退款本身仍由应用规则和审批流程控制。
类型化接口支持 noul(是/否概率)、choice(命名选项)和 score(有序等级)。因此,Clef 更适合作为智能体中的决策步骤,而不是替代所有推理和写作环节。公开输入类型。
Cloudflare Clef 比 Jev 便宜吗?
按公开输入 token 单价计算,不是。假设需要做 100 万次决策,每次按 2,000 个输入 tokens 计费,总计 20 亿 tokens。将Cloudflare 单价与TypeSafe 单价代入,得到以下仅包含输入推理费的示例:
| 模型 | 示例输入费用 | 相对 Jev |
|---|---|---|
| Jev | 84 美元 | 1.00× |
| Clef-flash | 180 美元 | 2.14× |
| Clef | 480 美元 | 5.71× |
这是我们的算术示例,不是报价。它假设相同的计费输入 token 数,并不假定同一段原始文本在不同模型下具有相同分词结果。实测还应包括问题模式开销、重试和图像处理。免费额度、折扣、Workers 执行、存储与人工复核不在示例内。Jev 列明输出 tokens 免费;Cloudflare 没有为这两款模型列出输出 token 单价。
如果新方案减少了高成本错误、免去单独的图像转文本步骤,或能可靠完成时限严格的决策,更高的 token 单价也可能合理。但必须用完整流程验证。不能把“比大型聊天模型便宜”改写成“比 Jev 便宜”。更广泛的业务分析见决策模型工作流与 ROI 指南。
基准测试:Clef 赢下一些任务,Jev 赢下另一些
Cloudflare 发布的结果支持按任务评估,不支持宣布全面赢家。以下数据来自 Clef 模型卡中的 Decision Index 0.2.1 测试,由 Cloudflare 报告,并非 Wavect 独立测量。质量指标为百分数,越高越好;延迟越低越好。
| 基准 / 指标 | Clef | Clef-flash | Jev |
|---|---|---|---|
| BANKING77,宏平均 F1 | 94.2 | 90.9 | 79.7 |
| CLINC150 + OOS,宏平均 F1 | 97.4 | 66.8 | 89.3 |
| RAGTruth,幻觉检测 F1 | 79.4 | 35.6 | 76.5 |
| GPQA Diamond,准确率 | 48.0 | 51.0 | 78.3 |
| When2Call MCQ,准确率 | 72.4 | 65.6 | 81.0 |
| 延迟中位数,毫秒 | 209.3 | 38.8 | 524.1 |
| p95 延迟,毫秒 | 238.6 | 122.4 | 536.0 |
我们的解读是:可以把 Clef 纳入意图路由试点,但必须测试未知意图,而不只是熟悉的类别。应将 Flash 视为质量分布不同的模型,而不是同一模型的加速版。它在 CLINC150 + OOS 和 RAGTruth 上的结果,是反对全面替换的重要反例。Jev 在 GPQA 和 When2Call 上的表现,也不支持“Clef 的所有决策都更好”这种说法。
延迟属于该评估环境,不能直接当成生产响应时间、服务等级承诺或自托管 GPU 的性能。应结合自己的并发量、请求长度、网络路径和回退行为,测量端到端 p95。基准表没有标明 Jev 版本时,不要把“Jev”列擅自改成某个新版本的实测结果。
迁移陷阱:同名 confidence 并不是同一个约定
不要把 Jev 的置信度阈值直接复制给 Clef。TypeSafe 将 Choice 置信度定义为 (p_max - 1/n) / (1 - 1/n),其中 n 为选项数量。它不同于直接返回获选答案的概率。TypeSafe:置信度公式
在本次审查的 Cloudflare 发布代码中,systemone_answer 将 Choice 的 confidence 设为获选答案的概率。我们检查的是修订版 a20e258。这是对公开实现的发现,并不证明所有托管部署都运行完全相同的修订版。托管端行为仍须单独确认。Cloudflare:本次审查的 Clef 发布代码
看一个算术示例:三个选项的概率分别为 0.80, 0.15, 0.05。Jev 文档公式给出 0.70,审查的 Clef 辅助函数给出 0.80。现有 confidence >= 0.75 规则会拒绝前者、接受后者,尽管概率分布完全相同。这是接口语义差异,不是 Clef 更确定或更准确的证据。
保留返回的完整概率分布,并在自己的适配层中明确决策统计量。使用带标签的验证样本重设阈值,再用未参与调参的测试集评估已接受决策的错误和人工复核比例。公式一致也不代表概率同样经过校准。这个独立问题可参阅 AnyJev 概率校准与选项顺序指南。
还有一个值得测试完整请求的原因:TypeSafe 描述的是问题独立评估,而 Clef 发布实现采用联合评分。我们据此提出的测试建议是:使用完整生产问题集合,并加入或移除无关问题,重复评估相同决策。这是架构推论,不是我们已经观察到 Clef 缺陷的声明。TypeSafe:问题独立评估说明
迁移 API:保留问题模式,重新验证接口边界
Jev 文档中的端点为 POST https://api.typesafe.ai/v1/systemone。能够保留 state、questions 和答案 ID 很有价值,但迁移到 Cloudflare 仍需要新的凭据、模型选择器,以及针对实际传输协议的适配层。TypeSafe:System One HTTP API
托管 Clef 文档列出 65,536-token 上下文、1 至 64 个问题,以及超长文本状态截断行为。图像接口最多接收四张内嵌 PNG、JPEG 或 WebP,不接受远程图像 URL。限制为每张 4 MiB、1,600 万像素,解码后总计 8 MiB,完整请求体最多 13 MiB。Cloudflare:托管 Clef API 接口约定
Clef-flash 使用自己的路由,以及相应的 model: "clef-flash" 选择器。切换版本时应同时检查端点和选择器。托管图像接口不能与本地发布代码中的视频帧示例混为一谈。Cloudflare:托管 Clef-flash API 接口约定
一个不执行实际业务操作的小型连通性测试
将下面的内容保存为 clef-request.json。示例把虚构消息归入待复核队列,不执行退款、不修改账户,也不授权任何操作。
{
"model": "clef",
"state": {
"message": "The package arrived with a broken seal. I am not sure whether anything is missing."
},
"questions": {
"review_queue": {
"type": "choice",
"instructions": "Select a review queue. Use manual_review when the evidence does not support a specific queue.",
"criteria": {
"damage_review": "Possible physical package damage.",
"delivery_review": "Delivery timing or location issue.",
"manual_review": "Missing or ambiguous evidence; a person should review."
}
},
"needs_more_evidence": {
"type": "noul",
"instructions": "Is more information needed before a refund decision can be considered?"
}
}
}在 shell 中配置账户 ID 和具有 Workers AI 权限的服务端 Cloudflare API token,然后使用 curl 7.76 或更高版本发送请求:
set -eu
: "${CLOUDFLARE_ACCOUNT_ID:?Set your Cloudflare account ID}"
: "${CLOUDFLARE_API_TOKEN:?Set a server-side Workers AI token}"
curl --fail-with-body --silent --show-error \
--connect-timeout 10 --max-time 60 \
"https://api.cloudflare.com/client/v4/accounts/${CLOUDFLARE_ACCOUNT_ID}/ai/run/@cf/cloudflare/clef" \
--header "Authorization: Bearer ${CLOUDFLARE_API_TOKEN}" \
--header "Content-Type: application/json" \
--data-binary @clef-request.json \
--output clef-response.json该示例使用文档列出的 REST 路由。我们在本地检查了 JSON 与 shell 语法,但未执行付费推理请求。检查 clef-response.json,包括 API 层错误。不要将原始输出直接连接到业务操作。REST 响应封装与 Workers binding 返回值应分别验证;适配层还应检查答案 ID、允许的选项和有限概率值。
未知标签、响应格式错误、超时和限流都应保留人工复核路径。基于图像的 Clef 请求失败时,不能删掉图像证据后悄悄回退到纯文本 Jev。应使用经过明确测试的文本表示,或停止自动处理并转人工。同样,超大输入应主动拒绝或拆分,而不是出事后才发现关键段落被截断。
开放权重、自托管与隐私边界
开放权重提供的是部署选择,不是现成的生产服务。Clef 发布说明要求加载基础模型和联合决策头。仅运行通用聊天生成接口,不能证明已经运行了发布的决策模型。应把权重、处理器、决策头和服务代码一起固定版本。
审查的本地辅助函数默认使用 max_length=16384,不同于托管端的 65,536-token 限制。模型卡提到的单张 H200 是已测试环境,不是最低 GPU 要求。仅作容量粗估,270 亿参数按每参数两字节计算,权重约 54 GB;90 亿参数约 18 GB,均未计运行时开销。这是算术估计,不是测得的显存需求,也不能证明某种量化配置适合你的硬件。
还应区分可下载权重与托管定制服务。Cloudflare 的发布公告描述了由前线部署工程团队协助开展的早期微调工作,并计划扩大自助访问。未确认权限前,不要把“已经可用的一键微调产品”写进客户交付范围。
Cloudflare 的 Workers AI 数据政策表示,未经明确同意,不会将客户内容用于训练或改进模型。但这并不能回答应用持久化与处理地点的所有问题。Cloudflare:Workers AI 数据使用说明
例如,AI Gateway 默认开启日志,日志可能包含提示词和响应。应检查自身架构中的日志、存储、访问权限与保留策略。不要把“不用于训练”推导成仅在欧盟推理或零保留保证。具体部署路径的合同与技术要求仍需确认。Cloudflare:AI Gateway 默认日志设置
能发现真实回归问题的 Jev 到 Clef 迁移清单
从一个可逆的决策开始。固定旧实现作为基线,让 Clef 在影子模式运行,不改变线上业务动作。在查看最终独立测试集之前定义验收边界。一份有效的发布记录应能回答以下问题:
| 验收项 | 应保留的证据 | 不应上线的情况 |
|---|---|---|
| API 与模式 | 真实 HTTP 样本、允许选项、错误案例及版本配置 | 只能处理理想情况 |
| 决策质量 | 各部署语言的已接受错误、复核率与稀有类别结果 | 总准确率掩盖有害的已接受决策 |
| 置信度约定 | 明确统计量、版本化阈值与独立测试结果 | 提供商切换悄悄改变验收规则 |
| 证据完整性 | 长状态、图像和完整问题集合测试 | 截断或回退丢失必要证据 |
| 运维 | 端到端 p95、重试、实测费用与回滚测试 | 代表性负载下收益消失 |
授权、幂等性和事务检查应留在确定性的应用代码中。符合问题模式的答案仍然只是模型判断,并不是行动许可。上线时记录所选部署、模式版本、验收规则和结果,使后续变化可以调查,同时避免记录不必要的个人信息。
我们的建议是:实测的能力或部署收益足以覆盖迁移成本时选择 Clef;仅在任务质量通过验收时选择 Flash;如果 Jev 的已验证行为能以更低成本满足要求,就继续使用 Jev。保持现有模型也是合理的工程结论。
Wavect 的 AI 工程服务可以帮助团队把对比转化为评估和集成计划。使用上线前 QA 清单组织验收,并携带有代表性的脱敏样本讨论你的决策流程。
有关 AI 项目交付的背景,可参阅 Twinsoft AI 案例。该案例不是 Clef 部署证明。
Clef 迁移常见问题
Cloudflare Clev 和 Clef 是同一个产品吗?
官方产品名称是 Cloudflare Clef。Clef 与 Clef-flash 于 2026 年 10 月 1 日发布。查找文档、权重和 Workers AI 端点时应使用 Clef。发布来源。
Clef 可以直接替换 Jev 吗?
类型化请求结构兼容,但传输协议、模型选择、输入限制与置信度含义仍须验证。尤其是审查的本地 Clef 实现,没有按 Jev 文档公式计算 Choice 置信度。API 兼容不代表验收规则等价。迁移发现。
Clef 比 Jev 便宜吗?
截至 2026 年 10 月 4 日,公开输入单价不是这样:Clef 每百万 tokens 为 0.24 美元,Clef-flash 为 0.09 美元,Jev 为 0.042 美元。整体成本还取决于实测错误、人工复核、重试与基础设施。计算与假设。
应该选择 Clef 还是 Clef-flash?
围绕实际质量要求或图像依赖的决策试点 Clef,再单独评估 Flash 是否适合延迟敏感任务。Cloudflare 的结果显示任务间差异显著,因此 Flash 不应直接继承 Clef 的阈值和上线批准。基准反例。
Clef 支持图像和视频吗?
托管模式文档列出了有数量和大小限制的内嵌图像,而本地模型还提供视频帧示例。这是不同接口。应确认实际部署支持的约定,不要假定本地视频示例可以直接用于托管图像端点。托管输入限制。
Clef 的上下文是 Jev 的两倍吗?
这种说法容易误导。托管 Clef 为 65,536 tokens。Jev 列出整个请求 64k,以及状态加最长问题 32k。审查的本地 Clef 辅助函数另有 16,384-token 默认值。应按实际请求结构评估。上下文差异。
可以自行托管 Clef 吗?
Cloudflare 发布了 Apache-2.0 权重、联合决策头和相关代码。自托管需要匹配的组件、容量规划及可运维的服务层。公开 H200 测试环境并不是最低硬件保证。部署边界。
高置信度可以授权业务操作吗?
不能。置信度概括的是模型输出,不是权限或已证明的正确性。应验证已接受决策的错误率、保留人工复核,并在模型之外执行授权和事务规则。迁移验收。
最终思考
开放权重和视觉输入,让 Cloudflare Clef 成为更值得关注的 Jev 式决策接口。但切换理由应是流程中可测量的改善,而不是宣传标题。批准任何一个 Clef 版本之前,都要重新验证置信度、保留证据并测试回滚。
