返回
Kevin Riedl

12 分钟 阅读 · 2026年10月4日
最近审核

下一篇
图片在你的设备上生成,不连接 Instagram。文章链接会复制到剪贴板,供链接贴纸使用。

Cloudflare Clef 与 Jev:价格、基准测试与迁移

Cloudflare Clef 面向需要类型化 AI 决策、开放权重和多模态输入的团队,是 Jev 的一种替代方案。它不是通用聊天机器人。应用提供证据和允许的答案,模型为这些答案评分,而不是生成自由文本。Cloudflare 于 2026 年 10 月 1 日发布 Clef 和 Clef-flash。官方名称是 Clef,不是“Clev”。Cloudflare:Clef 发布公告

我们的判断:当图像、部署控制或延迟成为现有决策流程的瓶颈时,Clef 值得认真试点。但它不是 Jev 的自动升级版,两款 Cloudflare 模型的公开输入单价也都更高。最重要的迁移发现藏在细节里:JSON 字段相同,不代表置信度含义相同。

审查日期:2026 年 10 月 4 日。本文基于一手文档与公开代码,不是 Wavect 自行运行的模型基准测试,也不代表我们已为客户部署 Clef。价格与托管接口是这一日期的快照,建议部分属于我们的工程判断。

Clef、Clef-flash 与 Jev:真正改变了什么?

Clef 使用 Qwen3.8-27B 基础模型和联合决策头。决策头对整个问题模式中的允许答案评分,而不是生成解释。Clef-flash 则基于 Qwen3.5-9B。两款 Cloudflare 模型都发布了 Apache-2.0 权重。Cloudflare:Clef 模型卡与评估 Cloudflare:Clef-flash 模型卡

TypeSafe 目前列出的是 jev-1.13.0,通过托管 System One API 接收文本。文档区分了整个请求的 64k token 预算,以及状态加最长问题的 32k 预算。把 Jev 简化成“32k”,再说 Clef 的上下文“翻倍”,会掩盖这个差别。TypeSafe:Jev 型号、价格与限制

决策因素ClefClef-flashJev 1.13
每百万输入 tokens 公开价格0.24 美元0.09 美元0.042 美元
部署方式Workers AI 或自托管权重Workers AI 或自托管权重TypeSafe 托管 API
原生视觉证据支持;托管与本地接口不同支持;托管与本地接口不同不支持;需预先转为文本
纳入试点的理由图像依赖的决策与部署控制延迟敏感、边界清晰的决策已验证的行为与更低的公开输入成本

Cloudflare 的价格来自 Workers AI 定价表,而不是宣传估算。表中的试点理由是我们的建议,不是性能保证。Cloudflare:Workers AI 定价

Jev 的基础接口请参阅Jev 技术评测。开放模型与基准来源问题由Laya 与 Jev 的对比单独讨论。本文聚焦一个具体问题:用 Cloudflare Clef 替换已有 Jev 集成,是否值得承担迁移成本与风险。

有价值的变化不是“又一个聊天机器人”。设想一个退货流程,同时有客户消息和破损包裹的照片。Clef 试点可以一起评估这些证据,在 damage_review、delivery_review 和 manual_review 之间选择。纯文本方案则需要先加入明确的图像转文本步骤。这只是架构示例,不是实测的 Clef 部署。退款本身仍由应用规则和审批流程控制。

类型化接口支持 noul(是/否概率)、choice(命名选项)和 score(有序等级)。因此,Clef 更适合作为智能体中的决策步骤,而不是替代所有推理和写作环节。公开输入类型。

Cloudflare Clef 比 Jev 便宜吗?

按公开输入 token 单价计算,不是。假设需要做 100 万次决策,每次按 2,000 个输入 tokens 计费,总计 20 亿 tokens。将Cloudflare 单价与TypeSafe 单价代入,得到以下仅包含输入推理费的示例:

模型示例输入费用相对 Jev
Jev84 美元1.00×
Clef-flash180 美元2.14×
Clef480 美元5.71×

这是我们的算术示例,不是报价。它假设相同的计费输入 token 数,并不假定同一段原始文本在不同模型下具有相同分词结果。实测还应包括问题模式开销、重试和图像处理。免费额度、折扣、Workers 执行、存储与人工复核不在示例内。Jev 列明输出 tokens 免费;Cloudflare 没有为这两款模型列出输出 token 单价。

如果新方案减少了高成本错误、免去单独的图像转文本步骤,或能可靠完成时限严格的决策,更高的 token 单价也可能合理。但必须用完整流程验证。不能把“比大型聊天模型便宜”改写成“比 Jev 便宜”。更广泛的业务分析见决策模型工作流与 ROI 指南。

基准测试:Clef 赢下一些任务,Jev 赢下另一些

Cloudflare 发布的结果支持按任务评估,不支持宣布全面赢家。以下数据来自 Clef 模型卡中的 Decision Index 0.2.1 测试,由 Cloudflare 报告,并非 Wavect 独立测量。质量指标为百分数,越高越好;延迟越低越好。

基准 / 指标ClefClef-flashJev
BANKING77,宏平均 F194.290.979.7
CLINC150 + OOS,宏平均 F197.466.889.3
RAGTruth,幻觉检测 F179.435.676.5
GPQA Diamond,准确率48.051.078.3
When2Call MCQ,准确率72.465.681.0
延迟中位数,毫秒209.338.8524.1
p95 延迟,毫秒238.6122.4536.0

我们的解读是:可以把 Clef 纳入意图路由试点,但必须测试未知意图,而不只是熟悉的类别。应将 Flash 视为质量分布不同的模型,而不是同一模型的加速版。它在 CLINC150 + OOS 和 RAGTruth 上的结果,是反对全面替换的重要反例。Jev 在 GPQA 和 When2Call 上的表现,也不支持“Clef 的所有决策都更好”这种说法。

延迟属于该评估环境,不能直接当成生产响应时间、服务等级承诺或自托管 GPU 的性能。应结合自己的并发量、请求长度、网络路径和回退行为,测量端到端 p95。基准表没有标明 Jev 版本时,不要把“Jev”列擅自改成某个新版本的实测结果。

迁移陷阱:同名 confidence 并不是同一个约定

不要把 Jev 的置信度阈值直接复制给 Clef。TypeSafe 将 Choice 置信度定义为 (p_max - 1/n) / (1 - 1/n),其中 n 为选项数量。它不同于直接返回获选答案的概率。TypeSafe:置信度公式

在本次审查的 Cloudflare 发布代码中,systemone_answer 将 Choice 的 confidence 设为获选答案的概率。我们检查的是修订版 a20e258。这是对公开实现的发现,并不证明所有托管部署都运行完全相同的修订版。托管端行为仍须单独确认。Cloudflare:本次审查的 Clef 发布代码

看一个算术示例:三个选项的概率分别为 0.80, 0.15, 0.05。Jev 文档公式给出 0.70,审查的 Clef 辅助函数给出 0.80。现有 confidence >= 0.75 规则会拒绝前者、接受后者,尽管概率分布完全相同。这是接口语义差异,不是 Clef 更确定或更准确的证据。

保留返回的完整概率分布,并在自己的适配层中明确决策统计量。使用带标签的验证样本重设阈值,再用未参与调参的测试集评估已接受决策的错误和人工复核比例。公式一致也不代表概率同样经过校准。这个独立问题可参阅 AnyJev 概率校准与选项顺序指南。

还有一个值得测试完整请求的原因:TypeSafe 描述的是问题独立评估,而 Clef 发布实现采用联合评分。我们据此提出的测试建议是:使用完整生产问题集合,并加入或移除无关问题,重复评估相同决策。这是架构推论,不是我们已经观察到 Clef 缺陷的声明。TypeSafe:问题独立评估说明

迁移 API:保留问题模式,重新验证接口边界

Jev 文档中的端点为 POST https://api.typesafe.ai/v1/systemone。能够保留 state、questions 和答案 ID 很有价值,但迁移到 Cloudflare 仍需要新的凭据、模型选择器,以及针对实际传输协议的适配层。TypeSafe:System One HTTP API

托管 Clef 文档列出 65,536-token 上下文、1 至 64 个问题,以及超长文本状态截断行为。图像接口最多接收四张内嵌 PNG、JPEG 或 WebP,不接受远程图像 URL。限制为每张 4 MiB、1,600 万像素,解码后总计 8 MiB,完整请求体最多 13 MiB。Cloudflare:托管 Clef API 接口约定

Clef-flash 使用自己的路由,以及相应的 model: "clef-flash" 选择器。切换版本时应同时检查端点和选择器。托管图像接口不能与本地发布代码中的视频帧示例混为一谈。Cloudflare:托管 Clef-flash API 接口约定

一个不执行实际业务操作的小型连通性测试

将下面的内容保存为 clef-request.json。示例把虚构消息归入待复核队列,不执行退款、不修改账户,也不授权任何操作。

{
  "model": "clef",
  "state": {
    "message": "The package arrived with a broken seal. I am not sure whether anything is missing."
  },
  "questions": {
    "review_queue": {
      "type": "choice",
      "instructions": "Select a review queue. Use manual_review when the evidence does not support a specific queue.",
      "criteria": {
        "damage_review": "Possible physical package damage.",
        "delivery_review": "Delivery timing or location issue.",
        "manual_review": "Missing or ambiguous evidence; a person should review."
      }
    },
    "needs_more_evidence": {
      "type": "noul",
      "instructions": "Is more information needed before a refund decision can be considered?"
    }
  }
}

在 shell 中配置账户 ID 和具有 Workers AI 权限的服务端 Cloudflare API token,然后使用 curl 7.76 或更高版本发送请求:

set -eu
: "${CLOUDFLARE_ACCOUNT_ID:?Set your Cloudflare account ID}"
: "${CLOUDFLARE_API_TOKEN:?Set a server-side Workers AI token}"

curl --fail-with-body --silent --show-error \
  --connect-timeout 10 --max-time 60 \
  "https://api.cloudflare.com/client/v4/accounts/${CLOUDFLARE_ACCOUNT_ID}/ai/run/@cf/cloudflare/clef" \
  --header "Authorization: Bearer ${CLOUDFLARE_API_TOKEN}" \
  --header "Content-Type: application/json" \
  --data-binary @clef-request.json \
  --output clef-response.json

该示例使用文档列出的 REST 路由。我们在本地检查了 JSON 与 shell 语法,但未执行付费推理请求。检查 clef-response.json,包括 API 层错误。不要将原始输出直接连接到业务操作。REST 响应封装与 Workers binding 返回值应分别验证;适配层还应检查答案 ID、允许的选项和有限概率值。

未知标签、响应格式错误、超时和限流都应保留人工复核路径。基于图像的 Clef 请求失败时,不能删掉图像证据后悄悄回退到纯文本 Jev。应使用经过明确测试的文本表示,或停止自动处理并转人工。同样,超大输入应主动拒绝或拆分,而不是出事后才发现关键段落被截断。

开放权重、自托管与隐私边界

开放权重提供的是部署选择,不是现成的生产服务。Clef 发布说明要求加载基础模型和联合决策头。仅运行通用聊天生成接口,不能证明已经运行了发布的决策模型。应把权重、处理器、决策头和服务代码一起固定版本。

审查的本地辅助函数默认使用 max_length=16384,不同于托管端的 65,536-token 限制。模型卡提到的单张 H200 是已测试环境,不是最低 GPU 要求。仅作容量粗估,270 亿参数按每参数两字节计算,权重约 54 GB;90 亿参数约 18 GB,均未计运行时开销。这是算术估计,不是测得的显存需求,也不能证明某种量化配置适合你的硬件。

还应区分可下载权重与托管定制服务。Cloudflare 的发布公告描述了由前线部署工程团队协助开展的早期微调工作,并计划扩大自助访问。未确认权限前,不要把“已经可用的一键微调产品”写进客户交付范围。

Cloudflare 的 Workers AI 数据政策表示,未经明确同意,不会将客户内容用于训练或改进模型。但这并不能回答应用持久化与处理地点的所有问题。Cloudflare:Workers AI 数据使用说明

例如,AI Gateway 默认开启日志,日志可能包含提示词和响应。应检查自身架构中的日志、存储、访问权限与保留策略。不要把“不用于训练”推导成仅在欧盟推理或零保留保证。具体部署路径的合同与技术要求仍需确认。Cloudflare:AI Gateway 默认日志设置

能发现真实回归问题的 Jev 到 Clef 迁移清单

从一个可逆的决策开始。固定旧实现作为基线,让 Clef 在影子模式运行,不改变线上业务动作。在查看最终独立测试集之前定义验收边界。一份有效的发布记录应能回答以下问题:

验收项应保留的证据不应上线的情况
API 与模式真实 HTTP 样本、允许选项、错误案例及版本配置只能处理理想情况
决策质量各部署语言的已接受错误、复核率与稀有类别结果总准确率掩盖有害的已接受决策
置信度约定明确统计量、版本化阈值与独立测试结果提供商切换悄悄改变验收规则
证据完整性长状态、图像和完整问题集合测试截断或回退丢失必要证据
运维端到端 p95、重试、实测费用与回滚测试代表性负载下收益消失

授权、幂等性和事务检查应留在确定性的应用代码中。符合问题模式的答案仍然只是模型判断,并不是行动许可。上线时记录所选部署、模式版本、验收规则和结果,使后续变化可以调查,同时避免记录不必要的个人信息。

我们的建议是:实测的能力或部署收益足以覆盖迁移成本时选择 Clef;仅在任务质量通过验收时选择 Flash;如果 Jev 的已验证行为能以更低成本满足要求,就继续使用 Jev。保持现有模型也是合理的工程结论。

Wavect 的 AI 工程服务可以帮助团队把对比转化为评估和集成计划。使用上线前 QA 清单组织验收,并携带有代表性的脱敏样本讨论你的决策流程。

有关 AI 项目交付的背景,可参阅 Twinsoft AI 案例。该案例不是 Clef 部署证明。

Clef 迁移常见问题

Cloudflare Clev 和 Clef 是同一个产品吗?

官方产品名称是 Cloudflare Clef。Clef 与 Clef-flash 于 2026 年 10 月 1 日发布。查找文档、权重和 Workers AI 端点时应使用 Clef。发布来源。

Clef 可以直接替换 Jev 吗?

类型化请求结构兼容,但传输协议、模型选择、输入限制与置信度含义仍须验证。尤其是审查的本地 Clef 实现,没有按 Jev 文档公式计算 Choice 置信度。API 兼容不代表验收规则等价。迁移发现。

Clef 比 Jev 便宜吗?

截至 2026 年 10 月 4 日,公开输入单价不是这样:Clef 每百万 tokens 为 0.24 美元,Clef-flash 为 0.09 美元,Jev 为 0.042 美元。整体成本还取决于实测错误、人工复核、重试与基础设施。计算与假设。

应该选择 Clef 还是 Clef-flash?

围绕实际质量要求或图像依赖的决策试点 Clef,再单独评估 Flash 是否适合延迟敏感任务。Cloudflare 的结果显示任务间差异显著,因此 Flash 不应直接继承 Clef 的阈值和上线批准。基准反例。

Clef 支持图像和视频吗?

托管模式文档列出了有数量和大小限制的内嵌图像,而本地模型还提供视频帧示例。这是不同接口。应确认实际部署支持的约定,不要假定本地视频示例可以直接用于托管图像端点。托管输入限制。

Clef 的上下文是 Jev 的两倍吗?

这种说法容易误导。托管 Clef 为 65,536 tokens。Jev 列出整个请求 64k,以及状态加最长问题 32k。审查的本地 Clef 辅助函数另有 16,384-token 默认值。应按实际请求结构评估。上下文差异。

可以自行托管 Clef 吗?

Cloudflare 发布了 Apache-2.0 权重、联合决策头和相关代码。自托管需要匹配的组件、容量规划及可运维的服务层。公开 H200 测试环境并不是最低硬件保证。部署边界。

高置信度可以授权业务操作吗?

不能。置信度概括的是模型输出,不是权限或已证明的正确性。应验证已接受决策的错误率、保留人工复核,并在模型之外执行授权和事务规则。迁移验收。

最终思考

开放权重和视觉输入,让 Cloudflare Clef 成为更值得关注的 Jev 式决策接口。但切换理由应是流程中可测量的改善,而不是宣传标题。批准任何一个 Clef 版本之前,都要重新验证置信度、保留证据并测试回滚。

构建产品,而不只是 backlog

如果这篇文章对应的是一个真实产品决策,Wavect 可以用高级创始人级判断帮你界定范围、构建、加固或领导软件工作。

可选服务路径:

只收重要内容

关注与你相关的内容

每当我们发布新文章,你会收到一封简短邮件。你可以关注整个博客,也可以只选感兴趣的主题。

你希望接收哪些内容?
选择主题

免费、双重确认、不使用跟踪像素。

返回
Kevin Riedl

12 分钟 阅读 · 2026年10月4日
最近审核

下一篇

获取下一篇关于AI 与智能体的一线笔记

有新文章时发送一封简短邮件,不使用跟踪像素,也不发送填充内容。

免费、双重确认、不使用跟踪像素。