返回
Kevin Riedl

13 分钟 阅读 · 2026年9月18日
最近审核

下一篇
图片在你的设备上生成,不连接 Instagram。文章链接会复制到剪贴板,供链接贴纸使用。

Jev AI 评测:面向智能体工作流的决策模型

Jev 是面向机器可消费决策的 AI 模型,而不是面向人类阅读的文本生成器。它接收应用状态与预先声明的问题,直接返回类型化选项、评分、概率和置信度。因此,它很适合成为智能体的内部控制层:先决定路由、排序、重试、升级或停止;只有真正需要语言表达时,才调用语言模型。

研究日期:本文是基于 Jev 1.13 的文档与架构评审,不是独立延迟基准,也不是生产部署案例。TypeSafe 于 2026 年 9 月 15 日以早期访问形式发布 Jev,并将其称为首个公开的 System One 模型。TypeSafe 的 Jev 发布文章

本文只承接一个明确的搜索意图:Jev 是什么、它的决策接口如何工作,以及它在生产软件中的位置。如需比较网关与路由器这一整体类别,请阅读我们的 LLM 网关与路由器指南。如需了解编程智能体按轮次切换模型,请阅读 NeMo Switchyard 评测。这些架构彼此相邻,但并不是 Jev 的同义词。

Jev 是什么,由谁开发?

Jev 是 TypeSafe 首个公开可用的决策模型。TypeSafe 将其定位为面向软件判断的低延迟推理层。传统做法往往先让模型生成一段文字,再从文字中解析出路由结果;Jev 则直接评估封闭问题,例如“哪个处理器应处理此请求?”,并返回预先声明的某个选项及其概率分布。

将 Jev 简化为“由 ChatGPT 的共同发明者打造”并不准确。TypeSafe 的创始人介绍称,Diogo Almeida 共同发明了 RLHF 与 InstructGPT,这些方法后来促成了 ChatGPT 和 GPT-4;发布文章则表示,他此前在 OpenAI 的工作参与了 ChatGPT 背后的研究。这是一项重要背景,但不等同于独自或整体发明 ChatGPT 产品。TypeSafe 团队介绍

Jev 如何把状态转换为类型化决策?

一次请求在概念上包含两部分:状态保存相关应用数据,问题声明需要做出的判断。TypeSafe 的介绍文档称,所有问题会针对同一状态独立并行评估。返回结果是结构化数据,代码可以直接比较、排序、设定阈值或路由,而无须从自然语言中重新提取值。TypeSafe 的 Jev 介绍文档

Jev 提供三种问题原语。输出只能落在开发者声明的模式中,但模式受限并不代表判断一定正确。

Jev 文档中的三种决策原语
原语问题形式返回信号适合用途
Choice从声明选项中选择一个所选项、完整概率分布与置信度把请求路由到代码、专用模型或人工
Score按声明量表评估状态评分、各等级概率与置信度评估紧急程度、质量或审核优先级
Noul评估一个是非命题答案为“是”的概率控制“是否包含退款请求”等分支

官方原语参考强调原子问题与代码组合。像“这笔交易安全吗?”这样的宽泛问题,把市场、政策、敞口、时间和执行等多个判断压进一个答案。更稳健的设计会拆分这些判断,把算术和不变量留在代码中,只让 Jev 处理真正需要语义判断的部分。

Jev、LLM 与确定性代码有什么区别?

Jev 并不是带 JSON 模式的聊天模型。传统 LLM 即使受输出模式约束,仍然按顺序生成 token。Jev 则围绕预先声明的决策与概率分布设计。它的实际优势不只是 JSON 更整齐,而是在概率推理与普通软件之间建立更窄、更清晰的契约。

让每个组件承担最适合它的工作
组件最擅长不应委托
确定性代码算术、权限、限制、日期、状态转换和副作用难以用规则维护的模糊语义分类
Jev基于给定状态的有限选项、评分和是非判断面向用户的文本、精确计算、开放式规划或最终授权
语言模型解释、综合、起草、对话与开放式推理在无人监督下控制高影响副作用

当前模型页面列出 jev-1.13.0,单次请求上下文为 64k,状态加最长问题的预算为 32k,仅支持文本输入,输入价格为每百万 token 0.042 美元,输出 token 免费。英语是主要训练语言,其他语言必须针对实际负载单独评估。移动别名 jev-latest 可能在应用不改代码的情况下指向新版本,因此生产试点应记录实际返回的版本;若阈值依赖特定版本,则应固定经过测试的模型 ID。TypeSafe 当前模型参考

Jev 如何在多个 LLM 之间路由请求?

模型路由是 Jev 很有潜力的早期用例,因为路由器通常只需要一个紧凑判断,而不需要一段精心润色的回答。可用的路由集合可以是 deterministic_codefast_llmreasoning_llmhuman_review。被禁止的数据类别、上下文长度、供应商可用性和预算等硬约束仍由代码控制。Jev 只处理语义部分:这个请求看起来需要哪类工作?

下面的示例遵循当前 Python SDK 形式,并有意固定本文评审的版本。它是一张架构草图,不是可直接复制到生产环境的完整策略。

from typesafe_sdk import Choice, Noul, TypeSafeClient

ROUTE_CONFIDENCE = {
    "deterministic_code": 0.90,
    "fast_llm": 0.80,
    "reasoning_llm": 0.75,
    "human_review": 0.00,
}


def choose_handler(request: str, risk_class: str) -> str:
    # Hard policy belongs in code, before probabilistic routing.
    if risk_class == "prohibited":
        return "reject"

    with TypeSafeClient(model="jev-1.13.0") as client:
        response = client.system_one(
            state={"request": request, "risk_class": risk_class},
            questions={
                "route": Choice(
                    instructions="Which handler should process `request`?",
                    criteria={
                        "deterministic_code": "A fixed lookup, rule or calculation is sufficient",
                        "fast_llm": "Short language generation with limited reasoning",
                        "reasoning_llm": "Multi-step interpretation or synthesis is required",
                        "human_review": "Ambiguous, sensitive or outside the declared routes",
                    },
                ),
                "needs_current_sources": Noul(
                    instructions="Does `request` require information that may have changed recently?"
                ),
            },
        )

    route = response.answers["route"]
    minimum = ROUTE_CONFIDENCE[route.choice]
    if route.confidence < minimum:
        return "human_review"
    return route.choice

SDK 快速入门文档展示了上例使用的 state、类型化问题和 response.answers 接口。TypeSafe Python 快速入门独立的置信度文档说明,Choice 与 Score 的置信度来自返回概率分布的形状。它不是所选路由一定正确的证明。阈值必须用代表性数据校准,并与错误分支的后果匹配。TypeSafe 置信度参考

TypeSafe 自己的意图路由模式把模型放在确定性逻辑、专用 LLM 与人工审核之前。这才是正确的理解:Jev 选择一个受限处理器;该处理器仍需自行负责权限、验证和输出质量。TypeSafe 意图路由模式

智能体的哪些步骤应改成决策,而不是提示词?

许多智能体工作流在每个内部步骤都调用语言模型,因为统一接口很方便。但这种方便会带来额外延迟、输出 token、解析、重试,以及更多文本偏离控制契约的机会。更好的判断标准是:该步骤是在为人生成语言,还是在为软件生成有限信号?

把控制决策与语言沟通分开
工作流步骤Jev 可以提供代码必须保留LLM 适合负责
路由意图、复杂度或风险类别允许的目的地、配额和供应商健康状态执行选中的专用任务
批准建议或语义政策匹配授权、限额、记录版本和最终提交向审核者解释原因
排序量表评分或成对相关性稳定排序、并列规则和必选项总结排序后的项目
重试或停止最近结果是否不完整或偏离任务重试上限、幂等性和超时状态在确有必要时生成修订答案
升级歧义、敏感性或例外可能性升级政策和访问控制为人工生成简明案例摘要

TypeSafe 的构建指南建议:确定性工作留在代码中,问题保持狭窄和原子化,只发送相关状态,并把不确定案例交给人工或更昂贵的推理模型。这能让智能体更可治理,但不会让它神奇地变成确定性系统。接口是类型化的,判断仍然是概率性的。TypeSafe 工作流设计指南

可通过我们的 AI 智能体设计模式指南判断外围系统应采用单次调用、ReAct、规划与执行分离、反思还是独立验证;再用 AI 智能体单次行动成本模型把路由器、重试、人工审核与失败结果都计入,而不是只强调某一次调用很便宜。

Jev 能执行自动化交易决策吗?

Jev 可以参与边界明确的交易工作流,但不应成为市场计算或订单执行的唯一权威。TypeSafe 发布的函数调用示例使用一个交易助手,把自然语言分析请求映射到十个普通的类型化函数。它会选择函数以及证券代码、时间窗口和图表样式等封闭参数。这个示例并不能证明盈利信号、仓位计算、下单能力或风险管理保证。TypeSafe 交易函数调用示例

更安全的架构应包含五道边界:

  1. 数据与特征服务:确定性校验时间戳、计算指标并规范化市场数据。
  2. Jev 决策层:用封闭选项判断语义市场状态、事件相关性、策略匹配度或审核优先级。
  3. 风险引擎:用代码计算仓位、敞口、价格边界、亏损限制、交易时段和投资组合约束。
  4. 执行服务:验证不可变订单提案,强制幂等,并记录经纪商响应。
  5. 监督机制:先在影子模式运行,与已批准基线比较,并把低把握或高影响案例送交审核。

不要让 Jev 计算盈亏、比较时间戳、推导精确数量或猜测缺失的限价。也不要把它的置信度理解为交易获利概率。语义模型可以帮助选择一个预先声明的分支;确定性风险服务必须决定该分支是否有权触碰资金。本文讨论软件架构,不构成投资建议。

Jev 1.13 的已知失败点是什么?

TypeSafe 为本文评审的版本发布了专门的 jaggedness 页面。文档指出,Jev 可能过度按字面理解问题,数值精度和日期比较能力较弱,容易受大量无关状态干扰,也可能被对抗性内容影响,而且不适合文本生成。结构恒等式和算术应由代码强制保证。TypeSafe 的 Jev 1.13 局限清单

  • 类型正确不等于判断正确。Jev 可以完全符合模式,却仍然选错选项。
  • 概率性不等于确定性。结构化输出降低了接口波动,但重复判断不会因此成为数学常量。
  • 置信度不等于授权。高置信度不能授予访问权限、批准付款或绕过风险限制。
  • 状态本身是攻击面。用户输入或检索内容可能影响语义判断;可信政策应隔离存放,并测试对抗性输入。
  • 封闭选项必须有退出路径。现实可能超出声明选项时,应加入未知、其他或人工审核。
  • 不同语言的质量不同。每个目标语言都应单独评估,不能直接翻译英语阈值。

Jev 的速度与成本数字可信吗?

这些数字值得关注,但必须准确归因。TypeSafe 报告端到端延迟为 70 至 500 毫秒,输入价格为每百万 token 0.042 美元,输出 token 不计费。发布文章称,在相似的 System One 型查询上,速度可达到 40 至 200 倍。官网的“快 193.6 倍、便宜 444.6 倍”来自其自行设计的四工作流评测,TypeSafe 也明确表示这些数字可能接近现实收益的高端。

评测网站使用共识标签比较多个模型的结构化工作流,并报告在其测试环境中,工作流形式优于将同一政策写成单个提示词。这是支持任务拆分的有价值证据,但仍然是供应商设计的测试框架,参考标签由模型生成,并非独立审计,也不保证适用于其他负载。TypeSafe 工作流评测网站

因此,不应把“快 20 至 200 倍”或“便宜 40 至 400 倍”当作普遍产品事实。更合适的指标是每个被接受决策的总成本:推理、重试、备用 LLM、人工审核、工程时间和错误路由成本之和,除以通过相同验收标准的决策数量。

团队应如何在生产环境试点 Jev?

先选择一个高频、可逆且已有标签结果的决策。模型路由很适合,因为 Jev 可以先在影子模式运行,而现有处理器继续作为默认路径。

  1. 定义决策契约。明确允许的选项、未知路径、硬规则,以及哪个组件拥有最终副作用。
  2. 构建代表性评测集。覆盖普通案例、罕见案例、歧义、多语言、提示注入,以及过期或矛盾上下文。
  3. 固定并记录模型。保存版本化模型 ID、输入模式版本、决策、完整概率分布、置信度、所选处理器和最终结果。
  4. 按后果校准。FAQ 路由错误与付款路由错误不应共用阈值。低置信度只是升级信号之一。
  5. 先观察,再执行。比较 Jev 与当前路由,分析分歧,只对达到约定质量与延迟标准的类别启用强制路由。
  6. 保留旁路。供应商故障、限流或模型漂移不能困住工作流。应始终保留确定性默认路径和快速回滚。
  7. 每次升级都重新评估。别名会移动。更换固定版本或决策政策前,应重跑同一套测试。

对于敏感数据,TypeSafe 表示不会使用客户请求训练 Jev,并为企业客户提供零数据保留选项。采购方仍需审核适用的 DPA、实际保留配置、区域、访问控制和事故条款。TypeSafe 法律与数据处理索引

试点应放在可观测的 智能体运行框架中,而不是把概率直接连接到副作用。Wavect 的 AI 产品与智能体工程从决策契约、评测集和回滚路径开始。Twinsoft AI 案例是我们交付能力的独立证据,并不表示该客户使用了 Jev。可使用 上线前软件 QA 清单管理外围发布控制,或带来一个高频决策及其验收标准

我们的结论:Jev 是决策层,不是更小的聊天机器人

Jev 的意义在于挑战一个浪费性的默认做法:让文本生成器承担每一个内部判断。类型化、带概率的决策接口可以减少解析,并让控制流更容易审查。模型路由、分诊、排序与受限升级都是合理的早期用例。

这个思路最强的版本也是最不神奇的版本。代码保留规则、算术、权限和副作用;Jev 提供狭窄的语义判断;语言模型负责语言生成和开放式推理;当后果重大时,人工或独立控制仍然负责授权。这样的分层可以让智能体工作流更快、更便宜、更可治理,同时不把概率软件误称为确定性系统。

生产级 AI 支持

正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。

查看相关服务:

Jev AI 常见问题

Jev AI 是什么?

Jev 是 TypeSafe 的首个 System One 模型。它依据类型化问题评估给定应用状态,并直接返回有限选项、评分或是非概率,供软件消费。

Jev 是大型语言模型吗?

TypeSafe 将 Jev 描述为针对结构化决策而非字符串生成优化的另一类模型。它仍会对自然语言状态进行概率推理,但接口和训练目标都围绕预先声明的决策设计。

Jev 会生成文本吗?

它不生成面向用户的开放式文本。Jev 为声明的问题返回类型化值、概率分布和置信信号。需要解释、草稿、对话或其他开放文本时,应使用语言模型。

Jev 是确定性的吗?

不是。它的输出契约结构化且受限,但判断仍然是概率性的。类型化输出可以防止模式外值,却不能保证所选值一定正确,也不能保证每次评估完全相同。

Jev 能选择由哪个 LLM 处理请求吗?

可以。Choice 问题可把请求分类到确定性代码、快速 LLM、推理 LLM 或人工审核等声明路径。硬政策、供应商状态、预算限制和最终授权仍应留在代码中。

Jev 能做自动化交易决策吗?

它可以在交易系统中提供边界明确的语义判断,但不应计算精确价格、数量、日期或风险限制,也不应成为唯一订单权威。数据验证、量化风险控制和执行不变量应由确定性服务负责。

Jev 有多快,成本多低?

TypeSafe 列出的价格为每百万输入 token 0.042 美元,输出 token 免费,并报告 70 至 500 毫秒延迟。最大速度和成本倍数来自供应商自测工作流,必须用采购方自己的被接受决策指标验证。

Jev 可以用于生产吗?

Jev 目前处于早期访问。若试点固定模型版本,使用代表性评测、按风险设置阈值、先做影子比较,并具备可观测性、确定性回退和已测试回滚,则可开展边界明确的生产试点。

最终思考

Jev 带来一个有用的分工:供机器使用的决策,不必先写成人类阅读的文字。它的类型化选项、评分与概率很适合模型路由和其他高频控制步骤。

生产机会并不是用 Jev 替换所有 LLM,而是把每类工作放进正确层级:确定性规则交给代码,有限语义判断交给 Jev,沟通与开放式推理交给语言模型,高影响动作外围保留独立授权。

生产级 AI 支持

正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。

查看相关服务:

只收重要内容

关注与你相关的内容

每当我们发布新文章,你会收到一封简短邮件。你可以关注整个博客,也可以只选感兴趣的主题。

你希望接收哪些内容?
选择主题

免费、双重确认、不使用跟踪像素。

返回
Kevin Riedl

13 分钟 阅读 · 2026年9月18日
最近审核

下一篇

获取下一篇关于AI 与智能体的一线笔记

有新文章时发送一封简短邮件,不使用跟踪像素,也不发送填充内容。

免费、双重确认、不使用跟踪像素。