---
title: "Laya vs Jev：基准结果与 AI 创业护城河"
canonical: https://wavect.io/zh/blog/laya-vs-jev-benchmark-ai-startup-moat/
language: zh
description: "Laya vs Jev 深度分析：核查“三天超越两年”的说法，区分微调检查点、准确率、校准和部署延迟，并讨论模型可替换后，AI 创业公司如何保留真正的客户价值。"
image: "https://wavect.io/img/blog/headers/header_laya-vs-jev-benchmark-ai-startup-moat.png"
---

[**返回**](/zh/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/zh/team/kevin-riedl/)

[Kevin Riedl](/zh/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 分钟 阅读 · 2026年9月20日 最近审核 2026年9月20日

[**下一篇**](/zh/blog/jev-ai-decision-model-review/)

# Laya vs Jev：基准结果与 AI 创业护城河

要点速览

Laya 是值得评估的开源决策模型候选方案，而非已经证实的通用 Jev 替代品。它的专用检查点报告了 76.6% 的硬标签准确率，高于另一项公开评估中的 Jev 72.7%，但训练、校准和部署条件存在重要差别。三天是公开文章的日期间隔，不是得到核实的完整研发周期。创业者真正应该构建的是模型可替换后仍有价值的工作流。

**模型领先，不等于商业护城河。**这才是 Laya vs Jev 事件值得创业者关注的地方。最吸引眼球的说法是：三天的开源开发，击败了两年的研究。但公开证据支持的是一个更具体、也更有价值的结论：专用替代方案可以挑战产品的核心性能指标，却不一定复制了整个产品。

对创始人来说，问题不只是哪个模型获胜。更重要的是：如果明天就出现可信的替代模型，客户还会为什么继续付费？

资料核查日期：2026 年 9 月 20 日。本文是对公开资料的分析，不是我们亲自运行的基准测试。关于产品本身，请阅读我们的 [Jev AI 决策模型评测](/zh/blog/jev-ai-decision-model-review/) ；本文重点讨论竞争性证据和创业风险。

## Jev 研发两年后，Laya 真的只用三天就做出来了吗？

TypeSafe 于 **2026 年 9 月 15 日**发布 Jev。创始人 Diogo Almeida 表示，公司此前进行了两年的低调研发，并介绍了自己在 OpenAI 参与 ChatGPT 背后相关方法研究的经历。这是创始人对公司发展过程的描述，不是经过独立审计的模型训练时间表。 [查看 TypeSafe 的官方发布文章。](https://typesafe.ai/blog/introducing-system-one-models-and-jev)

Laya 的开发者 Nandakishor M 于 **2026 年 9 月 18 日**发表技术文章。两篇文章的发布日期相隔三天，但这不能证明 Laya 的所有组件都是在这三天内从零研究、训练和评估完成的。 [阅读开发者的技术说明。](https://dev.to/nandakishor_m_6cc0adfde9f/i-built-non-autoregressive-decision-models-a-year-ago-then-a-frontier-lab-called-it-a-18me)

此外，他此前已有相关研究：SalesRLAgent 论文于 **2025 年 3 月 30 日**提交，研究的是面向销售转化决策的强化学习方法，并不是相同版本的 Laya。它证明存在更早的相关工作，并不能证明任何一方抄袭了另一方。 [查看 SalesRLAgent 的原始论文记录。](https://arxiv.org/abs/2503.23303)

**站得住脚的叙事是竞争压力来得很快，而不是已经证实的“两年对三天”研发竞赛。**发布时间、开发投入和产品成熟度是三个不同维度。

## Laya 是什么？比较的究竟是哪一个模型？

Laya 是一组开源、非自回归的决策模型。它不是逐个生成 token 来写出回答，而是对分类、评分等具有明确边界的问题进行判断。代码与模型权重采用 Apache 2.0 许可证发布。Laya 这个名称对应三个检查点，并非一个可以任意互换的单一模型。 [查看 Laya 模型卡与检查点说明。](https://huggingface.co/convaiinnovations/laya)

| 检查点 | 基础模型与规模 | 上下文 | 主要用途 |
| --- | --- | --- | --- |
| laya | ModernBERT-large，4.21 亿参数 | 512 token | 英语决策任务 |
| laya-multilingual | mmBERT-base，3.22 亿参数 | 1,024 token | 多语言输入 |
| laya-typed-decisions | ModernBERT-large，4.21 亿参数 | 1,024 token | 四类专门训练的工作流 |

采购、评估或替换“Laya”时，如果没有明确检查点，技术要求就是不完整的。有效的评估记录还应包含软件版本、路由设置、输入语言和问题模式。我们要选择的不是一个品牌，而是一套能够实际部署的配置。

## Laya 的性能真的超过 Jev 吗？

**专用检查点在一项 typed-decisions 评估中报告了更高的硬标签准确率，但并非每项指标都更好。**模型卡介绍的测试包含 400 个案例、2,000 次决策。Jev 1.13.0 的数字来自另一项已发表评估：Laya 作者没有在同一次测试中调用 Jev，提示内容和样本也有所不同。 [阅读专用检查点的结果与局限。](https://huggingface.co/convaiinnovations/laya-typed-decisions)

| 指标 | Laya 专用检查点 | Jev 1.13.0，独立发布的结果 | 如何理解 |
| --- | --- | --- | --- |
| 硬标签准确率 | 0.766 | 0.727 | Laya 报告的结果高出 3.9 个百分点。 |
| 软准确率 | 0.471 | 0.580 | 在这一考虑分布信息的指标上，Jev 报告的结果更高。 |
| 期望校准误差，越低越好 | 0.213 | 0.144 | 这里公开的校准结果更有利于 Jev。 |

另一个关键区别是训练数据。专用检查点使用了该基准的训练集进行微调。在同一公开评估中，英语和多语言基础检查点的硬标签准确率约为 36% 和 34%，低于约 46% 的多数类基线。专用模型的成功，并不能证明基础模型拥有同样强的零样本能力。

*typed-decisions* 数据集包含合成工作流，并提供独立的训练集和测试集。使用训练集本身并不等于测试数据泄漏。但它改变了比较问题：我们讨论的不再是“不经过适配，哪个模型泛化得更好”，而是“这个经过专门训练的模型，在这类任务上表现如何”。 [查看 typed-decisions 数据集。](https://huggingface.co/datasets/LocalLLaMA/typed-decisions)

对于只解决一种重复工作流的创业公司，这个范围更窄的结果仍可能非常重要。客户未必需要通用智能，而是需要业务流程稳定完成。不过，针对基准优化的模型，仍然必须在未见过的客户数据上证明自身价值。

## Laya 的默认路由器会自动得到宣传中的成绩吗？

**不会自动做到。**在核查的实现中，路由器默认不会悄悄选择 typed-decisions 专用检查点。需要显式指定，例如 `model="typed-decisions"`，传入任务提示，或通过 `auto_task_detection=True` 开启任务识别。 [直接核对路由器实现，不要猜测默认行为。](https://github.com/NandhaKishorM/laya/blob/main/laya/router.py)

吸引人的准确率属于特定检查点和测试设置。一个通用路由器示例，不能证明相同模型处理了你的请求。每条评估结果都应记录实际选中的检查点。还应测试不符合那四类专用模式的输入：识别基准中的问题签名，并不等于理解你的业务。

## 为什么“快八倍”和“校准更好”都需要附带条件？

项目基准报告中的 **32.8 毫秒**，对应多语言检查点在 T4 GPU 上处理一个问题。批量处理十个问题需要 72.3 毫秒。将批处理耗时除以问题数量得到的是吞吐量意义上的单题时间，并不等于单次请求延迟。同一报告中的校准改善还涉及重新拟合温度参数，不能与前表中专用检查点未经这种调整的 ECE 混为一谈。 [阅读 Laya 的测试方法与校准表格。](https://github.com/NandhaKishorM/laya/blob/main/BENCHMARKS.md)

部分对比数字来自一个独立的 Jev 小规模评估。该评估从法国访问托管服务，本地对照则是运行在 Apple M4 Max CPU 上的 GLiNER，而不是在同一 GPU 上运行的 Laya。这些数字反映不同部署路径，并不是只比较模型架构的受控速度测试。 [查看独立 Jev 评估及其限制。](https://github.com/AbdelStark/jev-benchmarks/blob/main/README.md)

对采购方来说，有价值的问题是：在实际负载下，包含排队、网络和失败回退的端到端延迟是多少？对创业者来说，有价值的校准问题是：在可接受的实际错误率下，能够自动处理多少工作？置信度不能直接变成批准退款、修改账户或绕过业务规则的权限。

多语言模型卡报告，在一个具有 20 个选项的任务上，51 种受测语言中有 45 种超过随机准确率的三倍。这里的随机准确率是 5%，因此门槛是 15%，而不是生产可用性标准。“支持很多语言”不能被理解为“每种语言都同样可靠”。 [阅读多语言检查点按语言划分的评估。](https://huggingface.co/convaiinnovations/laya-multilingual)

实际约束不止语言。Laya 文档提醒，大量候选选项会带来问题；采用延迟加载的路由器反复切换模型时，也可能反复加载检查点。预加载能避免这些重新加载，但需要更多内存。Banking77 的比较还使用了不同标签数量：Laya 为 77 个，引用的 Jev 小规模评估为 72 个，因此不能当作严格同条件排名。 [查看项目的部署说明与比较注意事项。](https://github.com/NandhaKishorM/laya/blob/main/README.md)

设计自己的测试时，不妨故意增加难度：混合语言工单、较长但相关的输入、相似标签、重新排列的选项，以及刚启动的工作进程。这些是我们建议的测试条件，不是我们亲自观察到的失败。它们可以帮助确认，你真正要运行的系统是否与标题中的系统一致。

## 为什么这构成 AI 创业风险，却不能证明 Jev 注定失败？

**我们的商业判断是：**如果一家公司的全部价值主张都来自模型优势，而客户无需替换周边工作流就能替换模型，这家公司就面临竞争风险。Laya 的公开结果让这个问题值得认真考虑，但它们不能说明 TypeSafe 的收入、留存、成本或未来商业结局。

任何一方都不应被当作永远正确。TypeSafe 自己的 Jev 1.13 限制说明提到，模型在精确计算、日期比较和对抗性内容方面存在问题。 [阅读 TypeSafe 的模型特定限制。](https://docs.typesafe.ai/model-jaggedness/jev-1.13)

战略问题在于：客户价值究竟位于哪一层？一个简单分类接口，比一个能整理杂乱业务数据、执行权限、支持审核人员并追踪错误的完整服务更容易被另一个接口替换。这是产品设计层面的分析，不是某家现有公司已经失败的证据。

同样的竞争压力也可能帮助应用型创业公司。上游模型变得更便宜或更可控时，不依赖特定模型的产品可以改善成本结构。如果技术替代了你出售的价值，它就是威胁；如果技术强化了你出售的价值，它就是更好的生产要素。

## 底层模型变化后，哪些东西仍然有价值？

我们会围绕五项能力构建产品：深入掌握工作流、获得合法使用许可的反馈数据、私有评估集、客户触达能力，以及可靠的运营。这些因素都不会自动成为护城河。它们必须真正改善客户结果，或以合理的方式让产品更难被替换。

例如，一个发票审核产品可以用开放检查点对发票分类，但完整产品可能仍需核对供应商身份、向审核者展示相关证据、执行支出权限、恢复失败的集成，并解释哪些内容发生了变化。这只是架构示例，不表示 Wavect 已经为客户部署了其中任一模型。

分发渠道也需要单独评估。Vercel 于 2026 年 9 月 19 日发布了 Jev 集成指南，使用 AI SDK 的 `experimental_evaluate` API 和 AI Gateway。这是具体的集成证据，但不是客户采用率或永久竞争优势的证明。 [查看 Vercel 的 Jev 与 AI SDK 指南。](https://vercel.com/kb/guide/typesafe-jev-and-ai-sdk)

开放权重改变了部署选择，却不会消除运营成本。需要计入算力、利用率、监控、更新、校准、安全和人工复核。应比较**每个正确完成的工作流的总成本**，而不是将收费 API 与一台想象中零成本的服务器进行比较。我们的 [智能体单次动作成本指南](/zh/blog/ai-agent-cost-per-action-2026/) 进一步解释了成本模型。

## 替换 Jev 前，如何评估开源替代方案？

用公开结果筛选候选方案，再用自己的验收测试决定生产配置。以下是我们建议的评估流程，不代表任何一个模型已经通过这些要求。

| 控制项 | 记录内容 | 支持的判断 |
| --- | --- | --- |
| 有代表性的保留测试集 | 拥有使用权限、与调优数据分离的私有案例；按语言和罕见高损失错误分组。 | 结果能否泛化到客户工作负载？ |
| 一致的任务约定 | 相同输入、标签、指令和必需输出；将零样本与微调比较分开。 | 系统是否在解决同一个问题？ |
| 固定配置 | 模型及 SDK 版本、实际检查点、路由设置和输入截断情况。 | 结果是否可复现？ |
| 质量与不确定性 | 准确率、校准、高损失误报、人工复核比例和不确定性区间。 | 多大程度的自动化有依据？ |
| 运行测量 | 冷启动与热运行的 p50/p95 延迟、并发负载、失败和完整成本。 | 部署是否经济、可靠？ |
| 受控上线 | 先进行不影响业务的影子决策，由应用管理权限，并具备回滚和明确审核责任。 | 错误决策能否被限制在可控范围？ |

在查看最终测试集结果之前，就应确定验收阈值。用于校准和选择阈值的数据必须与最终测试集分开。也要加入简单规则系统作为基线：有些决策既不需要 Jev，也不需要 Laya。迁移带来的额外复杂度，应由更好的实测结果来证明其必要性。

实施方面，可以了解 [Wavect 的 AI 工程服务](/zh/services/artificial-intelligence/) ，通过独立的 [Twinsoft AI 案例](/zh/case-studies/twinsoft-ai/) 了解产品背景，并用 [上线前软件质量检查清单](/zh/software-development-guide/software-qa-checklist-before-launch/) 组织验收。与其直接委托未经验证的模型替换，不如 [和我们的团队讨论范围明确的评估](/zh/contact/) 。

## 创业启示：构建不会被更好模型轻易替代的价值

Laya 值得评估，它发布的比较也值得认真阅读。更可靠的结论不是“三天抹去了两年工作”，而是：一个可信的专用模型可以迅速给以模型为核心的价值主张带来压力，同时留下大量产品、评估和运营问题尚待解决。

**构建客户在模型可替换后仍然舍不得放弃的部分。**把基准领先当作可以利用的优势，而不是永远存在的防线。新的挑战者出现时，应判断它究竟威胁了你的产品，还是为你提供了更好的组件。

## Laya vs Jev 常见问题

### Laya 真的只用三天就从零开发完成了吗？

核查的来源无法证明这一点。TypeSafe 于 2026 年 9 月 15 日发布 Jev，Laya 作者于 9 月 18 日发表技术文章，而且他在 2025 年 3 月已有相关研究。发布日期不能衡量完整研发投入。

### Laya 比 Jev 更好吗？

Laya 专用检查点在一项 typed-decisions 评估中报告了更高的硬标签准确率，但 Jev 在其他指标上的独立公开结果更好。提示、样本和训练经历不同，因此不能把这些数字视为受控的通用排名。

### 哪个 Laya 检查点取得了 76.6%？

该结果属于 laya-typed-decisions，它使用该基准的训练集进行了微调。这不是通用基础模型的零样本结果，而且本次核查的默认路由器不会悄悄选中这个专用检查点。

### 32.8 毫秒是否意味着 Laya 在生产环境中快八倍？

不是。这个测量对应多语言检查点在 T4 GPU 上处理一个问题。托管 API、网络、冷启动和并发属于不同条件。承诺速度倍数之前，必须测试实际部署路径。

### 类型化决策或置信度能够保证操作正确吗？

不能。有边界的输出仍可能包含错误判断，校准也依赖任务与数据。权限必须由应用执行；影响较大的操作还需要经过测试的阈值、人工复核路径和回滚能力。

### 自行托管 Laya 是否没有运营成本？

不是。开放权重不会消除算力、内存、监控、维护、安全和人工审核成本。应该比较每个正确完成的工作流的完整成本，而不是只比较供应商的请求价格。

### 除了模型性能，AI 创业公司还能建立什么优势？

潜在的持久价值包括深度集成的工作流、有使用许可的反馈数据、有代表性的私有评估、客户触达和可靠运营。这些是战略选择，不代表某家公司已经拥有不可攻破的护城河。

### 团队应该立即用 Laya 替换 Jev 吗？

应将 Laya 视为评估候选，而非自动迁移决定。使用私有保留数据比较相同任务，记录实际检查点，分开评估零样本与微调配置，测量运营成本，并从影子决策开始。

## 最终思考

基准成绩可以支持进一步评估，却不能自动支持迁移，更不能判定一家公司的成败。区分检查点、实验与产品，构建在模型变化后依然有用的价值。

## 你可能也喜欢..

[**Jev AI：面向智能体工作流的决策模型** 评估替代方案之前，先了解产品本身。](/zh/blog/jev-ai-decision-model-review/) [**AI 落地实施与通用 AI 咨询的区别** 比较实施责任与单纯提供建议的服务。](/zh/compare/ai-enablement-vs-generic-ai-consultancy/)

模型与基础设施

## 继续浏览此集群

模型选择、推理经济性、本地部署、压缩与服务架构。

[从核心文章开始**在欧盟自托管 LLM：开放权重模型何时才真正划算**](/zh/blog/self-hosting-llms-eu-cost/)

- [Jev AI 评测：面向智能体工作流的决策模型](/zh/blog/jev-ai-decision-model-review/)
- [SwarmLLM 评测 2026：手机与笔记本协同浏览器 LLM 推理](/zh/blog/swarmllm-browser-p2p-inference-review-2026/)
- [Phonely Alma 评测：这款语音 LLM 能否用于生产？](/zh/blog/phonely-alma-voice-llm-review/)
- [Utopia 企业评估：双时态知识图谱与历史问答](/zh/blog/utopia-temporal-knowledge-graph/)
- [NVIDIA PAIR 评测：本地 AI 路由与 AMD 支持缺口](/zh/blog/nvidia-pair-amd-rocm-strix-halo/)

[**返回**](/zh/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/zh/team/kevin-riedl/)

[Kevin Riedl](/zh/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 分钟 阅读 · 2026年9月20日 最近审核 2026年9月20日

[**下一篇**](/zh/blog/jev-ai-decision-model-review/)

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/zh/blog/laya-vs-jev-benchmark-ai-startup-moat/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-09-20",
      "inLanguage": "zh",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-09-20",
      "url": "https://wavect.io/zh/blog/laya-vs-jev-benchmark-ai-startup-moat/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "Laya 是值得评估的开源决策模型候选方案，而非已经证实的通用 Jev 替代品。它的专用检查点报告了 76.6% 的硬标签准确率，高于另一项公开评估中的 Jev 72.7%，但训练、校准和部署条件存在重要差别。三天是公开文章的日期间隔，不是得到核实的完整研发周期。创业者真正应该构建的是模型可替换后仍有价值的工作流。",
  "articleBody": " 博客概览/AI 与智能体/模型与基础设施 Laya vs Jev：基准结果与 AI 创业护城河 要点速览 Laya 是值得评估的开源决策模型候选方案，而非已经证实的通用 Jev 替代品。它的专用检查点报告了 76.6% 的硬标签准确率，高于另一项公开评估中的 Jev 72.7%，但训练、校准和部署条件存在重要差别。三天是公开文章的日期间隔，不是得到核实的完整研发周期。创业者真正应该构建的是模型可替换后仍有价值的工作流。 模型领先，不等于商业护城河。这才是 Laya vs Jev 事件值得创业者关注的地方。最吸引眼球的说法是：三天的开源开发，击败了两年的研究。但公开证据支持的是一个更具体、也更有价值的结论：专用替代方案可以挑战产品的核心性能指标，却不一定复制了整个产品。 对创始人来说，问题不只是哪个模型获胜。更重要的是：如果明天就出现可信的替代模型，客户还会为什么继续付费？ 资料核查日期：2026 年 9 月 20 日。本文是对公开资料的分析，不是我们亲自运行的基准测试。关于产品本身，请阅读我们的 Jev AI 决策模型评测；本文重点讨论竞争性证据和创业风险。 Jev 研发两年后，Laya 真的只用三天就做出来了吗？ TypeSafe 于 2026 年 9 月 15 日发布 Jev。创始人 Diogo Almeida 表示，公司此前进行了两年的低调研发，并介绍了自己在 OpenAI 参与 ChatGPT 背后相关方法研究的经历。这是创始人对公司发展过程的描述，不是经过独立审计的模型训练时间表。查看 TypeSafe 的官方发布文章。 Laya 的开发者 Nandakishor M 于 2026 年 9 月 18 日发表技术文章。两篇文章的发布日期相隔三天，但这不能证明 Laya 的所有组件都是在这三天内从零研究、训练和评估完成的。阅读开发者的技术说明。 此外，他此前已有相关研究：SalesRLAgent 论文于 2025 年 3 月 30 日提交，研究的是面向销售转化决策的强化学习方法，并不是相同版本的 Laya。它证明存在更早的相关工作，并不能证明任何一方抄袭了另一方。查看 SalesRLAgent 的原始论文记录。 站得住脚的叙事是竞争压力来得很快，而不是已经证实的“两年对三天”研发竞赛。发布时间、开发投入和产品成熟度是三个不同维度。 Laya 是什么？比较的究竟是哪一个模型？ Laya 是一组开源、非自回归的决策模型。它不是逐个生成 token 来写出回答，而是对分类、评分等具有明确边界的问题进行判断。代码与模型权重采用 Apache 2.0 许可证发布。Laya 这个名称对应三个检查点，并非一个可以任意互换的单一模型。查看 Laya 模型卡与检查点说明。 本次核查版本中的 Laya 检查点；上下文长度指该检查点的配置预算 检查点基础模型与规模上下文主要用途 layaModernBERT-large，4.21 亿参数512 token英语决策任务 laya-multilingualmmBERT-base，3.22 亿参数1,024 token多语言输入 laya-typed-decisionsModernBERT-large，4.21 亿参数1,024 token四类专门训练的工作流 采购、评估或替换“Laya”时，如果没有明确检查点，技术要求就是不完整的。有效的评估记录还应包含软件版本、路由设置、输入语言和问题模式。我们要选择的不是一个品牌，而是一套能够实际部署的配置。 Laya 的性能真的超过 Jev 吗？ 专用检查点在一项 typed-decisions 评估中报告了更高的硬标签准确率，但并非每项指标都更好。模型卡介绍的测试包含 400 个案例、2,000 次决策。Jev 1.13.0 的数字来自另一项已发表评估：Laya 作者没有在同一次测试中调用 Jev，提示内容和样本也有所不同。阅读专用检查点的结果与局限。 公开的 typed-decisions 结果，并非配对的直接对照实验 指标Laya 专用检查点Jev 1.13.0，独立发布的结果如何理解 硬标签准确率0.7660.727Laya 报告的结果高出 3.9 个百分点。 软准确率0.4710.580在这一考虑分布信息的指标上，Jev 报告的结果更高。 期望校准误差，越低越好0.2130.144这里公开的校准结果更有利于 Jev。 另一个关键区别是训练数据。专用检查点使用了该基准的训练集进行微调。在同一公开评估中，英语和多语言基础检查点的硬标签准确率约为 36% 和 34%，低于约 46% 的多数类基线。专用模型的成功，并不能证明基础模型拥有同样强的零样本能力。 typed-decisions 数据集包含合成工作流，并提供独立的训练集和测试集。使用训练集本身并不等于测试数据泄漏。但它改变了比较问题：我们讨论的不再是“不经过适配，哪个模型泛化得更好”，而是“这个经过专门训练的模型，在这类任务上表现如何”。查看 typed-decisions 数据集。 对于只解决一种重复工作流的创业公司，这个范围更窄的结果仍可能非常重要。客户未必需要通用智能，而是需要业务流程稳定完成。不过，针对基准优化的模型，仍然必须在未见过的客户数据上证明自身价值。 Laya 的默认路由器会自动得到宣传中的成绩吗？ 不会自动做到。在核查的实现中，路由器默认不会悄悄选择 typed-decisions 专用检查点。需要显式指定，例如 model=\"typed-decisions\"，传入任务提示，或通过 auto_task_detection=True 开启任务识别。直接核对路由器实现，不要猜测默认行为。 吸引人的准确率属于特定检查点和测试设置。一个通用路由器示例，不能证明相同模型处理了你的请求。每条评估结果都应记录实际选中的检查点。还应测试不符合那四类专用模式的输入：识别基准中的问题签名，并不等于理解你的业务。 为什么“快八倍”和“校准更好”都需要附带条件？ 项目基准报告中的 32.8 毫秒，对应多语言检查点在 T4 GPU 上处理一个问题。批量处理十个问题需要 72.3 毫秒。将批处理耗时除以问题数量得到的是吞吐量意义上的单题时间，并不等于单次请求延迟。同一报告中的校准改善还涉及重新拟合温度参数，不能与前表中专用检查点未经这种调整的 ECE 混为一谈。阅读 Laya 的测试方法与校准表格。 部分对比数字来自一个独立的 Jev 小规模评估。该评估从法国访问托管服务，本地对照则是运行在 Apple M4 Max CPU 上的 GLiNER，而不是在同一 GPU 上运行的 Laya。这些数字反映不同部署路径，并不是只比较模型架构的受控速度测试。查看独立 Jev 评估及其限制。 对采购方来说，有价值的问题是：在实际负载下，包含排队、网络和失败回退的端到端延迟是多少？对创业者来说，有价值的校准问题是：在可接受的实际错误率下，能够自动处理多少工作？置信度不能直接变成批准退款、修改账户或绕过业务规则的权限。 语言、标签数量与冷启动如何改变结果？ 多语言模型卡报告，在一个具有 20 个选项的任务上，51 种受测语言中有 45 种超过随机准确率的三倍。这里的随机准确率是 5%，因此门槛是 15%，而不是生产可用性标准。“支持很多语言”不能被理解为“每种语言都同样可靠”。阅读多语言检查点按语言划分的评估。 实际约束不止语言。Laya 文档提醒，大量候选选项会带来问题；采用延迟加载的路由器反复切换模型时，也可能反复加载检查点。预加载能避免这些重新加载，但需要更多内存。Banking77 的比较还使用了不同标签数量：Laya 为 77 个，引用的 Jev 小规模评估为 72 个，因此不能当作严格同条件排名。查看项目的部署说明与比较注意事项。 设计自己的测试时，不妨故意增加难度：混合语言工单、较长但相关的输入、相似标签、重新排列的选项，以及刚启动的工作进程。这些是我们建议的测试条件，不是我们亲自观察到的失败。它们可以帮助确认，你真正要运行的系统是否与标题中的系统一致。 为什么这构成 AI 创业风险，却不能证明 Jev 注定失败？ 我们的商业判断是：如果一家公司的全部价值主张都来自模型优势，而客户无需替换周边工作流就能替换模型，这家公司就面临竞争风险。Laya 的公开结果让这个问题值得认真考虑，但它们不能说明 TypeSafe 的收入、留存、成本或未来商业结局。 任何一方都不应被当作永远正确。TypeSafe 自己的 Jev 1.13 限制说明提到，模型在精确计算、日期比较和对抗性内容方面存在问题。阅读 TypeSafe 的模型特定限制。 战略问题在于：客户价值究竟位于哪一层？一个简单分类接口，比一个能整理杂乱业务数据、执行权限、支持审核人员并追踪错误的完整服务更容易被另一个接口替换。这是产品设计层面的分析，不是某家现有公司已经失败的证据。 同样的竞争压力也可能帮助应用型创业公司。上游模型变得更便宜或更可控时，不依赖特定模型的产品可以改善成本结构。如果技术替代了你出售的价值，它就是威胁；如果技术强化了你出售的价值，它就是更好的生产要素。 底层模型变化后，哪些东西仍然有价值？ 我们会围绕五项能力构建产品：深入掌握工作流、获得合法使用许可的反馈数据、私有评估集、客户触达能力，以及可靠的运营。这些因素都不会自动成为护城河。它们必须真正改善客户结果，或以合理的方式让产品更难被替换。 例如，一个发票审核产品可以用开放检查点对发票分类，但完整产品可能仍需核对供应商身份、向审核者展示相关证据、执行支出权限、恢复失败的集成，并解释哪些内容发生了变化。这只是架构示例，不表示 Wavect 已经为客户部署了其中任一模型。 分发渠道也需要单独评估。Vercel 于 2026 年 9 月 19 日发布了 Jev 集成指南，使用 AI SDK 的 experimental_evaluate API 和 AI Gateway。这是具体的集成证据，但不是客户采用率或永久竞争优势的证明。查看 Vercel 的 Jev 与 AI SDK 指南。 开放权重改变了部署选择，却不会消除运营成本。需要计入算力、利用率、监控、更新、校准、安全和人工复核。应比较每个正确完成的工作流的总成本，而不是将收费 API 与一台想象中零成本的服务器进行比较。我们的智能体单次动作成本指南进一步解释了成本模型。 替换 Jev 前，如何评估开源替代方案？ 用公开结果筛选候选方案，再用自己的验收测试决定生产配置。以下是我们建议的评估流程，不代表任何一个模型已经通过这些要求。 面向明确业务决策的实际替换测试 控制项记录内容支持的判断 有代表性的保留测试集拥有使用权限、与调优数据分离的私有案例；按语言和罕见高损失错误分组。结果能否泛化到客户工作负载？ 一致的任务约定相同输入、标签、指令和必需输出；将零样本与微调比较分开。系统是否在解决同一个问题？ 固定配置模型及 SDK 版本、实际检查点、路由设置和输入截断情况。结果是否可复现？ 质量与不确定性准确率、校准、高损失误报、人工复核比例和不确定性区间。多大程度的自动化有依据？ 运行测量冷启动与热运行的 p50/p95 延迟、并发负载、失败和完整成本。部署是否经济、可靠？ 受控上线先进行不影响业务的影子决策，由应用管理权限，并具备回滚和明确审核责任。错误决策能否被限制在可控范围？ 在查看最终测试集结果之前，就应确定验收阈值。用于校准和选择阈值的数据必须与最终测试集分开。也要加入简单规则系统作为基线：有些决策既不需要 Jev，也不需要 Laya。迁移带来的额外复杂度，应由更好的实测结果来证明其必要性。 实施方面，可以了解 Wavect 的 AI 工程服务，通过独立的 Twinsoft AI 案例了解产品背景，并用上线前软件质量检查清单组织验收。与其直接委托未经验证的模型替换，不如和我们的团队讨论范围明确的评估。 创业启示：构建不会被更好模型轻易替代的价值 Laya 值得评估，它发布的比较也值得认真阅读。更可靠的结论不是“三天抹去",
  "articleSection": "AI 基础设施",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "citation": [
    {
      "@type": "WebPage",
      "name": "查看 TypeSafe 的官方发布文章。",
      "url": "https://typesafe.ai/blog/introducing-system-one-models-and-jev"
    },
    {
      "@type": "WebPage",
      "name": "阅读开发者的技术说明。",
      "url": "https://dev.to/nandakishor_m_6cc0adfde9f/i-built-non-autoregressive-decision-models-a-year-ago-then-a-frontier-lab-called-it-a-18me"
    },
    {
      "@type": "WebPage",
      "name": "查看 SalesRLAgent 的原始论文记录。",
      "url": "https://arxiv.org/abs/2503.23303"
    },
    {
      "@type": "WebPage",
      "name": "查看 Laya 模型卡与检查点说明。",
      "url": "https://huggingface.co/convaiinnovations/laya"
    },
    {
      "@type": "WebPage",
      "name": "阅读专用检查点的结果与局限。",
      "url": "https://huggingface.co/convaiinnovations/laya-typed-decisions"
    },
    {
      "@type": "WebPage",
      "name": "查看 typed-decisions 数据集。",
      "url": "https://huggingface.co/datasets/LocalLLaMA/typed-decisions"
    },
    {
      "@type": "WebPage",
      "name": "直接核对路由器实现，不要猜测默认行为。",
      "url": "https://github.com/NandhaKishorM/laya/blob/main/laya/router.py"
    },
    {
      "@type": "WebPage",
      "name": "阅读 Laya 的测试方法与校准表格。",
      "url": "https://github.com/NandhaKishorM/laya/blob/main/BENCHMARKS.md"
    },
    {
      "@type": "WebPage",
      "name": "查看独立 Jev 评估及其限制。",
      "url": "https://github.com/AbdelStark/jev-benchmarks/blob/main/README.md"
    },
    {
      "@type": "WebPage",
      "name": "阅读多语言检查点按语言划分的评估。",
      "url": "https://huggingface.co/convaiinnovations/laya-multilingual"
    },
    {
      "@type": "WebPage",
      "name": "查看项目的部署说明与比较注意事项。",
      "url": "https://github.com/NandhaKishorM/laya/blob/main/README.md"
    },
    {
      "@type": "WebPage",
      "name": "阅读 TypeSafe 的模型特定限制。",
      "url": "https://docs.typesafe.ai/model-jaggedness/jev-1.13"
    },
    {
      "@type": "WebPage",
      "name": "查看 Vercel 的 Jev 与 AI SDK 指南。",
      "url": "https://vercel.com/kb/guide/typesafe-jev-and-ai-sdk"
    }
  ],
  "dateModified": "2026-09-20",
  "datePublished": "2026-09-20",
  "description": "Laya 是值得评估的开源决策模型候选方案，而非已经证实的通用 Jev 替代品。它的专用检查点报告了 76.6% 的硬标签准确率，高于另一项公开评估中的 Jev 72.7%，但训练、校准和部署条件存在重要差别。三天是公开文章的日期间隔，不是得到核实的完整研发周期。创业者真正应该构建的是模型可替换后仍有价值的工作流。",
  "headline": "Laya vs Jev：基准结果与 AI 创业护城河",
  "image": "https://wavect.io/img/blog/headers/header_laya-vs-jev-benchmark-ai-startup-moat.svg",
  "inLanguage": "zh",
  "keywords": "AI 决策模型, AI 基准测试, AI 创业战略",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/zh/blog/laya-vs-jev-benchmark-ai-startup-moat/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/zh/blog/laya-vs-jev-benchmark-ai-startup-moat/",
  "wordCount": 437
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/",
      "name": "首页",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/overview/",
      "name": "博客概览",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/topics/ai-agents/",
      "name": "AI 与智能体",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/clusters/models-infrastructure/",
      "name": "模型与基础设施",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/laya-vs-jev-benchmark-ai-startup-moat/",
      "name": "Laya vs Jev：基准结果与 AI 创业护城河",
      "position": 5
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "核查的来源无法证明这一点。TypeSafe 于 2026 年 9 月 15 日发布 Jev，Laya 作者于 9 月 18 日发表技术文章，而且他在 2025 年 3 月已有相关研究。发布日期不能衡量完整研发投入。"
      },
      "name": "Laya 真的只用三天就从零开发完成了吗？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Laya 专用检查点在一项 typed-decisions 评估中报告了更高的硬标签准确率，但 Jev 在其他指标上的独立公开结果更好。提示、样本和训练经历不同，因此不能把这些数字视为受控的通用排名。"
      },
      "name": "Laya 比 Jev 更好吗？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "该结果属于 laya-typed-decisions，它使用该基准的训练集进行了微调。这不是通用基础模型的零样本结果，而且本次核查的默认路由器不会悄悄选中这个专用检查点。"
      },
      "name": "哪个 Laya 检查点取得了 76.6%？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "不是。这个测量对应多语言检查点在 T4 GPU 上处理一个问题。托管 API、网络、冷启动和并发属于不同条件。承诺速度倍数之前，必须测试实际部署路径。"
      },
      "name": "32.8 毫秒是否意味着 Laya 在生产环境中快八倍？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "不能。有边界的输出仍可能包含错误判断，校准也依赖任务与数据。权限必须由应用执行；影响较大的操作还需要经过测试的阈值、人工复核路径和回滚能力。"
      },
      "name": "类型化决策或置信度能够保证操作正确吗？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "不是。开放权重不会消除算力、内存、监控、维护、安全和人工审核成本。应该比较每个正确完成的工作流的完整成本，而不是只比较供应商的请求价格。"
      },
      "name": "自行托管 Laya 是否没有运营成本？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "潜在的持久价值包括深度集成的工作流、有使用许可的反馈数据、有代表性的私有评估、客户触达和可靠运营。这些是战略选择，不代表某家公司已经拥有不可攻破的护城河。"
      },
      "name": "除了模型性能，AI 创业公司还能建立什么优势？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "应将 Laya 视为评估候选，而非自动迁移决定。使用私有保留数据比较相同任务，记录实际检查点，分开评估零样本与微调配置，测量运营成本，并从影子决策开始。"
      },
      "name": "团队应该立即用 Laya 替换 Jev 吗？"
    }
  ]
}
```
