---
title: "Valyu 小模型路由器：0.6B 检索结果说明了什么"
canonical: https://wavect.io/zh/blog/valyu-slm-multi-agent-router/
language: zh
description: "深入解读 Valyu 的 0.6B 检索智能体路由器：SFT 与强化学习、NDCG@10 的局限、延迟和数据源选择，并给出企业训练或采购前的评估方法。"
image: "https://wavect.io/img/blog/headers/header_valyu-slm-multi-agent-router.png"
---

[**返回**](/zh/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/zh/team/kevin-riedl/)

[Kevin Riedl](/zh/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 分钟 阅读 · 2026年9月13日 最近审核 2026年9月13日

[**下一篇**](/zh/blog/rag-production-readiness-checklist-eu/)

# Valyu 的 0.6B 多智能体路由器：研究结果、指标边界与落地判断

要点速览

Valyu 先用监督微调，再用 REINFORCE++ 训练 Qwen3-0.6B，让它选择检索智能体并生成关键词与日期限制。论文报告的平均 NDCG@10 为 0.771，高于提示词驱动的 Nova Lite 的 0.594 和 Claude Haiku 4.5 的 0.552，平均选择延迟为 120.1 毫秒。这不是通用模型排名，也不是完整答案质量测试。其 NDCG 使用各系统自身返回结果归一化，主结果表也未提供仅 SFT 的 NDCG 来隔离强化学习的增益。训练专用路由器之前，应统一相关性评估目标，同时衡量覆盖率、最终答案、权限和总运营成本。

**当小模型学到了哪些检索智能体真正能返回有用证据时，它可以胜过仅凭提示词做选择的大模型。**在 Valyu 的多智能体路由研究中，经过后训练的 Qwen3-0.6B 达到了 0.771 的平均 NDCG@10，Amazon Nova Lite 为 0.594，Claude Haiku 4.5 为 0.552。平均选择延迟为 120.1 毫秒。这是特定路由系统的实验结果，并不证明一个 6 亿参数模型在一般任务上优于 Haiku。 [[1]](#source-paper)

对企业来说，关键不是是否应该替换所有大模型，而是现有检索系统是否存在足够多的重复选源错误、可靠的评估数据和请求量，值得训练一个专用选择器。本文解释实验结果、容易忽略的指标边界，以及投入开发前应该获得哪些证据。

资料核查日期：2026 年 9 月 13 日。本文是基于原始资料的分析，不是 Wavect 对实验的复现。论文列入 SIGIR 2026 的 AgentSearch 研讨会日程，不应据此宣称其被 SIGIR 主会录用。 [[2]](#source-workshop)

## Valyu 的小模型路由器究竟胜过了什么？

作者比较了经过监督微调（SFT）和强化学习（RL）的路由器，以及两个通过提示词进行选择的基线模型。系统面对的是固定的 11 个领域智能体。小模型除了选源，还会为后续搜索生成关键词和日期范围。 [[1]](#source-paper)

| 路由器 | 平均 NDCG@10 | NDCG@10 中位数 | 平均延迟 | P99 延迟 |
| --- | --- | --- | --- | --- |
| Qwen3-0.6B，SFT + REINFORCE++ | 0.771 | 0.960 | 120.1 ms | 179.4 ms |
| Amazon Nova Lite，提示词基线 | 0.594 | 0.926 | 683.6 ms | 4,659.2 ms |
| Claude Haiku 4.5，提示词基线 | 0.552 | 0.929 | 2,457 ms | 6,985 ms |

平均分的绝对提升分别为**相对 Nova Lite 增加 0.177，相对 Haiku 增加 0.219**。NDCG 不是答对问题的百分比。三个系统的中位数相近而均值不同，提示我们应重点检查困难查询和失败案例，而不是只看平均数。 [[1]](#source-paper)

在专门挑选的“查询与智能体不匹配”子集上，论文报告的分数分别是 0.918、0.539 和 0.490。这对理解一类错误有帮助，却不能当作整体测试结果。论文举例：面对蛋白质结构问题，提示词基线选择了基因组学智能体，训练后的路由器则选择学术检索。关键在于信息真正存在于哪里，而不只是词语看起来属于哪个主题。 [[1]](#source-paper)

## 检索智能体路由，不等于大语言模型路由

这项决策属于 [检索增强生成（RAG）流程](/zh/glossary/rag/) ：选择证据与生成最终答案是两个独立步骤。

模型路由器决定由哪个模型回答或执行一个步骤。检索智能体路由器决定由哪个专用搜索服务或数据源提供证据。重排器则在检索完成后重新排列文档。一个产品可以同时包含三者，但它们解决的是不同问题。

Valyu 的模型输出智能体选择位掩码、关键词和时间区间，也支持选择多个智能体。因此它不只是主题分类器，但也不是能协调任意自主员工团队的通用调度器。收益可能来自选源、搜索参数生成，或两者的共同作用。 [[1]](#source-paper)

更广泛的架构问题可参考 [多模型智能体系统指南](/zh/blog/multi-model-ai-coding-agent-stack-2026/) ；跨供应商基础设施可参考 [LLM 网关与路由器对比](/zh/blog/llm-gateway-router-comparison-2026/) 。本文只讨论更具体的决策：针对已知数据源集合，训练一个以检索结果为依据的选择器。

## SFT 与检索结果反馈如何配合？

**SFT 先建立输出规范和基本选择能力。**论文描述了包含 56,000 条查询的 SFT 数据集，按 70%、15%、15% 分为训练、验证和测试集。目标输出包含来源、关键词与日期。训练使用秩为 16、alpha 为 32 的 LoRA、bf16 精度、两个训练轮次，以及 512 的最大序列长度。这些是论文的实验设置，不是通用的部署要求。 [[1]](#source-paper)

**RL 再评估所选路径实际检索到了什么。**作者从 SFT 检查点出发，用 11,000 条生产搜索日志查询进行 REINFORCE++ 训练。奖励结合路由适配性、检索内容相关性和来源可信度，不是只优化 NDCG。查询意图、关键词和日期质量仍然参与目标计算，KL 惩罚用于限制模型偏离 SFT 检查点的程度。 [[1]](#source-paper)

不要将两个阶段的数量直接相加，宣称有 67,000 条互不重复的训练样本。这些数字描述不同阶段，并没有证明样本完全不重叠。自己的评估应将相近查询族和不同时间段分开，避免训练信息进入最终测试。

**结果反馈发生在训练阶段。**线上路由器根据已经学到的规律，为新查询预测合适来源。它并不是先查看这次请求中所有智能体的实时结果，再决定路由。刚刚变空的索引、发生变化的数据源和故障连接器，仍然需要运行时健康检查与受限回退。

因此，值得推广的经验是“用结果指导学习”，而不是“SFT 天生无法利用结果”。监督训练的标签本身也可以来自检索评估。论文比较的是这套渐进训练方案与依靠意图提示的模型，没有排除其他结果驱动的监督方式。

公开的 [Qwen3-0.6B 模型卡 [3]](#source-qwen) 描述的是基础模型，不是 Valyu 训练后的路由器。下载基础权重不能复现这些分数。所审阅的论文没有提供训练后路由检查点的下载链接，因此在安排直接部署之前，应先确认权重、数据和训练代码的可用性。

## 读懂 NDCG@10：分母决定了它能说明什么

NDCG 奖励把相关结果放在靠前的位置。在该实验中，Claude Sonnet 4.6 对合并并打乱顺序的结果进行评分，不知道结果由哪个路由器产生。相关性分为 0 到 3 级，随后恢复原来的搜索排序计算指标。作者没有再增加重排步骤。 [[1]](#source-paper)

关键在于分母。第 4.5.1 节通过排列**各个系统自己返回的相关性分数**来计算理想排序，而不是让所有系统使用同一组理想结果。如果所有结果都无关，分数设为零；少于十条结果的列表不补齐。 [[1]](#source-paper)

这种计算方法限制了单个数字的解释范围。举一个数学示例：十条全部评为 1 的结果，与十条全部评为 3 的结果，若都用自己的排序列表归一化，两者的 NDCG@10 都是 1。两组结果的实际价值显然不同。一份很短但排列正确的列表，也不能因此证明检索覆盖充分。

这并不抹去作者报告的优势。但**0.771 不等于 77.1% 的答案准确率、召回率或完整度**，也不应在没有说明的情况下，被当作基于共同理想结果池的常规比较。上线前应同时测量共同结果池下的 NDCG、相关证据覆盖、全部无关的查询比例，以及最终答案是否正确。

可执行的做法是为每个查询建立人工审阅的相关文档或片段集合。所有路由器使用相同的目标集合、数据源快照和访问权限接受评估。同时保存原始排序与评分，避免所谓改进只是更换分母的结果。

## 120.1 毫秒不是整个 RAG 系统的延迟承诺

120.1 ms 的均值和 179.4 ms 的 P99 来自作者测量的选择器，不包含完整检索、重排和生成有据可依答案的过程。观测到的 P99 也不能直接成为线上服务承诺。排队、预热、批处理、输出限制和流量形态都会改变表现。 [[1]](#source-paper)

复现前还应澄清硬件描述。论文写的是使用 vLLM，在带有 48 GB RAM 的 NVIDIA L4 环境中服务；NVIDIA 官方却将单张 L4 的 GPU 显存列为 24 GB。48 GB 可能指主机内存，但该表述没有说明。不要把它改写成需要 48 GB 显存，更不能据此推荐采购配置。 [[1]](#source-paper) [[4]](#source-l4)

在实际运行环境中分别测试路由器延迟和端到端延迟，覆盖冷启动、代表性并发、超时和回退请求。选择器更快固然有价值，但缓慢的数据源仍可能主导用户等待时间。

## 委托开发前，应先回答四个问题

- **基线训练条件并不相同。** 对比的是领域训练后的 SLM 与依靠提示词的大模型，不是在同样训练条件下比较不同规模。结论支持这套专用系统，不足以说明模型大小普遍无关紧要。
- **主检索表没有单独隔离 RL 的增益。** SFT-only 结果包含选源匹配、关键词、日期和延迟，却没有在主比较中给出 SFT-only 的 NDCG@10。把全部收益归于 RL 之前，先要求这一消融实验。
- **智能体集合固定。** 11 个已知代理不等于不断扩展的工具市场。新增来源、索引变化和新的用户语言需要评估。论文把基于显式能力表示选择新智能体列为后续方向。
- **评估者与测试集构成很重要。** 盲评和打乱顺序有助于控制偏差，但结果仍由模型评判。应确认最终测试和困难子集的规模、去重方式、置信区间，以及独立人工相关性评估。SFT 数据划分本身不能回答这些问题。

作者也指出，还需要与其他学习型选择方法比较，在不同智能体配置中验证，并补充人工判断。这些边界说明应进行受控实验，而不是否定研究价值。 [[1]](#source-paper)

## 规则、监督选择器，还是 SFT 加 RL？

从能够通过明确验收的最低成本方法开始。 [LTRR [5]](#source-ltrr) 学习按下游效用排列检索器； [RAGRoute [6]](#source-ragroute) 研究联邦式 RAG 中的轻量选源。它们适合作为比较思路，但并不是可相互替换的 Valyu 路由实现。

| 你的情况 | 先做什么实验 | 原因 |
| --- | --- | --- |
| 来源少、资格规则明确 | 确定性路由加混合检索 | 只要基线足够好，就不必维护训练流程。 |
| 选源错误重复出现，且有可靠结果标签 | 结果标签驱动的分类器或 SFT 路由 | 先确认学习来源适配性有价值，再考虑 RL。 |
| 所选来源与生成参数之间存在复杂作用 | SFT 加检索反馈强化学习 | 可共同优化路径与输入造成的实际后果。 |
| 来源变化快、评估数据少或请求量低 | 按能力选择，并保留受限回退 | 固定的训练后目录可能维护成本过高。 |

用这个公式判断经济性：`月收益 = 适用请求量 × 每次请求的净可变成本节省 − 新增月固定成本`。比较两条路径上的数据源调用、模型推理与重试；固定成本包括分摊训练、标注、评估和运维。权重文件很小，不代表业务收益已经成立。更广泛的成本核算见 [每项任务成本指南](/zh/blog/cost-per-token-vs-cost-per-task/) 。

## 生产设计：把路由选择与权限控制分开

以下是 Wavect 提出的实施模式，不代表论文已经实现这些控制。

1. **先确定可用且获准的来源集合。** 在模型外解析租户、身份、文档访问权、地区限制与来源健康状态。路由器只能选择当前请求者有权访问的来源。
2. **验证完整路由输出。** 只接受已知路径标识、获准的多源组合，以及符合结构的关键词和日期。限制并行调用数量、请求大小与执行时间。无效输出不等于可以搜索所有来源。
3. **通过执行权限检查的适配器检索。** 保留调用者身份。主题相关不意味着用户获得了访问授权。
4. **提供有界回退。** 空结果、超时、未知领域或不确定选择可触发单独评估的替代路径。它必须遵守相同权限与预算，并避免递归重试。
5. **对整个决策过程做版本记录和观测。** 记录路由模型、可选智能体目录、来源或索引版本，以及所选路线、规范化参数、延迟与结果。覆盖下降时要能回滚。

只保留评估确实需要的信息，并设置访问与保存期限。查询和返回片段可能包含客户数据，低成本本地推理不会自动消除训练日志的风险。周边控制可以参考 [RAG 生产就绪清单](/zh/blog/rag-production-readiness-checklist-eu/) 及 [企业 MCP 授权架构](/zh/blog/enterprise-mcp-authorization-architecture/) 。

## 一个 30 天的检索智能体路由试点

**第一周：找准实际故障。**收集有权用于分析的查询、来源版本和结果，将选源问题与切块、索引、过时文档和生成错误分开。训练路由器无法修复坏语料。

**第二周：比较低成本基线。**在相同保留测试查询上评估规则、当前提示词路由器和小型结果标签选择器。单独保留歧义、无结果与多来源案例。逐一测试生产使用的语言，不要假定基础模型的多语言能力会完整迁移到训练后路由器。

**第三周：检验 RL 的额外价值。**只有在前一基线仍留下显著机会时才引入检索反馈策略。保持评估流程不变，对比 SFT-only 与 SFT+RL，并对抽样结果进行人工盲评。先在不改变用户答案的影子环境中运行。

**第四周：灰度上线或停止投入。**事先约定质量、p95/p99 延迟、每个验收答案成本和权限标准。只有通过后才切换一小部分查询，且保留回滚路径。试点证明普通混合检索已足够，也是一项有用的成果。

需要判断这个方向是否适合产品？Wavect 的 [AI 咨询服务](/zh/services/artificial-intelligence/) 可协助设计评估、集成与上线步骤。 [Twinsoft AI 案例](/zh/case-studies/twinsoft-ai/) 提供相关交付背景，不是 Wavect 已复现 Valyu 路由器的证据。也可用 [定制软件与现成方案比较指南](/zh/software-development-guide/custom-software-vs-off-the-shelf/) 分析自己持有路由层与采购方案的差别。

[讨论一次检索路由评估](/zh/contact/) ，带上现有来源、重复错误、流量和延迟预算。第一项交付应该是有证据支持的建设决策，而不是保证超过某个公开分数。

## 关于 Valyu 小模型路由器的常见问题

### 0.6B 模型真的超过了 Claude Haiku 4.5 吗？

在这项研究的特定检索路由配置中，训练后的 Qwen3-0.6B 报告了更高的平均 NDCG@10 和更低的平均选择延迟。但这不代表它在通用智能、最终答案准确率或其他任务上全面超过 Haiku。

### 什么是检索智能体路由器？

它选择哪些搜索智能体或数据源应为查询提供证据。Valyu 的路由器还生成关键词和日期限制。这不同于选择语言模型，也不同于对已检索到的文档重新排序。

### 路由器会在每次请求时先检查所有数据源吗？

检索结果的反馈用于训练。运行时，路由器根据学到的模式预测新查询的路线。实时的数据源故障仍需要健康检查、评估和有边界的回退机制。

### NDCG@10 为 0.771 是否表示答案正确率为 77.1%？

不是。NDCG 衡量结果排序，不是答案正确率。论文使用各系统自身的相关性评分构建理想排序，因此对绝对相关性和覆盖率的解释有局限。还应使用共同的相关性目标和答案级评估。

### 下载 Qwen3-0.6B 就能复现论文吗？

公开的基础模型不等于训练后的路由器。所审阅的论文未提供训练后路由器的下载链接。承诺复现之前，应确认权重、训练数据、代码和评估材料是否可获得。

### 团队是否应立即引入强化学习？

先建立可测量的基线，再尝试使用结果标签训练小型选择器。在同一保留测试集上比较仅 SFT 和 SFT 加强化学习，之后再承担额外训练和运营成本。权限控制应始终独立于学习出的路由策略。

## 来源与研究方法

1. [Valyu 论文：方法、结果表与评估协议](https://arxiv.org/html/2608.00030v1)
2. [SIGIR 2026 AgentSearch：研讨会议程](https://agent-search.github.io/agentsearch-sigir26/)
3. [Qwen3-0.6B：公开基础模型说明](https://huggingface.co/Qwen/Qwen3-0.6B)
4. [NVIDIA L4：官方显存规格](https://www.nvidia.com/en-us/data-center/l4/)
5. [LTRR：学习检索器排序的方法](https://arxiv.org/abs/2506.13743)
6. [RAGRoute：面向联邦 RAG 的轻量数据源选择](https://arxiv.org/abs/2502.19280)

题图由需求说明提供，基于 Kondapalli 等人的图 1。原论文采用 CC BY 4.0 许可。此处保留原图，不将其描述为 Wavect 的实现。 [[1]](#source-paper)

智能体工程

## 继续浏览此集群

编程智能体、MCP、上下文系统、评估与可靠自动化控制。

[从核心文章开始**AI 智能体的图工程：知识图谱什么时候值得做？**](/zh/blog/graph-engineering-ai-agents/)

- [Spotify shunt 评测：安装、Token 节省与限制](/zh/blog/spotify-shunt-claude-code-token-routing/)
- [OpenBot 评测：自托管 AI 同事的成本与权限](/zh/blog/openbot-self-hosted-ai-coworkers-review/)
- [Ramp Inspect 架构 2026：如何扩展后台编码 Agent](/zh/blog/ramp-inspect-background-coding-agent-infrastructure-2026/)
- [Model Hardware Standard 企业指南：MHS 与实体 AI](/zh/blog/model-hardware-standard-enterprise-guide/)
- [Fonio AI 2026 评估：价格、API、GDPR 与自建对比](/zh/blog/fonio-ai-review-build-vs-buy-2026/)

[**返回**](/zh/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/zh/team/kevin-riedl/)

[Kevin Riedl](/zh/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 分钟 阅读 · 2026年9月13日 最近审核 2026年9月13日

[**下一篇**](/zh/blog/rag-production-readiness-checklist-eu/)

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/zh/blog/valyu-slm-multi-agent-router/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-09-13",
      "inLanguage": "zh",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-09-13",
      "url": "https://wavect.io/zh/blog/valyu-slm-multi-agent-router/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "Valyu 先用监督微调，再用 REINFORCE++ 训练 Qwen3-0.6B，让它选择检索智能体并生成关键词与日期限制。论文报告的平均 NDCG@10 为 0.771，高于提示词驱动的 Nova Lite 的 0.594 和 Claude Haiku 4.5 的 0.552，平均选择延迟为 120.1 毫秒。这不是通用模型排名，也不是完整答案质量测试。其 NDCG 使用各系统自身返回结果归一化，主结果表也未提供仅 SFT 的 NDCG 来隔离强化学习的增益。训练专用路由器之前，应统一相关性评估目标，同时衡量覆盖率、最终答案、权限和总运营成本。",
  "articleBody": " 博客概览/AI 与智能体/智能体工程 Valyu 的 0.6B 多智能体路由器：研究结果、指标边界与落地判断 要点速览 Valyu 先用监督微调，再用 REINFORCE++ 训练 Qwen3-0.6B，让它选择检索智能体并生成关键词与日期限制。论文报告的平均 NDCG@10 为 0.771，高于提示词驱动的 Nova Lite 的 0.594 和 Claude Haiku 4.5 的 0.552，平均选择延迟为 120.1 毫秒。这不是通用模型排名，也不是完整答案质量测试。其 NDCG 使用各系统自身返回结果归一化，主结果表也未提供仅 SFT 的 NDCG 来隔离强化学习的增益。训练专用路由器之前，应统一相关性评估目标，同时衡量覆盖率、最终答案、权限和总运营成本。 当小模型学到了哪些检索智能体真正能返回有用证据时，它可以胜过仅凭提示词做选择的大模型。在 Valyu 的多智能体路由研究中，经过后训练的 Qwen3-0.6B 达到了 0.771 的平均 NDCG@10，Amazon Nova Lite 为 0.594，Claude Haiku 4.5 为 0.552。平均选择延迟为 120.1 毫秒。这是特定路由系统的实验结果，并不证明一个 6 亿参数模型在一般任务上优于 Haiku。[1] 对企业来说，关键不是是否应该替换所有大模型，而是现有检索系统是否存在足够多的重复选源错误、可靠的评估数据和请求量，值得训练一个专用选择器。本文解释实验结果、容易忽略的指标边界，以及投入开发前应该获得哪些证据。 资料核查日期：2026 年 9 月 13 日。本文是基于原始资料的分析，不是 Wavect 对实验的复现。论文列入 SIGIR 2026 的 AgentSearch 研讨会日程，不应据此宣称其被 SIGIR 主会录用。[2] Valyu 的小模型路由器究竟胜过了什么？ 作者比较了经过监督微调（SFT）和强化学习（RL）的路由器，以及两个通过提示词进行选择的基线模型。系统面对的是固定的 11 个领域智能体。小模型除了选源，还会为后续搜索生成关键词和日期范围。[1] 汇总自论文表 2 和表 6，均为作者报告的结果。延迟指路由选择，不是检索与答案生成的总耗时。 路由器平均 NDCG@10NDCG@10 中位数平均延迟P99 延迟 Qwen3-0.6B，SFT + REINFORCE++0.7710.960120.1 ms179.4 ms Amazon Nova Lite，提示词基线0.5940.926683.6 ms4,659.2 ms Claude Haiku 4.5，提示词基线0.5520.9292,457 ms6,985 ms 平均分的绝对提升分别为相对 Nova Lite 增加 0.177，相对 Haiku 增加 0.219。NDCG 不是答对问题的百分比。三个系统的中位数相近而均值不同，提示我们应重点检查困难查询和失败案例，而不是只看平均数。[1] 在专门挑选的“查询与智能体不匹配”子集上，论文报告的分数分别是 0.918、0.539 和 0.490。这对理解一类错误有帮助，却不能当作整体测试结果。论文举例：面对蛋白质结构问题，提示词基线选择了基因组学智能体，训练后的路由器则选择学术检索。关键在于信息真正存在于哪里，而不只是词语看起来属于哪个主题。[1] 检索智能体路由，不等于大语言模型路由 这项决策属于检索增强生成（RAG）流程：选择证据与生成最终答案是两个独立步骤。 模型路由器决定由哪个模型回答或执行一个步骤。检索智能体路由器决定由哪个专用搜索服务或数据源提供证据。重排器则在检索完成后重新排列文档。一个产品可以同时包含三者，但它们解决的是不同问题。 Valyu 的模型输出智能体选择位掩码、关键词和时间区间，也支持选择多个智能体。因此它不只是主题分类器，但也不是能协调任意自主员工团队的通用调度器。收益可能来自选源、搜索参数生成，或两者的共同作用。[1] 更广泛的架构问题可参考多模型智能体系统指南；跨供应商基础设施可参考LLM 网关与路由器对比。本文只讨论更具体的决策：针对已知数据源集合，训练一个以检索结果为依据的选择器。 SFT 与检索结果反馈如何配合？ SFT 先建立输出规范和基本选择能力。论文描述了包含 56,000 条查询的 SFT 数据集，按 70%、15%、15% 分为训练、验证和测试集。目标输出包含来源、关键词与日期。训练使用秩为 16、alpha 为 32 的 LoRA、bf16 精度、两个训练轮次，以及 512 的最大序列长度。这些是论文的实验设置，不是通用的部署要求。[1] RL 再评估所选路径实际检索到了什么。作者从 SFT 检查点出发，用 11,000 条生产搜索日志查询进行 REINFORCE++ 训练。奖励结合路由适配性、检索内容相关性和来源可信度，不是只优化 NDCG。查询意图、关键词和日期质量仍然参与目标计算，KL 惩罚用于限制模型偏离 SFT 检查点的程度。[1] 不要将两个阶段的数量直接相加，宣称有 67,000 条互不重复的训练样本。这些数字描述不同阶段，并没有证明样本完全不重叠。自己的评估应将相近查询族和不同时间段分开，避免训练信息进入最终测试。 结果反馈发生在训练阶段。线上路由器根据已经学到的规律，为新查询预测合适来源。它并不是先查看这次请求中所有智能体的实时结果，再决定路由。刚刚变空的索引、发生变化的数据源和故障连接器，仍然需要运行时健康检查与受限回退。 因此，值得推广的经验是“用结果指导学习”，而不是“SFT 天生无法利用结果”。监督训练的标签本身也可以来自检索评估。论文比较的是这套渐进训练方案与依靠意图提示的模型，没有排除其他结果驱动的监督方式。 公开的Qwen3-0.6B 模型卡 [3]描述的是基础模型，不是 Valyu 训练后的路由器。下载基础权重不能复现这些分数。所审阅的论文没有提供训练后路由检查点的下载链接，因此在安排直接部署之前，应先确认权重、数据和训练代码的可用性。 读懂 NDCG@10：分母决定了它能说明什么 NDCG 奖励把相关结果放在靠前的位置。在该实验中，Claude Sonnet 4.6 对合并并打乱顺序的结果进行评分，不知道结果由哪个路由器产生。相关性分为 0 到 3 级，随后恢复原来的搜索排序计算指标。作者没有再增加重排步骤。[1] 关键在于分母。第 4.5.1 节通过排列各个系统自己返回的相关性分数来计算理想排序，而不是让所有系统使用同一组理想结果。如果所有结果都无关，分数设为零；少于十条结果的列表不补齐。[1] 这种计算方法限制了单个数字的解释范围。举一个数学示例：十条全部评为 1 的结果，与十条全部评为 3 的结果，若都用自己的排序列表归一化，两者的 NDCG@10 都是 1。两组结果的实际价值显然不同。一份很短但排列正确的列表，也不能因此证明检索覆盖充分。 这并不抹去作者报告的优势。但0.771 不等于 77.1% 的答案准确率、召回率或完整度，也不应在没有说明的情况下，被当作基于共同理想结果池的常规比较。上线前应同时测量共同结果池下的 NDCG、相关证据覆盖、全部无关的查询比例，以及最终答案是否正确。 可执行的做法是为每个查询建立人工审阅的相关文档或片段集合。所有路由器使用相同的目标集合、数据源快照和访问权限接受评估。同时保存原始排序与评分，避免所谓改进只是更换分母的结果。 120.1 毫秒不是整个 RAG 系统的延迟承诺 120.1 ms 的均值和 179.4 ms 的 P99 来自作者测量的选择器，不包含完整检索、重排和生成有据可依答案的过程。观测到的 P99 也不能直接成为线上服务承诺。排队、预热、批处理、输出限制和流量形态都会改变表现。[1] 复现前还应澄清硬件描述。论文写的是使用 vLLM，在带有 48 GB RAM 的 NVIDIA L4 环境中服务；NVIDIA 官方却将单张 L4 的 GPU 显存列为 24 GB。48 GB 可能指主机内存，但该表述没有说明。不要把它改写成需要 48 GB 显存，更不能据此推荐采购配置。[1] [4] 在实际运行环境中分别测试路由器延迟和端到端延迟，覆盖冷启动、代表性并发、超时和回退请求。选择器更快固然有价值，但缓慢的数据源仍可能主导用户等待时间。 委托开发前，应先回答四个问题 基线训练条件并不相同。对比的是领域训练后的 SLM 与依靠提示词的大模型，不是在同样训练条件下比较不同规模。结论支持这套专用系统，不足以说明模型大小普遍无关紧要。 主检索表没有单独隔离 RL 的增益。SFT-only 结果包含选源匹配、关键词、日期和延迟，却没有在主比较中给出 SFT-only 的 NDCG@10。把全部收益归于 RL 之前，先要求这一消融实验。 智能体集合固定。11 个已知代理不等于不断扩展的工具市场。新增来源、索引变化和新的用户语言需要评估。论文把基于显式能力表示选择新智能体列为后续方向。 评估者与测试集构成很重要。盲评和打乱顺序有助于控制偏差，但结果仍由模型评判。应确认最终测试和困难子集的规模、去重方式、置信区间，以及独立人工相关性评估。SFT 数据划分本身不能回答这些问题。 作者也指出，还需要与其他学习型选择方法比较，在不同智能体配置中验证，并补充人工判断。这些边界说明应进行受控实验，而不是否定研究价值。[1] 规则、监督选择器，还是 SFT 加 RL？ 从能够通过明确验收的最低成本方法开始。LTRR [5]学习按下游效用排列检索器；RAGRoute [6]研究联邦式 RAG 中的轻量选源。它们适合作为比较思路，但并不是可相互替换的 Valyu 路由实现。 你的情况先做什么实验原因 来源少、资格规则明确确定性路由加混合检索只要基线足够好，就不必维护训练流程。 选源错误重复出现，且有可靠结果标签结果标签驱动的分类器或 SFT 路由先确认学习来源适配性有价值，再考虑 RL。 所选来源与生成参数之间存在复杂作用SFT 加检索反馈强化学习可共同优化路径与输入造成的实际后果。 来源变化快、评估数据少或请求量低按能力选择，并保留受限回退固定的训练后目录可能维护成本过高。 用这个公式判断经济性：月收益 = 适用请求量 × 每次请求的净可变成本节省 − 新增月固定成本。比较两条路径上的数据源调用、模型推理与重试；固定成本包括分摊训练、标注、评估和运维。权重文件很小，不代表业务收益已经成立。更广泛的成本核算见每项任务成本指南。 生产设计：把路由选择与权限控制分开 以下是 Wavect 提出的实施模式，不代表论文已经实现这些控制。 先确定可用且获准的来源集合。在模型外解析租户、身份、文档访问权、地区限制与来源健康状态。路由器只能选择当前请求者有权访问的来源。 验证完整路由输出。只接受已知路径标识、获准的多源组合，以及符合结构的关键词和日期。限制并行调用数量、请求大小与执行时间。无效输出不等于可以搜索所有来源。 通过执行权限检查的适配器检索。保留调用者身份。主题相关不意味着用户获得了访问授权。 提供有界回退。空结果、超时、未知领域或不确定选择可触发单独评估的替代路径。它必须遵守相同权限与预算，并避免递归重试。 对整个决策过程做版本记录和观测。记录路由模型、可选智能体目录、来源或索引版本，以及所选路线、规范化参数、延迟与结果。覆盖下降时要能回滚。 只保留评估确实需要的信息，并设置访问与保存期限。查询和返回片段可能包含客户数据，低成本本地推理不会自动消除训练日志的风险。周边控制可以参考RAG 生产就绪清单及企业 MCP 授权架构。 一个 30 天的检索智能体路由试点 第一周：找准实际故障。收集有权用于分析的查询、来源版本和结果，将选源问题与切块、索引、过时文档和生成错误分开。训练路由器无法修复坏语料。 第二周：比较低成本基线。在相同保留测试查询上评估规则、当前提示词路由器和小型结果标签选择器。单独保留歧义、无结果与多来源案例。逐一测试生产使用的语言，不要假定基础模型的多语言能力会完整迁移到训练后路由器。 第",
  "articleSection": "工程",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "citation": [
    {
      "@type": "WebPage",
      "name": "Valyu 论文：方法、结果表与评估协议",
      "url": "https://arxiv.org/html/2608.00030v1"
    },
    {
      "@type": "WebPage",
      "name": "SIGIR 2026 AgentSearch：研讨会议程",
      "url": "https://agent-search.github.io/agentsearch-sigir26/"
    },
    {
      "@type": "WebPage",
      "name": "Qwen3-0.6B：公开基础模型说明",
      "url": "https://huggingface.co/Qwen/Qwen3-0.6B"
    },
    {
      "@type": "WebPage",
      "name": "NVIDIA L4：官方显存规格",
      "url": "https://www.nvidia.com/en-us/data-center/l4/"
    },
    {
      "@type": "WebPage",
      "name": "LTRR：学习检索器排序的方法",
      "url": "https://arxiv.org/abs/2506.13743"
    },
    {
      "@type": "WebPage",
      "name": "RAGRoute：面向联邦 RAG 的轻量数据源选择",
      "url": "https://arxiv.org/abs/2502.19280"
    }
  ],
  "dateModified": "2026-09-13",
  "datePublished": "2026-09-13",
  "description": "Valyu 先用监督微调，再用 REINFORCE++ 训练 Qwen3-0.6B，让它选择检索智能体并生成关键词与日期限制。论文报告的平均 NDCG@10 为 0.771，高于提示词驱动的 Nova Lite 的 0.594 和 Claude Haiku 4.5 的 0.552，平均选择延迟为 120.1 毫秒。这不是通用模型排名，也不是完整答案质量测试。其 NDCG 使用各系统自身返回结果归一化，主结果表也未提供仅 SFT 的 NDCG 来隔离强化学习的增益。训练专用路由器之前，应统一相关性评估目标，同时衡量覆盖率、最终答案、权限和总运营成本。",
  "headline": "Valyu 的 0.6B 多智能体路由器：研究结果、指标边界与落地判断",
  "image": "https://wavect.io/img/blog/headers/header_valyu-slm-multi-agent-router.png",
  "inLanguage": "zh",
  "keywords": "检索路由, 小语言模型",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/zh/blog/valyu-slm-multi-agent-router/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/zh/blog/valyu-slm-multi-agent-router/",
  "wordCount": 438
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/",
      "name": "首页",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/overview/",
      "name": "博客概览",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/topics/ai-agents/",
      "name": "AI 与智能体",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/clusters/agent-engineering/",
      "name": "智能体工程",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/valyu-slm-multi-agent-router/",
      "name": "Valyu 小模型路由器：0.6B 检索结果说明了什么",
      "position": 5
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "在这项研究的特定检索路由配置中，训练后的 Qwen3-0.6B 报告了更高的平均 NDCG@10 和更低的平均选择延迟。但这不代表它在通用智能、最终答案准确率或其他任务上全面超过 Haiku。"
      },
      "name": "0.6B 模型真的超过了 Claude Haiku 4.5 吗？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "它选择哪些搜索智能体或数据源应为查询提供证据。Valyu 的路由器还生成关键词和日期限制。这不同于选择语言模型，也不同于对已检索到的文档重新排序。"
      },
      "name": "什么是检索智能体路由器？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "检索结果的反馈用于训练。运行时，路由器根据学到的模式预测新查询的路线。实时的数据源故障仍需要健康检查、评估和有边界的回退机制。"
      },
      "name": "路由器会在每次请求时先检查所有数据源吗？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "不是。NDCG 衡量结果排序，不是答案正确率。论文使用各系统自身的相关性评分构建理想排序，因此对绝对相关性和覆盖率的解释有局限。还应使用共同的相关性目标和答案级评估。"
      },
      "name": "NDCG@10 为 0.771 是否表示答案正确率为 77.1%？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "公开的基础模型不等于训练后的路由器。所审阅的论文未提供训练后路由器的下载链接。承诺复现之前，应确认权重、训练数据、代码和评估材料是否可获得。"
      },
      "name": "下载 Qwen3-0.6B 就能复现论文吗？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "先建立可测量的基线，再尝试使用结果标签训练小型选择器。在同一保留测试集上比较仅 SFT 和 SFT 加强化学习，之后再承担额外训练和运营成本。权限控制应始终独立于学习出的路由策略。"
      },
      "name": "团队是否应立即引入强化学习？"
    }
  ]
}
```
