本文内容
Valyu 的 0.6B 多智能体路由器:研究结果、指标边界与落地判断
当小模型学到了哪些检索智能体真正能返回有用证据时,它可以胜过仅凭提示词做选择的大模型。在 Valyu 的多智能体路由研究中,经过后训练的 Qwen3-0.6B 达到了 0.771 的平均 NDCG@10,Amazon Nova Lite 为 0.594,Claude Haiku 4.5 为 0.552。平均选择延迟为 120.1 毫秒。这是特定路由系统的实验结果,并不证明一个 6 亿参数模型在一般任务上优于 Haiku。[1]
对企业来说,关键不是是否应该替换所有大模型,而是现有检索系统是否存在足够多的重复选源错误、可靠的评估数据和请求量,值得训练一个专用选择器。本文解释实验结果、容易忽略的指标边界,以及投入开发前应该获得哪些证据。
资料核查日期:2026 年 9 月 13 日。本文是基于原始资料的分析,不是 Wavect 对实验的复现。论文列入 SIGIR 2026 的 AgentSearch 研讨会日程,不应据此宣称其被 SIGIR 主会录用。[2]
Valyu 的小模型路由器究竟胜过了什么?
作者比较了经过监督微调(SFT)和强化学习(RL)的路由器,以及两个通过提示词进行选择的基线模型。系统面对的是固定的 11 个领域智能体。小模型除了选源,还会为后续搜索生成关键词和日期范围。[1]
| 路由器 | 平均 NDCG@10 | NDCG@10 中位数 | 平均延迟 | P99 延迟 |
|---|---|---|---|---|
| Qwen3-0.6B,SFT + REINFORCE++ | 0.771 | 0.960 | 120.1 ms | 179.4 ms |
| Amazon Nova Lite,提示词基线 | 0.594 | 0.926 | 683.6 ms | 4,659.2 ms |
| Claude Haiku 4.5,提示词基线 | 0.552 | 0.929 | 2,457 ms | 6,985 ms |
平均分的绝对提升分别为相对 Nova Lite 增加 0.177,相对 Haiku 增加 0.219。NDCG 不是答对问题的百分比。三个系统的中位数相近而均值不同,提示我们应重点检查困难查询和失败案例,而不是只看平均数。[1]
在专门挑选的“查询与智能体不匹配”子集上,论文报告的分数分别是 0.918、0.539 和 0.490。这对理解一类错误有帮助,却不能当作整体测试结果。论文举例:面对蛋白质结构问题,提示词基线选择了基因组学智能体,训练后的路由器则选择学术检索。关键在于信息真正存在于哪里,而不只是词语看起来属于哪个主题。[1]
检索智能体路由,不等于大语言模型路由
这项决策属于检索增强生成(RAG)流程:选择证据与生成最终答案是两个独立步骤。
模型路由器决定由哪个模型回答或执行一个步骤。检索智能体路由器决定由哪个专用搜索服务或数据源提供证据。重排器则在检索完成后重新排列文档。一个产品可以同时包含三者,但它们解决的是不同问题。
Valyu 的模型输出智能体选择位掩码、关键词和时间区间,也支持选择多个智能体。因此它不只是主题分类器,但也不是能协调任意自主员工团队的通用调度器。收益可能来自选源、搜索参数生成,或两者的共同作用。[1]
更广泛的架构问题可参考多模型智能体系统指南;跨供应商基础设施可参考LLM 网关与路由器对比。本文只讨论更具体的决策:针对已知数据源集合,训练一个以检索结果为依据的选择器。
SFT 与检索结果反馈如何配合?
SFT 先建立输出规范和基本选择能力。论文描述了包含 56,000 条查询的 SFT 数据集,按 70%、15%、15% 分为训练、验证和测试集。目标输出包含来源、关键词与日期。训练使用秩为 16、alpha 为 32 的 LoRA、bf16 精度、两个训练轮次,以及 512 的最大序列长度。这些是论文的实验设置,不是通用的部署要求。[1]
RL 再评估所选路径实际检索到了什么。作者从 SFT 检查点出发,用 11,000 条生产搜索日志查询进行 REINFORCE++ 训练。奖励结合路由适配性、检索内容相关性和来源可信度,不是只优化 NDCG。查询意图、关键词和日期质量仍然参与目标计算,KL 惩罚用于限制模型偏离 SFT 检查点的程度。[1]
不要将两个阶段的数量直接相加,宣称有 67,000 条互不重复的训练样本。这些数字描述不同阶段,并没有证明样本完全不重叠。自己的评估应将相近查询族和不同时间段分开,避免训练信息进入最终测试。
结果反馈发生在训练阶段。线上路由器根据已经学到的规律,为新查询预测合适来源。它并不是先查看这次请求中所有智能体的实时结果,再决定路由。刚刚变空的索引、发生变化的数据源和故障连接器,仍然需要运行时健康检查与受限回退。
因此,值得推广的经验是“用结果指导学习”,而不是“SFT 天生无法利用结果”。监督训练的标签本身也可以来自检索评估。论文比较的是这套渐进训练方案与依靠意图提示的模型,没有排除其他结果驱动的监督方式。
公开的Qwen3-0.6B 模型卡 [3]描述的是基础模型,不是 Valyu 训练后的路由器。下载基础权重不能复现这些分数。所审阅的论文没有提供训练后路由检查点的下载链接,因此在安排直接部署之前,应先确认权重、数据和训练代码的可用性。
读懂 NDCG@10:分母决定了它能说明什么
NDCG 奖励把相关结果放在靠前的位置。在该实验中,Claude Sonnet 4.6 对合并并打乱顺序的结果进行评分,不知道结果由哪个路由器产生。相关性分为 0 到 3 级,随后恢复原来的搜索排序计算指标。作者没有再增加重排步骤。[1]
关键在于分母。第 4.5.1 节通过排列各个系统自己返回的相关性分数来计算理想排序,而不是让所有系统使用同一组理想结果。如果所有结果都无关,分数设为零;少于十条结果的列表不补齐。[1]
这种计算方法限制了单个数字的解释范围。举一个数学示例:十条全部评为 1 的结果,与十条全部评为 3 的结果,若都用自己的排序列表归一化,两者的 NDCG@10 都是 1。两组结果的实际价值显然不同。一份很短但排列正确的列表,也不能因此证明检索覆盖充分。
这并不抹去作者报告的优势。但0.771 不等于 77.1% 的答案准确率、召回率或完整度,也不应在没有说明的情况下,被当作基于共同理想结果池的常规比较。上线前应同时测量共同结果池下的 NDCG、相关证据覆盖、全部无关的查询比例,以及最终答案是否正确。
可执行的做法是为每个查询建立人工审阅的相关文档或片段集合。所有路由器使用相同的目标集合、数据源快照和访问权限接受评估。同时保存原始排序与评分,避免所谓改进只是更换分母的结果。
120.1 毫秒不是整个 RAG 系统的延迟承诺
120.1 ms 的均值和 179.4 ms 的 P99 来自作者测量的选择器,不包含完整检索、重排和生成有据可依答案的过程。观测到的 P99 也不能直接成为线上服务承诺。排队、预热、批处理、输出限制和流量形态都会改变表现。[1]
复现前还应澄清硬件描述。论文写的是使用 vLLM,在带有 48 GB RAM 的 NVIDIA L4 环境中服务;NVIDIA 官方却将单张 L4 的 GPU 显存列为 24 GB。48 GB 可能指主机内存,但该表述没有说明。不要把它改写成需要 48 GB 显存,更不能据此推荐采购配置。[1] [4]
在实际运行环境中分别测试路由器延迟和端到端延迟,覆盖冷启动、代表性并发、超时和回退请求。选择器更快固然有价值,但缓慢的数据源仍可能主导用户等待时间。
委托开发前,应先回答四个问题
- 基线训练条件并不相同。对比的是领域训练后的 SLM 与依靠提示词的大模型,不是在同样训练条件下比较不同规模。结论支持这套专用系统,不足以说明模型大小普遍无关紧要。
- 主检索表没有单独隔离 RL 的增益。SFT-only 结果包含选源匹配、关键词、日期和延迟,却没有在主比较中给出 SFT-only 的 NDCG@10。把全部收益归于 RL 之前,先要求这一消融实验。
- 智能体集合固定。11 个已知代理不等于不断扩展的工具市场。新增来源、索引变化和新的用户语言需要评估。论文把基于显式能力表示选择新智能体列为后续方向。
- 评估者与测试集构成很重要。盲评和打乱顺序有助于控制偏差,但结果仍由模型评判。应确认最终测试和困难子集的规模、去重方式、置信区间,以及独立人工相关性评估。SFT 数据划分本身不能回答这些问题。
作者也指出,还需要与其他学习型选择方法比较,在不同智能体配置中验证,并补充人工判断。这些边界说明应进行受控实验,而不是否定研究价值。[1]
规则、监督选择器,还是 SFT 加 RL?
从能够通过明确验收的最低成本方法开始。LTRR [5]学习按下游效用排列检索器;RAGRoute [6]研究联邦式 RAG 中的轻量选源。它们适合作为比较思路,但并不是可相互替换的 Valyu 路由实现。
| 你的情况 | 先做什么实验 | 原因 |
|---|---|---|
| 来源少、资格规则明确 | 确定性路由加混合检索 | 只要基线足够好,就不必维护训练流程。 |
| 选源错误重复出现,且有可靠结果标签 | 结果标签驱动的分类器或 SFT 路由 | 先确认学习来源适配性有价值,再考虑 RL。 |
| 所选来源与生成参数之间存在复杂作用 | SFT 加检索反馈强化学习 | 可共同优化路径与输入造成的实际后果。 |
| 来源变化快、评估数据少或请求量低 | 按能力选择,并保留受限回退 | 固定的训练后目录可能维护成本过高。 |
用这个公式判断经济性:月收益 = 适用请求量 × 每次请求的净可变成本节省 − 新增月固定成本。比较两条路径上的数据源调用、模型推理与重试;固定成本包括分摊训练、标注、评估和运维。权重文件很小,不代表业务收益已经成立。更广泛的成本核算见每项任务成本指南。
生产设计:把路由选择与权限控制分开
以下是 Wavect 提出的实施模式,不代表论文已经实现这些控制。
- 先确定可用且获准的来源集合。在模型外解析租户、身份、文档访问权、地区限制与来源健康状态。路由器只能选择当前请求者有权访问的来源。
- 验证完整路由输出。只接受已知路径标识、获准的多源组合,以及符合结构的关键词和日期。限制并行调用数量、请求大小与执行时间。无效输出不等于可以搜索所有来源。
- 通过执行权限检查的适配器检索。保留调用者身份。主题相关不意味着用户获得了访问授权。
- 提供有界回退。空结果、超时、未知领域或不确定选择可触发单独评估的替代路径。它必须遵守相同权限与预算,并避免递归重试。
- 对整个决策过程做版本记录和观测。记录路由模型、可选智能体目录、来源或索引版本,以及所选路线、规范化参数、延迟与结果。覆盖下降时要能回滚。
只保留评估确实需要的信息,并设置访问与保存期限。查询和返回片段可能包含客户数据,低成本本地推理不会自动消除训练日志的风险。周边控制可以参考RAG 生产就绪清单及企业 MCP 授权架构。
一个 30 天的检索智能体路由试点
第一周:找准实际故障。收集有权用于分析的查询、来源版本和结果,将选源问题与切块、索引、过时文档和生成错误分开。训练路由器无法修复坏语料。
第二周:比较低成本基线。在相同保留测试查询上评估规则、当前提示词路由器和小型结果标签选择器。单独保留歧义、无结果与多来源案例。逐一测试生产使用的语言,不要假定基础模型的多语言能力会完整迁移到训练后路由器。
第三周:检验 RL 的额外价值。只有在前一基线仍留下显著机会时才引入检索反馈策略。保持评估流程不变,对比 SFT-only 与 SFT+RL,并对抽样结果进行人工盲评。先在不改变用户答案的影子环境中运行。
第四周:灰度上线或停止投入。事先约定质量、p95/p99 延迟、每个验收答案成本和权限标准。只有通过后才切换一小部分查询,且保留回滚路径。试点证明普通混合检索已足够,也是一项有用的成果。
需要判断这个方向是否适合产品?Wavect 的AI 咨询服务可协助设计评估、集成与上线步骤。Twinsoft AI 案例提供相关交付背景,不是 Wavect 已复现 Valyu 路由器的证据。也可用定制软件与现成方案比较指南分析自己持有路由层与采购方案的差别。
讨论一次检索路由评估,带上现有来源、重复错误、流量和延迟预算。第一项交付应该是有证据支持的建设决策,而不是保证超过某个公开分数。
关于 Valyu 小模型路由器的常见问题
0.6B 模型真的超过了 Claude Haiku 4.5 吗?
什么是检索智能体路由器?
路由器会在每次请求时先检查所有数据源吗?
NDCG@10 为 0.771 是否表示答案正确率为 77.1%?
下载 Qwen3-0.6B 就能复现论文吗?
团队是否应立即引入强化学习?
来源与研究方法
- Valyu 论文:方法、结果表与评估协议
- SIGIR 2026 AgentSearch:研讨会议程
- Qwen3-0.6B:公开基础模型说明
- NVIDIA L4:官方显存规格
- LTRR:学习检索器排序的方法
- RAGRoute:面向联邦 RAG 的轻量数据源选择
题图由需求说明提供,基于 Kondapalli 等人的图 1。原论文采用 CC BY 4.0 许可。此处保留原图,不将其描述为 Wavect 的实现。 [1]
