返回
Kevin Riedl

14 分钟 阅读 · 2026年9月19日
最近审核

下一篇
图片在你的设备上生成,不连接 Instagram。文章链接会复制到剪贴板,供链接贴纸使用。

WikiSkill:智能体如何从经验中进化 SKILL.md

WikiSkill 是一种技能进化架构。它先把智能体执行轨迹整理为持久证据,再据此提出并验证可复用技能的修改。论文在五项基准上的平均结果显示,使用 WikiSkill 的 Qwen-3.5-9B 得分为 47.4%,而未使用技能的更大模型 Qwen-3.6-27B 为 39.4%。整个过程没有微调模型权重。

研究日期:主要来源是由 Google Research 与 Virginia Tech 相关研究者发布的 arXiv 预印本,并非经过同行评审的生产研究。它的重要性在于:智能体经验可以成为外部、可检查、可回滚的软件资产,而模型规模并不是唯一升级路径。WikiSkill 论文与作者记录

本文只覆盖一个明确搜索意图:WikiSkill 论文究竟证明了什么,以及如何把持久 Wiki 架构用于 SKILL.md 进化。关于 Agent Skills、MCP、RAG 与 Custom GPTs 的类别区别,请查看Agent Skills 对比指南。关于不含优化器 Wiki 的跨模型手册迁移,请查看智能体知识迁移指南。企业知识库属于另一个问题,可参考面向 AI 的企业 Wiki 指南

什么是 WikiSkill?

WikiSkill 是面向程序化智能体技能的外循环优化器。任务智能体先使用当前技能运行样本。Wiki Maintainer 将成功与失败轨迹整理为长期模式。Skill Proposer 阅读这些模式,并且每次只提出一个技能变更。只有候选版本在保留的验证任务上提高成绩,验证门才会接受它。

关键设计是分层。原始轨迹保留为证据。Wiki 累积记录什么有效、什么失败、哪些修改已经被拒绝。活跃技能则保持精炼,只承载执行所需的已发布流程。当某次修改失败时,技能回滚到上一版,但 Wiki 不会清空,因此优化器无需重新发现同一个失败。

这与“每次出错后让 LLM 重写提示词”不同。WikiSkill 拥有审计轨迹、独立验证集,以及生命周期不同的两类记忆:可回滚的执行说明与持续积累的学习历史。

WikiSkill 的三层架构如何工作?

论文把工作区分为 raw/wiki/skills/。推理智能体执行任务时可以读取活跃技能,但不能直接读取 Wiki。Maintainer 与 Proposer 可以检查原始证据和 Wiki。这一限制很重要,因为消融实验显示,让任务智能体直接访问 Wiki 反而降低最终技能质量。

WikiSkill 三层结构的职责与保留规则
典型内容读取者保留规则
Raw 层不可变任务轨迹、工具调用、输出与最终答案Wiki Maintainer、Skill Proposer保留原始证据
Wiki 层模式页面、索引、进化日志与技能影响历史Wiki Maintainer、Skill Proposer跨迭代累积,包括被拒绝的修改
Skills 层SKILL.md 与把说明关联到证据模式的 PURPOSE.md推理智能体、Skill Proposer只接受通过验证的改进,否则回滚

每轮迭代都遵循受控顺序:运行训练任务、抽取成功与失败样本、更新 Wiki、提出一次原子化创建或补丁、在验证任务上运行候选版本,然后只接受严格改进。论文最多执行八轮进化,并以三次独立完整运行的平均结果作为报告值。WikiSkill 完整方法、结果表与限制

这里的“Wiki”并不是面向用户的 RAG 语料库,也不是存放全部文档的仓库。它是优化器记忆:包含简洁的根因模式、支持轨迹、候选补丁与接受结果,使下一次修改可以建立在累计证据上。

WikiSkill 在五项基准上表现如何?

WikiSkill 在每个测试模型上都取得最高平均分,并比最强的既有技能进化方法高出 3.3 至 12.0 个百分点。五项任务分别覆盖近期数学推理、网页搜索、电子表格操作、长上下文文档问答和交互式环境任务。

WikiSkill 预印本表 1 报告的平均测试成绩
推理模型无技能WikiSkill相对无技能提升领先最强既有方法
Qwen-3.5-4B26.238.5+12.3+3.3
Qwen-3.5-9B29.947.4+17.5+5.1
Qwen-3.6-27B39.463.3+23.9+10.0
Gemma-4-31B41.354.9+13.6+5.8
Gemini-3.5-Flash49.568.1+18.6+12.0

收益并不均匀。Qwen-3.6-27B 在 SpreadsheetBench 上提升 40.9 分,但在 OfficeQA 上只提升 11.6 分。Qwen-3.5-4B 在 OfficeQA 上还出现轻微下降,因为它难以稳定执行技能中编码的长上下文搜索流程。因此,可靠结论不是“技能永远有效”,而是经过验证的程序知识改善了大多数模型与基准组合,但复杂技能能否被正确执行仍取决于模型和任务。

作为研究实验,它的比较方式较为严格:所有方法都从空技能集开始,最终技能直接注入推理提示,并使用配对 bootstrap 检验显著性。但这仍是基准研究,不能直接证明任意生产智能体都会降低成本、延迟或错误率。

9B 模型真的击败了 27B 模型吗?

在论文报告的五项基准平均值上,是的,但必须保留限定条件。使用 WikiSkill 的 Qwen-3.5-9B 平均为 47.4%,未使用技能的 Qwen-3.6-27B 为 39.4%。两者都属于 Qwen 系列,但版本不同,规模也不同。该实验并没有证明任何 9B 模型搭配任意技能都能在所有工作负载上超过所有 27B 模型。

它证明了一个更具工程价值的事实:模型能力与程序上下文是两条独立杠杆。较小模型如果获得经过测试的说明,可能超过每次都要重新发现流程的较大模型。同时,技能进化与模型扩展并不冲突。27B 模型从 WikiSkill 获得最大提升,增加 23.9 分至 63.3。

在把更大模型设为默认方案前,应冻结同一套评估数据并比较四条路径:当前模型无技能、当前模型使用人工技能、当前模型使用进化技能、较大模型无该技能。衡量通过验收的结果,而不是只看 Token 单价。一次便宜调用如果导致重试和人工修复,仍然可能更贵。

进化技能能在模型之间迁移吗?

很多情况下可以,而且其他模型进化出的技能有时优于接收模型自己的技能。在 SpreadsheetBench 上,Qwen-3.5-9B 无技能时为 24.3,使用自进化技能时为 33.6,使用 Qwen-3.6-27B 进化的技能时达到 50.5。在 ALFWorld 上,同一接收模型从自进化技能的 63.4 提升到 27B 技能的 70.2。

WikiSkill 研究中的部分跨模型迁移结果
接收模型与基准无技能自进化技能迁移技能结果
Qwen-3.5-9B,SpreadsheetBench24.333.650.5,来自 Qwen-3.6-27B迁移技能最佳
Qwen-3.5-9B,ALFWorld34.763.470.2,来自 Qwen-3.6-27B迁移技能最佳
Gemma-4-31B,LiveMath33.956.773.7,来自 Qwen-3.6-27B跨家族迁移最佳
Gemini-3.5-Flash,SpreadsheetBench50.576.618.1,来自 Qwen-3.5-4B负迁移

负迁移同样重要。可移植技能必须编码通用流程,而不是针对某个模型习惯的补丁。每次迁移都应视为新版本:重新运行接收模型的评估套件,与无技能和自进化技能比较,只要关键分组退化就拒绝导入,即使技能文本看起来很合理。

这与从前沿模型向低成本模型迁移知识的模式互补。WikiSkill 增加了持久优化历史与验证循环,而不是简单把一个模型的笔记交给另一个模型。

为什么持久 Wiki 是主要增益来源?

最清晰的消融实验隔离了 Wiki 的贡献。Gemini-3.5-Flash 在 Skill Proposer 无 Wiki 访问时,四项基准平均为 48.7%。让 Proposer 访问持久 Wiki 后,成绩提升至 63.7%,增加 15.0 分。如果推理智能体也直接访问 Wiki,成绩反而降至 60.9%。

这个结果支持清晰的架构边界:

  • 执行层只接收已发布技能。任务智能体必须证明技能本身足以完成工作。
  • 优化层接收完整证据历史。Proposer 需要重复失败、成功策略、被拒绝的差异和验证结果。
  • 发布继续受验证门控制。看似合理的修改只有在保留指标上改进后,才能成为生产说明。

如果没有 Wiki,优化历史容易消失在对话与临时轨迹批次中。持久 Wiki 把“我们已经试过”变成可检查状态,也减少重复的错误提案。论文案例先记录一个被拒绝的循环修复,再利用保留证据在下一轮创建被接受的规则,并在后续继续细化。

WikiSkill 论文没有证明什么?

这篇论文足以支持实验,但不足以支持盲目上线。作者列出的限制定义了几个关键边界。

  • 没有测试技能检索。活跃技能被直接注入系统提示。研究隔离了技能质量,但没有证明技能库扩大后如何选择正确技能。
  • 严格改进会阻止中间步骤。每个被接受补丁都必须立即超过最佳验证分。短期中性但能支持后续收益的重构会被拒绝。
  • Wiki 只增不减。当前没有自动剪枝、冲突淘汰或证据老化机制。
  • 没有超长周期任务。测试包含多步工具与长文档,但没有持续数百次动作或数小时的工作流。
  • 小验证集可能产生噪声。各基准验证集只有 10 至 40 个样本。生产门需要更具代表性的切片和重复运行。
  • 没有完整成本核算。优化器增加任务运行、Maintainer 调用、多轮 Proposer 工作与验证。分数更高不代表系统一定更便宜。

研究还保持其他 Harness 组件不变。工具契约、模型路由、权限、记忆、上下文装配和运行时可观察性仍需独立设计。可通过智能体 Harness 工程控制这些边界;当单一分数无法代表完整正确性时,可采用独立验证器模式

团队应如何试点 WikiSkill 式进化?

先选择一个可以独立评分的重复任务。Agent Skills 规范把 SKILL.md 定义为技能目录中的必需说明文件,frontmatter 中包含名称与描述,并可附加脚本或资源。这个文件系统契约适合作为进化技能的版本化发布单元。Agent Skills 规范

面向生产的 WikiSkill 试点
控制项最低实现发布证据
任务契约一个有边界的流程,明确输入、工具和禁止副作用版本化验收标准与代表性样本
数据切分独立训练集、验证集与未触碰测试集切分之间无轨迹或答案泄漏
原始证据带模型、提示、工具与环境版本的不可变轨迹成功与失败均可重放
Wiki 维护带轨迹 ID、置信度与新鲜度的根因模式可读索引、冲突日志与淘汰规则
技能提案一个原子化差异,注明目的并关联模式可审查补丁,禁止静默覆盖
验证门总分、受保护切片、回归预算和重复运行只有预先声明的门全部通过才接受
发布签名版本、分阶段上线、遥测与即时回滚与上一技能版本进行生产对照

不要只针对几个漂亮案例优化。Agent Skills 评估指南建议同时测试技能触发和输出质量,并为每个案例定义预期结果。WikiSkill 式进化还应增加回归切片、对抗任务和 Proposer 永远不可见的冻结最终测试集。Agent Skills 评估指南

安全必须进入优化循环。被投毒的检索文档、被入侵的工具输出或恶意训练任务,都可能被编译为长期说明。SkillJack 表明,经验生成的技能可以在原始投毒来源消失后继续保留后门。应标注不可信内容,为每个模式保存来源,在沙箱中运行候选版本,审查权限与网络行为变化,并禁止同一模型同时提出和批准高影响能力扩展。关于持久技能投毒的 SkillJack 预印本

我们的智能体评估与沙箱安全清单覆盖外围测试控制。Wavect 的AI 智能体工程服务可以把一个重复工作流转化为轨迹、Wiki、技能与发布流水线。上线前请使用软件 QA 清单,也可以把工作流与当前失败轨迹发给我们

我们的结论:先进化流程,再替换模型

WikiSkill 最有价值的思想并不是让智能体编辑 Markdown,而是为程序改进建立独立证据架构。轨迹保存发生了什么。持久 Wiki 汇总重复根因和失败干预。精炼技能只把已发布流程带入执行。验证决定流程是否升级。

基准标题确实成立:带进化技能的 9B Qwen 在研究平均值上超过无技能的 27B Qwen。更深层结果是,大模型从技能中获得更大提升,跨模型迁移有时有效,持久 Wiki 对增益贡献显著。技能不是模型质量的替代品,而是第二条扩展轴。

生产团队的下一步应可测量:选择一个重复任务,冻结评估集,版本化当前 SKILL.md,保留不可变轨迹,只提出原子补丁,并且只发布已证明的改进。在把更大模型设为每次失败的默认答案前,先验证这条路径。

生产级 AI 支持

正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。

查看相关服务:

WikiSkill 常见问题

什么是 WikiSkill?

WikiSkill 是一种从任务经验中进化程序化智能体技能的研究框架。它保存不可变轨迹,把重复成功与失败模式整理进持久 Wiki,提出原子化技能修改,并且只保留能提高验证表现的版本。

WikiSkill 由谁提出?

2026 年 8 月的预印本作者为 Liyan Tang、Cyrus Rashtchian、Chun-Sung Ferng、Andrew Tomkins、Da-Cheng Juan 与 Tu Vu,论文列出的机构包括 Google Research 与 Virginia Tech。它是 arXiv 预印本,不是经过同行评审的生产标准。

使用 WikiSkill 的 9B 模型真的超过了 27B 模型吗?

在五项基准平均值上,使用 WikiSkill 的 Qwen-3.5-9B 为 47.4%,未使用技能的 Qwen-3.6-27B 为 39.4%。这是不同 Qwen 版本之间的具体比较,不代表小模型普遍占优。

WikiSkill 会微调模型吗?

不会。论文方法修改外部程序技能文件,并把当前技能插入推理提示。模型权重保持不变。

为什么 WikiSkill 要维护独立 Wiki?

Wiki 跨迭代保存重复模式、证据、被拒绝补丁与验证结果。某次坏修改可以从已发布技能中回滚,但优化器不会丢失从失败中获得的知识。

一个模型进化的技能能用于另一个模型吗?

论文中多次出现有效迁移,包括跨模型家族迁移,但并不稳定。研究也报告负迁移,因此每个导入技能都必须在接收模型与目标工作负载上重新评估。

WikiSkill 能自动改进生产智能体吗?

它可以启发受控改进流水线,但论文没有证明无人监管的生产优化是安全的。实际系统仍需数据隔离、来源追踪、对抗测试、受保护回归切片、分阶段发布,以及高影响变更的独立授权。

最适合的首个 WikiSkill 试点是什么?

选择频繁、有边界、可回滚、具有客观成功标准且拥有足够历史轨迹的任务。在同一冻结评估集上比较当前模型无技能、人工技能、进化候选与更大模型方案。

最终思考

更大模型不是改进智能体的唯一路径。WikiSkill 表明,当经验被编译为持久证据,并且每次发布修改都必须通过验证时,外部流程可以成为可测量的能力层。

生产结论并不神秘:保存轨迹,分离优化器记忆与执行说明,版本化 SKILL.md,逐次验证迁移,并且在回滚技能时保留已经学到的教训。

生产级 AI 支持

正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。

查看相关服务:

只收重要内容

关注与你相关的内容

每当我们发布新文章,你会收到一封简短邮件。你可以关注整个博客,也可以只选感兴趣的主题。

你希望接收哪些内容?
选择主题

免费、双重确认、不使用跟踪像素。

返回
Kevin Riedl

14 分钟 阅读 · 2026年9月19日
最近审核

下一篇

获取下一篇关于AI 与智能体的一线笔记

有新文章时发送一封简短邮件,不使用跟踪像素,也不发送填充内容。

免费、双重确认、不使用跟踪像素。