本文内容
WikiSkill:智能体如何从经验中进化 SKILL.md
WikiSkill 是一种技能进化架构。它先把智能体执行轨迹整理为持久证据,再据此提出并验证可复用技能的修改。论文在五项基准上的平均结果显示,使用 WikiSkill 的 Qwen-3.5-9B 得分为 47.4%,而未使用技能的更大模型 Qwen-3.6-27B 为 39.4%。整个过程没有微调模型权重。
研究日期:。主要来源是由 Google Research 与 Virginia Tech 相关研究者发布的 arXiv 预印本,并非经过同行评审的生产研究。它的重要性在于:智能体经验可以成为外部、可检查、可回滚的软件资产,而模型规模并不是唯一升级路径。WikiSkill 论文与作者记录
本文只覆盖一个明确搜索意图:WikiSkill 论文究竟证明了什么,以及如何把持久 Wiki 架构用于 SKILL.md 进化。关于 Agent Skills、MCP、RAG 与 Custom GPTs 的类别区别,请查看Agent Skills 对比指南。关于不含优化器 Wiki 的跨模型手册迁移,请查看智能体知识迁移指南。企业知识库属于另一个问题,可参考面向 AI 的企业 Wiki 指南。
什么是 WikiSkill?
WikiSkill 是面向程序化智能体技能的外循环优化器。任务智能体先使用当前技能运行样本。Wiki Maintainer 将成功与失败轨迹整理为长期模式。Skill Proposer 阅读这些模式,并且每次只提出一个技能变更。只有候选版本在保留的验证任务上提高成绩,验证门才会接受它。
关键设计是分层。原始轨迹保留为证据。Wiki 累积记录什么有效、什么失败、哪些修改已经被拒绝。活跃技能则保持精炼,只承载执行所需的已发布流程。当某次修改失败时,技能回滚到上一版,但 Wiki 不会清空,因此优化器无需重新发现同一个失败。
这与“每次出错后让 LLM 重写提示词”不同。WikiSkill 拥有审计轨迹、独立验证集,以及生命周期不同的两类记忆:可回滚的执行说明与持续积累的学习历史。
WikiSkill 的三层架构如何工作?
论文把工作区分为 raw/、wiki/ 与 skills/。推理智能体执行任务时可以读取活跃技能,但不能直接读取 Wiki。Maintainer 与 Proposer 可以检查原始证据和 Wiki。这一限制很重要,因为消融实验显示,让任务智能体直接访问 Wiki 反而降低最终技能质量。
| 层 | 典型内容 | 读取者 | 保留规则 |
|---|---|---|---|
| Raw 层 | 不可变任务轨迹、工具调用、输出与最终答案 | Wiki Maintainer、Skill Proposer | 保留原始证据 |
| Wiki 层 | 模式页面、索引、进化日志与技能影响历史 | Wiki Maintainer、Skill Proposer | 跨迭代累积,包括被拒绝的修改 |
| Skills 层 | SKILL.md 与把说明关联到证据模式的 PURPOSE.md | 推理智能体、Skill Proposer | 只接受通过验证的改进,否则回滚 |
每轮迭代都遵循受控顺序:运行训练任务、抽取成功与失败样本、更新 Wiki、提出一次原子化创建或补丁、在验证任务上运行候选版本,然后只接受严格改进。论文最多执行八轮进化,并以三次独立完整运行的平均结果作为报告值。WikiSkill 完整方法、结果表与限制
这里的“Wiki”并不是面向用户的 RAG 语料库,也不是存放全部文档的仓库。它是优化器记忆:包含简洁的根因模式、支持轨迹、候选补丁与接受结果,使下一次修改可以建立在累计证据上。
WikiSkill 在五项基准上表现如何?
WikiSkill 在每个测试模型上都取得最高平均分,并比最强的既有技能进化方法高出 3.3 至 12.0 个百分点。五项任务分别覆盖近期数学推理、网页搜索、电子表格操作、长上下文文档问答和交互式环境任务。
| 推理模型 | 无技能 | WikiSkill | 相对无技能提升 | 领先最强既有方法 |
|---|---|---|---|---|
| Qwen-3.5-4B | 26.2 | 38.5 | +12.3 | +3.3 |
| Qwen-3.5-9B | 29.9 | 47.4 | +17.5 | +5.1 |
| Qwen-3.6-27B | 39.4 | 63.3 | +23.9 | +10.0 |
| Gemma-4-31B | 41.3 | 54.9 | +13.6 | +5.8 |
| Gemini-3.5-Flash | 49.5 | 68.1 | +18.6 | +12.0 |
收益并不均匀。Qwen-3.6-27B 在 SpreadsheetBench 上提升 40.9 分,但在 OfficeQA 上只提升 11.6 分。Qwen-3.5-4B 在 OfficeQA 上还出现轻微下降,因为它难以稳定执行技能中编码的长上下文搜索流程。因此,可靠结论不是“技能永远有效”,而是经过验证的程序知识改善了大多数模型与基准组合,但复杂技能能否被正确执行仍取决于模型和任务。
作为研究实验,它的比较方式较为严格:所有方法都从空技能集开始,最终技能直接注入推理提示,并使用配对 bootstrap 检验显著性。但这仍是基准研究,不能直接证明任意生产智能体都会降低成本、延迟或错误率。
9B 模型真的击败了 27B 模型吗?
在论文报告的五项基准平均值上,是的,但必须保留限定条件。使用 WikiSkill 的 Qwen-3.5-9B 平均为 47.4%,未使用技能的 Qwen-3.6-27B 为 39.4%。两者都属于 Qwen 系列,但版本不同,规模也不同。该实验并没有证明任何 9B 模型搭配任意技能都能在所有工作负载上超过所有 27B 模型。
它证明了一个更具工程价值的事实:模型能力与程序上下文是两条独立杠杆。较小模型如果获得经过测试的说明,可能超过每次都要重新发现流程的较大模型。同时,技能进化与模型扩展并不冲突。27B 模型从 WikiSkill 获得最大提升,增加 23.9 分至 63.3。
在把更大模型设为默认方案前,应冻结同一套评估数据并比较四条路径:当前模型无技能、当前模型使用人工技能、当前模型使用进化技能、较大模型无该技能。衡量通过验收的结果,而不是只看 Token 单价。一次便宜调用如果导致重试和人工修复,仍然可能更贵。
进化技能能在模型之间迁移吗?
很多情况下可以,而且其他模型进化出的技能有时优于接收模型自己的技能。在 SpreadsheetBench 上,Qwen-3.5-9B 无技能时为 24.3,使用自进化技能时为 33.6,使用 Qwen-3.6-27B 进化的技能时达到 50.5。在 ALFWorld 上,同一接收模型从自进化技能的 63.4 提升到 27B 技能的 70.2。
| 接收模型与基准 | 无技能 | 自进化技能 | 迁移技能 | 结果 |
|---|---|---|---|---|
| Qwen-3.5-9B,SpreadsheetBench | 24.3 | 33.6 | 50.5,来自 Qwen-3.6-27B | 迁移技能最佳 |
| Qwen-3.5-9B,ALFWorld | 34.7 | 63.4 | 70.2,来自 Qwen-3.6-27B | 迁移技能最佳 |
| Gemma-4-31B,LiveMath | 33.9 | 56.7 | 73.7,来自 Qwen-3.6-27B | 跨家族迁移最佳 |
| Gemini-3.5-Flash,SpreadsheetBench | 50.5 | 76.6 | 18.1,来自 Qwen-3.5-4B | 负迁移 |
负迁移同样重要。可移植技能必须编码通用流程,而不是针对某个模型习惯的补丁。每次迁移都应视为新版本:重新运行接收模型的评估套件,与无技能和自进化技能比较,只要关键分组退化就拒绝导入,即使技能文本看起来很合理。
这与从前沿模型向低成本模型迁移知识的模式互补。WikiSkill 增加了持久优化历史与验证循环,而不是简单把一个模型的笔记交给另一个模型。
为什么持久 Wiki 是主要增益来源?
最清晰的消融实验隔离了 Wiki 的贡献。Gemini-3.5-Flash 在 Skill Proposer 无 Wiki 访问时,四项基准平均为 48.7%。让 Proposer 访问持久 Wiki 后,成绩提升至 63.7%,增加 15.0 分。如果推理智能体也直接访问 Wiki,成绩反而降至 60.9%。
这个结果支持清晰的架构边界:
- 执行层只接收已发布技能。任务智能体必须证明技能本身足以完成工作。
- 优化层接收完整证据历史。Proposer 需要重复失败、成功策略、被拒绝的差异和验证结果。
- 发布继续受验证门控制。看似合理的修改只有在保留指标上改进后,才能成为生产说明。
如果没有 Wiki,优化历史容易消失在对话与临时轨迹批次中。持久 Wiki 把“我们已经试过”变成可检查状态,也减少重复的错误提案。论文案例先记录一个被拒绝的循环修复,再利用保留证据在下一轮创建被接受的规则,并在后续继续细化。
WikiSkill 论文没有证明什么?
这篇论文足以支持实验,但不足以支持盲目上线。作者列出的限制定义了几个关键边界。
- 没有测试技能检索。活跃技能被直接注入系统提示。研究隔离了技能质量,但没有证明技能库扩大后如何选择正确技能。
- 严格改进会阻止中间步骤。每个被接受补丁都必须立即超过最佳验证分。短期中性但能支持后续收益的重构会被拒绝。
- Wiki 只增不减。当前没有自动剪枝、冲突淘汰或证据老化机制。
- 没有超长周期任务。测试包含多步工具与长文档,但没有持续数百次动作或数小时的工作流。
- 小验证集可能产生噪声。各基准验证集只有 10 至 40 个样本。生产门需要更具代表性的切片和重复运行。
- 没有完整成本核算。优化器增加任务运行、Maintainer 调用、多轮 Proposer 工作与验证。分数更高不代表系统一定更便宜。
研究还保持其他 Harness 组件不变。工具契约、模型路由、权限、记忆、上下文装配和运行时可观察性仍需独立设计。可通过智能体 Harness 工程控制这些边界;当单一分数无法代表完整正确性时,可采用独立验证器模式。
团队应如何试点 WikiSkill 式进化?
先选择一个可以独立评分的重复任务。Agent Skills 规范把 SKILL.md 定义为技能目录中的必需说明文件,frontmatter 中包含名称与描述,并可附加脚本或资源。这个文件系统契约适合作为进化技能的版本化发布单元。Agent Skills 规范
| 控制项 | 最低实现 | 发布证据 |
|---|---|---|
| 任务契约 | 一个有边界的流程,明确输入、工具和禁止副作用 | 版本化验收标准与代表性样本 |
| 数据切分 | 独立训练集、验证集与未触碰测试集 | 切分之间无轨迹或答案泄漏 |
| 原始证据 | 带模型、提示、工具与环境版本的不可变轨迹 | 成功与失败均可重放 |
| Wiki 维护 | 带轨迹 ID、置信度与新鲜度的根因模式 | 可读索引、冲突日志与淘汰规则 |
| 技能提案 | 一个原子化差异,注明目的并关联模式 | 可审查补丁,禁止静默覆盖 |
| 验证门 | 总分、受保护切片、回归预算和重复运行 | 只有预先声明的门全部通过才接受 |
| 发布 | 签名版本、分阶段上线、遥测与即时回滚 | 与上一技能版本进行生产对照 |
不要只针对几个漂亮案例优化。Agent Skills 评估指南建议同时测试技能触发和输出质量,并为每个案例定义预期结果。WikiSkill 式进化还应增加回归切片、对抗任务和 Proposer 永远不可见的冻结最终测试集。Agent Skills 评估指南
安全必须进入优化循环。被投毒的检索文档、被入侵的工具输出或恶意训练任务,都可能被编译为长期说明。SkillJack 表明,经验生成的技能可以在原始投毒来源消失后继续保留后门。应标注不可信内容,为每个模式保存来源,在沙箱中运行候选版本,审查权限与网络行为变化,并禁止同一模型同时提出和批准高影响能力扩展。关于持久技能投毒的 SkillJack 预印本
我们的智能体评估与沙箱安全清单覆盖外围测试控制。Wavect 的AI 智能体工程服务可以把一个重复工作流转化为轨迹、Wiki、技能与发布流水线。上线前请使用软件 QA 清单,也可以把工作流与当前失败轨迹发给我们。
我们的结论:先进化流程,再替换模型
WikiSkill 最有价值的思想并不是让智能体编辑 Markdown,而是为程序改进建立独立证据架构。轨迹保存发生了什么。持久 Wiki 汇总重复根因和失败干预。精炼技能只把已发布流程带入执行。验证决定流程是否升级。
基准标题确实成立:带进化技能的 9B Qwen 在研究平均值上超过无技能的 27B Qwen。更深层结果是,大模型从技能中获得更大提升,跨模型迁移有时有效,持久 Wiki 对增益贡献显著。技能不是模型质量的替代品,而是第二条扩展轴。
生产团队的下一步应可测量:选择一个重复任务,冻结评估集,版本化当前 SKILL.md,保留不可变轨迹,只提出原子补丁,并且只发布已证明的改进。在把更大模型设为每次失败的默认答案前,先验证这条路径。
生产级 AI 支持
正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。
查看相关服务:
WikiSkill 常见问题
什么是 WikiSkill?
WikiSkill 是一种从任务经验中进化程序化智能体技能的研究框架。它保存不可变轨迹,把重复成功与失败模式整理进持久 Wiki,提出原子化技能修改,并且只保留能提高验证表现的版本。
WikiSkill 由谁提出?
2026 年 8 月的预印本作者为 Liyan Tang、Cyrus Rashtchian、Chun-Sung Ferng、Andrew Tomkins、Da-Cheng Juan 与 Tu Vu,论文列出的机构包括 Google Research 与 Virginia Tech。它是 arXiv 预印本,不是经过同行评审的生产标准。
使用 WikiSkill 的 9B 模型真的超过了 27B 模型吗?
在五项基准平均值上,使用 WikiSkill 的 Qwen-3.5-9B 为 47.4%,未使用技能的 Qwen-3.6-27B 为 39.4%。这是不同 Qwen 版本之间的具体比较,不代表小模型普遍占优。
WikiSkill 会微调模型吗?
不会。论文方法修改外部程序技能文件,并把当前技能插入推理提示。模型权重保持不变。
为什么 WikiSkill 要维护独立 Wiki?
Wiki 跨迭代保存重复模式、证据、被拒绝补丁与验证结果。某次坏修改可以从已发布技能中回滚,但优化器不会丢失从失败中获得的知识。
一个模型进化的技能能用于另一个模型吗?
论文中多次出现有效迁移,包括跨模型家族迁移,但并不稳定。研究也报告负迁移,因此每个导入技能都必须在接收模型与目标工作负载上重新评估。
WikiSkill 能自动改进生产智能体吗?
它可以启发受控改进流水线,但论文没有证明无人监管的生产优化是安全的。实际系统仍需数据隔离、来源追踪、对抗测试、受保护回归切片、分阶段发布,以及高影响变更的独立授权。
最适合的首个 WikiSkill 试点是什么?
选择频繁、有边界、可回滚、具有客观成功标准且拥有足够历史轨迹的任务。在同一冻结评估集上比较当前模型无技能、人工技能、进化候选与更大模型方案。
最终思考
更大模型不是改进智能体的唯一路径。WikiSkill 表明,当经验被编译为持久证据,并且每次发布修改都必须通过验证时,外部流程可以成为可测量的能力层。
生产结论并不神秘:保存轨迹,分离优化器记忆与执行说明,版本化 SKILL.md,逐次验证迁移,并且在回滚技能时保留已经学到的教训。
