本文内容
AI 智能体知识迁移:前沿模型探索一次,低成本模型规模执行
AI 智能体知识迁移能把昂贵的探索过程变成可复用资产。能力更强的模型先探索陌生任务,记录已验证机制和被否定的假设。之后,更便宜的模型在执行重复工作前读取这份手册。整个过程无需修改模型权重。
Agno 通过 ARC-AGI-3 把这一模式变成了可衡量结果。Gemini-3.7-Flash 在冷启动时得分 37.33,读取 GPT-5.6 编写的手册后达到 96.42。这不代表所有工作都应换成便宜模型,而是值得在重复、可验证流程中测试的架构假设。
本文只覆盖一个明确意图:无需重新训练的跨模型智能体知识迁移。缓存、批处理和提示设计等通用节省方法,请查看LLM Token 成本指南。按请求选择模型,请查看LLM 路由器对比。智能体记忆评测则聚焦存储和检索基础设施。
Agno 在 ARC-AGI-3 上证明了什么?
此前运行写下的显式手册,让一个更便宜的模型在同一公开交互式基准上接近前沿模型。根据 Agno 发布的 ARC-AGI Arcade 报告,GPT-5.6 热启动运行在 25 款公开游戏的 183 个关卡上获得 100.00 RHAE。Gemini-3.7-Flash 无先验知识时得分 37.33,读取 GPT-5.6 手册后得分 96.42。
| 运行方式 | RHAE | 完成关卡 | 每款游戏输出 Token |
|---|---|---|---|
| GPT-5.6 热启动 | 100.00 | 183/183 | 80K |
| Gemini-3.7-Flash 冷启动 | 37.33 | Agno 对比表未注明 | 195K |
| Gemini-3.7-Flash 读取 GPT-5.6 手册 | 96.42 | 179/183 | 65K |
| 专家人类汇总基准 | 95.4 | 183/183 | 不适用 |
两个领先结果都有服务器生成的凭证:GPT-5.6 热启动成绩卡和读取手册后的 Gemini 成绩卡记录了重放动作序列。得分与完成率不是同一指标。Gemini 的 96.42 高于 95.4 的专家人类汇总分,但仍有四个关卡未完成。
限制条件也是结论的一部分。ARC-AGI-3 技术报告将其定义为衡量陌生环境探索、目标推断、世界模型构建和高效行动的交互式基准。Agno 测试的是包含 25 款游戏的公开演示集。Agno 也明确说明,私有测试集更难、分布不同且无法公开运行。因此,这项结果不表示 ARC-AGI-3 已被解决。
什么是 AI 智能体知识迁移?
AI 智能体知识迁移,是让另一次运行、另一个智能体或模型复用此前运行产生的显式且已验证的任务经验。知识以可读规则、说明、示例或流程保存在模型权重之外。接收方无需训练或微调,就能检查、质疑、更新和删除它。
这比笼统的“记忆”更具体。可用经验必须带范围和证据。“客户喜欢简短回复”是偏好。“E104 错误必须先刷新 OAuth 授权,再使用相同幂等键重试一次”才是可执行规则,前提是同时保存证据和版本。
Agno 的跨模型学习如何运作?
- 冷启动:智能体进入游戏时没有特定说明、规则或已声明目标。
- 低成本试验:执行一个动作,观察准确状态变化,并分析已记录的历史。
- 保存已验证经验:机制、风险、成功解法和被否定的假设成为简短手册条目。
- 重置对话上下文:完成每个关卡后开启新会话,只有手册继续保留。
- 为另一模型提供种子知识:GPT-5.6 的 Markdown 手册被合并进 Gemini-3.7-Flash 的知识上下文。
- 继续学习:Gemini 把手册当作起点,复核意外结论,并可找到比编写者更好的路径。
ARC-AGI Arcade 开源仓库记录了学习存储、运行模式、污染规则、动作轨迹和成绩卡重放。可迁移的核心模式是把探索、持久证据和重复执行分开,并通过稳定接口连接。
这与模型蒸馏、RAG、记忆和路由有何不同?
| 模式 | 改变的内容 | 核心问题 |
|---|---|---|
| 智能体知识迁移 | 外部手册或流程 | 另一次运行能否复用已验证经验? |
| 模型蒸馏 | 学生模型训练数据,通常还有权重 | 训练后的小模型能否模仿教师模型? |
| RAG | 每次查询检索的来源上下文 | 当前需要哪些外部事实? |
| 智能体记忆 | 持久化的用户、会话、实体或学习状态 | 哪些信息应跨交互保留? |
| 模型路由 | 负责某个请求或步骤的模型 | 哪个模型能以最低成本达到阈值? |
生产系统可以同时使用五种模式。知识迁移让经验可移植,路由器选择模型,检索层加载相关条目,评测则判断组合是否仍可接受。
商业价值在哪里?
商业机会在于只为探索付费一次,再把成本摊到安全的重复工作中。Agno 报告显示,读取手册后的 Gemini 每款游戏使用 65K 输出 Token,是冷启动 195K 的三分之一,也低于 GPT-5.6 热启动的 80K。这是 Token 结果,不是通用账单折扣。供应商费率、输入 Token、工具调用、延迟、重试和人工审核都会影响实际金额。
每个已验收任务成本 = 分摊探索成本 + 模型 + 工具 + 重试 + 审核 + 故障恢复
当任务反复出现、规则足够稳定、成功可以验证且有回退路径时,这一模式更有价值。适用案例包括支持工单分流、文档分类、结构化数据清理、重复 QA 调查,以及稳定代码库中的编程任务。一次性战略和高后果判断仍可能需要前沿模型。
迁移的知识会如何失败?
- 范围错误:某款游戏、租户、市场或产品版本的经验被用于其他场景。
- 虚假确定性:一次偶然成功后,假设被写成事实。
- 知识过时:API、政策或流程已经变化,手册却仍被信任。
- 知识投毒:不可信内容诱导智能体持久保存恶意指令。
- 压缩损失:短规则遗漏了保证原操作安全的例外。
- 基准泄漏:源码、答案或人类基准进入智能体上下文,使测量失去意义。
Agno 会标记受污染的运行,并隔离相关手册。企业系统同样需要来源、范围、审批、有效期、版本、脱敏与回滚。学习存储会影响未来决策,因此写入权限应像代码变更一样受控。
团队应如何试点前沿模型到低成本模型的知识迁移?
- 选择重复流程:收集 30 至 100 个代表性任务,覆盖罕见和高成本失败。
- 冻结三条基线:多次测量前沿模型冷启动、便宜模型冷启动和当前非智能体流程。
- 定义学习 Schema:每个条目只写一项结论,并带范围、证据、编写模型、时间、版本、置信度和有效期。
- 分离写入与读取权限:前沿模型提出经验,共享前必须通过确定性验证或人工审批。
- 为低成本通道注入知识:只加载相关条目,并在轨迹中记录准确版本。
- 增加升级路径:将新情况、冲突、低置信度和验证失败交回前沿模型或人工。
- 执行对抗测试:覆盖过时手册、矛盾证据、提示注入、跨租户和删除请求。
- 比较已验收结果:测量通过率、严重失败率、P50/P95 延迟、审核时间和总成本。
生产级 AI 支持
正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。
查看相关服务:
Wavect 的 AI Enablement 服务可把这一模式变成适合实际工作负载的模型阶梯、受治理的学习存储和验收集。Hyperstate AI 案例展示了我们通过改造 AI 工作负载周边系统来降低成本和延迟的方法。如果重复流程和决策阈值尚不清楚,请先阅读探索阶段指南。
AI 智能体知识迁移常见问题
什么是 AI 智能体知识迁移?
Gemini-3.7-Flash 在 ARC-AGI-3 上超过人类了吗?
跨模型学习需要微调吗?
输出 Token 降到三分之一,成本也会降到三分之一吗?
哪类业务流程适合先试点?
来源与证据边界
文中五个一手来源于 2026 年 9 月 5 日复核。Agno 构建了 Harness,并报告冷启动对比和输出 Token。ARC 服务器生成了动作重放成绩卡,但实验仍只覆盖公开演示集。Wavect 未独立复现运行或审计供应商账单。该结果可支持试点,不代表节省得到保证。
最终思考
一次昂贵智能体运行最有价值的产物,未必是最终答案。它可能是那份紧凑、已验证的手册,让之后每次运行都能从更靠前的位置开始。
Agno 的 ARC-AGI-3 演示呈现了完整架构:前沿模型负责探索,外部学习存储负责保留,低成本模型负责执行,基准负责验证。为每条经验限定范围、保留证据、用冻结任务测试低成本通道,并升级处理不确定性。把前沿推理预算留给新问题,而不是每次重复购买。
