返回
Kevin Riedl

8 分钟 阅读 · 2026年9月5日
最近审核

下一篇
图片在你的设备上生成,不连接 Instagram。文章链接会复制到剪贴板,供链接贴纸使用。

AI 智能体知识迁移:前沿模型探索一次,低成本模型规模执行

AI 智能体知识迁移能把昂贵的探索过程变成可复用资产。能力更强的模型先探索陌生任务,记录已验证机制和被否定的假设。之后,更便宜的模型在执行重复工作前读取这份手册。整个过程无需修改模型权重。

Agno 通过 ARC-AGI-3 把这一模式变成了可衡量结果。Gemini-3.7-Flash 在冷启动时得分 37.33,读取 GPT-5.6 编写的手册后达到 96.42。这不代表所有工作都应换成便宜模型,而是值得在重复、可验证流程中测试的架构假设。

本文只覆盖一个明确意图:无需重新训练的跨模型智能体知识迁移。缓存、批处理和提示设计等通用节省方法,请查看LLM Token 成本指南。按请求选择模型,请查看LLM 路由器对比智能体记忆评测则聚焦存储和检索基础设施。

Agno 在 ARC-AGI-3 上证明了什么?

此前运行写下的显式手册,让一个更便宜的模型在同一公开交互式基准上接近前沿模型。根据 Agno 发布的 ARC-AGI Arcade 报告,GPT-5.6 热启动运行在 25 款公开游戏的 183 个关卡上获得 100.00 RHAE。Gemini-3.7-Flash 无先验知识时得分 37.33,读取 GPT-5.6 手册后得分 96.42。

运行方式RHAE完成关卡每款游戏输出 Token
GPT-5.6 热启动100.00183/18380K
Gemini-3.7-Flash 冷启动37.33Agno 对比表未注明195K
Gemini-3.7-Flash 读取 GPT-5.6 手册96.42179/18365K
专家人类汇总基准95.4183/183不适用

两个领先结果都有服务器生成的凭证:GPT-5.6 热启动成绩卡读取手册后的 Gemini 成绩卡记录了重放动作序列。得分与完成率不是同一指标。Gemini 的 96.42 高于 95.4 的专家人类汇总分,但仍有四个关卡未完成。

限制条件也是结论的一部分。ARC-AGI-3 技术报告将其定义为衡量陌生环境探索、目标推断、世界模型构建和高效行动的交互式基准。Agno 测试的是包含 25 款游戏的公开演示集。Agno 也明确说明,私有测试集更难、分布不同且无法公开运行。因此,这项结果不表示 ARC-AGI-3 已被解决。

什么是 AI 智能体知识迁移?

AI 智能体知识迁移,是让另一次运行、另一个智能体或模型复用此前运行产生的显式且已验证的任务经验。知识以可读规则、说明、示例或流程保存在模型权重之外。接收方无需训练或微调,就能检查、质疑、更新和删除它。

这比笼统的“记忆”更具体。可用经验必须带范围和证据。“客户喜欢简短回复”是偏好。“E104 错误必须先刷新 OAuth 授权,再使用相同幂等键重试一次”才是可执行规则,前提是同时保存证据和版本。

Agno 的跨模型学习如何运作?

  1. 冷启动:智能体进入游戏时没有特定说明、规则或已声明目标。
  2. 低成本试验:执行一个动作,观察准确状态变化,并分析已记录的历史。
  3. 保存已验证经验:机制、风险、成功解法和被否定的假设成为简短手册条目。
  4. 重置对话上下文:完成每个关卡后开启新会话,只有手册继续保留。
  5. 为另一模型提供种子知识:GPT-5.6 的 Markdown 手册被合并进 Gemini-3.7-Flash 的知识上下文。
  6. 继续学习:Gemini 把手册当作起点,复核意外结论,并可找到比编写者更好的路径。

ARC-AGI Arcade 开源仓库记录了学习存储、运行模式、污染规则、动作轨迹和成绩卡重放。可迁移的核心模式是把探索、持久证据和重复执行分开,并通过稳定接口连接。

这与模型蒸馏、RAG、记忆和路由有何不同?

模式改变的内容核心问题
智能体知识迁移外部手册或流程另一次运行能否复用已验证经验?
模型蒸馏学生模型训练数据,通常还有权重训练后的小模型能否模仿教师模型?
RAG每次查询检索的来源上下文当前需要哪些外部事实?
智能体记忆持久化的用户、会话、实体或学习状态哪些信息应跨交互保留?
模型路由负责某个请求或步骤的模型哪个模型能以最低成本达到阈值?

生产系统可以同时使用五种模式。知识迁移让经验可移植,路由器选择模型,检索层加载相关条目,评测则判断组合是否仍可接受。

商业价值在哪里?

商业机会在于只为探索付费一次,再把成本摊到安全的重复工作中。Agno 报告显示,读取手册后的 Gemini 每款游戏使用 65K 输出 Token,是冷启动 195K 的三分之一,也低于 GPT-5.6 热启动的 80K。这是 Token 结果,不是通用账单折扣。供应商费率、输入 Token、工具调用、延迟、重试和人工审核都会影响实际金额。

每个已验收任务成本 = 分摊探索成本 + 模型 + 工具 + 重试 + 审核 + 故障恢复

当任务反复出现、规则足够稳定、成功可以验证且有回退路径时,这一模式更有价值。适用案例包括支持工单分流、文档分类、结构化数据清理、重复 QA 调查,以及稳定代码库中的编程任务。一次性战略和高后果判断仍可能需要前沿模型。

迁移的知识会如何失败?

  • 范围错误:某款游戏、租户、市场或产品版本的经验被用于其他场景。
  • 虚假确定性:一次偶然成功后,假设被写成事实。
  • 知识过时:API、政策或流程已经变化,手册却仍被信任。
  • 知识投毒:不可信内容诱导智能体持久保存恶意指令。
  • 压缩损失:短规则遗漏了保证原操作安全的例外。
  • 基准泄漏:源码、答案或人类基准进入智能体上下文,使测量失去意义。

Agno 会标记受污染的运行,并隔离相关手册。企业系统同样需要来源、范围、审批、有效期、版本、脱敏与回滚。学习存储会影响未来决策,因此写入权限应像代码变更一样受控。

团队应如何试点前沿模型到低成本模型的知识迁移?

  1. 选择重复流程:收集 30 至 100 个代表性任务,覆盖罕见和高成本失败。
  2. 冻结三条基线:多次测量前沿模型冷启动、便宜模型冷启动和当前非智能体流程。
  3. 定义学习 Schema:每个条目只写一项结论,并带范围、证据、编写模型、时间、版本、置信度和有效期。
  4. 分离写入与读取权限:前沿模型提出经验,共享前必须通过确定性验证或人工审批。
  5. 为低成本通道注入知识:只加载相关条目,并在轨迹中记录准确版本。
  6. 增加升级路径:将新情况、冲突、低置信度和验证失败交回前沿模型或人工。
  7. 执行对抗测试:覆盖过时手册、矛盾证据、提示注入、跨租户和删除请求。
  8. 比较已验收结果:测量通过率、严重失败率、P50/P95 延迟、审核时间和总成本。

生产级 AI 支持

正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。

查看相关服务:

Wavect 的 AI Enablement 服务可把这一模式变成适合实际工作负载的模型阶梯、受治理的学习存储和验收集。Hyperstate AI 案例展示了我们通过改造 AI 工作负载周边系统来降低成本和延迟的方法。如果重复流程和决策阈值尚不清楚,请先阅读探索阶段指南

AI 智能体知识迁移常见问题

什么是 AI 智能体知识迁移?
它让另一次运行、另一个智能体或模型复用此前运行的显式且已验证经验。知识保存在权重之外,因此可检查、版本化、删除和测试。
Gemini-3.7-Flash 在 ARC-AGI-3 上超过人类了吗?
读取手册后的公开集 RHAE 得分 96.42,高于 95.4 的专家人类汇总分,但它只完成 179 个关卡,人类参考完成全部 183 个。结果不覆盖私有测试集。
跨模型学习需要微调吗?
不需要。Agno 迁移的是 Markdown 手册,没有修改模型权重。微调和蒸馏是独立投入,有不同的验证和回滚路径。
输出 Token 降到三分之一,成本也会降到三分之一吗?
不一定。需要按实际费率和工作负载计算输入、输出、工具、基础设施、重试、审核与故障恢复。
哪类业务流程适合先试点?
选择高频、可逆、机制重复且有客观验收检查的流程。不要把一次性战略决策或难以验证的不可逆操作作为首个试点。

来源与证据边界

文中五个一手来源于 2026 年 9 月 5 日复核。Agno 构建了 Harness,并报告冷启动对比和输出 Token。ARC 服务器生成了动作重放成绩卡,但实验仍只覆盖公开演示集。Wavect 未独立复现运行或审计供应商账单。该结果可支持试点,不代表节省得到保证。

最终思考

一次昂贵智能体运行最有价值的产物,未必是最终答案。它可能是那份紧凑、已验证的手册,让之后每次运行都能从更靠前的位置开始。

Agno 的 ARC-AGI-3 演示呈现了完整架构:前沿模型负责探索,外部学习存储负责保留,低成本模型负责执行,基准负责验证。为每条经验限定范围、保留证据、用冻结任务测试低成本通道,并升级处理不确定性。把前沿推理预算留给新问题,而不是每次重复购买。

生产级 AI 支持

正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。

查看相关服务:

只收重要内容

关注与你相关的内容

每当我们发布新文章,你会收到一封简短邮件。你可以关注整个博客,也可以只选感兴趣的主题。

你希望接收哪些内容?
选择主题

免费、双重确认、不使用跟踪像素。

返回
Kevin Riedl

8 分钟 阅读 · 2026年9月5日
最近审核

下一篇

获取下一篇关于AI 与智能体的一线笔记

有新文章时发送一封简短邮件,不使用跟踪像素,也不发送填充内容。

免费、双重确认、不使用跟踪像素。