返回
Christof Jori

7 分钟 阅读 · 2026年5月26日
最近审核

下一篇
图片在你的设备上生成,不连接 Instagram。文章链接会复制到剪贴板,供链接贴纸使用。

AI 代理项目为什么会被取消:基于证据的审查

Gartner 在 2025 年 6 月预测,到 2027 年底,超过 40% 的代理式 AI 项目将因成本上升、商业价值不明或风险控制不足而被取消。这是一项面向未来的分析师预测,不是已经测得的取消率,也不是对 Wavect 项目的结论。请阅读 Gartner 的原始新闻稿

Gartner 在 2026 年 5 月发布了另一项预测:到 2027 年,40% 的企业将因生产事故后发现的治理缺口而降级或停用自主 AI 代理。该预测的统计单位是企业而不是项目,结果是降级或停用,因此不能与较早的取消预测合并。请参阅 Gartner 的 2026 年治理预测

Wavect 未发布完整、编码一致且经过独立审计的项目组合数据来排列代理项目取消原因。以下八个领域是依据工程实践和公开风险指南形成的审查清单,不代表已观测频率、因果证明或有保证的低成本修复。

代理项目有风险?

 预约免费咨询

1. 预期价值和停止规则是否明确?

先明确任务、受影响用户、当前基线、预期收益、风险容忍度和负责人。预先决定哪些证据足以支持扩展、重构、暂停或停止。即使代理在技术上有能力,如果普通自动化、搜索或流程重构能以更低风险解决问题,它仍可能不是正确方案。

不要把试点继续运行当作价值证明。追踪一个被接受的业务或用户结果、测量来源以及实现它的成本。记录依赖采用率、流程变化、供应商定价或下游团队的假设。

2. 评测是否代表真实部署?

一次提示词演示或少量手选样本不能证明生产表现。围绕真实任务分布、关键边界情况、事实错误与幻觉、拒答行为、工具使用和受影响群体定义测试集、指标和验收阈值。为评测保留版本,并在模型、提示词、工具、数据或政策变化时检查回归。

NIST AI 风险管理框架核心要求记录测试、评估、验证与确认方法,在接近部署的条件下测量,监控生产环境并定义人工监督。请参阅官方 AI RMF Core。评测框架有用,但没有通用规则证明它必须在第一个冲刺完成或恰好包含 20 个意图。应按影响、不确定性和变更频率调整规模。我们的软件质量保证实践TDD 词汇页介绍相邻测试概念,但不能替代针对代理的评测。

3. 是否端到端测量工具可靠性和延迟?

测量完整流程中用户感知的延迟和成功率,而不是孤立的中位数。记录每一步的延迟、超时、重试、速率限制、部分失败、重复副作用和依赖项可用性,并按任务和环境分段。不存在判定失败的通用延迟阈值,容忍度取决于流程及其替代方案。

只并行执行彼此独立的工作;只有在新鲜度和授权允许时才缓存;在操作支持时让写入具备幂等性。按实测质量、延迟和成本为每项任务选择 LLM 与推理预算。价格更低的模型若达不到验收或风险阈值,就不是胜者。

4. 单位经济是否按已接受结果计算?

供应商账单会随用量、模型选择、提示词长度、重试、工具调用、缓存和价格更新而变化。只有在记录了基线、负载、质量与风险阈值以及完整成本时,账单轶事或架构节省主张才可视为证据。

测量每次尝试、成功动作、被接受的解决结果和人工升级的成本。纳入模型 token、工具、检索、基础设施、可观测性、审核、支持和失败恢复。在相同质量和风险阈值下比较架构。RAG、缩短提示词、缓存或不同的嵌入与向量存储选择可能帮助某些系统,但未经测量都不能保证降低总成本。

5. 是否设计了人工监督、接管和恢复?

定义哪些决定需要批准、系统何时必须移交、谁接收升级、此人需要哪些上下文,以及用户如何从错误中恢复。测试权限被拒、人工不可用、责任不清和下游动作失败。所需监督取决于动作影响及适用法律。

不要默认记录“完整上下文”。日志可能包含个人、机密或安全敏感数据。只捕获运营、调查和法律义务所需的最少证据,并配套访问控制、保留期限、完整性和脱敏措施。NIST 更新后的 Generative AI Profile 是用于治理、映射、测量和管理生成式 AI 风险的自愿性跨行业资源,并非认证或保证。

6. 源数据和权限是否适合任务?

错误输出可能来自模型行为、检索、来源质量、工具结果、政策或编排。先诊断所在层,再修改提示词。为来源指定负责人、出处、刷新规则、冲突处理和访问审查,并用当前及对抗性案例测试检索。

对文档、API、凭证和动作应用最小权限。在检索和执行动作时都保留授权检查,而不只是在摄取时检查。提示词工程无法修复过时的源事实,也无法修复暴露错误数据的授权模型。

7. 范围是否由任务和信任边界限定?

单个代理可以协调多项能力,但每增加一项任务、工具或权限,评测与失败面都会扩大。先从边界明确的任务和显式成功标准开始,仅当证据支持下一风险等级时再增加能力。“一个代理、一项工作、一套评测”可以是有用的启发法,但不是通用架构定律。

记录哪些组件负责决策、检索、执行和批准。适当时分离读写路径,并测试跨工具交互和权限升级。NIST AI RMF 的 Map 指南要求记录目标应用范围、组件风险与人工监督,而不是把所有代理一概而论。

8. 治理和法律义务是否映射到具体用例?

审计轨迹不等于保存所有输入和输出。确定哪些决定与动作需要可追溯性,保留数据的法律与安全依据,谁可检查、保留多久,以及如何保护完整性。对 MCP 或其他工具调用,工具身份、授权上下文、结果、时间戳和软件版本可作为有用的运营证据,但仍受数据最小化和安全要求约束。

GDPR 第 22 条不是笼统的“AI 反对权”。它涉及完全基于自动化处理、会产生法律效果或类似重大影响的决定,并受例外和保障措施约束。第 22(3) 条针对特定例外列出了人工介入、表达个人观点和质疑决定等权利。请阅读官方 GDPR 文本,并针对实际处理活动寻求专业意见。

Christof Jori

"当任务、证据、失败边界、负责人和停止规则都明确时,代理审查才可信。一次成功演示只是一个观察结果。"

项目审查应包含哪些证据?

审查领域证据决策问题
价值基线、结果指标、采用情况和负责人该用例是否值得继续投资?
评测有版本的测试、阈值、失败和生产监控表现是否符合部署风险?
工具端到端成功、尾延迟、重试和副作用流程是否可靠且可恢复?
经济性每次尝试、接受结果和升级的成本价值是否超过完整运营成本?
监督批准、接管、回退和事故演练人能否有效介入?
数据出处、新鲜度、质量、权限和冲突输入是否合适且已授权?
范围任务、工具、权限和信任边界复杂性是否有边界且经过测试?
治理负责人、日志、保留、法律映射和剩余风险组织能否负责任地运营系统?

这些领域可能相互作用,但表格不表示已观测的聚类频率。例如,超时可能触发重试、增加成本并造成重复动作。应在事故或评测证据中记录这条链,而不是宣称存在通用失败模式。

团队何时应暂停、重构或停止?

在热情和沉没成本扭曲决定前设定阈值。对于尚未解决的高影响安全、隐私、授权或恢复问题,应暂停部署。若任务、流程、工具边界或证据计划有误,应重构。若预期价值不再足以覆盖完整成本与剩余风险,或更简单的方案效果更好,应停止。

取消可能是合理的治理结果,不证明代理技术或工程失败。同样,技术上线也不证明业务成功。保存决策记录、证据、负责人、整改选项和重新评估的条件。

Wavect 的经验能证明什么?

Wavect 发布的 Twinsoft AIPromptIDQuivrHyperstate AI 案例研究描述了部分交付工作。它们不构成完整的代理项目队列,不能确定取消率或排列原因。后续公司结果需要单独且带日期的证据,不能从交付案例中推断。

Wavect 可以利用经验提出测试、控制和架构选项。项目负责人仍需针对具体用例、用户、供应商、数据、法律和运营环境取得当前证据。

最终思考

Gartner 的超过 40% 是对 2027 年底前代理式 AI 项目取消情况的预测,不是已观测的通用失败率。其 2026 年治理预测使用企业作为单位,结果是降级或停用。Wavect 没有经审计的项目组合数据来验证任一预测或排列八类原因。

应从预期价值、贴近部署的评测、工具可靠性、完整单位经济、人工监督与恢复、源数据和权限、范围边界以及适用治理来审查代理项目。提前定义暂停、重构和停止标准。目标不是避免每一次取消,而是让继续投资与取消都成为基于证据的决定。

生产级 AI 支持

正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。

查看相关服务:

只收重要内容

关注与你相关的内容

每当我们发布新文章,你会收到一封简短邮件。你可以关注整个博客,也可以只选感兴趣的主题。

你希望接收哪些内容?
选择主题

免费、双重确认、不使用跟踪像素。

返回
Christof Jori

7 分钟 阅读 · 2026年5月26日
最近审核

下一篇

获取下一篇关于AI 与智能体的一线笔记

有新文章时发送一封简短邮件,不使用跟踪像素,也不发送填充内容。

免费、双重确认、不使用跟踪像素。