本文内容
专注力是新的瓶颈:你只能运行自己能够控制的 AI 智能体
AI 智能体可以提高实施吞吐量,尤其是在工作能够拆分为相互独立且定义清晰的任务时。它们也会带来任务拆分、上下文、工具访问、审核、集成和事故响应工作。真正有用的问题不是一个人理论上能运行多少个智能体,而是团队能在自身风险容忍度内验证并集成多少并行工作。
没有证据支持每位操作者只能管理两个、五个或十个智能体这样的通用上限。容量会随工作、模型、工具、代码库、测试、权限、操作者和错误后果而变化。应把并发量视为一个需要测量的运行参数。当智能体属于不同人员时,编排还会涉及身份、同意和交付问题;我们的跨所有者智能体通信指南介绍了这一信任边界。
正在使用 AI 智能体构建产品?
预约免费咨询生成速度加快后,什么会发生变化?
更快的生成可以转移约束,但不会消除约束。团队可能减少编写代码的时间,却需要投入更多时间决定应当改变什么、提供上下文、控制工具、审核行为、解决冲突,并证明结果满足要求。常规修改、新型架构、安全敏感工作和模糊的产品决策之间,具体比例会有所不同。
不要假定最困难的工作占固定比例,也不要假定一位操作者现在一定能超过某个特定规模的团队。应测量已经完成并被接受的结果。生成的代码行数、工具调用次数或智能体轮次都只是活动指标,它们可能上升,而周期时间、质量或可维护性反而恶化。
并行什么时候有帮助?
当子任务真正独立、输入与输出明确、工具不会争用共享状态,而且集成可以低成本验证时,并行智能体最有希望发挥作用。如果无法预先确定所需子任务,编排者与工作者模式也可能有帮助。Anthropic 对其研究系统的说明介绍了广度优先查询的优势,同时也指出协调、评测、可靠性和成本方面的挑战。报告中的基准和速度结果只适用于该系统与工作负载,并不是通用倍数。请参阅原始的多智能体研究系统工程报告。
当任务共享文件、模式、有状态环境、迁移、凭据或尚未解决的架构决策时,顺序执行通常更安全。在接口和集成测试稳定之后,仍然可以引入并行。
哪些因素会限制编排规模?
| 约束 | 可观察信号 | 控制措施 |
|---|---|---|
| 任务耦合 | 修改冲突、重复工作、过时假设 | 划分责任并明确依赖关系 |
| 审核容量 | 队列等待时间增长、审核流于表面、反馈延迟 | 限制进行中的工作,并按风险确定优先级 |
| 上下文质量 | 反复纠正、遗漏约束、缺乏依据的完成声明 | 提供边界明确的任务说明、来源、状态和验收证据 |
| 集成 | 合并冲突、契约损坏、环境争用 | 使用兼容接口、隔离工作区和集成门禁 |
| 评测 | 漏出缺陷、脆弱测试、指标操纵 | 结合确定性检查、代表性评测和人工审核 |
| 权限 | 意外写入、访问范围过宽、责任不清 | 应用最小权限、审批、日志、回滚和责任归属 |
| 成本与延迟 | 工具队列、重试、token 增长、关键路径缓慢 | 测量每个已接受任务的端到端经济性 |
NIST 指出,根据具体情境,生成式 AI 可能需要不同程度的监督、人机配置、审核、跟踪、文档和管理。这支持基于风险的监督,而不是固定的操作者与智能体比例。请参阅 NIST 生成式 AI 概况。
如何测量安全并发量?
从一个工作流和一组代表性任务开始。先建立顺序执行的基线,再逐级增加并发量,同时尽可能保持任务组合和验收标准稳定。记录:
- 从任务准备就绪到被接受的时间,包括审核和返工;
- 审核队列等待时间,以及各角色投入的时间;
- 首次通过率,以及按严重程度划分的漏出缺陷;
- 合并冲突、重复工作、回滚和事故;
- 每个已接受结果的工具、模型、基础设施和人工成本;
- 权限例外和缺乏依据的完成声明;
- 操作者工作负荷和交接连续性。
当已接受的总吞吐量趋于平缓、审核或集成队列超过服务目标,或风险指标突破约定阈值时,应停止提高并发量。当模型、工具、权限、代码库、测试套件或任务组合变化时,应重新测量。
每项委派任务应包含什么?
- 目标:具体结果及其重要性。
- 边界:范围内外的文件、系统、人员、数据和操作。
- 输入:权威来源、当前状态、假设和依赖项。
- 权限:允许的读取与写入、审批点和禁止操作。
- 输出契约:产物、格式、责任归属,以及如何报告部分失败。
- 验收:测试、审核标准、证据和回滚或恢复路径。
- 交接:已更改的状态、决策、未解决风险和下一项安全操作。
清晰委派可以减少重复探索和覆盖缺口,但不能保证正确性。因此,必须根据真实系统检查完成证据,而不能只接受智能体的叙述。
上下文和交接应如何运作?
上下文应当充分且范围明确,而不只是简短或按定时器重置。不了解当前约束的新智能体可能重复过去的错误;过长的上下文则可能掩盖主导要求。尽可能将持久状态保存在有版本管理的产物中,包括计划、决策、接口、测试结果和恢复说明。摘要应区分经过验证的事实、假设、待解决问题和实际应用的工作。
使用明确的状态转换,例如待处理、进行中、需要注意、已完成和已验证。智能体消息不能证明某项变更确实存在或已通过检查。在后续工作依赖它之前,应检查产物并运行相关检查。
审核智能体能代替人工审核吗?
审核智能体可以增加一轮独立检查、测试假设或审查另一类风险。它们可能与生成模型共享盲点、遗漏环境行为,或针对不完整的评分标准进行优化。应把它们作为一种控制措施,而不是输出正确或安全的证明。
人工审核应与后果相称,并重点关注意图、架构、安全、隐私、用户影响,以及自动检查无法覆盖的例外情况。Google Cloud 的多智能体参考架构同样强调人工监督、明确的自主程度、可观测性和持续评测。请参阅其多智能体架构指南。

"真正有用的智能体数量,是团队能在风险容忍度内验证并集成的并发量。应根据已接受的结果测量,而不是根据活动量判断。"
我们如何在项目中应用这些原则?
Wavect 不会把通用的双智能体默认值、五智能体上限、四小时审核上限或固定经验门槛作为公开交付承诺。我们根据任务图、审核责任、工具与数据访问、测试、集成范围和失败后果设定进行中工作的限制。随着证据变化,这些限制在项目内也可能改变。
在加入并行工作智能体之前,我们要求任务边界明确、尽可能隔离责任、审核队列可见、交接清晰,并有覆盖重要契约的检查。对于风险更高的变更,我们会增加审批门禁和更深入的人工审核。这是一种运行方式,不能证明缺陷绝不会漏出。
这会如何改变招聘?
智能体辅助工作提高了任务拆分、领域判断、验证、安全、调试、沟通和恢复技能的价值。它并不意味着编写代码不再重要,也不能证明最有价值的工程师就是能监督五个智能体的人。应根据角色实际负责的工作和风险评估人才。
对于兼职技术领导,这可能包括选择适合使用智能体的环节、定义权限和证据、建立评测与审核循环,以及测量自动化是否改善了被接受的交付结果。请参阅我们的兼职技术领导服务。
最终思考
更快的生成可能使专注、上下文、验证和集成成为受限资源,但不会形成一个通用的编排上限。当任务独立,而且验收成本低且可靠时,并行可以提供帮助;当工作相互耦合、权限过宽,或审核与集成队列无法跟上时,并行也可能造成损害。
先按顺序执行任务,定义任务与交接契约,测量已接受的结果,再逐步提高并发量。将自动检查、代表性评测、审核智能体和与风险相称的人工监督作为互补控制措施。当实测系统超过审核、集成、成本或风险限制时,应减少进行中的工作。