本文内容
30/60/90 天 AI 智能体试点:面向奥地利中小企业的生产环境上线计划
一次现实的 AI 智能体上线大约需要 90 天。第 0 到 30 天用来界定范围和降低风险:挑选一个边界清晰、高频次的工作流,把它梳理清楚,事先定义成功指标和叫停标准,盘点智能体需要的系统和权限,并搭好日志记录以及一套取自真实案例的评测集。第 31 到 60 天针对沙箱构建,并以影子模式运行,由智能体提出建议、人来批准,同时对照评测集进行衡量,并将权限收紧到最小权限。第 61 到 90 天在保留批准关卡的前提下投入一小部分真实流量,盯紧每次动作的成本和错误率,编写运行手册和回滚方案,把所有权移交给团队,并做出决定:扩大、迭代还是叫停。难点在于权限、批准设计、评测、日志和一次干净的移交,而不是模型本身。
这篇讲的是怎么做,源自实战。运行 30 天后的具体 go/no-go 衡量方法,请使用我们的 AI 试点终止或扩展评分卡。至于项目为什么会死,请看 为什么 AI 智能体项目会被取消。本文继续负责避免这些问题的上线顺序。如果你希望和团队一起完成工作流梳理、实施与交接,请查看我们的 AI 落地服务。
当智能体通过机器人硬件执行动作时,同样的上线过程还需要独立的物理安全层。我们的 Gemini Robotics 2 全身控制指南把这套试点方法应用于具身推理、机器人 API、确定性防护和监督运动。
想和我们一起规划并为 90 天的智能体上线降低风险吗?
预约免费咨询首先:智能体真的是对的工具吗?
一个 AI 智能体 是这样一种系统:模型自行决定步骤,并通过工具对你的系统执行动作,在有限的人工介入下分多步朝着目标推进。去掉其中任何一项,它就退化成更简单、通常也更好的东西。大多数失败的"智能体"项目本应是一个 RAG 助手或一段写好的工作流。挑选能完成任务的最便宜的工具。
| 你需要什么 | 对的工具 |
|---|---|
| 从知识库给出单轮回答,成本可预测、易于审计 | RAG 助手,而非智能体 |
| 在结构化数据上执行固定的、基于规则的、可预测的步骤 | RPA 或写好的工作流,而非智能体 |
| 不对系统执行动作的对话式问答 | 一个聊天机器人,而非智能体 |
| 开放式目标、步骤数量不可预测、必须通过工具跨系统执行动作 | 一个带护栏的 AI 智能体,并接受更高的成本和误差累积的风险 |
经验法则:把智能体留给那些额外推理会改变业务结果的工作流。如果步骤从不变化,智能体就是那个更贵、更难审计的错误工具。
第 0 到 30 天:界定范围、降低风险
整个试点的成败都在这里决定。挑一个高频次、边界清晰的工作流,并在动手构建之前写下来:你要推动的那一个数字、引入工具前的基线(现在就开始测量),以及一个叫停标准(例如,若第四周采用率低于设定门槛就停,或数据太脏,或影响太小)。盘点智能体会触及的每一个系统和权限,从一开始就按最小权限来规划。搭好日志记录和可观测性,并用真实案例构建一套小型评测集,取自真实失败的 20 到 50 个任务就是很好的起点。决定哪些动作需要人工批准关卡,尤其是任何不可逆的动作。
第 31 到 60 天:构建并以影子模式运行
针对沙箱构建,绝不针对线上系统。然后以影子模式运行:智能体处理与你的团队相同的真实输入,并记录它会做什么,但人始终是最终决策者,这样你能在它触碰任何东西之前衡量它的判断力。采用自主权的阶梯,先是有人监督,待指标过关后再转为仅在例外时或抽样批准。在第 30 天和第 60 天对照评测集做轻量打分,让第 90 天的决定是一次确认,而非意外。把权限收紧到最小权限,并有意识地对失败模式做红队演练:提示注入、不安全的工具调用,以及演示里永远不会出现的那种现实中的模糊请求。为杂乱的输入而设计,而不是为顺畅路径而设计,往往正是能上线的试点和不能上线的试点之间的分水岭。
第 61 到 90 天:有限生产环境与移交
在保留批准关卡的前提下投入一小部分真实流量,并以审计优先的姿态开始:先观察行为,再收紧控制。监控每次动作的成本和错误率,并在每次调用之前于基础设施层强制执行硬性的 token 和成本预算,而不是事后在报告里看到。编写运行手册和回滚方案:定义那个一旦某项指标退化就自动回退到上一版本的触发条件。然后做大多数团队会跳过的那一步:把所有权移交给团队。决策权,谁能改动智能体、谁来负责,必须在更大范围铺开之前定义清楚,团队也必须能在不依赖构建它的那些人的情况下读懂追踪记录并执行运行手册。最后,对照你第 0 天的指标和叫停标准做出判断:扩大、迭代还是停止。
难点,以及如何把它们做对
- 权限与最小权限。OWASP 的 excessive agency 风险来自过多的功能、权限和自主权。给智能体按任务限定、有时限的最小权限访问,以及独立身份。
- 人工批准设计。 模式是先提议再批准:智能体在高影响或不可逆的动作前暂停,由人在完整上下文下批准、修改或拒绝。你不必批准每一个动作,但你必须给那些可能造成损害的动作设上关卡。
- 评测与回归。 三层:每一步的确定性检查、生产环境中的抽样以捕捉漂移,以及定期的人工复核来校准。测试一个智能体意味着测试它的判断力,而不只是某一个输出。
- 日志与审计追踪。记录模型调用、工具调用和决策,并设定保留期与访问控制。这有助于调试、事件还原和问责,但 GDPR 没有规定通用的智能体日志格式或无限期保留。
- 每次动作的成本与降级处理。 智能体式流程每个任务的成本可能是聊天机器人的数倍,因为每一步都会重新发送上下文。从第一天起就追踪每个结果的成本,把便宜的步骤路由到小模型,并定义当某个工具或模型出错时会发生什么。
- 干净的移交。 一个只有你的供应商懂的智能体是负担,不是胜利。团队必须拥有它。

"如今模型是简单的那部分。这 90 天讲的是权限、批准关卡、评测和一次干净的移交。影子模式是杠杆最高的那一步:让智能体在真实输入上证明它的判断力,而人仍握着方向盘,那么上线的决定就会自己做出来。"
为什么这么多智能体项目会失败
Gartner 预测到 2027 年底将有超过 40% 的智能体式 AI 项目被取消,原因包括成本、业务价值不清和风险管控不足。这是分析机构的预测,不是已测得的取消率。常见问题包括幻觉、延迟、评测欠债、成本失控、交接缺失、脏数据和审计缺口。90 天计划的目的是尽早暴露它们。更多类型见为什么 AI 智能体项目会被取消。
欧盟与奥地利这部分
处理个人数据的智能体受 GDPR 约束。保留适度记录,落实数据最小化与最小权限,并在决策完全基于自动化处理且产生法律或类似重大影响时评估第 22 条。当供应商是处理者时签署处理协议,并分开评估跨境传输。按当前欧盟 AI 法案时间表,大多数第 50 条义务自 2026 年 8 月 2 日起适用,某些生成内容透明度解决方案的宽限期至 2026 年 12 月 2 日。高风险义务分别在 2027 年和 2028 年跟进。先分类用例和角色,再对应义务。
常见问题
上线一个 AI 智能体需要多久?
什么是人在回路的批准?
我如何防止 AI 智能体造成损害?
我到底需不需要智能体?
运行一个 AI 智能体要花多少钱?
什么是影子模式?
什么是叫停标准,为什么要先设它?
什么是评测,为什么要在做智能体之前先构建它?
奥地利的 AI 智能体,法律立场如何?
我如何移交智能体,让我的团队拥有它?
最终思考
AI 智能体上线不是模型问题,而是一个包含模型的运营问题。真正有用的 90 天,应花在边界清晰的流程、最小权限、真实失败评测、影子模式和团队交接上。
选择推理真正改变结果的最小流程,在第 0 天设定指标和停止标准,让影子模式为自主权提供证据。这样试点才能为扩展、迭代或停止提供依据,而不是依赖标题预测。
想和我们一起界定第一个智能体工作流并做影子测试吗?
预约免费咨询