本文内容
AI MVP 范围模板:验收标准、评测集、上线门槛,以及哪些内容应写进 SoW
为 AI MVP 划定范围与定义完全确定性的工作流不同,因为模型输出可能随模型版本、采样设置、上下文和措辞而变化。"用户可以重置密码"或许能写成精确的通过或失败测试;"助手回答正确"则需要定义任务分布和评分规则。因此,我们建议工作说明书明确四项内容:一个带参考标签或评分量表的版本化评测集、一项目标指标与阈值、一个上线门槛,以及对不确定情形的明确处理与回滚机制。下方附有一份可直接复制的模板。
这是采购起点,不是法律意见,也不是通用质量标准。我们于 2026 年 9 月 2 日重新核对了监管日期和评测指南。
想在与代理机构签约之前对这份范围做一次压力测试吗?
预约免费咨询为什么"它能用"对 AI 不管用
传统软件也使用统计测试、性能测试和基于属性的测试,因此验收并不总是二元的。这里的特殊问题在于,生成式回答可能有多种可接受形式,也可能在不同运行之间变化。对定义好的集合进行测量,在方差重要时重复案例,并准确记录模型和配置。温度设为零可以减少采样方差,但不能保证托管模型每次输出完全相同。对提示词、检索、模型、策略或工具的重大变更执行回归评测,频率应与风险相称。这符合 NIST 在其 AI RMF Measure 指南中关于记录测试集、指标、类似部署的条件、不确定性和持续监控的建议。
AI MVP 的工作说明书必须钉死哪些内容
每一节都得对得起自己的位置。承重的几节是评测集、验收标准和上线门槛。
| 章节 | 它必须钉死什么 |
|---|---|
| 问题 + 一个结果 | 一句话。MVP 必须完成的那一项用户任务。凡不为它服务的,都在范围之外。 |
| 范围内与范围外 | 两份清单。范围外清单才是承重的那一份:把你不打算构建的那些诱人功能(多语言、语音、微调、移动端)点名列出,让它们成为变更请求,而不是默认假设。 |
| 功能 + AI 行为规格 | 常规需求外加 AI 行为:任务、语气、拒答行为(何时必须说"我不知道")、引用要求,以及在低置信度或检索未命中时的回退。这里就是你为不确定情形编码的地方。 |
| 验收标准 | 在一个具名评测集上的目标指标加阈值。绝不能是"它能用"。示例见下。 |
| 评测集 | 如何从预期和可预见用途抽样、如何论证样本量、谁负责参考标签或评分量表,以及如何为案例评分。尽可能使用确定性检查;用人工复核校准模型评审器并记录分歧。 |
| 上线门槛 + 回滚 | 可衡量的上线门槛,由负责的产品、工程、风险和质量人员在上线前共同商定,并包括监控、回滚触发器和终止判据。 |
| 数据 | 来源、出处、使用权、个人数据处理、跨境传输、留存和驻留要求。根据 EDPB 角色指南确定每个供应商是控制者、处理者还是次级处理者,并落实所需合同和指令。不用于训练和留存设置属于具体产品控制,并非 GDPR 的统一措辞。 |
| 非功能性 | 用户感知和端到端延迟、流式交互需要时的 time-to-first-token、每项成功任务的成本、并发、可用性及保护隐私的遥测。核对所选供应商当前的输入、输出、缓存、工具和媒体价格,不要假设固定比例。 |
| 安全与合规 | 认证、授权、租户隔离、威胁模型、事件响应、适用的 GDPR 义务,以及具体系统在 EU AI Act 下的分类和透明度义务。 |
| 里程碑、付款、IP、交接 | 分阶段的探索、构建、评测、加固和上线,并在合同中约定商业条款、IP 条款、第三方许可处理和具名交接产物。 |
验收标准:错与对
正是这一节决定了你能否对供应商有所约束。
错,因为没有数字、没有集合、也没有底线:"聊天机器人正确回答客户的问题"、"助手准确而有帮助"、"模型很少幻觉"、"它在测试中表现良好"。
更好的结构,使用说明性质的占位符,并根据实际风险和工作负载替换为有证据支持的阈值:
- 忠实度目标 [阈值],扎根于检索上下文,按评分量表评分并与人工标签校准;
- 回答相关性目标 [阈值];
- 关键安全失败 [零或明确批准的风险上限],并列明阻止上线的类别;
- 无法回答案例上的拒答或上报 [阈值];
- p95 time-to-first-token 与完整响应预算 [各自在重要之处];
- 商定模型和工作流下每项成功任务的成本 [预算];
- 部署前的评测运行中,任何指标都不低于其底线。
这些字段只是示例,不是行业基准。不存在可辩护的通用评测集规模,也不存在通用的忠实度、有害输出、延迟或成本阈值。应根据使用频率、后果严重性、相关群体覆盖、置信区间以及系统失败时可用的回退方案推导每个数值。NIST 的生成式 AI 配套指南属于自愿性指南,但提供了实用的风险框架。评分方法见LLM 评测何时值得构建。
可直接复制的范围模板
粘贴它,填好方括号,删掉不适用的部分。在你拿到任何一份提案之前就把它传阅一遍。
AI MVP 范围 / SoW,[项目名称]
日期 [日期] · 版本 [v0.1] · 负责人 [姓名]
1. 问题 + 一个结果。 问题:[一句话]。这个 MVP 必须交付的那一个结果:[用户] 能够 [做 X],以便 [Y]。
2. 范围。 范围内:[功能 1]、[功能 2]。范围外,仅限变更请求:[多语言]、[语音]、[微调]、[移动端]。
3. 功能 + AI 行为。 功能:[清单]。AI 行为:任务 [具体做什么]、语气 [简洁,不臆测]、引用 [必须或不得扎根于来源]、拒答 [当超出范围或低置信度时,说"我不知道"或上报]、回退 [备用模型、缓存答案或转交人工]。
4. 验收标准。 在评测集 [名称/版本] 上:[指标] >= [带依据和不确定性的阈值];关键安全失败 [零或定义的风险上限];无法回答案例上的正确拒答或上报 >= [阈值];p95 [延迟指标] < [预算];每项成功任务的成本 < [预算];部署前任何指标均无低于商定底线的重大回归。
5. 评测集。 规模 [N,并说明抽样依据],覆盖 [顺畅路径]、[边缘]、[无法回答]、[对抗]和相关群体案例。参考负责人:[客户方领域专家]。打分:对 [客观字段] 做确定性检查,用带评分量表的模型评审器评估 [质量],并以盲法人工复核进行校准和处理争议案例。存储并版本化于 [位置]。
6. 上线门槛 + 回滚。 当第 4 节的所有底线均达成、并经 [产品] + [工程] + [QA] 签字确认后上线。回滚:若 [指标] 在一个 [窗口] 内跌破 [底线],自动回退。终止判据:若 [忠实度 < X% 或出现任何有害输出],则不发布。
7. 数据。 来源 [清单]、出处与权利 [按来源]、个人数据 [类型、目的、合法依据、留存]、传输和驻留 [要求]。供应商角色 [控制者/处理者/次级处理者],适用时的第 28 条条款,训练使用 [条款],留存 [条款/设置]。
8. 非功能性。 延迟、可用性、并发和成本预算如第 4 节所述。可观测性:仅记录质量、安全和成本所需的最少元数据;除非有充分理由,否则对原始提示词和响应进行脱敏或不予记录;定义访问权限和留存期限;在 [阈值] 告警。
9. 安全 + 合规。 认证 [方法]、权限与租户隔离 [模型]、威胁模型和事件响应、GDPR 义务 [角色、必要时的处理记录、合法依据、可能对权利和自由造成高风险时的 DPIA、处理者条款],以及 EU AI Act 下适用的角色、分类、第 50 条义务和期限。
10. 里程碑 + 付款。 探索、构建、评测与加固、上线,按阶段付款。IP 所有权、转让或许可、第三方组件和生效日期:[合同条款]。交接:评测集与结果、提示词与模型登记表、架构与数据流图、运行手册、日志访问、凭据。签字确认:客户 [__] 供应商 [__] 日期 [__]。

"如果范围无法用数字告诉你足够好长什么样、以及模型出错时会发生什么,那它就不是范围。它只是一个愿望。评测集和上线门槛是把一个 AI 演示变成你真正能够采购之物的那两行字。"
关于 AI Act 的一点说明
第 50 条并非对所有包含 AI 的应用一概适用。对于旨在与自然人直接交互的系统,提供方通常必须告知对方正在与 AI 交互,除非对具有合理信息、观察力和审慎的人而言显而易见,并须考虑法定例外。第 50 条的其他义务涉及合成内容标记和部署方的特定披露。大多数适用义务自 2026 年 8 月 2 日开始;对于此前已上市的合成内容系统,第 50 条第 2 款提供方有至 2026 年 12 月 2 日的过渡期。根据欧盟条例 2026/1744,附件 III 高风险规则自 2027 年 12 月 2 日适用,附件 I 中嵌入产品的高风险规则自 2028 年 8 月 2 日适用。应核对当前合并版 AI Act及自身角色,而不是给所有系统套用同一日期。
常见问题
如何为一项 AI 功能编写验收标准?
什么是评测集?
评测集应归谁所有?
评测案例如何打分?
LLM 应用的上线门槛是什么?
AI 工作说明书里应该包含什么?
为什么我不能在范围里直接写"AI 回答正确"?
AI 出错或不确定时我该如何处理?
AI MVP 的 SoW 需要哪些数据条款?
EU AI Act 会影响我的 AI MVP 范围吗?
最终思考
AI MVP 范围取决于可辩护的评测集和上线门槛。两者共同把含糊的"给我们造个助手"转化为买方可以评估的证据和合同条款。
在接受提案前,先写下结果,划出范围外界线,在由自身领域专家治理的集合上定义有依据的指标和底线,决定模型不确定时的处理方式,并明确上线门槛。先填好模板,才能依据同一组要求比较提案。
想把评测集和上线门槛内置到你的 MVP 范围里吗?
预约免费咨询