返回
Kevin Riedl

13 min 阅读 · 12 Jun 2026
最近审核

下一篇
图片在你的设备上生成,不连接 Instagram。文章链接会复制到剪贴板,供链接贴纸使用。

AI MVP 范围模板:验收标准、评测集、上线门槛,以及哪些内容应写进 SoW

为 AI MVP 划定范围与定义完全确定性的工作流不同,因为模型输出可能随模型版本、采样设置、上下文和措辞而变化。"用户可以重置密码"或许能写成精确的通过或失败测试;"助手回答正确"则需要定义任务分布和评分规则。因此,我们建议工作说明书明确四项内容:一个带参考标签或评分量表的版本化评测集、一项目标指标与阈值、一个上线门槛,以及对不确定情形的明确处理与回滚机制。下方附有一份可直接复制的模板。

这是采购起点,不是法律意见,也不是通用质量标准。我们于 2026 年 9 月 2 日重新核对了监管日期和评测指南。

想在与代理机构签约之前对这份范围做一次压力测试吗?

 预约免费咨询

为什么"它能用"对 AI 不管用

传统软件也使用统计测试、性能测试和基于属性的测试,因此验收并不总是二元的。这里的特殊问题在于,生成式回答可能有多种可接受形式,也可能在不同运行之间变化。对定义好的集合进行测量,在方差重要时重复案例,并准确记录模型和配置。温度设为零可以减少采样方差,但不能保证托管模型每次输出完全相同。对提示词、检索、模型、策略或工具的重大变更执行回归评测,频率应与风险相称。这符合 NIST 在其 AI RMF Measure 指南中关于记录测试集、指标、类似部署的条件、不确定性和持续监控的建议。

AI MVP 的工作说明书必须钉死哪些内容

每一节都得对得起自己的位置。承重的几节是评测集、验收标准和上线门槛。

章节它必须钉死什么
问题 + 一个结果一句话。MVP 必须完成的那一项用户任务。凡不为它服务的,都在范围之外。
范围内与范围外两份清单。范围外清单才是承重的那一份:把你不打算构建的那些诱人功能(多语言、语音、微调、移动端)点名列出,让它们成为变更请求,而不是默认假设。
功能 + AI 行为规格常规需求外加 AI 行为:任务、语气、拒答行为(何时必须说"我不知道")、引用要求,以及在低置信度或检索未命中时的回退。这里就是你为不确定情形编码的地方。
验收标准在一个具名评测集上的目标指标加阈值。绝不能是"它能用"。示例见下。
评测集如何从预期和可预见用途抽样、如何论证样本量、谁负责参考标签或评分量表,以及如何为案例评分。尽可能使用确定性检查;用人工复核校准模型评审器并记录分歧。
上线门槛 + 回滚可衡量的上线门槛,由负责的产品、工程、风险和质量人员在上线前共同商定,并包括监控、回滚触发器和终止判据。
数据来源、出处、使用权、个人数据处理、跨境传输、留存和驻留要求。根据 EDPB 角色指南确定每个供应商是控制者、处理者还是次级处理者,并落实所需合同和指令。不用于训练和留存设置属于具体产品控制,并非 GDPR 的统一措辞。
非功能性用户感知和端到端延迟、流式交互需要时的 time-to-first-token、每项成功任务的成本、并发、可用性及保护隐私的遥测。核对所选供应商当前的输入、输出、缓存、工具和媒体价格,不要假设固定比例。
安全与合规认证、授权、租户隔离、威胁模型、事件响应、适用的 GDPR 义务,以及具体系统在 EU AI Act 下的分类和透明度义务。
里程碑、付款、IP、交接分阶段的探索、构建、评测、加固和上线,并在合同中约定商业条款、IP 条款、第三方许可处理和具名交接产物。

验收标准:错与对

正是这一节决定了你能否对供应商有所约束。

,因为没有数字、没有集合、也没有底线:"聊天机器人正确回答客户的问题"、"助手准确而有帮助"、"模型很少幻觉"、"它在测试中表现良好"。

更好的结构,使用说明性质的占位符,并根据实际风险和工作负载替换为有证据支持的阈值:

  • 忠实度目标 [阈值],扎根于检索上下文,按评分量表评分并与人工标签校准;
  • 回答相关性目标 [阈值];
  • 关键安全失败 [零或明确批准的风险上限],并列明阻止上线的类别;
  • 无法回答案例上的拒答或上报 [阈值];
  • p95 time-to-first-token 与完整响应预算 [各自在重要之处];
  • 商定模型和工作流下每项成功任务的成本 [预算];
  • 部署前的评测运行中,任何指标都不低于其底线。

这些字段只是示例,不是行业基准。不存在可辩护的通用评测集规模,也不存在通用的忠实度、有害输出、延迟或成本阈值。应根据使用频率、后果严重性、相关群体覆盖、置信区间以及系统失败时可用的回退方案推导每个数值。NIST 的生成式 AI 配套指南属于自愿性指南,但提供了实用的风险框架。评分方法见LLM 评测何时值得构建

可直接复制的范围模板

粘贴它,填好方括号,删掉不适用的部分。在你拿到任何一份提案之前就把它传阅一遍。

AI MVP 范围 / SoW,[项目名称]
日期 [日期] · 版本 [v0.1] · 负责人 [姓名]

1. 问题 + 一个结果。 问题:[一句话]。这个 MVP 必须交付的那一个结果:[用户] 能够 [做 X],以便 [Y]。

2. 范围。 范围内:[功能 1]、[功能 2]。范围外,仅限变更请求:[多语言]、[语音]、[微调]、[移动端]。

3. 功能 + AI 行为。 功能:[清单]。AI 行为:任务 [具体做什么]、语气 [简洁,不臆测]、引用 [必须或不得扎根于来源]、拒答 [当超出范围或低置信度时,说"我不知道"或上报]、回退 [备用模型、缓存答案或转交人工]。

4. 验收标准。 在评测集 [名称/版本] 上:[指标] >= [带依据和不确定性的阈值];关键安全失败 [零或定义的风险上限];无法回答案例上的正确拒答或上报 >= [阈值];p95 [延迟指标] < [预算];每项成功任务的成本 < [预算];部署前任何指标均无低于商定底线的重大回归。

5. 评测集。 规模 [N,并说明抽样依据],覆盖 [顺畅路径]、[边缘]、[无法回答]、[对抗]和相关群体案例。参考负责人:[客户方领域专家]。打分:对 [客观字段] 做确定性检查,用带评分量表的模型评审器评估 [质量],并以盲法人工复核进行校准和处理争议案例。存储并版本化于 [位置]。

6. 上线门槛 + 回滚。 当第 4 节的所有底线均达成、并经 [产品] + [工程] + [QA] 签字确认后上线。回滚:若 [指标] 在一个 [窗口] 内跌破 [底线],自动回退。终止判据:若 [忠实度 < X% 或出现任何有害输出],则不发布。

7. 数据。 来源 [清单]、出处与权利 [按来源]、个人数据 [类型、目的、合法依据、留存]、传输和驻留 [要求]。供应商角色 [控制者/处理者/次级处理者],适用时的第 28 条条款,训练使用 [条款],留存 [条款/设置]。

8. 非功能性。 延迟、可用性、并发和成本预算如第 4 节所述。可观测性:仅记录质量、安全和成本所需的最少元数据;除非有充分理由,否则对原始提示词和响应进行脱敏或不予记录;定义访问权限和留存期限;在 [阈值] 告警。

9. 安全 + 合规。 认证 [方法]、权限与租户隔离 [模型]、威胁模型和事件响应、GDPR 义务 [角色、必要时的处理记录、合法依据、可能对权利和自由造成高风险时的 DPIA、处理者条款],以及 EU AI Act 下适用的角色、分类、第 50 条义务和期限。

10. 里程碑 + 付款。 探索、构建、评测与加固、上线,按阶段付款。IP 所有权、转让或许可、第三方组件和生效日期:[合同条款]。交接:评测集与结果、提示词与模型登记表、架构与数据流图、运行手册、日志访问、凭据。签字确认:客户 [__] 供应商 [__] 日期 [__]。

Kevin Riedl

"如果范围无法用数字告诉你足够好长什么样、以及模型出错时会发生什么,那它就不是范围。它只是一个愿望。评测集和上线门槛是把一个 AI 演示变成你真正能够采购之物的那两行字。"

关于 AI Act 的一点说明

第 50 条并非对所有包含 AI 的应用一概适用。对于旨在与自然人直接交互的系统,提供方通常必须告知对方正在与 AI 交互,除非对具有合理信息、观察力和审慎的人而言显而易见,并须考虑法定例外。第 50 条的其他义务涉及合成内容标记和部署方的特定披露。大多数适用义务自 2026 年 8 月 2 日开始;对于此前已上市的合成内容系统,第 50 条第 2 款提供方有至 2026 年 12 月 2 日的过渡期。根据欧盟条例 2026/1744,附件 III 高风险规则自 2027 年 12 月 2 日适用,附件 I 中嵌入产品的高风险规则自 2028 年 8 月 2 日适用。应核对当前合并版 AI Act及自身角色,而不是给所有系统套用同一日期。

常见问题

如何为一项 AI 功能编写验收标准?
不要写成"它能用。"应在具名且版本化的评测集上定义目标指标和有依据的阈值,并加入阻止上线的安全类别、拒答或上报行为、延迟与成本预算以及回归规则。在输出方差重要时重复运行并记录不确定性,不要照搬通用数字。
什么是评测集?
一个版本化且有明确负责人的样本,覆盖预期、边缘、无法回答、对抗和相关群体案例,并带有参考标签或评分量表。不存在通用最小规模。应针对决策和风险论证覆盖范围与不确定性,并用生产故障持续扩充。
评测集应归谁所有?
你这一方的领域专家,而非供应商一家。知道正确答案长什么样的那个人必须定义黄金答案,否则你就是在让构建方批改自己的作业。
评测案例如何打分?
将日期、ID、JSON 结构等客观字段的确定性代码检查,与需要判断时的基于评分量表的模型评审和人工复核结合起来。用盲法人工标签校准模型评审器,记录分歧,并将有争议或后果重大的案例交给人工。
LLM 应用的上线门槛是什么?
决定能否上线的可衡量门槛:系统在商定评测集上必须满足的阈值和阻止条件,并由产品、工程、风险和质量责任人签字确认。它还定义监控、回滚触发器和终止判据。
AI 工作说明书里应该包含什么?
问题与一个结果、范围内与范围外、功能需求外加 AI 行为规格(语气、拒答、引用、回退)、作为评测集上指标加阈值的验收标准、评测集本身、上线门槛与回滚、数据权利及 PII 与驻留、非功能性(延迟、每次动作成本、日志记录)、安全与合规,以及里程碑、付款、IP 和交接产物。
为什么我不能在范围里直接写"AI 回答正确"?
因为生成式回答可能有多种可接受形式,也可能在不同运行或模型版本之间变化。你需要定义好的集合、评分规则和底线,否则就没有客观内容可签字确认,质量糟糕时也无从争议。
AI 出错或不确定时我该如何处理?
明确拒答、上报或回退路径,并用无法回答和含糊案例进行测试。根据后果严重性和可用的人工复核设定阈值,不要照搬通用百分比。
AI MVP 的 SoW 需要哪些数据条款?
记录出处与使用权、个人数据目的和合法依据、留存、传输与驻留要求、供应商角色、适用时的处理者条款、训练用途、安全控制、删除和审计权。模型提供方可能是处理者或次级处理者,取决于合同链条。
EU AI Act 会影响我的 AI MVP 范围吗?
可能会,取决于系统、角色和使用场景。适用的第 50 条义务通常自 2026 年 8 月 2 日开始,附件 III 高风险规则自 2027 年 12 月 2 日适用,附件 I 产品内嵌高风险规则自 2028 年 8 月 2 日适用。应对系统进行分类并核对合并版法律。

最终思考

AI MVP 范围取决于可辩护的评测集和上线门槛。两者共同把含糊的"给我们造个助手"转化为买方可以评估的证据和合同条款。

在接受提案前,先写下结果,划出范围外界线,在由自身领域专家治理的集合上定义有依据的指标和底线,决定模型不确定时的处理方式,并明确上线门槛。先填好模板,才能依据同一组要求比较提案。

想把评测集和上线门槛内置到你的 MVP 范围里吗?

 预约免费咨询

生产级 AI 支持

正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。

查看相关服务:

只收重要内容

关注与你相关的内容

每当我们发布新文章,你会收到一封简短邮件。你可以关注整个博客,也可以只选感兴趣的主题。

你希望接收哪些内容?
选择主题

免费、双重确认、不使用跟踪像素。

返回
Kevin Riedl

13 min 阅读 · 12 Jun 2026
最近审核

下一篇

获取下一篇关于产品与 MVP的一线笔记

有新文章时发送一封简短邮件,不使用跟踪像素,也不发送填充内容。

免费、双重确认、不使用跟踪像素。