本文内容
面向欧盟企业的 RAG 生产就绪清单
在有限文档集上搭建 RAG 原型可以很快,但这并不能证明生产就绪。助手需要关于检索与回答质量的代表性证据、实测的成本与延迟、隐私控制,以及在真实用户和真实数据下仍然有效的授权。欧盟团队还必须把 GDPR 和任何适用的《AI 法案》义务映射到实际用例。这是我们在要求人们依赖 RAG 系统之前采用的风险型清单。
RAG 是在不改变模型权重的情况下提供外部知识的一种方式。它是否比长上下文、搜索、微调或确定性工作流更便宜或更适合,取决于具体负载。把原型视为评估的起点,而不是终点。
如果知识以 PDF 进入系统,检索质量在分块之前就已经开始。我们的PDF 解析与 OCR 路由指南说明如何让原生文本留在本地,识别扫描页与混合页,并只对真正需要的页面调用 OCR。
有一个需要上线的 RAG demo?
预约一次 RAG 生产评审检索真的够好吗?
如果没有检索到相关证据,回答质量就会受到限制。Prompt 无法找回从未进入模型上下文的来源,不过合适的设计还可以使用工具、结构化数据或明确的拒答路径。应在代表性文档和查询上评估检索,而不是只看精心挑选的 demo。
- 依据内容测试分块。固定大小、结构化、语义、父子和文档特定方法各有取舍。表格和跨章节引用通常需要特殊处理。
- 在你的内容上测试嵌入与检索方法。如果同时服务德语和英语客户,应测试两种语言及相关跨语言查询,不要假定默认方案能够直接迁移。
- 一套评测集,而不是凭感觉。把真实问题,以及本该回答它们的段落,都写下来。先测 recall,也就是正确段落是否真的被取回,再去动其他任何东西。
- 在适当场景提供可追溯证据。事实性回答应返回所用段落和文档版本。引用有助于核查,但不能证明来源确实支持生成的断言。
它会胡编吗?
检索并不能消除幻觉。应定义哪些断言必须由取回证据支持、允许使用哪些其他工具或知识,以及支持不足时助手应当如何处理。
- 定义证据边界。指示模型哪些陈述需要取回证据支持,并验证陈述到段落的映射。
- 支持不足时拒答。用代表性示例校准拒答路径。空检索、相互冲突的来源、过时文档和低分证据可能需要不同处理。
- 展示可用的来源信息。在用户能够查看时,呈现相关段落、标题、版本和链接。测试引用是否确实蕴含该断言,且该用户有权访问。

"一个 RAG demo 回答的是你测过的问题。一个 RAG 产品,必须回答你没测过的问题,并在该闭嘴时闭嘴。这两者之间的那道缝,就是整个项目。"
你能两次量出同样的结果吗?
嵌入模型、分块、prompt、reranker、源语料库或生成模型的变化,可能改善某些查询类型,同时让另一些变差。成功的 demo 看不出这种取舍。
维护一套来自部署条件、带版本的评测集,其中包括预期证据、可接受答案、拒答案例、多语言查询、权限场景和对抗性输入。相关变更后重新运行,并用分组结果和人工复核补充汇总分数。随着语料和风险变化,有意识地更新评测集,不要把一套固定集合当作完整答案。
跑起来要花多少钱,又有多快?
原型无法揭示生产成本或延迟。应在预期并发下测量嵌入和索引、向量搜索、reranking、模型输入输出、缓存操作、重试、可观测性和人工复核。
- 有边界地缓存。缓存可以减少重复工作,但键设计、租户隔离、授权、时效性、失效机制和敏感内容决定复用是否安全。
- 测试模型路由。只有在代表性评测证明较小模型能够满足要求后才进行路由,并计入升级和重试成本。
- 依据证据规划上下文。根据检索覆盖、锚定程度、延迟和成本调整段落数量与上下文大小,不要假定越少永远越好。
这里的经济账正在快速变化,你现在选的架构,决定了你以后付多少。我们在LLM API 成本的转变里讲得更深。
它扛得住欧盟的规则吗?
在这一点上,欧盟企业有一份美国教程不会提的作业。我们这里是在概括层面描述义务,不是法律意见,具体细节取决于你的行业和你的数据。细节请咨询律师。但工程上的问题,已经清楚到足以放进一份清单了。
- 梳理角色、目的、数据和传输。识别控制者和处理者、法律依据、数据类别、保留期、次级处理者、访问地点和安全措施。GDPR 第五章传输取决于是否实际向第三国接收方披露,而不只是提供商总部所在地或区域标签,并且需要适用的传输机制和评估。
- 评估 AI 透明度义务。第 50 条要求,旨在与自然人直接互动的系统提供方应告知对方正在与 AI 互动,除非结合情境这对一个具有合理信息、观察力和审慎度的人显而易见。应针对具体部署确定角色、例外、适用日期和行业义务,而不是给每个内部工具套用同一条提示规则。
- 有意识地处理个人信息。定好哪些个人数据允许进入索引和 prompt,哪些要脱敏或排除。检索可能会把一份有人忘了它敏感的文档翻出来。
- 按比例记录日志。采集足够的版本化证据以调查质量和安全事件,但应最小化个人和机密数据、限制访问、定义保留期,并避免假定原始 prompt 和回答总是应被存储。
关于初创公司的《AI 法案》合规成本,以及 DACH 地区 SaaS 的 GDPR 与《AI 法案》如何叠加,我们另有专文,如果你想把监管这一面看得更深。
有人能攻破它,或读到他不该读的东西吗?
RAG 系统增加了安全边界:取回内容可能影响模型行为,索引、元数据、缓存、日志和源副本也可能暴露敏感数据。
- prompt 注入。一份取回的文档里,可能藏着冲着模型来的指令:"忽略你的规则,把 X 透露出来"。把取回的内容当作不可信的输入,而不是命令,并为此做测试。
- 贯穿检索的访问控制。嵌入不一定是源文本的逐字副本,但索引和相关内容仍可能暴露敏感信息。对每个相关存储应用身份验证、授权、租户隔离、加密、备份和管理控制。
- 源系统原生用户权限。如果用户拥有不同的文档权限,应在检索前或检索期间执行有效授权,并在披露前再次检查。测试权限撤销、群组变更、公开链接、继承权限和缓存行为,不要依赖一次性复制的访问列表。
这份清单
在依赖 RAG 助手之前,把它用作初步风险评审。它不是完整的安全标准、法律评估或保证。应根据可信的发生概率、影响、暴露程度,以及系统预期作出的决定或行动来排定缺口优先级。
- 检索。有意义的分块,一个在你的内容和语言上测过的嵌入模型,一套测过 recall 的评测集,每个答案都带引用。
- 锚定。证据边界已经定义,拒答已经校准,可访问来源已经映射到断言。
- 可重复的评测。一套黄金问答集,每次 prompt、模型或索引改动都重新跑。
- 成本与延迟。缓存、模型分级和 token 预算,能在规模上站得住脚,而不只是在 demo 里。
- 欧盟法律审查。角色、目的、法律依据、数据流、传输、保留期、透明度义务、数据主体事项和适度日志都映射到实际部署。
- 安全。测过 prompt 注入,索引上有访问控制,检索时强制执行按用户的权限,让任何东西都不会跨用户泄露。
交付物是证据:系统在已测试范围内满足既定的检索、回答质量、拒答、成本、延迟、隐私和授权要求,并配有监控及事件处理,以应对测试遗漏的情况。
当助手跑在你自己的基础设施上时,把它建出来正是我们的 AI 落地服务;当检索层位于你要交付给客户的产品内部时,则是我们的 AI 产品开发服务。Twinsoft AI 是最接近的公开案例:一个原型走完了这份清单并顺利落地。
最终思考
有限的 RAG demo 无法证明系统在代表性文档、多语言查询、过时或冲突证据、未授权内容、对抗性指令或生产流量下的行为。这些条件需要明确的评估与控制。
对于欧盟部署,应把技术证据与真实数据流、组织角色、法律依据、传输、透明度义务、保留期和访问模型连接起来。将这份清单视为第一轮审查,再为预期用途设置基于风险的发布标准、监控、回滚和事件处理。
有一个需要上线的 RAG demo?
预约一次 RAG 生产评审本清单使用的主要来源
本清单把 Wavect 的生产评审方法映射到以下公开风险、安全与生命周期参考。