面向 LLM 的假名化网关:提示词真的脱离 GDPR 适用范围了吗?
假名化网关不会让你脱离 GDPR 适用范围。它最多只能让模型供应商脱离,而这是一个窄得多、并且需要你拿出证据的主张。这一品类都在兜售同一个隐含承诺:让提示词先过一遍假名化,把它发给托管模型就不再是数据保护问题。从 2025 年 9 月 4 日起,这个承诺有了精确的法律形态,而这个形态比营销话术更有用,因为它明确告诉采购方需要收集哪些证据。
那一天,欧盟法院在C-413/23 P 号案件(EDPS 诉 SRB)中认定,假名化数据不应在一切情形下、对每一个人都被视为个人数据。请仔细读后半句。同一份数据可以对你仍是个人数据,而对接收方不再是。你的义务不会移动,接收方的地位则可能移动,前提是事实站得住。
本文处理的是采购方的问题:买来的假名化平台会改变你的法律地位中的哪一部分,以及在依赖它之前你需要哪些证据。提示词前的 PII 脱敏指南负责讲如何用 Presidio、Privacy Filter 或托管 DLP 构建检测与占位符层;欧盟数据驻留指南负责讲模型本身跑在哪里;GDPR 与欧盟人工智能法叠加指南负责讲 DACH 产品团队必须交付的合规产物清单。资料核实于 2026 年 8 月 18 日。
在签署 AI 平台合同之前需要一份完整的证据包吗?
预约 AI 架构评审什么是面向 LLM 的假名化网关?
它是位于用户与一个或多个托管模型之间的控制点,出站时把可识别值替换为占位符,回程时再把它们还原。机制只有三步,这一品类的每个产品实现的都是这三步。
- 检测并替换。姓名、地址、客户编号、账户标识以及正文中的提及都会被找出来,换成带类型的占位符。
- 调用模型。带占位符的提示词发往供应商。供应商永远看不到原始值,只看到 token。
- 还原。响应返回后,占位符映射回原始值,用户看到的是一条完整答案。
各家产品的差别在于封装方式,而不在机制。有的卖一套 API,让你放在自有应用前面;有的卖一个内置网关的成品聊天产品。Pryvet 是这一品类中的一家德国平台,适合当作样本,因为它公开的细节足以供人核查。其公开定价页起价为每用户每月 29 欧元,配额从十名员工起,并按服务器所在地把可选模型分为德国、欧洲和美国三组,GPT-5.2、Gemini 2.5 Pro、Claude Opus 4.7 与阿里 Qwen 都在第三组。其信任中心列出了背后的次级处理者,基础设施侧包括 T-Systems、Microsoft Azure、AWS、MongoDB Atlas 和 Auth0,模型侧包括 Anthropic、OpenAI、Google、Mistral、DeepSeek 和阿里 Qwen。
按服务器所在地分组,是这一品类任何一家供应商页面上最诚实的一处,也正是下文法律分析重要的原因。网关是控制手段,目的地依然是你逐次请求作出的选择,而美国托管的目的地,对真正离开你机房的内容而言,仍然构成第五章意义上的跨境传输。
独立性与商标声明: 本页由 Wavect 发布,Wavect 自身也是服务商,因此我们对本页存在商业利益。我们与本页提及的其他公司没有关联,未获得其背书,也不是其合作伙伴;所有第三方公司名称、品牌与商标均归各自所有者所有。关于其他服务商的陈述来自公开可查的来源,主要是其自己发布的页面,以本页标注的核查日期为准,此后可能已经发生变化。做决定前请自行直接核实。本页依据我们所知的情况撰写,并力求保持客观。如果你认为其中有不准确或不公平之处,请写信告诉我们,我们会更正: [email protected]
| 这一层能做到的 | 它做不到的 |
|---|---|
| 把供应商收到的数据压缩为带占位符的文本 | 让你脱离控制者角色或任何一项控制者义务 |
| 给你一个统一执行点,管住日志、留存与模型选择 | 在 GDPR 意义上替你完成匿名化 |
| 让误粘贴一条客户记录的后果没那么严重 | 阻止自由文本提示词通过上下文单独锁定某个人 |
| 可以作为补充措施支撑传输影响评估 | 替代传输机制本身 |
| 生成一条数据保护官真正读得懂的审计轨迹 | 覆盖附件、截图或语音,除非供应商明确说明 |
假名化能让提示词脱离 GDPR 适用范围吗?
对你不能,这一点没有争议。GDPR 第 4 条第 5 项把假名化定义为:处理之后,若无附加信息即不能再归属到某个数据主体,且该附加信息被单独保存。这个定义的前提就是附加信息仍然存在。如果它不存在,你就无法还原答案,产品也就不成立。
EDPB《2025 年第 01 号假名化指南》在第 22 段说得很直接:只要借助附加信息仍可归属到自然人,假名化数据就是个人数据,并且"即使假名化数据与附加信息不在同一方手中"也同样成立。事后删除映射同样不能追溯生效。指南写明,只有在满足匿名化条件时数据才成为匿名数据,而那是另一条高得多的门槛。
欧盟法院在 2025 年补上的,是接收方这一半。可识别性要按主体、按情境逐一判断,因此同样的字节,对持有密钥的一方是个人数据,对现实中拿不到密钥的一方则可能不是。法院在同一份判决中也确认了这一思路的边界:你告知数据主体接收方的义务,要以收集时点、并以你自己的视角来判断,也就是在任何假名化之前。
| 相关方 | 提示词对其是否为个人数据 | 由此产生的后果 |
|---|---|---|
| 你,也就是部署方企业 | 永远是。映射由你持有或控制 | 完整的控制者义务:法律依据、告知、留存、必要时的 DPIA、处理记录 |
| 网关供应商 | 若其持有或可触及映射,则是 | 第 28 条意义上的处理者,需签署数据处理协议并公开次级处理者清单 |
| 模型供应商 | 视事实而定,可能不是 | 这是网关真正能够改变的唯一环节,而且必须有证据 |
| 供应商所在国的公权力机关 | 需单独评估 | 下文 EDPB 的检验标准正是为这一主体而写 |
任何引用这一判决的备忘录都应写上两点限制。法院撤销了普通法院的判决并将案件发回重审,因此诉讼尚未终结。而 EDPB 指南带有"Adopted - version for public consultation"的标注,于 2025 年 1 月 16 日通过,公开征询在 2025 年 2 月 28 日截止。二者都是今天可得的最佳依据,但都不是定论,基于它们作出的结论必须标注复核日期。
要让模型供应商落在适用范围之外,你得证明什么?
EDPB 已经把检验标准写好了,而绝大多数采购方从未读过。指南第 63 至 68 段描述了假名化在跨境传输中作为补充措施何时有效。三个条件必须同时成立。
| EDPB 条件 | 对一次 LLM API 调用意味着什么 | 难度 |
|---|---|---|
| 归属需要接收国公权力机关既不持有、也无法以合理努力获取的附加信息 | 映射绝不能随提示词一起传输,也不能从提示词中推导出来 | 设计上可以做到,也是这一品类每家供应商本来就在宣称的一点 |
| 附加信息由出口方独占持有,或由欧洲经济区内、抑或保护水平实质相当的司法辖区内的可信实体持有,并单独保存 | 要问清映射存储物理上位于何处、由谁运营,以及是否有母公司在美国的次级处理者能够触及 | 合同与架构上可核查,往往正是这个问题改变结论 |
| 这些机关无法在与某个群体互动的过程中,凭假名化数据加上可合理获取的信息单独锁定某个数据主体 | 提示词文本本身不得把候选范围收窄到一个人 | 最难的一条,也是下一节存在的理由 |
第 70 段还补充了一条即使不涉及跨境也适用的规则:在向第三方传输假名化数据之前,至少要识别该接收方可用于归属的手段。对前沿模型供应商而言,这意味着要明确说明该供应商已经掌握了什么(包括你其余的流量),以及它在自己一侧保存多久。一个压缩了提示词、却在元数据里留下稳定用户标识的网关,并没有通过这项检验。
为什么自由文本会击穿字段级假名化
替换姓名很容易,防止一段提示词精确描述出某一个人则不然。"不得被单独锁定"这一条件在实践中就是在这里破的,而相关证据对整个品类都不太好看。
苏黎世联邦理工学院的研究者在《Beyond Memorization: Violating Privacy Via Inference with Large Language Models》中证明,当前模型能从普通文本推断出居住地、收入、性别等个人属性,top-1 准确率最高可达 85%,top-3 可达 95%,成本约为人工的百分之一,耗时约为人工的二百四十分之一。攻击面不是姓名字段,而是行文本身。
EDPB 从另一个方向预判了同一个问题。指南第 21 段指出,你控制范围之外的信息,"例如来自社交媒体或在线论坛帖子等可公开获取来源的信息",同样会促成归属,必须纳入你对假名化有效性的评估。
在真实提示词中,能挺过一轮扎实字段处理的残留,通常长这样。
- 角色加机构加事件。"我们那位三月到因斯布鲁克站点上任的临时财务负责人",一个具名实体都没有,却已锁定了一个人。
- 罕见组合。一个诊断、一个邮编、一个年龄区间。单看都不是姓名,合起来就是一个人。
- 引用的往来邮件。即便去掉邮件头,写作风格、称呼习惯和内部简称仍会随粘贴的邮件一起传出去。
- 附件与截图。只解析结构化文本的网关,可能原样放行一张图片。这一点要明确追问,因为屏幕内容无法像表单字段那样打码。
- 检索上下文。如果助手使用 RAG,被检索到的片段同样是提示词内容。带权限的检索是另一项独立控制,见我们的 RAG 权限指南。
这些都不意味着网关没用,只意味着结论取决于你的语料。一条"三楼打印机卡纸了"的工单可以干净地假名化,一段人力资源申诉记录则不行,再强的占位符工程也改不了。诚实的架构决策是把第二类流量改道,而不是去买一个更强的检测器。
生产级 AI 支持
正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。
查看相关服务:
向假名化平台供应商提出的八个问题
按"答案改变决策的频率"排序,而不是按它们在安全问卷中的位置。底层的通用部分见我们的AI 供应商安全问卷。
- 映射存在哪里,谁能读?请说明司法辖区、运营方和访问路径。EDPB 的条件是独占持有,所以"我们的云"不算答案,"德国某超大规模云厂商的区域"也只有在你知道密钥归谁掌管之后才算。
- 假名化是默认开启,还是套餐功能?这个问题值得对每个产品都问一遍。以 Pryvet 公开的功能矩阵为例,Professional 套餐把个人数据的自动删除与假名化列为可选,Enterprise 套餐则加上敏感数据和可选的自定义规则集。一项可以被关掉的控制,必须由你的制度在别处兜住。
- 这次请求用哪个模型、在哪个国家?允许用户自行挑选美国托管模型的平台,等于把跨境传输的决定权交给了用户。先决定这是否可接受,然后用配置去执行,而不是靠培训。
- 除了提示词,你们还发送什么?租户标识、用户标识、会话标识和系统提示词都会一并传出。仅仅一个稳定的用户标识,就足以推翻"不得被单独锁定"的条件。
- 你们和模型供应商各自保留什么?请对方以书面形式给出每家供应商的留存设置,并说明聊天记录被删除时映射存储会发生什么。
- 检测范围包含什么,什么会直接放行?结构化字段、自由文本、表格、PDF、图片、音频。请索取德语复合词以及奥地利、瑞士格式上的漏检率,而不是一个英语基准。
- 谁是处理者,协议里到底怎么写?第 28 条合同、当前次级处理者清单、变更通知期限和审计权。像 Pryvet 那样公开清单是及格线,不是差异化优势。
- 你们能给我哪些可以归档的证据?传输影响评估的输入材料、假名化域的架构说明,以及最近一次渗透测试的结果。供应商拿不出来,就得由你自己写,这部分成本应当计入比较。
无论买哪个平台,都留在你身上的责任
下表中的每一项义务都会在采购之后继续存在。供应商在这件事上并没有欺瞒,只是采购方常把合规标识读成责任转移,而它从来不是。
| 义务 | 为什么网关无法吸收它 |
|---|---|
| 控制者角色与法律依据 | 目的和方式由你决定。假名化是第 25 条和第 32 条意义上的措施,不是法律依据 |
| 收集时的告知义务 | 欧盟法院是以控制者视角、在任何假名化之前来评估它的 |
| 高风险处理下的 DPIA | 风险降低是评估的输入项,而不是评估的替代品 |
| 传输机制与传输影响评估 | 假名化是叠加在第 46 条保障之上的补充措施,不能取而代之 |
| 处理活动记录与留存 | 聊天历史就是处理。定好期限,并让平台去执行 |
| 已经生效的欧盟人工智能法义务 | 第 4 条的 AI 素养义务现在就适用,透明度义务自 2026 年 8 月 2 日起。见我们的第 50 条清单 |
| 一条员工真能遵守的内部规则 | 只有团队真的走网关,控制才成立。我们的一页纸 AI 制度是能站得住的最短版本 |
买网关、换模型,还是干脆不把数据放进去?
四个选项,网关只在其中一个区间是最优解。其余方案的成本测算见我们的自建部署成本分析和内部 AI 助手成本拆解。
| 选项 | 什么时候它最优 | 代价是什么 |
|---|---|---|
| 根本不发送个人数据 | 任务是起草、总结公开材料或写代码。内部 AI 的大部分价值都在这里 | 范围纪律加一条路由规则。目前为止最便宜的控制 |
| 假名化网关加托管模型 | 流量混杂、临时用户多,而且你想尽快拿到一个统一执行点 | 按席位授权费、残留的单独锁定风险,以及上文那套证据工作 |
| 由合同锁定的欧盟处理区域提供服务的模型 | 数据本身是个人数据,提示词天然具有识别性 | 可选模型更少,在最难的任务上存在真实的能力差距,还要额外核实处理区域而不是供应商的注册地 |
| 自建的开放权重模型 | 高并发、受监管行业,或者根本不能外发的数据 | GPU 支出,加上工程投入的时间下限,后者最常被低估 |
第三行写的是处理区域而不是国籍,这是刻意为之。供应商的注册地只说明它受哪国公司法管辖,并不说明某一次请求在哪里被处理,欧洲供应商同样可以把推理放在第三国区域或第三国云上运行。把区域写进合同,按模型、按端点逐一锁定,并要求书面确认它不会静默切换到别处。一个没有写明处理地点的欧洲品牌,留给你的正是你原本想避开的第五章跨境传输问题。
实践中好的答案通常是其中两项的组合:一条硬性规则,让大多数工作永远不携带个人数据,再加一条受治理的通道来承接确实携带的那部分。我们在 PromptID 就是这么搭的:模型无关的调用统一走一层编排,于是供应商成了一项配置决策,而不是架构承诺。如果你还在平台采购与自研之间摇摆,我们的定制软件与现成软件对比指南是这个决策的中立版本。
为期两周的证据型试点
不要用演示来评估这一品类。用你自己最棘手的提示词来评估,并以一份可以交给数据保护官的档案收尾。
- 从真实流量中构建 200 条提示词语料,向难看的场景倾斜:人力资源、法务、支持升级,以及一切带附件的内容。
- 做单独锁定测试。把假名化后的输出交给一个强模型,让它描述是谁写的、写的是谁。统计有多少次候选范围收窄到十人以下。
- 按类别测量漏检率,德国、奥地利、瑞士格式分开统计,自由文本与结构化字段也分开统计。
- 测量任务质量差值。占位符会改变答案。同一批任务在有网关和无网关两种条件下各评一次,因为没人使用的合规助手不构成控制。
- 记录经网关与直连的每请求时延与成本。这一品类中两次模型往返很常见。
- 用一页纸写清映射存储的架构:位置、运营方、访问、留存、删除。这就是你的假名化域,也是 EDPB 检验标准实际打分的那份文件。
- 确定能挺过试点的路由规则:哪些类别的提示词走网关,哪些走欧盟托管模型,哪些永远不出门。
假名化与 LLM 提示词常见问题
假名化数据在 GDPR 下仍然是个人数据吗?
假名化网关能让 LLM 合规吗?
假名化可以取代标准合同条款吗?
欧盟法院在 EDPS 诉 SRB 案中判了什么?
假名化和匿名化是一回事吗?
占位符会降低回答质量吗?
假名化网关应该花多少钱?
最终思考
把假名化网关当作它本来的样子:一项不错的工程控制,一面很弱的法律盾牌。它给了你一个统一执行模型选择、留存与日志的位置,也让误粘贴变得可以承受。它不会把你变成一个责任更小的控制者,只有当你的提示词真的不再让人被单独锁定时,它才能把模型供应商移出适用范围,而那取决于你的文本,而不是供应商的检测器。为那个执行点而买它,用你最棘手的提示词去测它,把映射存储的架构写在一页纸上,并把无法去标识化的流量放在一条本来就不需要网关的通道上。
