Pasarelas de seudonimización para LLM: ¿el prompt sale del ámbito del RGPD?
Una pasarela de seudonimización no te saca del ámbito del RGPD. En el mejor de los casos saca al proveedor del modelo, y esa es una afirmación mucho más estrecha que tienes que poder demostrar. La categoría vende una promesa implícita: haz pasar el prompt por el seudonimizador y enviarlo a un modelo alojado deja de ser un problema de protección de datos. Desde el 4 de septiembre de 2025 esa promesa tiene una forma jurídica precisa, y esa forma resulta más útil que el marketing, porque te dice exactamente qué pruebas debe reunir un comprador.
Ese día el Tribunal de Justicia declaró, en el asunto C-413/23 P, SEPD contra JUR, que los datos seudonimizados no deben considerarse datos personales en todos los casos y para toda persona. Lee con cuidado la segunda mitad de esa frase. Los datos pueden seguir siendo personales para ti y dejar de serlo para el destinatario. Tus obligaciones no se mueven. La situación del destinatario sí puede moverse, si los hechos lo respaldan.
Esta página cubre la pregunta del comprador: qué cambia una plataforma de seudonimización comprada en tu posición jurídica y qué pruebas necesitas antes de apoyarte en ella. Nuestra guía de redacción de PII antes del prompt cubre cómo construir la capa de detección y marcadores con Presidio, Privacy Filter o DLP gestionado. Nuestra guía de residencia de datos en la UE cubre dónde se ejecuta el modelo, y nuestra guía de RGPD y Reglamento de IA cubre la lista de artefactos que un equipo de producto en DACH debe entregar. Fuentes revisadas el 18 de agosto de 2026.
¿Necesitas el expediente de pruebas antes de firmar un contrato de plataforma de IA?
Reserva una revisión de arquitectura de IA¿Qué es una pasarela de seudonimización para LLM?
Es un punto de control situado entre tus usuarios y uno o varios modelos alojados, que sustituye los valores identificativos por marcadores en la ida y los restituye en la vuelta. El mecanismo tiene tres pasos, y todos los productos de la categoría implementan los mismos tres.
- Detectar y sustituir. Nombres, direcciones, números de cliente, identificadores de cuenta y menciones en texto libre se localizan y se cambian por marcadores tipados.
- Llamar al modelo. El prompt con marcadores va al proveedor. El proveedor nunca ve los valores originales, solo los tokens.
- Restituir. Llega la respuesta, los marcadores se asignan a los valores originales y la persona usuaria ve una respuesta completa.
Los productos se diferencian en el empaquetado, no en el mecanismo. Algunos venden una API que colocas delante de tu propia aplicación. Otros venden un producto de chat terminado con la pasarela dentro. Pryvet, una plataforma alemana de esta categoría, sirve bien como ejemplo porque publica suficiente detalle para poder inspeccionarlo. Su página pública de precios parte de 29 euros por usuario y mes con contingentes desde diez empleados, y agrupa los modelos seleccionables por ubicación de servidor en alemanes, europeos y estadounidenses, con GPT-5.2, Gemini 2.5 Pro, Claude Opus 4.7 y Alibaba Qwen en el tercer grupo. Su centro de confianza enumera los subencargados que hay detrás, incluidos T-Systems, Microsoft Azure, AWS, MongoDB Atlas y Auth0 en infraestructura, y Anthropic, OpenAI, Google, Mistral, DeepSeek y Alibaba Qwen en modelos.
Esa agrupación por ubicación de servidor es lo más honesto que hay en cualquier página de proveedor de esta categoría, y es la razón por la que importa el análisis jurídico que sigue. La pasarela es el control. El destino sigue siendo una decisión que tomas por petición, y un destino alojado en Estados Unidos sigue siendo una transferencia del capítulo V de todo lo que realmente sale de tu casa.
Independencia y marcas: Wavect publica esta página y es también un proveedor, así que tenemos un interés comercial en ella. No estamos afiliados a las demás empresas nombradas aquí, no contamos con su respaldo y no somos socios suyos, y todos los nombres de empresa, marcas y marcas registradas de terceros pertenecen a sus respectivos titulares. Las afirmaciones sobre otros proveedores proceden de fuentes públicamente accesibles, sobre todo de sus propias páginas publicadas, en la fecha de revisión indicada en esta página, y pueden haber cambiado desde entonces. Verifícalas directamente antes de decidir. Esta página se ha redactado según nuestro leal saber y entender, con la intención de mantenernos objetivos. Si crees que algo aquí es inexacto o injusto, escríbenos y lo corregimos: [email protected]
| Lo que hace la capa | Lo que no hace |
|---|---|
| Reduce los datos que recibe el proveedor a texto con marcadores | Sacarte del rol de responsable o de cualquier obligación |
| Te da un único punto de aplicación para registro, conservación y elección de modelo | Anonimizar los datos, en el sentido del RGPD, por ti |
| Hace menos dañino un pegado accidental de una ficha de cliente | Evitar que un prompt en texto libre singularice a una persona por contexto |
| Puede sostener una evaluación de impacto de la transferencia como medida complementaria | Sustituir el propio mecanismo de transferencia |
| Crea una traza de auditoría que tu delegado de protección de datos puede leer | Cubrir adjuntos, capturas de pantalla o voz salvo que el proveedor lo indique |
¿Saca la seudonimización un prompt del ámbito del RGPD?
A ti no, y eso está resuelto. El artículo 4.5 del RGPD define la seudonimización como el tratamiento tras el cual los datos ya no pueden atribuirse a una persona sin información adicional, siempre que esa información adicional se conserve por separado. La definición presupone que esa información adicional sigue existiendo. Si no existiera, no podrías restituir la respuesta y el producto no funcionaría.
Las Directrices 01/2025 del CEPD sobre seudonimización lo dicen directamente en el apartado 22: los datos seudonimizados que puedan atribuirse a una persona física mediante información adicional son personales, y eso vale también cuando los datos y esa información no están en las mismas manos. Borrar después la correspondencia tampoco ayuda de forma retroactiva. Las directrices señalan que los datos se vuelven anónimos únicamente si se cumplen las condiciones de anonimato, un listón distinto y mucho más alto.
Lo que el TJUE añadió en 2025 es la otra mitad del cuadro, la del destinatario. La identificabilidad se evalúa por actor y por situación, de modo que los mismos bytes pueden ser datos personales para quien posee la clave y no serlo para quien no puede obtenerla de forma realista. El Tribunal confirmó en la misma sentencia el límite de esa idea: tu deber de informar sobre los destinatarios se evalúa en el momento de la recogida y desde tu perspectiva, antes de cualquier seudonimización.
| Parte | ¿Es el prompt dato personal para ella? | Qué se sigue |
|---|---|---|
| Tú, la empresa que despliega | Sí, siempre. Posees o controlas la correspondencia | Obligaciones plenas: base jurídica, información, conservación, EIPD cuando proceda, registro |
| El proveedor de la pasarela | Sí, si posee o puede alcanzar la correspondencia | Encargado del artículo 28, con contrato y lista de subencargados |
| El proveedor del modelo | Posiblemente no, según los hechos | Es la única parte que la pasarela puede cambiar de verdad, y solo con pruebas |
| Una autoridad pública del país del proveedor | Se evalúa por separado | El test del CEPD que sigue está escrito justo para este actor |
Dos matices deben aparecer en cualquier informe que cite esto. El Tribunal anuló la sentencia del Tribunal General y devolvió el asunto, así que el litigio no ha terminado. Y las directrices del CEPD llevan el encabezado "Adopted - version for public consultation", adoptadas el 16 de enero de 2025, con consulta cerrada el 28 de febrero de 2025. Ambas son la mejor autoridad disponible hoy. Ninguna es la última palabra, y una afirmación construida sobre ellas necesita fecha de revisión.
¿Qué tendrías que demostrar para que el proveedor del modelo quede fuera del ámbito?
El CEPD ya escribió el test, y casi ningún comprador lo ha leído. Los apartados 63 a 68 de las directrices describen cuándo la seudonimización funciona como medida complementaria en una transferencia a un tercer país. Tres condiciones tienen que cumplirse a la vez.
| Condición del CEPD | Qué significa para una llamada a la API de un LLM | Dificultad |
|---|---|---|
| La atribución exige información adicional que las autoridades del país receptor no poseen ni pueden obtener con un esfuerzo razonable | La correspondencia nunca debe viajar con el prompt ni poder deducirse de él | Alcanzable por diseño, y lo único que ya afirma cualquier proveedor de la categoría |
| La información adicional la posee en exclusiva el exportador, o una entidad de confianza en el EEE o en una jurisdicción esencialmente equivalente, conservada por separado | Pregunta dónde reside físicamente el almacén de correspondencias, quién lo opera y si algún subencargado con matriz estadounidense puede alcanzarlo | Verificable contractual y arquitectónicamente, y a menudo la pregunta que cambia la respuesta |
| Esas autoridades no pueden singularizar a una persona en su interacción con un grupo, usando los datos seudonimizados y lo que puedan obtener con esfuerzo razonable | El propio texto del prompt no debe estrechar la población hasta una sola persona | La difícil, y el motivo de la sección siguiente |
El apartado 70 añade la regla que se aplica incluso sin cuestión de transferencia: antes de transmitir datos seudonimizados a un tercero, identifica al menos los medios de que dispone ese destinatario para la atribución. Con un proveedor de modelos frontera eso significa explicitar qué posee ya el proveedor, incluido el resto de tu tráfico, y cuánto lo conserva. Una pasarela que reduce el prompt pero deja un identificador de usuario estable en los metadatos no ha superado este test.
Por qué el texto libre derrota a la seudonimización por campos
Sustituir nombres es fácil. Evitar que un prompt describa exactamente a una persona no lo es. Aquí es donde se rompe en la práctica la condición de no singularización, y la evidencia es incómoda para toda la categoría.
Investigadores de la ETH de Zúrich demostraron en Beyond Memorization: Violating Privacy Via Inference with Large Language Models que los modelos actuales infieren atributos personales como ubicación, ingresos y sexo a partir de texto corriente, alcanzando hasta un 85 por ciento de acierto top-1 y un 95 por ciento top-3, a alrededor de una centésima parte del coste y una doscientos cuarentava parte del tiempo que necesita una persona. La superficie de ataque no es el campo del nombre. Es la escritura.
El CEPD anticipa el mismo problema desde el otro lado. El apartado 21 de las directrices dice que la información fuera de tu control, "por ejemplo, información de fuentes de acceso público, como publicaciones en una red social o un foro en línea", cuenta para la atribución y debe considerarse al evaluar si la seudonimización es eficaz.
En prompts reales, el residuo que sobrevive a una buena pasada por campos suele tener este aspecto.
- Rol más organización más suceso. "Nuestro director financiero interino que empezó en marzo en la sede de Innsbruck" identifica a una persona sin una sola entidad nombrada.
- Combinaciones raras. Un diagnóstico, un código postal y una franja de edad. Ninguno es un nombre. Juntos son una persona.
- Correspondencia citada. El estilo de escritura, los saludos habituales y la jerga interna viajan con un correo pegado aunque se elimine la cabecera.
- Adjuntos y capturas. Una pasarela que analiza texto estructurado puede dejar pasar una imagen intacta. Pregúntalo de forma explícita, porque el contenido de pantalla no se puede redactar como un campo de formulario.
- Contexto de recuperación. Si el asistente usa RAG, los fragmentos recuperados también son contenido del prompt. La recuperación con permisos es un control aparte, en nuestra guía de permisos en RAG.
Nada de esto hace inútil la pasarela. Hace que la afirmación dependa de tu corpus. Una cola de tickets con "la impresora de la planta 3 está atascada" se seudonimiza limpiamente. Un hilo de una queja de recursos humanos no, y ninguna ingeniería de marcadores lo cambiará. La decisión arquitectónica honesta es enrutar la segunda categoría a otro sitio en lugar de comprar un detector más potente.
Ayuda para IA en producción
Si estás construyendo un producto de IA y te preocupan el coste de inferencia, la arquitectura o la preparación para producción, Wavect ayuda a fundadores a convertir prototipos de IA en sistemas fiables.
Ruta de servicio:
Ocho preguntas para un proveedor de plataformas de seudonimización
Ordenadas por la frecuencia con la que la respuesta cambia una decisión, no por su lugar en un cuestionario de seguridad. Nuestro cuestionario de seguridad para proveedores de IA cubre la capa genérica que hay debajo.
- ¿Dónde vive la correspondencia y quién puede leerla? Nombra la jurisdicción, el operador y la vía de acceso. La condición del CEPD es exclusividad, así que "nuestra nube" no es una respuesta, y "una región de un hiperescalador en Alemania" solo lo es cuando sabes quién guarda las claves.
- ¿La seudonimización viene activada o es una función de plan? Merece la pena preguntarlo en todos los productos. En la matriz publicada de Pryvet, por ejemplo, el plan Professional lista el borrado automático y la seudonimización de datos personales como opcionales, mientras que el plan Enterprise añade datos sensibles y un conjunto de reglas propio opcional. Un control que alguien puede desactivar es un control que tu política debe imponer en otro lugar.
- ¿Qué modelo, en qué país, para esta petición? Una plataforma que deja elegir un modelo alojado en Estados Unidos ha entregado la decisión de transferencia al usuario. Decide si eso es aceptable y aplícalo con configuración, no con formación.
- ¿Qué enviáis exactamente además del prompt? Identificadores de tenant, de usuario y de sesión, y también los prompts de sistema. Un identificador de usuario estable derriba por sí solo la condición de no singularización.
- ¿Qué se conserva, en vuestro lado y en el del proveedor del modelo? Pide por escrito la configuración de conservación por proveedor y qué ocurre con el almacén de correspondencias cuando se borra un chat.
- ¿Qué entra en el alcance de la detección y qué pasa de largo? Campos estructurados, texto libre, tablas, PDF, imágenes, audio. Pide la tasa de falsos negativos en compuestos alemanes y en formatos austríacos y suizos, no en un benchmark en inglés.
- ¿Quién es el encargado y qué dice de verdad el contrato? Contrato del artículo 28, lista actual de subencargados, plazo de notificación de cambios y derechos de auditoría. Una lista publicada, como la que mantiene Pryvet, es el mínimo y no un diferencial.
- ¿Qué pruebas me entregáis para mi propio expediente? Una aportación para la evaluación de impacto de la transferencia, una descripción arquitectónica del dominio de seudonimización y los resultados de la última prueba de penetración. Si el proveedor no puede producirlas, las escribirás tú, y ese coste pertenece a la comparación.
Lo que sigue siendo tuyo compres la plataforma que compres
Todas las obligaciones de esta tabla sobreviven a la compra. Los proveedores no están siendo deshonestos al respecto; los compradores simplemente leen un sello de cumplimiento como una transferencia de responsabilidad, y nunca lo es.
| Obligación | Por qué la pasarela no la absorbe |
|---|---|
| Rol de responsable y base jurídica | Tú decides fines y medios. La seudonimización es una medida de los artículos 25 y 32, no una base |
| Deber de información en la recogida | El TJUE lo evaluó desde la perspectiva del responsable, antes de cualquier seudonimización |
| EIPD cuando el tratamiento es de alto riesgo | La reducción del riesgo es una entrada de la evaluación, no un sustituto |
| Mecanismo de transferencia y evaluación de impacto | La seudonimización es una medida complementaria sobre garantías del artículo 46, no en su lugar |
| Registro de actividades y conservación | El historial de chat es tratamiento. Fija el plazo y haz que la plataforma lo aplique |
| Obligaciones del Reglamento de IA ya aplicables | La alfabetización en IA del artículo 4 aplica ya, y la transparencia desde el 2 de agosto de 2026. Ver nuestra lista del artículo 50 |
| Una regla interna que la gente pueda seguir | El control solo funciona si el equipo usa la pasarela. Nuestra política de IA de una página es la versión más corta que aguanta |
¿Comprar la pasarela, mover el modelo o dejar los datos fuera?
Cuatro opciones, y la pasarela solo gana en una franja. El modelado de costes de las alternativas está en nuestro análisis de costes del autohospedaje y en nuestro desglose de costes del asistente interno.
| Opción | Cuándo gana | Qué te cuesta |
|---|---|---|
| No enviar ningún dato personal | La tarea es redactar, resumir material público o programar. Ahí está la mayor parte del valor interno de la IA | Disciplina de alcance y una regla de enrutamiento. El control más barato con diferencia |
| Pasarela de seudonimización más modelo alojado | Tráfico mixto, muchos usuarios ocasionales y quieres un punto de aplicación rápido | Licencia por puesto, riesgo residual de singularización y el trabajo probatorio anterior |
| Modelo servido desde una región de procesamiento en la UE fijada por contrato | Los datos son personales y los prompts son identificativos por naturaleza | Un menú de modelos más pequeño, una brecha real de capacidad en lo más difícil y el trabajo de verificar la región en lugar del domicilio del proveedor |
| Modelo de pesos abiertos autohospedado | Volumen alto, sector regulado o datos que no pueden salir | Gasto en GPU más el suelo de tiempo de ingeniería, la parte que los equipos subestiman |
La tercera fila dice región de procesamiento, no nacionalidad, y es a propósito. El domicilio social de un proveedor te dice a qué derecho de sociedades está sujeto, no dónde se sirve una petición concreta, y un proveedor europeo puede igualmente ejecutar la inferencia en una región de un tercer país o sobre una nube de un tercer país. Fija la región en el contrato, por modelo y por endpoint, y pide por escrito que no haga conmutación silenciosa a otra. Una marca europea con una ubicación de procesamiento sin especificar te deja justo con la pregunta del capítulo V que querías evitar.
En la práctica la buena respuesta suele ser dos de estas a la vez: una regla dura de que la mayor parte del trabajo nunca lleva datos personales, más una vía gobernada para el trabajo que sí. Esa es la forma que construimos en PromptID, donde las llamadas agnósticas al modelo corren tras una única capa de orquestación, de modo que el proveedor es una decisión de configuración y no un compromiso arquitectónico. Si aún dudas entre plataforma y desarrollo propio, nuestra guía de software a medida frente a software estándar es la versión neutral de esa decisión.
Un piloto de dos semanas orientado a pruebas
No evalúes esta categoría con una demo. Evalúala con tus peores prompts y termina con un expediente que puedas entregar a un delegado de protección de datos.
- Construye un corpus de 200 prompts de tráfico real, cargado hacia los casos feos: recursos humanos, legal, escalados de soporte, todo lo que lleve adjunto.
- Ejecuta la prueba de singularización. Toma la salida seudonimizada y pide a un modelo potente que describa quién la escribió y sobre quién. Cuenta cuántas veces la población se estrecha por debajo de diez personas.
- Mide los falsos negativos por categoría, por separado para formatos alemanes, austríacos y suizos, y por separado para texto libre y campos estructurados.
- Mide la diferencia de calidad en la tarea. Los marcadores cambian las respuestas. Puntúa las mismas tareas con y sin pasarela, porque un asistente conforme que nadie usa no es un control.
- Registra latencia y coste por petición con la pasarela frente a la llamada directa. Dos viajes de ida y vuelta al modelo son habituales en esta categoría.
- Documenta en una página la arquitectura del almacén de correspondencias: ubicación, operador, acceso, conservación, borrado. Ese es tu dominio de seudonimización y es el documento que el test del CEPD califica.
- Decide la regla de enrutamiento que sobreviva al piloto: qué clases de prompt van a la pasarela, cuáles a un modelo alojado en la UE y cuáles no salen nunca.
Preguntas frecuentes sobre seudonimización y prompts de LLM
¿Los datos seudonimizados siguen siendo datos personales bajo el RGPD?
¿Una pasarela de seudonimización hace que un LLM cumpla el RGPD?
¿Puede la seudonimización sustituir a las cláusulas contractuales tipo?
¿Qué decidió el TJUE en SEPD contra JUR?
¿Seudonimización y anonimización son lo mismo?
¿Los marcadores empeoran la calidad de las respuestas?
¿Cuánto debería costar una pasarela de seudonimización?
Reflexiones finales
Trata la pasarela de seudonimización por lo que es: un buen control de ingeniería y un escudo jurídico débil. Te da un lugar donde aplicar la elección de modelo, la conservación y el registro, y hace sobrevivible un pegado accidental. No te convierte en un responsable más pequeño, y solo saca al proveedor del modelo del ámbito si tus prompts dejan realmente de singularizar personas, algo que es una propiedad de tu texto y no del detector del proveedor. Cómprala por el punto de aplicación, pruébala con tus peores prompts, documenta en una página la arquitectura del almacén de correspondencias y mantén el tráfico que no se puede desidentificar en una vía que nunca necesitó la pasarela.
Fuentes primarias
- Tribunal de Justicia de la Unión Europea, comunicado de prensa 107/25 de 4 de septiembre de 2025 sobre el asunto C-413/23 P, SEPD contra JUR
- Directrices 01/2025 del CEPD sobre seudonimización, página de consulta, adoptadas el 16 de enero de 2025
- Reglamento (UE) 2016/679, RGPD, con la definición de seudonimización del artículo 4.5
- ETH de Zúrich, SRI Lab, Beyond Memorization: Violating Privacy Via Inference with Large Language Models
- Página de seguridad de Pryvet, sobre seudonimización previa al tratamiento y procesamiento en servidores alemanes o europeos
