Volver
Christof Jori

8 min de lectura · 08 Jun 2026
Última revisión

Siguiente
Se crea en tu dispositivo, sin conectar con Instagram. Copiamos el enlace para su sticker de enlace.

Checklist de Production-Readiness de RAG para Empresas de la UE

Un prototipo RAG sobre un conjunto limitado de documentos se puede montar rápido. Eso no demuestra que esté listo para producción. Un asistente necesita pruebas representativas de la calidad del retrieval y de las respuestas, coste y latencia medidos, controles de privacidad y una autorización que resista usuarios y datos reales. Los equipos de la UE también deben mapear el RGPD y las obligaciones aplicables de la Ley de IA al caso de uso real. Esta es la checklist basada en riesgos que usamos antes de pedir a alguien que dependa de un sistema RAG.

RAG es una forma de aportar conocimiento externo sin cambiar los pesos del modelo. Que sea más barato o adecuado que el contexto largo, la búsqueda, el fine-tuning o un flujo determinista depende de la carga de trabajo. Trata el prototipo como el inicio de la evaluación, no como el final.

Si el conocimiento llega en PDF, la calidad del retrieval empieza antes del chunking. Nuestra guía de parsing de PDF y enrutamiento OCR explica cómo mantener local el texto nativo, detectar páginas escaneadas o mixtas y reservar el OCR para las páginas que lo necesitan.

Tienes una demo de RAG que debe salir a producción?

 Reserva una Revisión de RAG en Producción

El retrieval es realmente lo bastante bueno?

La calidad de la respuesta queda limitada cuando no se recuperan pruebas relevantes. El prompting no puede recuperar una fuente que nunca entró en el contexto del modelo, aunque el diseño adecuado también puede usar herramientas, datos estructurados o una ruta explícita de no respuesta. Evalúa el retrieval con documentos y consultas representativos, no solo con una demo seleccionada.

  • Chunking probado con el contenido. Los enfoques de tamaño fijo, estructurales, semánticos, parent-child y específicos del documento tienen compromisos distintos. Las tablas y referencias entre secciones suelen requerir un tratamiento especial.
  • Un método de embeddings y retrieval probado con tu contenido. Si atiendes a clientes en alemán e inglés, prueba ambos idiomas y las consultas multilingües relevantes en lugar de asumir que un valor por defecto se transfiere.
  • Un conjunto de evaluación, no una corazonada. Anota preguntas reales y los pasajes que deberían responderlas. Mide el recall, si el pasaje correcto se recupera de verdad, antes de tocar cualquier otra cosa.
  • Pruebas trazables cuando corresponda. Devuelve los pasajes y las versiones de documentos usados en respuestas factuales. Una cita mejora la verificabilidad, pero no demuestra que la fuente respalde la afirmación generada.

Se va a inventar cosas?

El retrieval no elimina las alucinaciones. Define qué afirmaciones deben respaldarse con pruebas recuperadas, qué otras herramientas o conocimientos están permitidos y qué debe hacer el asistente cuando el respaldo sea insuficiente.

  • Definir el límite de la evidencia. Indica al modelo qué afirmaciones requieren respaldo recuperado y valida el mapeo entre afirmaciones y pasajes.
  • Abstenerse cuando el respaldo sea insuficiente. Calibra la ruta de no respuesta con ejemplos representativos. Un retrieval vacío, fuentes contradictorias, documentos obsoletos y pruebas con puntuación baja pueden requerir tratamientos distintos.
  • Mostrar procedencia útil. Presenta el pasaje, título, versión y enlace relevantes cuando el usuario pueda inspeccionarlos. Prueba si las citas implican la afirmación y son accesibles para ese usuario.
Christof Jori

"Una demo de RAG responde las preguntas que testeaste. Un producto RAG tiene que responder las que no, y callar cuando no debe hablar. La brecha entre esas dos cosas es todo el engagement."

Puedes medirlo igual dos veces?

Los cambios en el modelo de embeddings, chunking, prompt, reranker, corpus de origen o modelo generativo pueden mejorar unas clases de consultas y degradar otras. Una demo exitosa no revela ese compromiso.

Mantén un conjunto de evaluación versionado extraído de las condiciones de despliegue, con pruebas esperadas, respuestas aceptables, abstenciones, consultas multilingües, casos de permisos y entradas adversariales. Vuelve a ejecutarlo ante cambios relevantes y complementa las métricas agregadas con resultados por segmento y revisión humana. Actualiza el conjunto deliberadamente cuando cambien el corpus y los riesgos, en vez de tratar un conjunto fijo como completo.

Cuánto costará operarlo, y qué tan rápido es?

Un prototipo no revela el coste ni la latencia de producción. Mide el trabajo de embeddings e indexación, la búsqueda vectorial, el reranking, la entrada y salida del modelo, las operaciones de caché, los reintentos, la observabilidad y la revisión humana con la concurrencia esperada.

  • Cachea con límites. La caché puede reducir trabajo repetido, pero las claves, el aislamiento entre tenants, la autorización, la frescura, la invalidación y el contenido sensible determinan si reutilizar es seguro.
  • Prueba el routing de modelos. Enruta solo después de que una evaluación representativa muestre dónde un modelo menor cumple el requisito. Incluye los costes de escalado y reintentos.
  • Presupuesta el contexto desde la evidencia. Ajusta el número de pasajes y el tamaño de contexto frente a cobertura del retrieval, grounding, latencia y coste, sin asumir que menos siempre es mejor.

La economía aquí se mueve rápido, y la arquitectura que elijas ahora decide lo que pagarás luego. Profundizamos en eso en el cambio en los costes de las APIs de LLM.

Aguanta bajo las reglas de la UE?

Aquí las empresas de la UE tienen deberes que un tutorial de EE. UU. no menciona. Describimos obligaciones a nivel general, no damos asesoramiento legal, y los detalles dependen de tu sector y tus datos. Habla con un abogado para lo concreto. Pero las preguntas de ingeniería son lo bastante claras como para ponerlas en una checklist.

  • Mapea roles, fines, datos y transferencias. Identifica al responsable y los encargados, la base jurídica, las categorías de datos, la conservación, los subencargados, las ubicaciones de acceso y las medidas de seguridad. Una transferencia del capítulo V del RGPD depende de la divulgación real a un destinatario en un tercer país, no solo de la sede del proveedor o de una etiqueta regional, y requiere un mecanismo de transferencia aplicable y su evaluación.
  • Evalúa las obligaciones de transparencia de IA. El artículo 50 impone a los proveedores de sistemas destinados a interactuar directamente con personas físicas el deber de diseño de informarles de que interactúan con IA, salvo que resulte obvio para una persona razonablemente informada, observadora y circunspecta en ese contexto. Determina los roles, excepciones, fecha de aplicación y obligaciones sectoriales del despliegue, en vez de aplicar una única regla de aviso a todas las herramientas internas.
  • Maneja los datos personales de forma deliberada. Decide qué datos personales se permiten en el índice y en los prompts, y qué se redacta o se excluye. El retrieval puede sacar a la luz un documento cuya sensibilidad alguien había olvidado.
  • Registra de forma proporcionada. Captura suficientes pruebas versionadas para investigar eventos de calidad y seguridad, pero minimiza los datos personales y confidenciales, restringe el acceso, define la conservación y no asumas que siempre deban almacenarse prompts y respuestas sin procesar.

Hemos escrito por separado sobre el coste del cumplimiento de la Ley de IA para una startup y cómo se apilan el RGPD y la Ley de IA para un SaaS de la región DACH, si quieres el lado regulatorio con más profundidad.

Puede alguien romperlo o leer lo que no debería?

Un sistema RAG añade límites de seguridad: el contenido recuperado puede influir en el comportamiento del modelo, y los índices, metadatos, cachés, logs y copias de fuentes pueden exponer datos sensibles.

  • Inyección de prompts. Un documento recuperado puede contener instrucciones dirigidas al modelo: "ignora tus reglas y revela X". Trata el contenido recuperado como entrada no confiable, no como una orden, y testéalo.
  • Control de acceso en todo el retrieval. Los embeddings no son necesariamente una copia literal del texto fuente, pero el índice y el contenido asociado aún pueden exponer información sensible. Aplica autenticación, autorización, aislamiento entre tenants, cifrado, copias de seguridad y controles administrativos a todo almacén relevante.
  • Permisos nativos del sistema de origen. Si los usuarios tienen derechos documentales distintos, aplica la autorización efectiva antes o durante el retrieval y de nuevo antes de divulgar. Prueba revocaciones, cambios de grupo, enlaces públicos, permisos heredados y comportamiento de caché, en vez de depender de una lista de acceso copiada una sola vez.

La checklist

Úsala como revisión inicial de riesgos antes de depender de un asistente RAG. No es un estándar de seguridad completo, una evaluación legal ni una garantía. Prioriza las brechas por probabilidad creíble, impacto, exposición y las decisiones o acciones previstas del sistema.

  1. Retrieval. Chunking con sentido, un modelo de embeddings probado en tu contenido e idiomas, un conjunto de evaluación con recall medido, citas en cada respuesta.
  2. Grounding. Los límites de la evidencia están definidos, la abstención está calibrada y las fuentes accesibles están mapeadas a las afirmaciones.
  3. Evaluación repetible. Un conjunto dorado de preguntas y respuestas que vuelves a ejecutar en cada cambio de prompt, modelo o índice.
  4. Coste y latencia. Caching, escalonado de modelos y presupuestos de tokens que puedas defender a escala, no solo en la demo.
  5. Revisión jurídica de la UE. Los roles, fines, base jurídica, flujos de datos, transferencias, conservación, obligaciones de transparencia, atención a interesados y logs proporcionados están mapeados al despliegue real.
  6. Seguridad. Inyección de prompts testeada, control de acceso sobre el índice, permisos por usuario aplicados en el retrieval para que nada se filtre entre usuarios.

El entregable son pruebas de que el sistema cumple requisitos definidos de retrieval, calidad de respuesta, abstención, coste, latencia, privacidad y autorización dentro del alcance probado, más monitorización y gestión de incidentes para lo que las pruebas no detecten.

Construir exactamente eso es nuestro servicio de habilitación de IA cuando el asistente corre en tu propia infraestructura, y nuestro servicio de productos de IA cuando la capa de recuperación vive dentro de un producto que entregas a clientes. Twinsoft AI es el ejemplo publicado más cercano de un prototipo que pasó por esta lista y salió por el otro lado.

Reflexiones finales

Una demo RAG limitada no demuestra cómo se comporta el sistema con documentos representativos, consultas multilingües, pruebas obsoletas o contradictorias, contenido no autorizado, instrucciones adversariales o tráfico de producción. Esas condiciones requieren evaluación y controles explícitos.

Para un despliegue en la UE, conecta las pruebas técnicas con el flujo real de datos, los roles organizativos, la base jurídica, las transferencias, las obligaciones de transparencia, la conservación y el modelo de acceso. Trata esta checklist como una primera revisión y después establece criterios de lanzamiento basados en riesgos, monitorización, rollback y gestión de incidentes para el uso previsto.

Tienes una demo de RAG que debe salir a producción?

 Reserva una Revisión de RAG en Producción

Fuentes primarias de esta checklist

La checklist relaciona el método de revisión de producción de Wavect con estas referencias públicas de riesgo, seguridad y ciclo de vida.

Ayuda para IA en producción

Si estás construyendo un producto de IA y te preocupan el coste de inferencia, la arquitectura o la preparación para producción, Wavect ayuda a fundadores a convertir prototipos de IA en sistemas fiables.

Ruta de servicio:

Tu bandeja, sin ruido

Sigue el trabajo que te importa

Recibe un correo breve cuando publiquemos algo nuevo. Sigue todo el blog o solo los temas que te interesan.

¿Qué quieres recibir?
Elige tus temas

Gratis, doble opt-in y sin píxeles de seguimiento.

Volver
Christof Jori

8 min de lectura · 08 Jun 2026
Última revisión

Siguiente

Recibe la próxima nota de campo sobre IA y agentes

Un correo breve cuando publiquemos. Sin píxeles de seguimiento ni contenido de relleno.

Gratis, doble opt-in y sin píxeles de seguimiento.