En este artículo
Cuánto Cuesta de Verdad un Asistente de IA Interno en la Región DACH (2026)
Un directivo hace una pregunta sencilla: ¿cuánto cuesta de verdad, por persona y mes, un asistente de IA interno sobre nuestros documentos de empresa? La respuesta que recibe suele ser una de dos cosas poco útiles. O una cifra de cinco dígitos que da miedo y que asume un clúster de GPU self-hosted que nadie necesita, o un encogimiento de hombros del tipo "casi nada, los tokens ya son baratos". Las dos están mal, porque el coste real de un asistente RAG sobre SharePoint, Confluence y Google Drive no es una gran línea. Son varias pequeñas, más la parte que todos olvidan: mantenerlo en marcha.
Perspectiva de ingeniería y proceso, no un pitch de proveedor. Esto va de desplegar IA internamente, un trabajo distinto de construir un producto de IA para tus clientes; la parte de setup interno la hacemos bajo AI Enablement. Los números de abajo son orientativos, sacados de precios públicos de 2026, y los tuyos diferirán. Vuelve a comprobar los precios actuales antes de presupuestar.
Antes de poner precio a la recuperación, decide qué recuperará. Nuestra guía de wiki empresarial preparada para IA define la arquitectura de conocimiento canónico, permisos y revisión que asume este modelo de costes.
¿Quieres una cifra real para tu setup?
Reserva Consultoría Gratuita¿Qué impulsa de verdad el coste de un asistente de IA interno?
Casi todos se fijan en la factura del LLM, y en un asistente interno rara vez es la cifra mayor. El coste lo moldean tres cosas que tú controlas antes de gastar un solo token:
- Cuánta gente lo usa, y con qué intensidad. Diez usuarios intensivos que consultan 30 veces al día cuestan más que 200 usuarios ocasionales que lo abren dos veces por semana. La unidad que importa son consultas por día, no la plantilla.
- Cuánto tiene que leer para responder. Cada respuesta arrastra fragmentos recuperados de tus documentos al prompt. Mete diez páginas de contexto en cada llamada y tu factura de tokens de entrada se multiplica, aunque la pregunta fuera de una línea.
- Cómo de fresco tiene que estar el índice. Re-embeddear documentos en el momento en que cambian cuesta más que un sync nocturno. La mayoría del conocimiento interno no cambia minuto a minuto, y ese es un ahorro que casi todos los equipos dejan sobre la mesa.
Pon esas tres suposiciones por escrito primero. Mueven la factura mensual más que cualquier elección de proveedor que hagas después.
¿Cuáles son los componentes de coste, línea por línea?
Este es un presupuesto ilustrativo de 2026 para un asistente RAG autogestionado pequeño. Los rangos son supuestos del escenario, no medias de mercado ni ofertas. Recalcúlalos con precios actuales y tokens, almacenamiento, consultas, réplicas y niveles de servicio medidos.
| Componente | Qué es | Coste mensual aproximado | Notas |
|---|---|---|---|
| Embeddings (inicial + actualizaciones) | Convertir tus docs en vectores para poder buscarlos | ~$0 a $30 | El 2 de septiembre de 2026, OpenAI lista text-embedding-3-small a $0,02 por 1M de tokens y text-embedding-3-large a $0,13. A esas tarifas, 100M tokens cuestan $2 o $13 una vez; las actualizaciones siguen el volumen cambiado. |
| Base de datos vectorial | Almacenar y buscar esos vectores | ~$0 a $150+ | Los tiers gratuitos pueden cubrir un prototipo. Pinecone, Qdrant Cloud y Weaviate Cloud usan modelos distintos de uso, capacidad, gasto mínimo y recursos dedicados, así que no existe un precio inicial universal defendible. El self-hosting cambia la factura por cómputo y operaciones. |
| Tokens de respuesta del LLM | El modelo que escribe cada respuesta a partir del contexto recuperado | ~$20 a unos cientos | La línea variable. La impulsan consultas/día por tamaño de contexto por precio del modelo. Un modelo mid-tier más contexto ajustado lo mantiene pequeño; enrutar cada consulta a un modelo frontier con contexto inflado es como explota. |
| Recuperación + orquestación | El pegamento: gestión de la consulta, reranking, filtrado de permisos | ~$0 a $40 | Mayormente tu propio cómputo. Un reranker opcional añade un pequeño coste por consulta; la recuperación con permisos añade latencia, no mucho gasto. |
| Hosting | Servidor de la app, API gateway, logs, monitoreo | ~$20 a $100 | Un contenedor pequeño más un gateway gestionado. Modesto y plano hasta que escalas usuarios. |
| Mantenimiento | Mantenerlo correcto: cuidado de conectores, runs de evals, upgrades de modelo | La cifra real | Incluye tiempo de ingeniería y revisión y puede superar la infraestructura en un año. El presupuesto honesto lo mide en vez de omitirlo. |
Fíjate en el patrón. Las filas de infraestructura son sorprendentemente baratas en 2026. El coste que decide si el proyecto vale la pena está en la última fila, y es el que ningún quote de proveedor incluye.

"La base vectorial y los tokens son la parte barata. La parte cara es el ingeniero que mantiene correctas las respuestas después de que cambien los documentos. Presupuéstalo o el proyecto se pudre."
Construir o comprar: ¿qué sale de verdad más barato?
Los productos empaquetados de "IA sobre tu base de conocimiento" cotizan un precio por asiento, a menudo en el rango de un asiento de productividad de pago. Es limpio y predecible, y para un equipo pequeño con documentos genéricos puede ser la opción correcta. El pero aparece en dos sitios: pagas por asiento tanto si un usuario consulta una vez al mes como cincuenta veces al día, y tu enrutado de datos y tu lógica de recuperación son lo que decidió el proveedor.
Un setup autogestionado le da la vuelta. El coste por consulta es bajo y solo pagas lo que corre, pero cargas con la construcción y el mantenimiento. El punto de equilibrio no va solo del número de asientos, va de control. En cuanto necesitas recuperación con permisos que refleje tus reglas de acceso de SharePoint y Confluence, o los datos no pueden salir de tu infraestructura, el precio por asiento de paquete deja de ser toda la historia. Profundizamos en la decisión de despliegue en cómo desplegar IA internamente sin crear shelfware.
¿Dónde añade coste la residencia de datos en DACH?
Para una empresa DACH, la ubicación de los datos forma parte del diseño legal y técnico. El RGPD no exige procesamiento exclusivamente en la UE: el capítulo V permite transferencias basadas en decisiones de adecuación o garantías apropiadas, junto con la evaluación completa. La Ley de IA tampoco crea un mandato general de residencia. Contratos, reglas sectoriales, políticas de clientes, secreto o el mecanismo de transferencia sí pueden exigir procesamiento solo en la UE para un despliegue concreto.
- Endpoints en zona UE o regionales. Microsoft Foundry Data Zone procesa dentro de una zona UE definida, mientras los despliegues de región única procesan en la región elegida. Disponibilidad, cuotas, SLA y precio pueden variar. Compara el modelo y la región exactos en vez de asumir un sobrecoste fijo.
- Base vectorial y app hosteadas en la UE. Fijar región puede ser una configuración, un tier distinto o no estar disponible. Puede cambiar precio, redundancia, egress, capacidad y operación.
- El propio trabajo de compliance. El coste real de residencia es la revisión: el contrato de encargo de tratamiento, el registro de actividades de tratamiento, y confirmar que ningún acceso de mantenimiento llega a los datos desde fuera de la UE. Es esfuerzo de una vez más una revisión recurrente menor, y sale mucho más barato hecho en el diseño que reconvertido después.
Diseñados desde el principio, residencia y controles de transferencia son inputs explícitos del presupuesto. Añadidos después pueden exigir migración, cambio de proveedor o reconstrucción.
¿Cuánto cuesta por asiento y mes, en un ejemplo calculado?
Solo ilustrativo. Tus números diferirán, y deberías volver a comprobar los precios actuales antes de fiarte de esto. La idea es la forma de la factura, no la cifra exacta.
Supón una empresa DACH con 50 usuarios activos, cada uno con unas 10 consultas al día (unas 11.000 consultas al mes), sobre un corpus de unos cientos de miles de fragmentos de documento, respondido por un modelo mid-tier en región UE con recuperación ajustada (un puñado de fragmentos por respuesta), reindexado nocturno y una base vectorial gestionada.
| Línea | Coste mensual orientativo |
|---|---|
| Embeddings (deltas nocturnos tras el embed masivo de una vez) | ~$5 a $20 |
| Base vectorial gestionada (tier de producción, región UE) | ~$50 a $150 |
| Tokens de respuesta del LLM (modelo mid-tier, contexto ajustado) | ~$60 a $250 |
| Hosting, gateway, monitoreo | ~$30 a $100 |
| Subtotal de infraestructura | ~$150 a $520 / mes |
| Repartido entre 50 asientos | ~$3 a $10 por asiento / mes |
| Mantenimiento (tiempo de ingeniería, amortizado) | La línea dominante a lo largo de un año |
Con estos supuestos, el subtotal de infraestructura queda en unos $3 a $10 por asiento activo al mes. Es la aritmética de este escenario de 11.000 consultas, no un benchmark DACH. Mantenimiento, identidad, seguridad, copias, soporte, impuestos y personal quedan fuera.
¿Cómo lo mantienes barato sin dejar que se pudra?
La misma disciplina que mantiene asequible una build de IA en producción aplica aquí. Las palancas de coste, en el orden en que rinden:
- Enruta al modelo capaz más barato. La mayoría de las preguntas internas no necesitan tu modelo más caro. Reserva el modelo frontier para la minoría difícil y el coste por consulta cae con fuerza.
- Recupera menos, con más precisión. El mayor desperdicio de tokens es meter demasiados fragmentos en cada respuesta. Una buena recuperación más un reranker manda al modelo unos pocos fragmentos relevantes, no diez páginas. Es la palanca con mayor efecto sobre la línea del LLM.
- Cachea repeticiones medidas. Hazlo solo cuando los logs muestren inputs repetibles y seguros por permisos, con invalidación para documentos y derechos cambiados. La mecánica está en cómo reducir los costes de tokens LLM en 2026.
- Indexa según un SLA de frescura. Elige sincronización nocturna, por eventos o casi en tiempo real según la tolerancia a respuestas obsoletas. El coste de embeddings sigue el volumen de tokens cambiados.
Una nota de humildad que ninguna tabla de costes captura: un asistente barato que da respuestas erróneas en silencio es el resultado más caro de todos. Necesitas un set de evals, una forma de medir la calidad de las respuestas después de que cambien los documentos, y alguien cuyo trabajo sea vigilarlo. Esa línea de mantenimiento no es relleno opcional. Es la diferencia entre una herramienta en la que el equipo confía y una que dejan de abrir. Vimos rendir la misma disciplina en trabajo de IA en producción como Twinsoft AI, donde el harness de evals fue lo que hizo segura la optimización de coste.
Reflexiones finales
No existe un precio DACH universal por asiento. En el ejemplo de 50 asientos y 11.000 consultas, los supuestos dan unos $3 a $10 por asiento activo al mes antes de mantenimiento, identidad, seguridad, copias, soporte, impuestos y personal. Recalcula cada línea con uso medido y precios vivos.
Procesar solo en la UE no es una regla general del RGPD o la Ley de IA, pero contratos, garantías de transferencia, obligaciones sectoriales o políticas pueden exigirlo. Define primero la frontera legal y técnica, luego cotiza los despliegues aptos. Mide consultas, tokens, tamaño de retrieval, volumen de embeddings, uso vectorial y mantenimiento.
¿Quieres un plan calculado para tu infra?
Reserva Consultoría GratuitaFuentes primarias de esta guía
Vuelve a comprobar estas páginas vivas de proveedores antes de aprobar un presupuesto.