Volver
Kevin Riedl

9 min de lectura · 27 Jun 2026
Última revisión

Siguiente
Se crea en tu dispositivo, sin conectar con Instagram. Copiamos el enlace para su sticker de enlace.

Gateways LLM Comparados 2026: LiteLLM vs OpenRouter vs Portkey vs RouteLLM

La mayoría de los equipos conecta su producto directamente al SDK de un solo proveedor. Funciona hasta que deja de funcionar. Entonces el proveedor tiene una caída y tu app cae con él. Entonces finanzas pregunta por qué un trabajo descontrolado quemó el presupuesto de un mes en una tarde. Entonces sale un modelo nuevo, más barato y mejor para la mitad de tu tráfico, y cambiar significa tocar cada punto de llamada. Así que el equipo empieza a atornillar reintentos, un límite de gasto, un segundo proveedor y una caché, y en un trimestre ha construido media capa de infraestructura de agentes mal, en su propio código, sin que nadie sea su dueño.

Esa capa que falta tiene nombre: gateway LLM. Un endpoint por delante de varios proveedores puede centralizar fallback, caching, límites de gasto y routing. Esta es una perspectiva de ingeniería, no un pitch. Volvimos a comprobar las afirmaciones sobre funciones, licencias, privacidad y precios con fuentes primarias el 2 de septiembre de 2026. Los catálogos y las tarifas cambian, así que verifícalos de nuevo durante la compra.

¿Conectando un producto de IA a un solo proveedor?

 Reserva Consultoría Gratuita

¿Qué hace de verdad un gateway LLM?

Un gateway es un proxy que se sitúa entre tu aplicación y los proveedores de modelos. Tu código llama a un endpoint, normalmente en el formato de petición de OpenAI, y el gateway traduce la llamada y la reenvía al proveedor que deba atenderla. Esa única costura es donde obtienes las features que de otro modo reconstruirías a mano:

  • Un endpoint sobre muchos proveedores. Una superficie de petición común reduce código específico de proveedor. No elimina el lock-in, porque las herramientas, los esquemas, la seguridad y la semántica de los modelos siguen variando.
  • Fallback. Ante un error elegible o timeout, un gateway configurado puede reintentar otro despliegue, modelo o proveedor. Mejora la resiliencia, pero no garantiza disponibilidad.
  • Caching. Peticiones idénticas o semánticamente similares pueden devolver una respuesta guardada y saltarse la llamada al modelo entera, lo que recorta coste y latencia en el tráfico repetitivo.
  • Límites de gasto y keys. Presupuestos y límites de tasa por key, por usuario o por equipo, para que un bucle malo no pueda vaciar la cuenta y para que puedas dar a cada equipo una virtual key acotada.
  • Routing. Envía la mayoría fácil a un modelo barato y la minoría difícil a uno frontier, por reglas o por una política aprendida.
  • Observability. Un sitio donde ves cada petición, su coste, su latencia y sus tokens, desglosados por modelo, key y feature.

El routing es la palanca de coste por la que viene la mayoría, y cubrimos su economía en cómo reducir los costes de tokens LLM en 2026. Este artículo va de las herramientas que te dan esa palanca más el resto de la capa.

¿En qué se diferencian LiteLLM, OpenRouter, Portkey y RouteLLM?

Estos cuatro nombres aparecen juntos, pero no son el mismo tipo de producto. LiteLLM y Portkey ofrecen software de gateway, OpenRouter es un agregador hosteado y RouteLLM es un framework de investigación de routing. La tabla se verificó con fuentes primarias el 2 de septiembre de 2026.

HerramientaTipoHostingRouting / fallbackCachingObservabilityMejor para
LiteLLMGateway y SDK open source más funciones enterprise comercialesPrincipalmente self-hostBalanceo y retry/fallback configurablesSí, con opciones RedisSeguimiento de gasto e integraciones de loggingEquipos que quieren operar su gateway
OpenRouterAgregador hosteado / marketplaceSaaSRouting y fallbacks entre proveedoresPrompt caching del proveedor según modeloLogs de actividad y analítica de usoAcceso hosteado a 500+ modelos tras una key
PortkeyGateway + observability + guardrails (core OSS + cloud)Self-host del core, o cloud; air-gapped en enterpriseSí, routing, fallback, reintentos sobre 1.600+ modelosProfunda, logs, trazas, analítica, 50+ guardrailsEquipos en producción que quieren guardrails y observability integrados
RouteLLMFramework de routing open source (investigación)Self-host o embebidoRouting de modelos, no un plano de control completoNo es función centralHerramientas de eval, no observability de producción de todo el gatewayProbar un router aprendido de coste-calidad

LiteLLM documenta un gateway y SDK compatibles con OpenAI para más de 100 API de LLM. Su repositorio es mayoritariamente MIT, pero los archivos del directorio enterprise tienen otra licencia comercial. OpenRouter es un agregador hosteado con facturación consolidada, routing entre proveedores y un catálogo amplio. El gateway de Portkey usa licencia MIT y ofrece routing, caching, retries, guardrails y self-hosting; Portkey también vende planes hosteados y enterprise. RouteLLM es un framework de LMSYS y Berkeley para servir y evaluar decisiones de routing aprendidas, no el plano de control circundante.

Kevin Riedl

"Tres de estos son gateways y uno es un router. Comparar RouteLLM con LiteLLM es comparar el cerebro con el cuerpo. La mayoría de los equipos necesita ambos, y la mayoría va primero a por el cuerpo."

Self-host o hosteado: ¿cuál deberías elegir?

Esta es la primera decisión real, y normalmente decide la herramienta. El tradeoff es control y residencia de datos contra carga operativa.

Si LiteLLM ya es tu opción probable, usa nuestra guía para autoalojar LiteLLM en producción y cubre Postgres, Redis, gestión de claves, parcheo y controles de salida que se esconden tras la palabra autoalojado.

  • Hosteado (OpenRouter, Portkey cloud). Evitas operar el gateway, pero añades otro procesador a la ruta. OpenRouter afirma que el logging de prompts y respuestas es opt-in, mientras conserva metadatos y siguen aplicando las políticas del proveedor final. Sus controles de privacidad incluyen filtros por política; clientes enterprise pueden solicitar routing dentro de la UE. La FAQ indica precios de inferencia sin recargo, una comisión del 5,5 % al comprar créditos con mínimo de 0,80 dólares y condiciones BYOK separadas. Como la página de precios expresa algunas franquicias BYOK por plan, concilia FAQ, precios y contrato.
  • Self-host (LiteLLM, gateway de Portkey, RouteLLM). Controlas el despliegue y los upgrades del gateway, pero las llamadas llegan al proveedor upstream configurado. Los componentes open source de LiteLLM no añaden una comisión por petición; las funciones comerciales tienen otros términos. El seguimiento persistente y las topologías de producción pueden añadir Postgres, Redis y otros servicios, pero no son obligatorios en toda instalación.

Un criterio práctico es elegir el despliegue que ya cumpla tus restricciones de procesamiento de datos, fiabilidad y operaciones. Self-host no equivale automáticamente a cumplimiento, ni SaaS a incumplimiento. Mapea subencargados, retención, regiones, claves y responsabilidad de incidentes.

¿Qué tal el seguimiento de coste y la observability?

Los dashboards del proveedor pueden mostrar uso de cuenta, pero un gateway puede consolidar atribución entre proveedores y adjuntar metadatos de aplicación. Las cuatro herramientas cubren esa tarea a distinta profundidad.

  • LiteLLM documenta seguimiento multiusuario, presupuestos, límites de tasa y callbacks de logging. Self-host controla dónde vive la telemetría del gateway, no la retención de los proveedores upstream.
  • Portkey ofrece logs, trazas, analítica, feedback y guardrails. Sus precios de septiembre de 2026 miden logs registrados: 10.000 al mes en Free y 100.000 en Production por 49 dólares mensuales antes de sobrecostes. Las peticiones siguen si se supera el cupo Free, pero no se guardan más logs.
  • OpenRouter te da un dashboard de uso y analítica de los modelos que llamas, suficiente para muchos equipos y con cero setup.
  • RouteLLM incluye utilidades de servicio y evaluación, pero no el plano multiusuario de gasto, claves y telemetría de producción de un gateway.

Los dashboards de gasto dicen cuánto pagaste, no si la calidad se mantuvo. Algunas plataformas ya incluyen evals o integraciones, como las plantillas y guías de evaluación por lotes de Portkey. Aun así necesitas un conjunto de aceptación específico de tu tarea y un release gate.

¿Dónde encaja RouteLLM, y son reales las cifras?

RouteLLM es el único de los cuatro centrado puramente en la decisión de routing: dada una consulta, mándala al modelo fuerte o al barato. Las cifras publicadas son genuinamente fuertes, y vale citarlas con cuidado. El equipo de LMSYS y Berkeley reporta que, con datos de entrenamiento aumentados, su router de factorización de matrices alcanza alrededor del 95 % del rendimiento de GPT-4 enviando solo el 14 % de las llamadas al modelo fuerte, lo que sitúan en torno a un 75 % más barato que una baseline aleatoria, y más del 85 % de reducción de coste en la evaluación MT Bench.

Lee esas cifras como orientativas y como las enmarca la fuente: vienen del paper original de RouteLLM, medidas sobre datasets concretos (MT Bench, MMLU, GSM8K) contra un modelo fuerte de clase GPT-4, publicado en 2024 y presentado en ICLR 2025. Tu tráfico no son esos benchmarks, así que el ahorro en tu workload será distinto. La conclusión honesta es la forma, no el porcentaje exacto: un router aprendido puede mantener la mayor parte de la calidad enviando una minoría de las llamadas al modelo caro. Aun así tienes que probarlo en tu propia eval antes de confiar en él.

En la práctica no eliges RouteLLM en lugar de un gateway. Puedes correr RouteLLM como el cerebro de routing y poner un gateway alrededor para fallback, keys, caching y observability, o usas las reglas de routing más simples de un gateway y te ahorras el framework. RouteLLM se gana su sitio cuando el routing es tu mayor palanca de coste y el routing por reglas está dejando ahorro sobre la mesa.

¿Estás evaluando OmniRoute en concreto? Separa esa pregunta de producto de la comparativa de categoría. Nuestra guía de routing de IA con OmniRoute y checklist de producción cubre diseño de rutas, hardening de acceso, pruebas de fallos y eval gates antes del despliegue.

¿Cómo deberías elegir?

Mapea la herramienta a la restricción que de verdad te ata, no a la lista de features más larga:

  1. Lo necesitas hoy, sin infra que operar. Tira de una opción hosteada. OpenRouter por amplitud de modelos tras una key, Portkey cloud si además quieres observability y guardrails desde el día uno.
  2. La residencia de datos o el control total importan. Self-host. LiteLLM si quieres un proxy open source ligero y muy usado; el core open source de Portkey si la observability y los guardrails son requisitos de primera clase.
  3. La observability y los guardrails son la prioridad. Portkey está construido alrededor de ellos. Los demás loguean; Portkey hace del log el producto.
  4. El routing es tu mayor palanca de coste. Añade RouteLLM como cerebro de routing dentro del gateway que elijas, y prueba el ahorro en tu propia eval.
  5. No lo tienes claro. Empieza con un gateway hosteado, instruméntalo, y deja que dos semanas de datos reales de gasto por feature te digan qué optimizar. Los datos responden la pregunta más rápido que la tabla comparativa.

Una interfaz estrecha compatible con OpenAI puede reducir el trabajo de migración, pero no vuelve intercambiables los gateways. Prueba streaming, tool calls, outputs estructurados, errores, autenticación y extensiones de proveedor antes de cambiar.

Reflexiones finales

Un gateway LLM es la capa que la mayoría de los equipos reconstruye mal antes de darse cuenta de que tiene nombre. Ponla pronto y obtienes fallback, caching, límites de gasto, routing y observability en un solo sitio, tras un endpoint que tu código puede seguir llamando mientras cambias lo que hay detrás.

Las cuatro herramientas no son intercambiables. LiteLLM es el caballo de batalla open source auto-hospedado. OpenRouter es el camino hosteado más rápido a muchos modelos. Portkey lidera con observability y guardrails y te da tanto open source como cloud. RouteLLM es el cerebro de routing, no un gateway, con cifras fuertes pero específicas de benchmark que debes volver a probar en tu propio tráfico. Elige por la restricción que te ata, primero hosteado frente a self-host, luego instruméntalo, y deja que tus propios datos de gasto y eval, no el gráfico de un proveedor, decidan qué optimizar después.

¿Quieres una segunda opinión sobre tu capa de infra de IA?

 Reserva Consultoría Gratuita

Ayuda para IA en producción

Si estás construyendo un producto de IA y te preocupan el coste de inferencia, la arquitectura o la preparación para producción, Wavect ayuda a fundadores a convertir prototipos de IA en sistemas fiables.

Ruta de servicio:

Tu bandeja, sin ruido

Sigue el trabajo que te importa

Recibe un correo breve cuando publiquemos algo nuevo. Sigue todo el blog o solo los temas que te interesan.

¿Qué quieres recibir?
Elige tus temas

Gratis, doble opt-in y sin píxeles de seguimiento.

Volver
Kevin Riedl

9 min de lectura · 27 Jun 2026
Última revisión

Siguiente

Recibe la próxima nota de campo sobre IA y agentes

Un correo breve cuando publiquemos. Sin píxeles de seguimiento ni contenido de relleno.

Gratis, doble opt-in y sin píxeles de seguimiento.