Volver
Kevin Riedl

13 min de lectura · 19 de julio de 2026
Última revisión

Siguiente
Se crea en tu dispositivo, sin conectar con Instagram. Copiamos el enlace para su sticker de enlace.

Kimi K3 para Empresas de la UE: Coste API, Datos y Plan de Piloto

Kimi K3 merece un piloto controlado por API para programación compleja y trabajo de conocimiento, pero todavía no es la opción por defecto de bajo riesgo para una empresa de la UE. El flagship de Moonshot AI con 2,8 billones de parámetros combina un contexto de un millón de tokens, visión nativa, resultados iniciales sólidos en código y una API compatible con OpenAI. El precio oficial es de 3 dólares por millón de tokens de entrada sin caché, 0,30 dólares con cache hit y 15 dólares por los de salida.

La decisión de compra es más difícil que el titular del benchmark. K3 siempre razona, aunque la API ya ofrece esfuerzo low, high y max. La evaluación independiente lo encuentra más lento y verboso que la mediana. Los documentos públicos no son totalmente coherentes sobre el uso del contenido, y la política internacional señala Singapur. Los pesos completos, el informe técnico, la licencia y las recetas de despliegue ya son públicos. El self-hosting se puede verificar, pero sigue siendo infraestructura de centro de datos.

Esta review se verificó el 7 de agosto de 2026. Responde a una pregunta acotada: ¿debería una empresa europea hacer un piloto con la API o el self-hosting de Kimi K3, y qué debe demostrar antes de producción? Para la elección general entre familias usa nuestra comparativa de LLM open-weight de 2026.

Resumen de compra de Kimi K3, verificado el 7 de agosto de 2026
PreguntaRespuesta verificadaImplicación comercial
¿Está activa la API?Sí, como kimi-k3 en api.moonshot.ai/v1La evaluación técnica puede empezar hoy
¿Cuánto cuesta?0,30 dólares entrada cacheada, 3 dólares entrada sin caché y 15 dólares salida por 1M tokensLa salida y el razonamiento pueden dominar la factura
¿Es potente?60 en el índice actual de Artificial AnalysisSuficiente para probar, no demuestra tu caso de uso
¿Dónde se almacenan los datos personales internacionales?La política pública señala SingapurUn comprador europeo necesita documentar la transferencia
¿Se usan los datos de API para entrenar?La ayuda actual dice que no; términos públicos anteriores permiten un uso más amplio sin acuerdo separadoLa restricción aplicable debe quedar por escrito
¿Puede alojarse hoy en local?Sí; pesos, informe, licencia y recetas vLLM/SGLang son públicosPlanifica unos 1,6 TB y al menos un nodo de ocho aceleradores

¿Necesitas evaluar Kimi K3 con datos medibles?

 Planificar un Piloto de Dos Semanas

¿Qué es Kimi K3?

Kimi K3 es el mayor modelo de Moonshot AI, diseñado para programación de larga duración, trabajo de conocimiento, análisis multimodal y razonamiento profundo. El artículo técnico de lanzamiento declara 2,8 billones de parámetros totales, Stable LatentMoE con 16 expertos activos de 896, Kimi Delta Attention, Attention Residuals, visión nativa y hasta un millón de tokens de contexto.

Los 2,8 billones representan capacidad total, no cálculo denso aplicado a cada token. Se activan 104.000 millones de parámetros por token y el checkpoint publicado ocupa unos 1,6 TB. vLLM documenta ocho NVIDIA B300 u ocho AMD MI355X como la ruta single-node más sencilla; configuraciones mayores buscan más throughput. Sigue siendo infraestructura de centro de datos.

K3 está disponible en Kimi.com, Kimi Work, Kimi Code y la API internacional. La guía oficial de API documenta entrada de texto, imagen y vídeo; streaming; salida con JSON schema estricto; tool calls; carga dinámica de herramientas y caché automática. También deja límites relevantes para producción:

  • el modo thinking está siempre activo y reasoning_effort admite low, high y max;
  • temperature, top-p, penalties y n están fijados;
  • las conversaciones multi-turn y los tools deben devolver el mensaje completo del assistant, incluido el historial de razonamiento;
  • cambiar a K3 en mitad de una sesión puede desestabilizar la calidad;
  • K3 puede tomar decisiones demasiado proactivas cuando los límites son ambiguos;
  • Moonshot reconoce una brecha de experiencia frente a Claude Fable 5 y GPT-5.6 Sol.

¿Qué tal rinde Kimi K3 fuera de los benchmarks de Moonshot?

La evidencia independiente inicial coloca K3 cerca de la frontera, muy fuerte en frontend visual, por debajo de la velocidad media y con mucha verbosidad. Esta descripción ayuda más a un comprador que llamarlo "el mejor modelo" o "IA china barata".

Evidencia independiente verificada el 7 de agosto de 2026
SeñalResultado de K3Qué respaldaQué no demuestra
Artificial Analysis Intelligence Index60 en el perfil v4.1.1 actualCapacidad amplia cercana a la fronteraPrecisión o fiabilidad en tu dominio
Velocidad de salida38,5 tokens/s y 3,14 s hasta el primer tokenInteractivo, pero bajo la medianaLatencia con tu contexto y concurrencia
Volumen de salida130M tokens, frente a mediana de 100MK3 es más verboso que la medianaQue más tokens produzcan el mismo valor adicional
Frontend Code ArenaPrimer puesto con 1.679 en el snapshot de lanzamientoPreferencia humana por los frontends generadosBackend, seguridad, mantenibilidad o tests

El perfil de Kimi K3 en Artificial Analysis mide ahora 3,14 segundos hasta el primer token y 38,5 tokens por segundo. Su puntuación v4.1.1 es 60; la evaluación costó unos 2.425 dólares y produjo 130 millones de tokens. Los perfiles en vivo cambian, así que fecha y versión deben acompañar la cifra.

El resultado de frontend importa porque personas comparan las salidas a ciegas. La Associated Press informó de K3 en lo alto del ranking de frontend. Sigue siendo una fracción del software engineering. Una interfaz bonita puede tener controles inaccesibles, estado frágil, dependencias inseguras, tests ausentes y comportamiento de backend inventado.

¿Cuánto cuesta realmente la API de Kimi K3?

Kimi K3 solo resulta barato si su calidad evita suficientes reintentos y mantiene un cache hit alto. El precio es de 3 dólares por millón de tokens de entrada sin caché, 0,30 dólares con caché y 15 dólares por salida. Los tokens de razonamiento cuentan como salida. Una respuesta visible corta puede esconder una factura considerable.

Ejemplo: una tarea sobre un repositorio envía 100.000 tokens de entrada y genera 20.000 de salida.

Ejemplo de coste por tarea con Kimi K3
Comportamiento de cachéEntradaSalidaTotal por tarea10.000 tareas
Sin cache hit0,300 $0,300 $0,600 $6.000 $
80 % de entrada cacheada0,084 $0,300 $0,384 $3.840 $
90 % de entrada cacheada0,057 $0,300 $0,357 $3.570 $

Son cálculos ilustrativos, no una previsión. Moonshot afirma superar el 90 % de cache hit en workloads de código, pero el prefijo largo debe permanecer estable. Cambios en repositorio, herramientas, instrucciones o mensajes anteriores pueden reducirlo. Registra entrada cacheada y no cacheada, salida de razonamiento, retries, tool calls y minutos de revisión por separado.

La unidad correcta es el coste por tarea aceptada. Si K3 completa 82 de 100 tareas a 0,40 dólares cada una, el coste directo por resultado aceptado es de 0,49 dólares antes de revisión. Si un modelo barato solo completa 55, puede perder. Si Kimi K2.7 Code consigue la misma calidad, sus tarifas de 0,95 dólares de entrada y 4 de salida lo convierten en mejor default. Envía a K3 solo la cola difícil.

¿Cumple Kimi K3 el RGPD?

Ninguna página pública convierte Kimi K3 automáticamente en una solución conforme al RGPD para tu empresa. Depende de tu rol, caso de uso, datos personales, contrato, transferencia, subencargados, retención, controles y arquitectura. La documentación pública aporta evidencia, pero también preguntas que un comprador europeo debe cerrar por escrito.

La página de seguridad de datos de la API dice que inputs y outputs no se usan para entrenar o mejorar modelos, que el tráfico usa HTTPS/TLS, que los usuarios están aislados y que los archivos subidos se pueden eliminar. El suplemento para Kimi Business también establece no training by default para el contenido empresarial y remite a un data processing addendum.

Los puntos sin resolver son igual de importantes:

  • La política internacional de OpenPlatform sitúa los servidores seguros en Singapur y permite conservar información de cuenta, input y pagos mientras la cuenta esté activa.
  • Los términos públicos permiten usar contenido para operar, desarrollar, mejorar, proteger y hacer cumplir el servicio. Otra cláusula remite las restricciones de training a acuerdos separados.
  • La ayuda más reciente y el suplemento Business son más restrictivos, pero procurement no debería adivinar qué documento gobierna la cuenta concreta.
  • Se mencionan certificaciones sin publicar nombre, alcance, periodo de auditoría o informe revisable.
  • No encontramos una lista pública completa de subencargados, retención fija por tipo de dato ni región de procesamiento solo UE.

Singapur está fuera del EEE. La Comisión Europea explica el uso de cláusulas contractuales tipo para transferencias a terceros países. El responsable de privacidad o asesor legal debe confirmar mecanismo, roles, evaluación de impacto de la transferencia, subencargados, borrado, auditoría e incidentes. Empieza con datos sintéticos o públicos. Añade datos personales, confidenciales o regulados solo después de aprobación. Esto es orientación de compra, no asesoramiento jurídico.

¿Migrar desde OpenAI es solo cambiar la base URL?

No. El transporte resulta familiar, pero el estado, los parámetros, la caché y los fallos de K3 exigen trabajo de integración. Para la primera llamada basta con el SDK de OpenAI, https://api.moonshot.ai/v1 y kimi-k3. Para producción debes:

  1. Conservar el mensaje completo del assistant. Mantén razonamiento y tool calls en requests multi-turn.
  2. Abrir una sesión nueva al cambiar de modelo. No cambies una conversación de Claude, GPT, GLM o Kimi K2 a K3 a mitad.
  3. Eliminar controles no soportados. El sampling está fijado y hoy solo existe razonamiento máximo.
  4. Diseñar prefijos estables. Instrucciones, tools y contexto duradero van primero para habilitar caché.
  5. Limitar la autonomía. Define scope, permisos, aprobaciones, presupuestos y condiciones de parada.
  6. Tratar la capacidad como riesgo de producto. Lee headers, limita concurrencia, aplica backoff a 429 y acuerda cuotas antes del launch.
  7. Probar los filtros. Mide falsos positivos en código, seguridad, legal y vocabulario de tu dominio.

La documentación de rate limits no publica un RPM o TPM universal. El límite depende de la recarga acumulada de la cuenta. Es suficiente para un piloto, no para un SLA. Concurrencia, región, uptime, respuesta a incidentes y soporte deben quedar en el acuerdo comercial.

¿Puede una empresa de la UE alojar Kimi K3 por su cuenta?

Sí. Moonshot publicó el 27 de julio los pesos, el informe técnico, la model card, las guías de inferencia y la licencia Kimi K3. La licencia permite un uso comercial amplio, pero las empresas de Model as a Service que superen 20 millones de dólares de ingresos en doce meses necesitan un acuerdo separado. Los productos comerciales muy grandes también tienen una obligación de atribución.

La barrera práctica es alta: unos 1,6 TB de checkpoint, una ruta documentada con ocho B300 u ocho MI355X, e imágenes Docker que todavía dependen de componentes preliminares. Para muchas empresas será más realista un host especializado o la API. Revisa licencia, hardware, energía, operación, redundancia y actualizaciones con nuestro marco de break-even entre modelos locales y API.

¿Quién debería probar Kimi K3 ahora?

K3 entra en la shortlist cuando la tarea justifica razonamiento máximo, el código o trabajo visual de larga duración es central, un prefijo estable puede generar cache hits, se puede empezar con datos aprobados, existen acceptance tests y fallback, y el equipo tolera cambios tempranos mientras llegan pesos e informe técnico.

No lo conviertas en default para tareas simples, productos donde manda la latencia, salidas largas de poco valor, necesidades actuales de procesamiento solo en la UE, contratos insuficientes o self-hosting inmediato. Kimi K2.7 Code, un modelo más pequeño o un proveedor ya aprobado pueden ganar en coste por tarea.

¿Cómo debe funcionar un piloto de dos semanas?

  1. Día 1, definir la decisión. Un workflow, un modelo actual, 50 a 100 tareas reales, hard stops y un owner.
  2. Días 2 y 3, clasificar datos. Quitar secretos y datos personales. Mapear prompts, archivos, logs, tools, soporte, storage y borrado.
  3. Días 3 a 5, construir el adapter. Mantener historial completo e instrumentar caché, tokens, latencia, retries, tool calls y errores de filtro.
  4. Días 6 a 8, probar a ciegas. Comparar K3 e incumbent en las mismas tareas por corrección, instrucciones, código, tools y minutos de revisión.
  5. Días 9 y 10, forzar fallos. Probar 429, timeout, truncado, fallo de tool, instrucciones maliciosas del repo, objetivos ambiguos y cancelación.
  6. Días 11 y 12, cerrar procurement. Solicitar DPA, transferencias, subencargados, retención, certificados, SLA de incidentes, borrado, soporte y cuotas.
  7. Días 13 y 14, decidir por tarea aceptada. Comparar éxito, straight-through completion, corrección humana, P50/P95, cache hit y coste total.

Un piloto aprobado debe superar al modelo actual en la métrica que paga la migración sin abrir un hueco contractual, de seguridad o fiabilidad. El servicio de AI Enablement de Wavect cubre evaluación, integración, guardrails, observabilidad y handover. El caso Twinsoft AI muestra por qué el sistema alrededor del modelo importa más que su nombre.

Debajo de todo esto hay una decisión de stack, y nuestra guía de selección tecnológica enuncia la regla que aplicamos: decide en función de la restricción cuya reversión es cara. En una API fuera del EEE esa restricción suele ser el mecanismo de transferencia y el contrato, no el precio por millón de tokens.

Preguntas frecuentes sobre Kimi K3 para empresas

¿Está Kimi K3 disponible por API?

Sí. El endpoint internacional es api.moonshot.ai/v1 y el model ID es kimi-k3. Usa una interfaz compatible con OpenAI, pero el historial de razonamiento, parámetros fijos, caché y tools requieren pruebas específicas.

¿Cuánto cuesta la API de Kimi K3?

El 7 de agosto de 2026 Moonshot listaba 0,30 dólares por millón de tokens de entrada cacheados, 3 dólares sin caché y 15 dólares por salida. El razonamiento se factura como salida.

¿Kimi usa datos de API para entrenar?

La ayuda actual dice que no. El suplemento Business también prohíbe training por defecto para contenido empresarial. Términos públicos anteriores permiten usos más amplios sin acuerdo separado, por lo que la restricción aplicable debe constar por escrito.

¿Dónde almacena Kimi datos de usuarios internacionales?

La política internacional de OpenPlatform señala Singapur. Verifica ubicaciones reales, subencargados, retención y mecanismo de transferencia antes de enviar datos personales o confidenciales.

¿Kimi K3 es open source u open weight?

Kimi K3 es open weight. Desde el 27 de julio los pesos, el informe y las guías están disponibles bajo una licencia Kimi K3 propia. Permite uso comercial amplio, pero incluye condiciones para grandes proveedores Model as a Service y productos de gran escala.

¿Es Kimi K3 mejor que Claude o GPT para programar?

K3 lideró un snapshot inicial de frontend y se acerca a la frontera en Artificial Analysis. Moonshot reconoce que sigue por detrás de Claude Fable 5 y GPT-5.6 Sol en conjunto. Decide con una evaluación ciega sobre tu repositorio.

Reflexiones finales

Kimi K3 se ha ganado un sitio en la shortlist. Su contexto de un millón de tokens, visión, buenos resultados, pesos públicos y rutas de despliegue crean opciones creíbles por API y self-hosting.

Todavía no merece una aprobación general. El razonamiento puede elevar el coste, las pruebas independientes lo ven lento y verboso, los límites dependen de la cuenta, la documentación de datos necesita contrato y el self-hosting parte de unos 1,6 TB más ocho aceleradores. Mide tareas aceptadas, cierra DPA y transferencias, revisa la licencia y deja que un piloto decida.

Construye el producto, no solo el backlog

Si este artículo conecta con una decisión real de producto, Wavect puede ayudarte a definir, construir, endurecer o liderar el trabajo de software con criterio senior de founder.

Rutas de servicio útiles:

Tu bandeja, sin ruido

Sigue el trabajo que te importa

Recibe un correo breve cuando publiquemos algo nuevo. Sigue todo el blog o solo los temas que te interesan.

¿Qué quieres recibir?
Elige tus temas

Gratis, doble opt-in y sin píxeles de seguimiento.

Volver
Kevin Riedl

13 min de lectura · 19 de julio de 2026
Última revisión

Siguiente

Recibe nuevos artículos por correo

Un correo breve cuando publicamos. Gratis y sin seguimiento.

Gratis, doble opt-in y sin píxeles de seguimiento.