Volver
Kevin Riedl

13 min de lectura · 19 de julio de 2026
Última revisión

Siguiente
Se crea en tu dispositivo, sin conectar con Instagram. Copiamos el enlace para su sticker de enlace.

Kimi K3 para Empresas de la UE: Coste API, Datos y Plan de Piloto

Kimi K3 merece un piloto controlado por API para programación compleja y trabajo de conocimiento, pero todavía no es la opción por defecto de bajo riesgo para una empresa de la UE. El flagship de Moonshot AI con 2,8 billones de parámetros combina un contexto de un millón de tokens, visión nativa, resultados iniciales sólidos en código y una API compatible con OpenAI. El precio oficial es de 3 dólares por millón de tokens de entrada sin caché, 0,30 dólares con cache hit y 15 dólares por los de salida.

La decisión de compra es más difícil que el titular del benchmark. K3 siempre razona, aunque la API ofrece esfuerzo low, high y max. Artificial Analysis mide actualmente K3 max con 60 puntos, unos 38 tokens de salida por segundo y 3,55 segundos TTFT. Los documentos públicos específicos de la API siguen sin ser totalmente coherentes sobre el uso del contenido, y la privacidad de OpenPlatform señala Singapur. Los pesos completos, el informe técnico, la licencia y las recetas de despliegue son públicos. El self-hosting se puede verificar, pero sigue siendo infraestructura de centro de datos.

Esta review se verificó el 2 de septiembre de 2026. Responde a una pregunta acotada: ¿debería una empresa europea hacer un piloto con la API o el self-hosting de Kimi K3, y qué debe demostrar antes de producción? Para la elección general entre familias usa nuestra comparativa de LLM open-weight de 2026.

Resumen de compra de Kimi K3, verificado el 2 de septiembre de 2026
PreguntaRespuesta verificadaImplicación comercial
¿Está activa la API?Sí, como kimi-k3 en api.moonshot.ai/v1La evaluación técnica puede empezar hoy
¿Cuánto cuesta?0,30 dólares entrada cacheada, 3 dólares entrada sin caché y 15 dólares salida por 1M tokensLa salida y el razonamiento pueden dominar la factura
¿Es potente?60 en el índice actual de Artificial AnalysisSuficiente para probar, no demuestra tu caso de uso
¿Dónde se almacenan los datos personales internacionales?La política pública señala SingapurUn comprador europeo necesita documentar la transferencia
¿Se usan los datos de API para entrenar?La ayuda actual dice que no; los términos y la privacidad anteriores de la API permiten una mejora más ampliaIdentifica los documentos aplicables y fija la restricción por contrato
¿Puede alojarse hoy en local?Sí; pesos, informe, licencia y recetas vLLM/SGLang son públicosPlanifica unos 1,56 TB de checkpoint y al menos un nodo de centro de datos con ocho aceleradores

¿Necesitas evaluar Kimi K3 con datos medibles?

 Planificar un Piloto de Dos Semanas

¿Qué es Kimi K3?

Kimi K3 es el mayor modelo de Moonshot AI, diseñado para programación de larga duración, trabajo de conocimiento, análisis multimodal y razonamiento profundo. El artículo técnico de lanzamiento declara 2,8 billones de parámetros totales, Stable LatentMoE con 16 expertos activos de 896, Kimi Delta Attention, Attention Residuals, visión nativa y hasta un millón de tokens de contexto.

Los 2,8 billones representan capacidad total, no cálculo denso aplicado a cada token. Se activan 104.000 millones de parámetros por token y el snapshot de Hugging Face contiene unos 1,56 TB de archivos safetensor. La receta actual de vLLM exige al menos ocho GB300 o, con ROCm, ocho MI355X o MI350X, y recomienda infraestructura multinodo para tráfico real de producción. Sigue siendo infraestructura de centro de datos.

K3 está disponible en Kimi.com, Kimi Work, Kimi Code y la API internacional. La guía oficial de API documenta entrada de texto, imagen y vídeo; streaming; salida con JSON schema estricto; tool calls; carga dinámica de herramientas y caché automática. También deja límites relevantes para producción:

  • el modo thinking está siempre activo y reasoning_effort admite low, high y max;
  • temperature, top-p, penalties y n están fijados;
  • las conversaciones multi-turn y los tools deben devolver el mensaje completo del assistant, incluido el historial de razonamiento;
  • cambiar a K3 en mitad de una sesión puede desestabilizar la calidad;
  • K3 puede tomar decisiones demasiado proactivas cuando los límites son ambiguos;
  • Moonshot reconoce una brecha de experiencia frente a Claude Fable 5 y GPT-5.6 Sol.

¿Qué tal rinde Kimi K3 fuera de los benchmarks de Moonshot?

La evidencia independiente actual coloca K3 cerca de la frontera y muy fuerte en frontend visual, pero ni el ranking de lanzamiento ni una sola medición de latencia garantizan la producción. Esta descripción ayuda más a un comprador que llamarlo "el mejor modelo" o "IA china barata".

Evidencia independiente verificada el 2 de septiembre de 2026
SeñalResultado de K3Qué respaldaQué no demuestra
Artificial Analysis Intelligence Index60 en el perfil v4.1.1 actualCapacidad amplia cercana a la fronteraPrecisión o fiabilidad en tu dominio
Rendimiento API en Artificial AnalysisUnos 38 tokens/s y 3,55 s hasta el primer tokenUna medición actual de la API propiaLatencia con tu contexto y concurrencia
Tokens en el análisis de lanzamientoUnos 132M tokens de salida, 21% menos que K2.6Mejor eficiencia de tokens que K2.6 en esa evaluaciónTu longitud de salida, valor o coste de producción
Ranking actual Arena WebDevSegundo con 1.674 e intervalo de incertidumbre ±11Preferencia humana ciega por las aplicaciones web generadasBackend, seguridad, mantenibilidad o tests

El perfil comparativo actual de K3 en Artificial Analysis muestra unos 38 tokens de salida por segundo, 3,55 segundos TTFT y una puntuación v4.1.1 de 60 para K3 max. Su análisis de lanzamiento informa de unos 132 millones de tokens de salida, un 21% menos que K2.6. Los perfiles en vivo cambian, así que fecha y versión deben acompañar la cifra.

El resultado de frontend importa porque personas comparan las salidas a ciegas. El ranking actual de Arena WebDev sitúa K3 max segundo con 1.674 puntos, detrás de Claude Opus 5, en vez de conservar el primer puesto del lanzamiento. Sigue siendo una fracción del software engineering. Una interfaz bonita puede tener controles inaccesibles, estado frágil, dependencias inseguras, tests ausentes y comportamiento de backend inventado.

¿Cuánto cuesta realmente la API de Kimi K3?

Kimi K3 solo resulta barato si su calidad evita suficientes reintentos y mantiene un cache hit alto. El precio es de 3 dólares por millón de tokens de entrada sin caché, 0,30 dólares con caché y 15 dólares por salida. Los tokens de razonamiento cuentan como salida. Una respuesta visible corta puede esconder una factura considerable.

Ejemplo: una tarea sobre un repositorio envía 100.000 tokens de entrada y genera 20.000 de salida.

Ejemplo de coste por tarea con Kimi K3
Comportamiento de cachéEntradaSalidaTotal por tarea10.000 tareas
Sin cache hit0,300 $0,300 $0,600 $6.000 $
80 % de entrada cacheada0,084 $0,300 $0,384 $3.840 $
90 % de entrada cacheada0,057 $0,300 $0,357 $3.570 $

Son cálculos ilustrativos, no una previsión. Moonshot afirma superar el 90 % de cache hit en workloads de código, pero el prefijo largo debe permanecer estable. Cambios en repositorio, herramientas, instrucciones o mensajes anteriores pueden reducirlo. Registra entrada cacheada y no cacheada, salida de razonamiento, retries, tool calls y minutos de revisión por separado.

La unidad correcta es el coste por tarea aceptada. Si K3 completa 82 de 100 tareas a 0,40 dólares cada una, el coste directo por resultado aceptado es de 0,49 dólares antes de revisión. Si un modelo barato solo completa 55, puede perder. Si Kimi K2.7 Code consigue la misma calidad, sus tarifas de 0,95 dólares de entrada y 4 de salida lo convierten en mejor default. Envía a K3 solo la cola difícil.

¿Cumple Kimi K3 el RGPD?

Ninguna página pública convierte Kimi K3 automáticamente en una solución conforme al RGPD para tu empresa. Depende de tu rol, caso de uso, datos personales, contrato, transferencia, subencargados, retención, controles y arquitectura. La documentación pública aporta evidencia, pero también preguntas que un comprador europeo debe cerrar por escrito.

La página de seguridad de datos de la API dice que inputs y outputs no se usan para entrenar o mejorar modelos, que el tráfico usa HTTPS/TLS, que los usuarios están aislados y que los archivos subidos se pueden eliminar. Como es una guía operativa, un comprador empresarial debe asegurar la misma restricción en la orden y los términos de tratamiento de datos aplicables.

Los puntos sin resolver son igual de importantes:

  • La política internacional de OpenPlatform sitúa los servidores seguros en Singapur y permite conservar información de cuenta, input y pagos mientras la cuenta esté activa.
  • Los términos específicos de OpenPlatform, actualizados el 30 de abril de 2025, permiten usar contenido para operar, mantener, desarrollar y mejorar el servicio.
  • La ayuda más reciente es más restrictiva sobre training, pero procurement no debería adivinar qué documento gobierna la cuenta concreta.
  • Los términos generales de Kimi vigentes desde el 13 de agosto de 2026 incluyen training, evaluación y mejora en la licencia de contenido, con opt-out prospectivo. Esos términos de consumo pueden no regir una cuenta API contratada, pero refuerzan la necesidad de reglas claras en la orden y el DPA.
  • Se mencionan certificaciones sin publicar nombre, alcance, periodo de auditoría o informe revisable.
  • No encontramos una lista pública completa de subencargados, retención fija por tipo de dato ni región de procesamiento solo UE.

Singapur está fuera del EEE. La Comisión Europea explica el uso de cláusulas contractuales tipo para transferencias a terceros países. El responsable de privacidad o asesor legal debe confirmar mecanismo, roles, evaluación de impacto de la transferencia, subencargados, borrado, auditoría e incidentes. Empieza con datos sintéticos o públicos. Añade datos personales, confidenciales o regulados solo después de aprobación. Esto es orientación de compra, no asesoramiento jurídico.

¿Migrar desde OpenAI es solo cambiar la base URL?

No. El transporte resulta familiar, pero el estado, los parámetros, la caché y los fallos de K3 exigen trabajo de integración. Para la primera llamada basta con el SDK de OpenAI, https://api.moonshot.ai/v1 y kimi-k3. Para producción debes:

  1. Conservar el mensaje completo del assistant. Mantén razonamiento y tool calls en requests multi-turn.
  2. Abrir una sesión nueva al cambiar de modelo. No cambies una conversación de Claude, GPT, GLM o Kimi K2 a K3 a mitad.
  3. Eliminar controles no soportados. El sampling está fijado y hoy solo existe razonamiento máximo.
  4. Diseñar prefijos estables. Instrucciones, tools y contexto duradero van primero para habilitar caché.
  5. Limitar la autonomía. Define scope, permisos, aprobaciones, presupuestos y condiciones de parada.
  6. Tratar la capacidad como riesgo de producto. Verifica el tier actual en la consola, limita concurrencia, aplica backoff a 429 y acuerda cuotas antes del launch.
  7. Probar los filtros. Mide falsos positivos en código, seguridad, legal y vocabulario de tu dominio.

La documentación actual de rate limits publica tiers basados en la recarga acumulada. Tier 0 empieza tras recargar 1 dólar con 1 solicitud concurrente, 3 RPM, 500.000 TPM y 1,5 millones TPD; los tiers superiores elevan esos límites. Los límites se aplican por usuario, se comparten entre modelos y pueden ajustarse por capacidad o controles de riesgo. Verifica el tier en la consola y fija throughput, región, uptime, respuesta a incidentes y soporte en el acuerdo comercial.

¿Puede una empresa de la UE alojar Kimi K3 por su cuenta?

Sí. Moonshot publicó el 27 de julio los pesos, el informe técnico, la model card, las guías de inferencia y la licencia Kimi K3. La licencia permite uso comercial amplio. Si el licenciatario o sus afiliadas operan Model as a Service y sus ingresos agregados superan 20 millones de dólares en cualquier periodo consecutivo de doce meses, necesitan un acuerdo separado antes del uso comercial. Un producto o servicio con más de 100 millones de usuarios activos mensuales o más de 20 millones de dólares de ingresos mensuales debe mostrar "Kimi K3" de forma prominente. El uso interno y el uso mediante productos oficiales de Moonshot o partners de inferencia certificados quedan exentos de esas dos condiciones.

La barrera práctica es alta: unos 1,56 TB de archivos safetensor y, según la receta actual de vLLM, al menos ocho GB300 o, con ROCm, ocho MI355X o MI350X. La receta recomienda infraestructura multinodo para tráfico real de producción. Para muchas empresas será más realista un host especializado o la API. Revisa licencia, hardware, energía, operación, redundancia y actualizaciones con nuestro marco de break-even entre modelos locales y API.

Una ruta experimental reduce el pico de VRAM transmitiendo expertos enrutados desde disco. Nuestro análisis de la inferencia por capas de AirLLM explica por qué 3,72 GB demuestran ejecución, no throughput interactivo, y por qué el formato MXFP4 nativo de K3 contradice el resumen «sin cuantización».

¿Quién debería probar Kimi K3 ahora?

K3 entra en la shortlist cuando la tarea justifica razonamiento máximo, el código o trabajo visual de larga duración es central, un prefijo estable puede generar cache hits, se puede empezar con datos aprobados, existen acceptance tests y fallback, y el equipo tolera cambios tempranos mientras llegan pesos e informe técnico.

No lo conviertas en default para tareas simples, productos donde manda la latencia, salidas largas de poco valor, necesidades actuales de procesamiento solo en la UE, contratos insuficientes o self-hosting inmediato. Kimi K2.7 Code, un modelo más pequeño o un proveedor ya aprobado pueden ganar en coste por tarea.

¿Cómo debe funcionar un piloto de dos semanas?

  1. Día 1, definir la decisión. Un workflow, un modelo actual, 50 a 100 tareas reales, hard stops y un owner.
  2. Días 2 y 3, clasificar datos. Quitar secretos y datos personales. Mapear prompts, archivos, logs, tools, soporte, storage y borrado.
  3. Días 3 a 5, construir el adapter. Mantener historial completo e instrumentar caché, tokens, latencia, retries, tool calls y errores de filtro.
  4. Días 6 a 8, probar a ciegas. Comparar K3 e incumbent en las mismas tareas por corrección, instrucciones, código, tools y minutos de revisión.
  5. Días 9 y 10, forzar fallos. Probar 429, timeout, truncado, fallo de tool, instrucciones maliciosas del repo, objetivos ambiguos y cancelación.
  6. Días 11 y 12, cerrar procurement. Solicitar DPA, transferencias, subencargados, retención, certificados, SLA de incidentes, borrado, soporte y cuotas.
  7. Días 13 y 14, decidir por tarea aceptada. Comparar éxito, straight-through completion, corrección humana, P50/P95, cache hit y coste total.

Un piloto aprobado debe superar al modelo actual en la métrica que paga la migración sin abrir un hueco contractual, de seguridad o fiabilidad. El servicio de AI Enablement de Wavect cubre evaluación, integración, guardrails, observabilidad y handover. El caso Twinsoft AI muestra por qué el sistema alrededor del modelo importa más que su nombre.

Debajo de todo esto hay una decisión de stack, y nuestra guía de selección tecnológica enuncia la regla que aplicamos: decide en función de la restricción cuya reversión es cara. En una API fuera del EEE esa restricción suele ser el mecanismo de transferencia y el contrato, no el precio por millón de tokens.

Preguntas frecuentes sobre Kimi K3 para empresas

¿Está Kimi K3 disponible por API?

Sí. El endpoint internacional es api.moonshot.ai/v1 y el model ID es kimi-k3. Usa una interfaz compatible con OpenAI, pero el historial de razonamiento, parámetros fijos, caché y tools requieren pruebas específicas.

¿Cuánto cuesta la API de Kimi K3?

El 2 de septiembre de 2026 Moonshot listaba 0,30 dólares por millón de tokens de entrada con cache hit, 3 dólares con cache miss y 15 dólares por salida. El razonamiento se factura como salida.

¿Kimi usa datos de API para entrenar?

La ayuda actual dice que no. Los términos y la privacidad específicos de OpenPlatform permiten usos de mejora más amplios, mientras que los términos de consumo del 13 de agosto incluyen training con opt-out. Un comprador empresarial debe identificar los documentos aplicables y fijar la restricción por escrito.

¿Dónde almacena Kimi datos de usuarios internacionales?

La política internacional de OpenPlatform señala Singapur. Verifica ubicaciones reales, subencargados, retención y mecanismo de transferencia antes de enviar datos personales o confidenciales.

¿Kimi K3 es open source u open weight?

Kimi K3 es open weight. Desde el 27 de julio los pesos, el informe y las guías están disponibles bajo una licencia Kimi K3 propia. Permite uso comercial amplio, pero incluye condiciones para grandes proveedores Model as a Service y productos de gran escala.

¿Es Kimi K3 mejor que Claude o GPT para programar?

K3 lideró un snapshot inicial de frontend, ahora ocupa el segundo puesto en Arena WebDev y se acerca a la frontera en Artificial Analysis. Moonshot reconoce que sigue por detrás de Claude Fable 5 y GPT-5.6 Sol en conjunto. Decide con una evaluación ciega sobre tu repositorio.

Reflexiones finales

Kimi K3 se ha ganado un sitio en la shortlist. Su contexto de 1.048.576 tokens, visión, buenos resultados, pesos públicos y rutas de despliegue crean opciones creíbles por API y self-hosting.

Todavía no merece una aprobación general. El razonamiento puede elevar el coste, la latencia medida debe repetirse bajo tu carga, los límites dependen de la cuenta, la documentación de datos necesita contrato y el self-hosting parte de unos 1,56 TB más al menos ocho aceleradores de centro de datos. Mide tareas aceptadas, cierra DPA y transferencias, revisa la licencia y deja que un piloto decida.

Construye el producto, no solo el backlog

Si este artículo conecta con una decisión real de producto, Wavect puede ayudarte a definir, construir, endurecer o liderar el trabajo de software con criterio senior de founder.

Rutas de servicio útiles:

Tu bandeja, sin ruido

Sigue el trabajo que te importa

Recibe un correo breve cuando publiquemos algo nuevo. Sigue todo el blog o solo los temas que te interesan.

¿Qué quieres recibir?
Elige tus temas

Gratis, doble opt-in y sin píxeles de seguimiento.

Volver
Kevin Riedl

13 min de lectura · 19 de julio de 2026
Última revisión

Siguiente

Recibe la próxima nota de campo sobre IA y agentes

Un correo breve cuando publiquemos. Sin píxeles de seguimiento ni contenido de relleno.

Gratis, doble opt-in y sin píxeles de seguimiento.