Volver
Kevin Riedl

9 min de lectura · 25 Jun 2026
Última revisión

Siguiente
Se crea en tu dispositivo, sin conectar con Instagram. Copiamos el enlace para su sticker de enlace.

Mejores LLM de pesos abiertos en 2026: DeepSeek, Qwen, Kimi, GLM y Llama

No existe un modelo de pesos abiertos universalmente mejor. A 2 de septiembre de 2026, DeepSeek V4 ofrece dos niveles muy grandes con licencia MIT, Qwen3.8 incluye un checkpoint multimodal de 27B bajo Apache 2.0 y un modelo disperso de 2,4T bajo su propia licencia Max, Kimi K3 combina multimodalidad nativa y una ventana de 1M bajo licencia propia, GLM-5.3 se centra en coding de largo horizonte con una nueva licencia permisiva propia y Llama 4 mantiene un ecosistema amplio, pero excluye a desarrolladores establecidos en la UE de la concesión multimodal.

"Pesos abiertos" solo significa que los pesos se pueden descargar. No garantiza una licencia aprobada por la Open Source Initiative, hardware barato, comportamiento idéntico entre API y despliegue propio ni calidad útil en el contexto máximo anunciado. Selecciona el checkpoint y la licencia exactos y después prueba tus tareas.

Perspectiva de ingeniería, no discurso comercial. Revisamos las fichas, repositorios y licencias oficiales el 2 de septiembre de 2026. Las tablas de benchmarks de los proveedores son evidencia útil del lanzamiento, pero sus harnesses y ajustes difieren y no demuestran un ganador neutral.

¿Necesitas una selección ajustada a tareas, límites de la UE y presupuesto de GPU?

 Seleccionar modelos para mi carga

¿Qué distingue a las familias actuales?

  • DeepSeek V4. Los repositorios oficiales actuales incluyen V4 Flash-0731 y V4 Pro-0813, ambos bajo MIT. La ficha original documenta contexto de 1M y arquitecturas dispersas; los checkpoints fechados sustituyen a las versiones preliminares.
  • Qwen3.8. La colección oficial de Alibaba incluye un modelo multimodal de 27B y otro disperso de 2,4T totales y 95B activos. La ficha de 27B indica 262.144 tokens nativos, extensión a 1M con YaRN y Apache 2.0. El checkpoint de 2,4T usa la licencia Qwen3.8-Max, con condiciones para productos muy grandes y grandes negocios MaaS o de asistentes de trabajo con IA. La extensión es una configuración de serving, no una garantía de calidad a 1M.
  • Kimi K3. La ficha de Moonshot declara 2,8T parámetros totales y 104B activos, entrada nativa de texto, imagen y vídeo y contexto de 1M. La licencia Kimi K3 añade condiciones para grandes negocios de modelo como servicio y productos comerciales muy grandes, pero exime el uso interno de esas condiciones adicionales.
  • GLM-5.3. Z.ai publicó GLM-5.3 después de GLM-5.2. Usa el mismo modelo base de 753B, se evalúa con hasta 1M de contexto y cambia el postentrenamiento para coding y tareas largas. Su licencia GLM-5.3 es permisiva, pero no está etiquetada como MIT. La afirmación anterior sobre MIT ya no describe el checkpoint actual.
  • Llama 4. La ficha de Meta enumera Scout con 109B totales, 17B activos y contexto de 10M, y Maverick con 400B totales, 17B activos y contexto de 1M. La política de uso no concede derechos multimodales a personas domiciliadas ni empresas con sede principal en la UE. Sí exceptúa expresamente a los usuarios finales de productos que incorporen los modelos.

Soofi S pertenece a otra categoría. Nuestro análisis para compradores separa evidencia pública de planes. Nuestro análisis de la API de Kimi K3 trata el servicio alojado como una compra distinta de ejecutar los pesos descargables.

Tamaño, contexto, licencia y despliegue

FamiliaCheckpoint actualTamaño publicadoContextoLicenciaImplicación
DeepSeekV4 Flash-0731 / Pro-0813304B / 1,7T totalesFamilia V4: 1MMITDespliegue multi-GPU grande; calcular según formato exacto
QwenQwen3.8-27B / 2.4T-A95B27B denso / 2,4T totales, 95B activos27B: 262.144 nativos, extensible a 1MApache 2.0 / licencia Qwen3.8-Max27B es mucho más accesible; 2,4T requiere clúster
KimiKimi K32,8T totales / 104B activos1MLicencia Kimi K3Clúster y revisión específica de licencia
GLMGLM-5.3753B totales1MLicencia GLM-5.3Multi-GPU serio o serving experimental con offload
LlamaLlama 4 Scout / Maverick109B / 17B activos; 400B / 17B activos10M / 1MLicencia comunitaria Llama 4Resolver primero la restricción para desarrolladores de la UE

Son límites máximos, no garantías de calidad. Las secuencias largas aumentan la caché KV y pueden reducir la concurrencia. La cuantización cambia la memoria y a veces la calidad. No conviertas parámetros en una cifra fija de GPU sin especificar precisión, runtime, contexto, lote y redundancia.

¿Qué familia conviene probar para coding y agentes?

Las fuentes primarias permiten una lista de candidatos, no un ranking universal. Las fichas de DeepSeek Flash-0731, Qwen3.8, Kimi K3 y GLM-5.3 publican benchmarks, pero usan harnesses, niveles de razonamiento, versiones y a veces pruebas internas distintos. Compara cifras solo cuando coincidan tarea, split, harness, herramientas y método de puntuación.

  • Self-hosting multimodal manejable: empieza por Qwen3.8-27B si encajan Apache 2.0, 27B y 262K nativos.
  • Evals grandes de coding o herramientas: prueba DeepSeek V4 Flash-0731, GLM-5.3 y Kimi K3 con tasa de finalización, recuperación, latencia y coste total.
  • Contexto muy largo: prueba recuperación y finalización a tus longitudes reales. Un límite de 1M o 10M solo confirma entrada aceptada.
  • Llama 4 en la UE: obtén revisión jurídica antes de descargar o desplegar los pesos multimodales. La excepción del usuario final no es licencia para el desarrollador.
Kevin Riedl

"La ficha indica qué probar y bajo qué licencia. Tu eval indica qué desplegar. Mantén separadas ambas decisiones."

¿Puedes alojarlos en la UE?

DeepSeek V4 y Qwen3.8-27B usan licencias permisivas estándar. Qwen3.8-2.4T-A95B, GLM-5.3 y Kimi K3 conceden derechos amplios bajo textos específicos con condiciones que requieren revisión separada. Llama 4 es la excepción: su política niega derechos multimodales a desarrolladores de la UE, pero conserva una excepción para usuarios finales de productos integradores.

El self-hosting puede mantener la inferencia en un entorno controlado en la UE, pero no demuestra por sí solo cumplimiento del RGPD. Siguen haciendo falta base jurídica, minimización, retención, controles de acceso, análisis de encargados y transferencias, política de logs y respuesta a incidentes. Evalúa por separado cualquier endpoint alojado porque ubicación y contrato dependen del servicio.

Proceso de selección defendible

  1. Nombra el checkpoint exacto. La familia oculta diferencias en pesos, modalidades, contexto y licencia.
  2. Resuelve licencia y jurisdicción. Registra la revisión de licencia y pide asesoramiento en despliegues relevantes.
  3. Presupuesta la configuración real. Incluye precisión, contexto, concurrencia, overhead, redundancia y red.
  4. Ejecuta el mismo eval privado. Usa tareas representativas, prompts estables, mismas herramientas y criterios explícitos con al menos dos candidatos.
  5. Fija y monitoriza. Registra revisión de pesos, tokenizer, runtime, cuantización y configuración de seguridad.

Por qué importa el harness de evaluación

Los benchmarks públicos pueden sufrir contaminación, sobreajuste y efectos del harness. Sobre todo, no son tu carga. Unas decenas de tareas representativas con criterios claros revelan fallos que oculta un promedio. Mide finalización, latencia, coste, errores de herramientas, recuperación en contexto largo y recuperación tras un fallo.

Reflexiones finales

A 2 de septiembre de 2026, la comparación actual incluye los checkpoints 0731 y 0813 de DeepSeek V4, Qwen3.8, Kimi K3, GLM-5.3 y Llama 4. Qwen3.8-27B es el checkpoint nombrado más accesible; los mayores niveles de Qwen, DeepSeek, Kimi y GLM requieren planificación de clúster. Qwen3.8-Max, Kimi y GLM usan licencias específicas, y la restricción multimodal de Llama 4 para desarrolladores de la UE sigue siendo decisiva.

Elige el checkpoint legalmente desplegable más pequeño que supere tu eval. Trata el contexto como límite que validar, los benchmarks del proveedor como evidencia de lanzamiento y las API alojadas como productos de cumplimiento distintos de los pesos descargables.

Ayuda para IA en producción

Si estás construyendo un producto de IA y te preocupan el coste de inferencia, la arquitectura o la preparación para producción, Wavect ayuda a fundadores a convertir prototipos de IA en sistemas fiables.

Ruta de servicio:

Tu bandeja, sin ruido

Sigue el trabajo que te importa

Recibe un correo breve cuando publiquemos algo nuevo. Sigue todo el blog o solo los temas que te interesan.

¿Qué quieres recibir?
Elige tus temas

Gratis, doble opt-in y sin píxeles de seguimiento.

Volver
Kevin Riedl

9 min de lectura · 25 Jun 2026
Última revisión

Siguiente

Recibe la próxima nota de campo sobre IA y agentes

Un correo breve cuando publiquemos. Sin píxeles de seguimiento ni contenido de relleno.

Gratis, doble opt-in y sin píxeles de seguimiento.