En este artículo
Mejores LLM de pesos abiertos en 2026: DeepSeek, Qwen, Kimi, GLM y Llama
No existe un modelo de pesos abiertos universalmente mejor. A 2 de septiembre de 2026, DeepSeek V4 ofrece dos niveles muy grandes con licencia MIT, Qwen3.8 incluye un checkpoint multimodal de 27B bajo Apache 2.0 y un modelo disperso de 2,4T bajo su propia licencia Max, Kimi K3 combina multimodalidad nativa y una ventana de 1M bajo licencia propia, GLM-5.3 se centra en coding de largo horizonte con una nueva licencia permisiva propia y Llama 4 mantiene un ecosistema amplio, pero excluye a desarrolladores establecidos en la UE de la concesión multimodal.
"Pesos abiertos" solo significa que los pesos se pueden descargar. No garantiza una licencia aprobada por la Open Source Initiative, hardware barato, comportamiento idéntico entre API y despliegue propio ni calidad útil en el contexto máximo anunciado. Selecciona el checkpoint y la licencia exactos y después prueba tus tareas.
Perspectiva de ingeniería, no discurso comercial. Revisamos las fichas, repositorios y licencias oficiales el 2 de septiembre de 2026. Las tablas de benchmarks de los proveedores son evidencia útil del lanzamiento, pero sus harnesses y ajustes difieren y no demuestran un ganador neutral.
¿Necesitas una selección ajustada a tareas, límites de la UE y presupuesto de GPU?
Seleccionar modelos para mi carga¿Qué distingue a las familias actuales?
- DeepSeek V4. Los repositorios oficiales actuales incluyen V4 Flash-0731 y V4 Pro-0813, ambos bajo MIT. La ficha original documenta contexto de 1M y arquitecturas dispersas; los checkpoints fechados sustituyen a las versiones preliminares.
- Qwen3.8. La colección oficial de Alibaba incluye un modelo multimodal de 27B y otro disperso de 2,4T totales y 95B activos. La ficha de 27B indica 262.144 tokens nativos, extensión a 1M con YaRN y Apache 2.0. El checkpoint de 2,4T usa la licencia Qwen3.8-Max, con condiciones para productos muy grandes y grandes negocios MaaS o de asistentes de trabajo con IA. La extensión es una configuración de serving, no una garantía de calidad a 1M.
- Kimi K3. La ficha de Moonshot declara 2,8T parámetros totales y 104B activos, entrada nativa de texto, imagen y vídeo y contexto de 1M. La licencia Kimi K3 añade condiciones para grandes negocios de modelo como servicio y productos comerciales muy grandes, pero exime el uso interno de esas condiciones adicionales.
- GLM-5.3. Z.ai publicó GLM-5.3 después de GLM-5.2. Usa el mismo modelo base de 753B, se evalúa con hasta 1M de contexto y cambia el postentrenamiento para coding y tareas largas. Su licencia GLM-5.3 es permisiva, pero no está etiquetada como MIT. La afirmación anterior sobre MIT ya no describe el checkpoint actual.
- Llama 4. La ficha de Meta enumera Scout con 109B totales, 17B activos y contexto de 10M, y Maverick con 400B totales, 17B activos y contexto de 1M. La política de uso no concede derechos multimodales a personas domiciliadas ni empresas con sede principal en la UE. Sí exceptúa expresamente a los usuarios finales de productos que incorporen los modelos.
Soofi S pertenece a otra categoría. Nuestro análisis para compradores separa evidencia pública de planes. Nuestro análisis de la API de Kimi K3 trata el servicio alojado como una compra distinta de ejecutar los pesos descargables.
Tamaño, contexto, licencia y despliegue
| Familia | Checkpoint actual | Tamaño publicado | Contexto | Licencia | Implicación |
|---|---|---|---|---|---|
| DeepSeek | V4 Flash-0731 / Pro-0813 | 304B / 1,7T totales | Familia V4: 1M | MIT | Despliegue multi-GPU grande; calcular según formato exacto |
| Qwen | Qwen3.8-27B / 2.4T-A95B | 27B denso / 2,4T totales, 95B activos | 27B: 262.144 nativos, extensible a 1M | Apache 2.0 / licencia Qwen3.8-Max | 27B es mucho más accesible; 2,4T requiere clúster |
| Kimi | Kimi K3 | 2,8T totales / 104B activos | 1M | Licencia Kimi K3 | Clúster y revisión específica de licencia |
| GLM | GLM-5.3 | 753B totales | 1M | Licencia GLM-5.3 | Multi-GPU serio o serving experimental con offload |
| Llama | Llama 4 Scout / Maverick | 109B / 17B activos; 400B / 17B activos | 10M / 1M | Licencia comunitaria Llama 4 | Resolver primero la restricción para desarrolladores de la UE |
Son límites máximos, no garantías de calidad. Las secuencias largas aumentan la caché KV y pueden reducir la concurrencia. La cuantización cambia la memoria y a veces la calidad. No conviertas parámetros en una cifra fija de GPU sin especificar precisión, runtime, contexto, lote y redundancia.
¿Qué familia conviene probar para coding y agentes?
Las fuentes primarias permiten una lista de candidatos, no un ranking universal. Las fichas de DeepSeek Flash-0731, Qwen3.8, Kimi K3 y GLM-5.3 publican benchmarks, pero usan harnesses, niveles de razonamiento, versiones y a veces pruebas internas distintos. Compara cifras solo cuando coincidan tarea, split, harness, herramientas y método de puntuación.
- Self-hosting multimodal manejable: empieza por Qwen3.8-27B si encajan Apache 2.0, 27B y 262K nativos.
- Evals grandes de coding o herramientas: prueba DeepSeek V4 Flash-0731, GLM-5.3 y Kimi K3 con tasa de finalización, recuperación, latencia y coste total.
- Contexto muy largo: prueba recuperación y finalización a tus longitudes reales. Un límite de 1M o 10M solo confirma entrada aceptada.
- Llama 4 en la UE: obtén revisión jurídica antes de descargar o desplegar los pesos multimodales. La excepción del usuario final no es licencia para el desarrollador.

"La ficha indica qué probar y bajo qué licencia. Tu eval indica qué desplegar. Mantén separadas ambas decisiones."
¿Puedes alojarlos en la UE?
DeepSeek V4 y Qwen3.8-27B usan licencias permisivas estándar. Qwen3.8-2.4T-A95B, GLM-5.3 y Kimi K3 conceden derechos amplios bajo textos específicos con condiciones que requieren revisión separada. Llama 4 es la excepción: su política niega derechos multimodales a desarrolladores de la UE, pero conserva una excepción para usuarios finales de productos integradores.
El self-hosting puede mantener la inferencia en un entorno controlado en la UE, pero no demuestra por sí solo cumplimiento del RGPD. Siguen haciendo falta base jurídica, minimización, retención, controles de acceso, análisis de encargados y transferencias, política de logs y respuesta a incidentes. Evalúa por separado cualquier endpoint alojado porque ubicación y contrato dependen del servicio.
Proceso de selección defendible
- Nombra el checkpoint exacto. La familia oculta diferencias en pesos, modalidades, contexto y licencia.
- Resuelve licencia y jurisdicción. Registra la revisión de licencia y pide asesoramiento en despliegues relevantes.
- Presupuesta la configuración real. Incluye precisión, contexto, concurrencia, overhead, redundancia y red.
- Ejecuta el mismo eval privado. Usa tareas representativas, prompts estables, mismas herramientas y criterios explícitos con al menos dos candidatos.
- Fija y monitoriza. Registra revisión de pesos, tokenizer, runtime, cuantización y configuración de seguridad.
Por qué importa el harness de evaluación
Los benchmarks públicos pueden sufrir contaminación, sobreajuste y efectos del harness. Sobre todo, no son tu carga. Unas decenas de tareas representativas con criterios claros revelan fallos que oculta un promedio. Mide finalización, latencia, coste, errores de herramientas, recuperación en contexto largo y recuperación tras un fallo.
Reflexiones finales
A 2 de septiembre de 2026, la comparación actual incluye los checkpoints 0731 y 0813 de DeepSeek V4, Qwen3.8, Kimi K3, GLM-5.3 y Llama 4. Qwen3.8-27B es el checkpoint nombrado más accesible; los mayores niveles de Qwen, DeepSeek, Kimi y GLM requieren planificación de clúster. Qwen3.8-Max, Kimi y GLM usan licencias específicas, y la restricción multimodal de Llama 4 para desarrolladores de la UE sigue siendo decisiva.
Elige el checkpoint legalmente desplegable más pequeño que supere tu eval. Trata el contexto como límite que validar, los benchmarks del proveedor como evidencia de lanzamiento y las API alojadas como productos de cumplimiento distintos de los pesos descargables.