En este artículo
LLM de pesos abiertos 2026: DeepSeek, Qwen, Kimi, GLM, Llama y Muse
No hay un modelo de pesos abiertos universalmente mejor. Esta selección se revisó el 5 de octubre de 2026. Incluye DeepSeek V4, los distintos tamaños y licencias de Qwen3.8, Kimi K3, GLM-5.3, Llama 4 y Muse Glimmer-30B de Meta. Para evaluar agentes en una estación de trabajo, compara Qwen3.8-27B con Muse Glimmer-30B. No traslades la restricción de Llama 4 para desarrolladores multimodales de la UE a la publicación independiente de Muse bajo Apache 2.0.
"Pesos abiertos" solo significa que los pesos se pueden descargar. No garantiza una licencia aprobada por la Open Source Initiative, hardware barato, comportamiento idéntico entre API y despliegue propio ni calidad útil en el contexto máximo anunciado. Selecciona el checkpoint y la licencia exactos y después prueba tus tareas.
Es una selección de compra revisada, no una lista exhaustiva de todos los modelos más recientes. Verificamos los checkpoints y licencias citados el 5 de octubre de 2026 y añadimos Muse Glimmer, antes omitido. Las tablas de los proveedores documentan sus propias pruebas, no una clasificación neutral ni un benchmark ejecutado por Wavect.
¿Necesitas una selección ajustada a tareas, límites de la UE y presupuesto de GPU?
Seleccionar modelos para mi carga¿Qué distingue a las familias actuales?
- DeepSeek V4. Los repositorios oficiales actuales incluyen V4 Flash-0731 y V4 Pro-0813, ambos bajo MIT. La ficha original documenta contexto de 1M y arquitecturas dispersas; los checkpoints fechados sustituyen a las versiones preliminares.
- Qwen3.8. La colección oficial de Alibaba incluye un modelo multimodal de 27B y otro disperso de 2,4T totales y 95B activos. La ficha de 27B indica 262.144 tokens nativos, extensión a 1M con YaRN y Apache 2.0. El checkpoint de 2,4T usa la licencia Qwen3.8-Max, con condiciones para productos muy grandes y grandes negocios MaaS o de asistentes de trabajo con IA. La extensión es una configuración de serving, no una garantía de calidad a 1M.
- Kimi K3. La ficha de Moonshot declara 2,8T parámetros totales y 104B activos, entrada nativa de texto, imagen y vídeo y contexto de 1M. La licencia Kimi K3 añade condiciones para grandes negocios de modelo como servicio y productos comerciales muy grandes, pero exime el uso interno de esas condiciones adicionales.
- GLM-5.3. Z.ai publicó GLM-5.3 después de GLM-5.2. Usa el mismo modelo base de 753B, se evalúa con hasta 1M de contexto y cambia el postentrenamiento para coding y tareas largas. Su licencia GLM-5.3 es permisiva, pero no está etiquetada como MIT. La afirmación anterior sobre MIT ya no describe el checkpoint actual.
- Llama 4. La ficha de Meta enumera Scout con 109B totales, 17B activos y contexto de 10M, y Maverick con 400B totales, 17B activos y contexto de 1M. La política de uso no concede derechos multimodales a personas domiciliadas ni empresas con sede principal en la UE. Sí exceptúa expresamente a los usuarios finales de productos que incorporen los modelos.
- Muse Glimmer-30B. La ficha oficial de Meta indica publicación en agosto de 2026 bajo Apache 2.0, unos 29.600 millones de parámetros totales con su codificador perceptivo, entrada de texto e imagen, salida textual y contexto publicado de 131.072+. Está orientado a agentes locales. Es un modelo y licencia separados de Llama 4, no la eliminación de la restricción de Llama.
Soofi S pertenece a otra categoría. Nuestro análisis para compradores separa evidencia pública de planes. Nuestro análisis de la API de Kimi K3 trata el servicio alojado como una compra distinta de ejecutar los pesos descargables.
Tamaño, contexto, licencia y despliegue
| Familia | Checkpoint actual | Tamaño publicado | Contexto | Licencia | Implicación |
|---|---|---|---|---|---|
| DeepSeek | V4 Flash-0731 / Pro-0813 | 304B / 1,7T totales | Familia V4: 1M | MIT | Despliegue multi-GPU grande; calcular según formato exacto |
| Qwen | Qwen3.8-27B / 2.4T-A95B | 27B denso / 2,4T totales, 95B activos | 27B: 262.144 nativos, extensible a 1M | Apache 2.0 / licencia Qwen3.8-Max | 27B es mucho más accesible; 2,4T requiere clúster |
| Kimi | Kimi K3 | 2,8T totales / 104B activos | 1M | Licencia Kimi K3 | Clúster y revisión específica de licencia |
| GLM | GLM-5.3 | 753B totales | 1M | Licencia GLM-5.3 | Multi-GPU serio o serving experimental con offload |
| Llama | Llama 4 Scout / Maverick | 109B / 17B activos; 400B / 17B activos | 10M / 1M | Licencia comunitaria Llama 4 | Resolver primero la restricción para desarrolladores de la UE |
| Muse | Muse Glimmer-30B | Unos 29.600 millones totales, denso | 131,072+ | Apache 2.0 | Candidato para agentes locales; dimensionar cuantización, codificador y caché KV |
Son límites máximos, no garantías de calidad. Las secuencias largas aumentan la caché KV y pueden reducir la concurrencia. La cuantización cambia la memoria y a veces la calidad. No conviertas parámetros en una cifra fija de GPU sin especificar precisión, runtime, contexto, lote y redundancia.
Separa estaciones de trabajo de despliegues en clúster
Qwen3.8-27B y Muse Glimmer-30B plantean un despliegue distinto al de checkpoints con billones de parámetros. Meta señala objetivos de 24 GB y 32 GB para sus paquetes Muse cuantizados, y 64 GB para precisión completa. Son objetivos del proveedor para configuraciones concretas, no garantías para cualquier runtime, contexto o concurrencia. Reserva memoria para caché KV, imágenes, posible modelo borrador y aplicación. Nuestra guía de Muse Glimmer para agentes locales desarrolla paquetes y pruebas concretas sin duplicar aquí esa revisión.
¿Qué familia conviene probar para coding y agentes?
Las fuentes primarias permiten una lista de candidatos, no un ranking universal. Las fichas de DeepSeek Flash-0731, Qwen3.8, Kimi K3 y GLM-5.3 publican benchmarks, pero usan harnesses, niveles de razonamiento, versiones y a veces pruebas internas distintos. Compara cifras solo cuando coincidan tarea, split, harness, herramientas y método de puntuación.
- Para un agente multimodal en una estación de trabajo: evalúa Qwen3.8-27B y Muse Glimmer-30B en paralelo. Ambos checkpoints usan Apache 2.0, pero difieren en contexto, herramientas, cuantización y compatibilidad del runtime.
- Evals grandes de coding o herramientas: prueba DeepSeek V4 Flash-0731, GLM-5.3 y Kimi K3 con tasa de finalización, recuperación, latencia y coste total.
- Contexto muy largo: prueba recuperación y finalización a tus longitudes reales. Un límite de 1M o 10M solo confirma entrada aceptada.
- Llama 4 en la UE: obtén revisión jurídica antes de descargar o desplegar los pesos multimodales. La excepción del usuario final no es licencia para el desarrollador.

"La ficha indica qué probar y bajo qué licencia. Tu eval indica qué desplegar. Mantén separadas ambas decisiones."
¿Puedes alojarlos en la UE?
DeepSeek V4, Qwen3.8-27B y Muse Glimmer-30B usan licencias permisivas estándar para los pesos citados. Qwen3.8-2.4T-A95B, GLM-5.3 y Kimi K3 tienen textos específicos que requieren revisión. La política multimodal de Llama 4 excluye derechos de desarrollo para los usuarios de la UE indicados y exceptúa usuarios finales de productos que lo integran. Esa regla de Llama no es la licencia de Muse. Ninguna licencia de pesos demuestra por sí sola cumplimiento del RGPD.
El self-hosting puede mantener la inferencia en un entorno controlado en la UE, pero no demuestra por sí solo cumplimiento del RGPD. Siguen haciendo falta base jurídica, minimización, retención, controles de acceso, análisis de encargados y transferencias, política de logs y respuesta a incidentes. Evalúa por separado cualquier endpoint alojado porque ubicación y contrato dependen del servicio.
Proceso de selección defendible
- Nombra el checkpoint exacto. La familia oculta diferencias en pesos, modalidades, contexto y licencia.
- Resuelve licencia y jurisdicción. Registra la revisión de licencia y pide asesoramiento en despliegues relevantes.
- Presupuesta la configuración real. Incluye precisión, contexto, concurrencia, overhead, redundancia y red.
- Ejecuta el mismo eval privado. Usa tareas representativas, prompts estables, mismas herramientas y criterios explícitos con al menos dos candidatos.
- Fija y monitoriza. Registra revisión de pesos, tokenizer, runtime, cuantización y configuración de seguridad.
Por qué importa el harness de evaluación
Los benchmarks públicos pueden sufrir contaminación, sobreajuste y efectos del harness. Sobre todo, no son tu carga. Unas decenas de tareas representativas con criterios claros revelan fallos que oculta un promedio. Mide finalización, latencia, coste, errores de herramientas, recuperación en contexto largo y recuperación tras un fallo.
Preguntas frecuentes
¿La restricción europea de Llama 4 se aplica a Muse Glimmer?
¿Qué modelos debería probar localmente un equipo pequeño?
¿El contexto más largo significa el mejor modelo?
¿Son resultados de benchmarks de Wavect?
Reflexiones finales
La selección de octubre de 2026 diferencia Qwen3.8-27B y Muse Glimmer-30B, candidatos para estaciones de trabajo, de checkpoints mucho mayores. Evalúa licencias por checkpoint, especialmente Muse frente a Llama 4. Elige la configuración legalmente utilizable más pequeña que supere tus pruebas, y analiza las API alojadas aparte de los pesos descargables.