Volver
Kevin Riedl

9 min de lectura · 25 Jun 2026
Última revisión

Siguiente
Se crea en tu dispositivo, sin conectar con Instagram. Copiamos el enlace para su sticker de enlace.

LLM de pesos abiertos 2026: DeepSeek, Qwen, Kimi, GLM, Llama y Muse

No hay un modelo de pesos abiertos universalmente mejor. Esta selección se revisó el 5 de octubre de 2026. Incluye DeepSeek V4, los distintos tamaños y licencias de Qwen3.8, Kimi K3, GLM-5.3, Llama 4 y Muse Glimmer-30B de Meta. Para evaluar agentes en una estación de trabajo, compara Qwen3.8-27B con Muse Glimmer-30B. No traslades la restricción de Llama 4 para desarrolladores multimodales de la UE a la publicación independiente de Muse bajo Apache 2.0.

"Pesos abiertos" solo significa que los pesos se pueden descargar. No garantiza una licencia aprobada por la Open Source Initiative, hardware barato, comportamiento idéntico entre API y despliegue propio ni calidad útil en el contexto máximo anunciado. Selecciona el checkpoint y la licencia exactos y después prueba tus tareas.

Es una selección de compra revisada, no una lista exhaustiva de todos los modelos más recientes. Verificamos los checkpoints y licencias citados el 5 de octubre de 2026 y añadimos Muse Glimmer, antes omitido. Las tablas de los proveedores documentan sus propias pruebas, no una clasificación neutral ni un benchmark ejecutado por Wavect.

¿Necesitas una selección ajustada a tareas, límites de la UE y presupuesto de GPU?

 Seleccionar modelos para mi carga

¿Qué distingue a las familias actuales?

  • DeepSeek V4. Los repositorios oficiales actuales incluyen V4 Flash-0731 y V4 Pro-0813, ambos bajo MIT. La ficha original documenta contexto de 1M y arquitecturas dispersas; los checkpoints fechados sustituyen a las versiones preliminares.
  • Qwen3.8. La colección oficial de Alibaba incluye un modelo multimodal de 27B y otro disperso de 2,4T totales y 95B activos. La ficha de 27B indica 262.144 tokens nativos, extensión a 1M con YaRN y Apache 2.0. El checkpoint de 2,4T usa la licencia Qwen3.8-Max, con condiciones para productos muy grandes y grandes negocios MaaS o de asistentes de trabajo con IA. La extensión es una configuración de serving, no una garantía de calidad a 1M.
  • Kimi K3. La ficha de Moonshot declara 2,8T parámetros totales y 104B activos, entrada nativa de texto, imagen y vídeo y contexto de 1M. La licencia Kimi K3 añade condiciones para grandes negocios de modelo como servicio y productos comerciales muy grandes, pero exime el uso interno de esas condiciones adicionales.
  • GLM-5.3. Z.ai publicó GLM-5.3 después de GLM-5.2. Usa el mismo modelo base de 753B, se evalúa con hasta 1M de contexto y cambia el postentrenamiento para coding y tareas largas. Su licencia GLM-5.3 es permisiva, pero no está etiquetada como MIT. La afirmación anterior sobre MIT ya no describe el checkpoint actual.
  • Llama 4. La ficha de Meta enumera Scout con 109B totales, 17B activos y contexto de 10M, y Maverick con 400B totales, 17B activos y contexto de 1M. La política de uso no concede derechos multimodales a personas domiciliadas ni empresas con sede principal en la UE. Sí exceptúa expresamente a los usuarios finales de productos que incorporen los modelos.
  • Muse Glimmer-30B. La ficha oficial de Meta indica publicación en agosto de 2026 bajo Apache 2.0, unos 29.600 millones de parámetros totales con su codificador perceptivo, entrada de texto e imagen, salida textual y contexto publicado de 131.072+. Está orientado a agentes locales. Es un modelo y licencia separados de Llama 4, no la eliminación de la restricción de Llama.

Soofi S pertenece a otra categoría. Nuestro análisis para compradores separa evidencia pública de planes. Nuestro análisis de la API de Kimi K3 trata el servicio alojado como una compra distinta de ejecutar los pesos descargables.

Tamaño, contexto, licencia y despliegue

FamiliaCheckpoint actualTamaño publicadoContextoLicenciaImplicación
DeepSeekV4 Flash-0731 / Pro-0813304B / 1,7T totalesFamilia V4: 1MMITDespliegue multi-GPU grande; calcular según formato exacto
QwenQwen3.8-27B / 2.4T-A95B27B denso / 2,4T totales, 95B activos27B: 262.144 nativos, extensible a 1MApache 2.0 / licencia Qwen3.8-Max27B es mucho más accesible; 2,4T requiere clúster
KimiKimi K32,8T totales / 104B activos1MLicencia Kimi K3Clúster y revisión específica de licencia
GLMGLM-5.3753B totales1MLicencia GLM-5.3Multi-GPU serio o serving experimental con offload
LlamaLlama 4 Scout / Maverick109B / 17B activos; 400B / 17B activos10M / 1MLicencia comunitaria Llama 4Resolver primero la restricción para desarrolladores de la UE
MuseMuse Glimmer-30BUnos 29.600 millones totales, denso131,072+Apache 2.0Candidato para agentes locales; dimensionar cuantización, codificador y caché KV

Son límites máximos, no garantías de calidad. Las secuencias largas aumentan la caché KV y pueden reducir la concurrencia. La cuantización cambia la memoria y a veces la calidad. No conviertas parámetros en una cifra fija de GPU sin especificar precisión, runtime, contexto, lote y redundancia.

Separa estaciones de trabajo de despliegues en clúster

Qwen3.8-27B y Muse Glimmer-30B plantean un despliegue distinto al de checkpoints con billones de parámetros. Meta señala objetivos de 24 GB y 32 GB para sus paquetes Muse cuantizados, y 64 GB para precisión completa. Son objetivos del proveedor para configuraciones concretas, no garantías para cualquier runtime, contexto o concurrencia. Reserva memoria para caché KV, imágenes, posible modelo borrador y aplicación. Nuestra guía de Muse Glimmer para agentes locales desarrolla paquetes y pruebas concretas sin duplicar aquí esa revisión.

¿Qué familia conviene probar para coding y agentes?

Las fuentes primarias permiten una lista de candidatos, no un ranking universal. Las fichas de DeepSeek Flash-0731, Qwen3.8, Kimi K3 y GLM-5.3 publican benchmarks, pero usan harnesses, niveles de razonamiento, versiones y a veces pruebas internas distintos. Compara cifras solo cuando coincidan tarea, split, harness, herramientas y método de puntuación.

  • Para un agente multimodal en una estación de trabajo: evalúa Qwen3.8-27B y Muse Glimmer-30B en paralelo. Ambos checkpoints usan Apache 2.0, pero difieren en contexto, herramientas, cuantización y compatibilidad del runtime.
  • Evals grandes de coding o herramientas: prueba DeepSeek V4 Flash-0731, GLM-5.3 y Kimi K3 con tasa de finalización, recuperación, latencia y coste total.
  • Contexto muy largo: prueba recuperación y finalización a tus longitudes reales. Un límite de 1M o 10M solo confirma entrada aceptada.
  • Llama 4 en la UE: obtén revisión jurídica antes de descargar o desplegar los pesos multimodales. La excepción del usuario final no es licencia para el desarrollador.
Kevin Riedl

"La ficha indica qué probar y bajo qué licencia. Tu eval indica qué desplegar. Mantén separadas ambas decisiones."

¿Puedes alojarlos en la UE?

DeepSeek V4, Qwen3.8-27B y Muse Glimmer-30B usan licencias permisivas estándar para los pesos citados. Qwen3.8-2.4T-A95B, GLM-5.3 y Kimi K3 tienen textos específicos que requieren revisión. La política multimodal de Llama 4 excluye derechos de desarrollo para los usuarios de la UE indicados y exceptúa usuarios finales de productos que lo integran. Esa regla de Llama no es la licencia de Muse. Ninguna licencia de pesos demuestra por sí sola cumplimiento del RGPD.

El self-hosting puede mantener la inferencia en un entorno controlado en la UE, pero no demuestra por sí solo cumplimiento del RGPD. Siguen haciendo falta base jurídica, minimización, retención, controles de acceso, análisis de encargados y transferencias, política de logs y respuesta a incidentes. Evalúa por separado cualquier endpoint alojado porque ubicación y contrato dependen del servicio.

Proceso de selección defendible

  1. Nombra el checkpoint exacto. La familia oculta diferencias en pesos, modalidades, contexto y licencia.
  2. Resuelve licencia y jurisdicción. Registra la revisión de licencia y pide asesoramiento en despliegues relevantes.
  3. Presupuesta la configuración real. Incluye precisión, contexto, concurrencia, overhead, redundancia y red.
  4. Ejecuta el mismo eval privado. Usa tareas representativas, prompts estables, mismas herramientas y criterios explícitos con al menos dos candidatos.
  5. Fija y monitoriza. Registra revisión de pesos, tokenizer, runtime, cuantización y configuración de seguridad.

Por qué importa el harness de evaluación

Los benchmarks públicos pueden sufrir contaminación, sobreajuste y efectos del harness. Sobre todo, no son tu carga. Unas decenas de tareas representativas con criterios claros revelan fallos que oculta un promedio. Mide finalización, latencia, coste, errores de herramientas, recuperación en contexto largo y recuperación tras un fallo.

Preguntas frecuentes

¿La restricción europea de Llama 4 se aplica a Muse Glimmer?
No confundas las publicaciones. La ficha revisada de Muse Glimmer-30B especifica Apache 2.0. La política multimodal de Llama 4 tiene su propia restricción para desarrolladores de la UE y excepción para usuarios finales. Revisa el checkpoint y la ley aplicable, no atribuyas una única licencia a todos los modelos Meta.
¿Qué modelos debería probar localmente un equipo pequeño?
En esta selección, Qwen3.8-27B y Muse Glimmer-30B son candidatos para estaciones de trabajo. Verifica paquete de pesos, runtime, memoria disponible, longitud de contexto y concurrencia antes de asumir que encajan.
¿El contexto más largo significa el mejor modelo?
No. El tamaño máximo admitido no demuestra precisión de recuperación, éxito en tareas o concurrencia asequible. Prueba longitudes reales y recuperación ante errores.
¿Son resultados de benchmarks de Wavect?
No. Las especificaciones y benchmarks de lanzamiento proceden de las fuentes primarias enlazadas. El proceso de selección es nuestra recomendación técnica, no una afirmación de haber ejecutado nuevas pruebas comparativas.

Reflexiones finales

La selección de octubre de 2026 diferencia Qwen3.8-27B y Muse Glimmer-30B, candidatos para estaciones de trabajo, de checkpoints mucho mayores. Evalúa licencias por checkpoint, especialmente Muse frente a Llama 4. Elige la configuración legalmente utilizable más pequeña que supere tus pruebas, y analiza las API alojadas aparte de los pesos descargables.

Ayuda para IA en producción

Si estás construyendo un producto de IA y te preocupan el coste de inferencia, la arquitectura o la preparación para producción, Wavect ayuda a fundadores a convertir prototipos de IA en sistemas fiables.

Ruta de servicio:

Tu bandeja, sin ruido

Sigue el trabajo que te importa

Recibe un correo breve cuando publiquemos algo nuevo. Sigue todo el blog o solo los temas que te interesan.

¿Qué quieres recibir?
Elige tus temas

Gratis, doble opt-in y sin píxeles de seguimiento.

Volver
Kevin Riedl

9 min de lectura · 25 Jun 2026
Última revisión

Siguiente

Recibe la próxima nota de campo sobre IA y agentes

Un correo breve cuando publiquemos. Sin píxeles de seguimiento ni contenido de relleno.

Gratis, doble opt-in y sin píxeles de seguimiento.