Volver
Kevin Riedl

11 min de lectura · 1 de septiembre de 2026
Última revisión

Siguiente
Se crea en tu dispositivo, sin conectar con Instagram. Copiamos el enlace para su sticker de enlace.

Análisis de Tencent Hy4 Preview: ¿Merece un piloto con contexto de 1M?

Sí, Tencent Hy4 preview merece un piloto controlado si el trabajo de programación está limitado por contextos largos, llamadas a herramientas en varios pasos o recuperación repetida del repositorio. Todavía no es la opción predeterminada para cualquier producción. El modelo es enorme, el autoalojamiento exige un centro de datos y Tencent reconoce que esta versión temprana puede razonar y verificar durante más tiempo del necesario.

Tencent lanzó Hy4 preview el 28 de agosto de 2026 con 770.000 millones de parámetros en el backbone, 49.000 millones activos por token y más de un millón de tokens de contexto. El anuncio oficial de Tencent enumera WorkBuddy, CodeBuddy, Tencent Cloud TokenHub y OpenRouter como vías de acceso. La oferta inicial de WorkBuddy y CodeBuddy se anunció gratis durante dos semanas.

Este análisis se verificó el 1 de septiembre de 2026. Su intención es concreta: decidir si un equipo de software debe probar Hy4 en tareas de programación prolongadas. Para una selección de todo el mercado, consulta nuestra comparativa de LLM con pesos abiertos. La decisión entre retrieval, ajuste y contexto largo pertenece a la guía RAG vs fine-tuning vs long context.

Hy4 preview en 60 segundos

Resumen para compradores, verificado el 1 de septiembre de 2026
PreguntaRespuesta verificadaImplicación
¿Qué es?Un MoE con 770B totales y 49B activosGran capacidad con activación dispersa, no un checkpoint de 49B
¿Cuánto contexto?1.048.576 tokens en la receta de servicioCapacidad para entradas enormes, no garantía de recuerdo
¿Licencia?Pesos y código con Apache 2.0Uso comercial y autoalojamiento posibles tras la revisión jurídica normal
¿Usa herramientas?Sí, vLLM y SGLang incluyen parsers de razonamiento y herramientasEl harness propio sigue controlando permisos y recuperación
¿Precio oficial?0,834 USD de entrada, 2,501 USD de salida y 0,042 USD de caché por 1M tokensLa reutilización real de caché puede cambiar el coste
¿Autoalojamiento?La receta apunta a 8 GPU B300 o 16 B200La evaluación alojada debe preceder a la compra

¿Necesitas un piloto neutral de Hy4 con tareas reales, control de costes y criterios de aceptación?

 Planificar el piloto de dos semanas

¿Qué es Tencent Hy4 preview?

Hy4 preview es el modelo insignia Mixture-of-Experts disperso del equipo Hy de Tencent para programación, ofimática, análisis, juegos y ciencia. La ficha oficial en Hugging Face documenta 78 capas. La primera usa una red densa; las otras 77 contienen 256 expertos enrutados y uno compartido. Cada token activa ocho expertos enrutados y el compartido.

Los 770B describen el backbone. Una capa nativa de predicción multitoken añade 10B parámetros totales y 0,7B activos para decodificación especulativa. Por eso algunos listados muestran 780B. Gated DeepSeek Sparse Attention, IndexCache entre capas e identity Hyper-Connections buscan hacer más eficientes las entradas largas y el razonamiento sostenido.

Los pesos, una variante FP8, el código de ajuste, las instrucciones de despliegue y la licencia están en el repositorio oficial de Hy4. Es una apertura importante, pero no convierte un modelo de 770B en una descarga para portátil.

¿Qué mostró nuestra prueba en WorkBuddy?

Pedimos a Hy4 preview dentro de WorkBuddy un panel interactivo de benchmarks de modelos de IA. Lo relevante no fue solo el HTML. Escribió la lógica principal, construyó harnesses headless, verificó JavaScript contra un DOM simulado y comprobó filtros y casos límite de la simulación de costes antes de entregar.

Es una observación prometedora, no un benchmark independiente. Un panel correcto no demuestra una tasa general de éxito, seguridad ni ventaja económica. Sí propone una hipótesis útil: Hy4 puede aportar valor cuando un agente debe mantener requisitos, estado de implementación, pruebas y salidas de herramientas durante una ejecución larga.

¿Qué dicen los benchmarks de Hy4?

Tencent encargó a 163 expertos internos una evaluación ciega de 203 tareas de ingeniería. Hy4 obtuvo 2,99 sobre 4, frente a 2,92 de GLM-5.3 y 2,94 de Kimi K3. Contra GLM-5.3, Tencent publica 46,8% de victorias, 12,8% de empates y 40,4% de derrotas. Contra Kimi K3, 51,2%, 7,9% y 40,9%.

SeñalResultadoQué respaldaQué no demuestra
Evaluación de Tencent2,99/4 en 203 tareasCompetitividad en tareas reales del proveedorSuperioridad independiente o éxito en tu repositorio
SWE-bench Pro65,7Buena resolución de incidencias bajo ese harnessMantenibilidad, latencia o seguridad
DeepSWE64,3Potencial como agente de programaciónComprensión fiable con un millón de tokens
SWE-bench Multilingual82,9Programación multilingüe prometedoraCalidad igual en cada idioma y framework

Estas cifras justifican una evaluación, no una migración. Los benchmarks varían en harness, herramientas, contexto, hardware, reintentos y puntuación. Hy4 también es una versión preview cuyo comportamiento de servicio puede cambiar.

¿Un millón de tokens equivale a recordar todo el repositorio?

No. El contexto máximo es capacidad de entrada, no una garantía de memoria o precisión. Puede reducir el troceado destructivo y mostrar relaciones más amplias. No garantiza que un detalle intermedio provoque la edición correcta ni que cada token enviado aporte valor.

El estudio LongCodeBench encontró caídas fuertes de rendimiento en programación al crecer el contexto de modelos anteriores, aunque admitían ventanas largas. Hy4 apareció después y no fue evaluado. El estudio respalda el método de prueba, no una puntuación para Hy4.

En producción, aporta un mapa del repositorio, límites de tarea, archivos cambiados, pruebas de aceptación y evidencia concisa. Nuestra guía los agentes de programación necesitan contexto explica por qué una estructura curada suele superar a volcar todo el código.

¿API alojada o Hy4 autoalojado?

La mayoría de equipos debe empezar con WorkBuddy, CodeBuddy, TokenHub, OpenRouter u otra ruta alojada revisada. Confirma precio, región, retención, throughput, límite de contexto y soporte de herramientas con el proveedor que vayas a contratar.

La receta oficial de vLLM utiliza 16 NVIDIA B200 u 8 B300. Los ejemplos de vLLM y SGLang ofrecen un endpoint compatible con OpenAI, pesos FP8 y parsers propios para razonamiento y herramientas. Es infraestructura viable para quien ya opera inferencia distribuida, no el primer paso de un equipo de producto.

RutaCuándo elegirlaRiesgo principalCriterio
WorkBuddy o CodeBuddyPrueba integral rápidaMenos control del harness y la telemetría¿Completa el trabajo real con evidencia?
API alojadaIntegración, medición y herramientasLímites, datos y variación de servicio¿Mejora el coste por tarea aceptada?
FP8 autoalojadoVolumen estable, control de datos y operaciones GPUCapital, utilización, red, actualizaciones y guardias¿El TCO medido supera una API contratada?

Consulta el modelo de equilibrio entre LLM locales y API antes de comprar hardware. El denominador correcto son las tareas aceptadas, no los tokens teóricos.

Plan de piloto de dos semanas

  1. Fija entre 20 y 30 tareas: errores, navegación, funciones, reparación de tests, documentos largos y fallos de herramientas.
  2. Mantén el harness comparable: mismos commits, instrucciones, herramientas, límites y pruebas.
  3. Prueba bandas de contexto: compacto, grande curado y estrés cercano al máximo.
  4. Mide el coste completo: entrada, caché, salida, reintentos, tiempo y minutos de revisión.
  5. Provoca fallos: comandos fallidos, salida malformada, archivos obsoletos y dependencias ausentes.
  6. Verifica seguridad: clasifica datos, limita credenciales y red, redacta logs y exige aprobación para acciones de riesgo.
  7. Decide por resultados: escala solo si mejoran aceptación, coste, revisión o control de datos.

Métricas comerciales que importan

  • Tasa de aceptación al primer intento y coste por cambio aceptado
  • Precisión de recuperación en varias posiciones del contexto
  • Llamadas válidas a herramientas, recuperación y parada limpia
  • Calidad de verificación y lectura correcta de fallos
  • Tiempo P50 y P95, incluido el exceso de razonamiento
  • Excepciones de seguridad, secretos y anulaciones manuales

Si un modelo no gana todas las funciones, separa el routing de esta reseña. Nuestra guía de compra para agentes multimodelo distribuye planificación, implementación y verificación según capacidad medida.

Ayuda para IA en producción

Si estás construyendo un producto de IA y te preocupan el coste de inferencia, la arquitectura o la preparación para producción, Wavect ayuda a fundadores a convertir prototipos de IA en sistemas fiables.

Ruta de servicio:

Recomendación

Prueba Hy4 cuando las ejecuciones largas sean un cuello de botella medido y exista una referencia real. Empieza alojado, estructura el contexto, instrumenta la caché y deja que las pruebas, no la confianza del modelo, decidan.

Espera si las tareas caben en una ventana menor, faltan tests fiables o nadie controla riesgo de proveedor y permisos. Autoaloja solo cuando un trabajo validado, la necesidad de control y la utilización estable justifiquen entre 8 y 16 GPU de centro de datos y su operación.

Fuentes primarias y vigencia

Arquitectura, acceso, precios, evaluación interna y oferta inicial proceden del anuncio de Tencent del 28 de agosto. Especificaciones, resultados públicos, límites y Apache 2.0 provienen de la ficha y el repositorio. El hardware procede de vLLM. LongCodeBench aporta un método general y no probó Hy4. Wavect no reprodujo la batería de Tencent. Precios, condiciones y límites pueden cambiar después del 1 de septiembre de 2026.

Preguntas frecuentes sobre Tencent Hy4 Preview

¿Qué es Tencent Hy4 preview?
Es un modelo Mixture-of-Experts del equipo Hy de Tencent para programación, agentes, ofimática, análisis, juegos y ciencia. El backbone tiene 770.000 millones de parámetros totales, 49.000 millones activos por token y una capa MTP separada de 10.000 millones.
¿Hy4 admite realmente un millón de tokens?
Sí. La ficha indica 1M y la receta de vLLM especifica 1.048.576 tokens. Es capacidad, no prueba de uso correcto de cada detalle a máxima longitud. Evalúa recuperación y éxito en varias bandas.
¿Hy4 preview es open source?
Tencent publica pesos, FP8, código, ajuste y despliegue bajo Apache 2.0. Aun así, producción exige revisar licencia, terceros, comportamiento y obligaciones regulatorias.
¿Cuánto cuesta la API de Hy4?
Tencent publica 0,834 USD por millón de tokens de entrada, 2,501 USD de salida y 0,042 USD para caché. Confirma el precio y las condiciones del proveedor elegido.
¿Hy4 funciona en un portátil o una GPU?
No en la configuración oficial completa. La receta de vLLM lista 16 B200 u 8 B300 para FP8. Las cuantizaciones comunitarias necesitan evaluación independiente de calidad, rendimiento y licencia.
¿Hy4 es mejor que GLM-5.3 o Kimi K3?
Hy4 quedó ligeramente por delante en la evaluación interna ciega de Tencent. Las diferencias fueron pequeñas y el proveedor ejecutó la prueba. Decide con tareas controladas de tus repositorios, herramientas, idiomas y criterios.
¿Cuál es el mayor riesgo para agentes de programación?
Confundir capacidad con memoria fiable, pagar razonamiento innecesario, confiar en herramientas sin controles y comprar infraestructura antes de demostrar valor con un piloto alojado.

Reflexiones finales

Hy4 preview merece atención porque combina un modelo abierto enorme, un millón de tokens, herramientas para agentes y precios alojados agresivos. La prueba del panel en WorkBuddy sugiere que puede sostener implementación y verificación en una tarea full stack significativa.

La compra depende de tu evidencia. Prueba repositorios reales, compara cambios aceptados, calcula todo el flujo y mantén permisos y tests externos bajo control.

Ayuda para IA en producción

Si estás construyendo un producto de IA y te preocupan el coste de inferencia, la arquitectura o la preparación para producción, Wavect ayuda a fundadores a convertir prototipos de IA en sistemas fiables.

Ruta de servicio:

Tu bandeja, sin ruido

Sigue el trabajo que te importa

Recibe un correo breve cuando publiquemos algo nuevo. Sigue todo el blog o solo los temas que te interesan.

¿Qué quieres recibir?
Elige tus temas

Gratis, doble opt-in y sin píxeles de seguimiento.

Volver
Kevin Riedl

11 min de lectura · 1 de septiembre de 2026
Última revisión

Siguiente

Recibe la próxima nota de campo sobre IA y agentes

Un correo breve cuando publiquemos. Sin píxeles de seguimiento ni contenido de relleno.

Gratis, doble opt-in y sin píxeles de seguimiento.