Análisis de Tencent Hy4 Preview: ¿Merece un piloto con contexto de 1M?
Sí, Tencent Hy4 preview merece un piloto controlado si el trabajo de programación está limitado por contextos largos, llamadas a herramientas en varios pasos o recuperación repetida del repositorio. Todavía no es la opción predeterminada para cualquier producción. El modelo es enorme, el autoalojamiento exige un centro de datos y Tencent reconoce que esta versión temprana puede razonar y verificar durante más tiempo del necesario.
Tencent lanzó Hy4 preview el 28 de agosto de 2026 con 770.000 millones de parámetros en el backbone, 49.000 millones activos por token y más de un millón de tokens de contexto. El anuncio oficial de Tencent enumera WorkBuddy, CodeBuddy, Tencent Cloud TokenHub y OpenRouter como vías de acceso. La oferta inicial de WorkBuddy y CodeBuddy se anunció gratis durante dos semanas.
Este análisis se verificó el 1 de septiembre de 2026. Su intención es concreta: decidir si un equipo de software debe probar Hy4 en tareas de programación prolongadas. Para una selección de todo el mercado, consulta nuestra comparativa de LLM con pesos abiertos. La decisión entre retrieval, ajuste y contexto largo pertenece a la guía RAG vs fine-tuning vs long context.
Hy4 preview en 60 segundos
| Pregunta | Respuesta verificada | Implicación |
|---|---|---|
| ¿Qué es? | Un MoE con 770B totales y 49B activos | Gran capacidad con activación dispersa, no un checkpoint de 49B |
| ¿Cuánto contexto? | 1.048.576 tokens en la receta de servicio | Capacidad para entradas enormes, no garantía de recuerdo |
| ¿Licencia? | Pesos y código con Apache 2.0 | Uso comercial y autoalojamiento posibles tras la revisión jurídica normal |
| ¿Usa herramientas? | Sí, vLLM y SGLang incluyen parsers de razonamiento y herramientas | El harness propio sigue controlando permisos y recuperación |
| ¿Precio oficial? | 0,834 USD de entrada, 2,501 USD de salida y 0,042 USD de caché por 1M tokens | La reutilización real de caché puede cambiar el coste |
| ¿Autoalojamiento? | La receta apunta a 8 GPU B300 o 16 B200 | La evaluación alojada debe preceder a la compra |
¿Necesitas un piloto neutral de Hy4 con tareas reales, control de costes y criterios de aceptación?
Planificar el piloto de dos semanas¿Qué es Tencent Hy4 preview?
Hy4 preview es el modelo insignia Mixture-of-Experts disperso del equipo Hy de Tencent para programación, ofimática, análisis, juegos y ciencia. La ficha oficial en Hugging Face documenta 78 capas. La primera usa una red densa; las otras 77 contienen 256 expertos enrutados y uno compartido. Cada token activa ocho expertos enrutados y el compartido.
Los 770B describen el backbone. Una capa nativa de predicción multitoken añade 10B parámetros totales y 0,7B activos para decodificación especulativa. Por eso algunos listados muestran 780B. Gated DeepSeek Sparse Attention, IndexCache entre capas e identity Hyper-Connections buscan hacer más eficientes las entradas largas y el razonamiento sostenido.
Los pesos, una variante FP8, el código de ajuste, las instrucciones de despliegue y la licencia están en el repositorio oficial de Hy4. Es una apertura importante, pero no convierte un modelo de 770B en una descarga para portátil.
¿Qué mostró nuestra prueba en WorkBuddy?
Pedimos a Hy4 preview dentro de WorkBuddy un panel interactivo de benchmarks de modelos de IA. Lo relevante no fue solo el HTML. Escribió la lógica principal, construyó harnesses headless, verificó JavaScript contra un DOM simulado y comprobó filtros y casos límite de la simulación de costes antes de entregar.
Es una observación prometedora, no un benchmark independiente. Un panel correcto no demuestra una tasa general de éxito, seguridad ni ventaja económica. Sí propone una hipótesis útil: Hy4 puede aportar valor cuando un agente debe mantener requisitos, estado de implementación, pruebas y salidas de herramientas durante una ejecución larga.
¿Qué dicen los benchmarks de Hy4?
Tencent encargó a 163 expertos internos una evaluación ciega de 203 tareas de ingeniería. Hy4 obtuvo 2,99 sobre 4, frente a 2,92 de GLM-5.3 y 2,94 de Kimi K3. Contra GLM-5.3, Tencent publica 46,8% de victorias, 12,8% de empates y 40,4% de derrotas. Contra Kimi K3, 51,2%, 7,9% y 40,9%.
| Señal | Resultado | Qué respalda | Qué no demuestra |
|---|---|---|---|
| Evaluación de Tencent | 2,99/4 en 203 tareas | Competitividad en tareas reales del proveedor | Superioridad independiente o éxito en tu repositorio |
| SWE-bench Pro | 65,7 | Buena resolución de incidencias bajo ese harness | Mantenibilidad, latencia o seguridad |
| DeepSWE | 64,3 | Potencial como agente de programación | Comprensión fiable con un millón de tokens |
| SWE-bench Multilingual | 82,9 | Programación multilingüe prometedora | Calidad igual en cada idioma y framework |
Estas cifras justifican una evaluación, no una migración. Los benchmarks varían en harness, herramientas, contexto, hardware, reintentos y puntuación. Hy4 también es una versión preview cuyo comportamiento de servicio puede cambiar.
¿Un millón de tokens equivale a recordar todo el repositorio?
No. El contexto máximo es capacidad de entrada, no una garantía de memoria o precisión. Puede reducir el troceado destructivo y mostrar relaciones más amplias. No garantiza que un detalle intermedio provoque la edición correcta ni que cada token enviado aporte valor.
El estudio LongCodeBench encontró caídas fuertes de rendimiento en programación al crecer el contexto de modelos anteriores, aunque admitían ventanas largas. Hy4 apareció después y no fue evaluado. El estudio respalda el método de prueba, no una puntuación para Hy4.
En producción, aporta un mapa del repositorio, límites de tarea, archivos cambiados, pruebas de aceptación y evidencia concisa. Nuestra guía los agentes de programación necesitan contexto explica por qué una estructura curada suele superar a volcar todo el código.
¿API alojada o Hy4 autoalojado?
La mayoría de equipos debe empezar con WorkBuddy, CodeBuddy, TokenHub, OpenRouter u otra ruta alojada revisada. Confirma precio, región, retención, throughput, límite de contexto y soporte de herramientas con el proveedor que vayas a contratar.
La receta oficial de vLLM utiliza 16 NVIDIA B200 u 8 B300. Los ejemplos de vLLM y SGLang ofrecen un endpoint compatible con OpenAI, pesos FP8 y parsers propios para razonamiento y herramientas. Es infraestructura viable para quien ya opera inferencia distribuida, no el primer paso de un equipo de producto.
| Ruta | Cuándo elegirla | Riesgo principal | Criterio |
|---|---|---|---|
| WorkBuddy o CodeBuddy | Prueba integral rápida | Menos control del harness y la telemetría | ¿Completa el trabajo real con evidencia? |
| API alojada | Integración, medición y herramientas | Límites, datos y variación de servicio | ¿Mejora el coste por tarea aceptada? |
| FP8 autoalojado | Volumen estable, control de datos y operaciones GPU | Capital, utilización, red, actualizaciones y guardias | ¿El TCO medido supera una API contratada? |
Consulta el modelo de equilibrio entre LLM locales y API antes de comprar hardware. El denominador correcto son las tareas aceptadas, no los tokens teóricos.
Plan de piloto de dos semanas
- Fija entre 20 y 30 tareas: errores, navegación, funciones, reparación de tests, documentos largos y fallos de herramientas.
- Mantén el harness comparable: mismos commits, instrucciones, herramientas, límites y pruebas.
- Prueba bandas de contexto: compacto, grande curado y estrés cercano al máximo.
- Mide el coste completo: entrada, caché, salida, reintentos, tiempo y minutos de revisión.
- Provoca fallos: comandos fallidos, salida malformada, archivos obsoletos y dependencias ausentes.
- Verifica seguridad: clasifica datos, limita credenciales y red, redacta logs y exige aprobación para acciones de riesgo.
- Decide por resultados: escala solo si mejoran aceptación, coste, revisión o control de datos.
Métricas comerciales que importan
- Tasa de aceptación al primer intento y coste por cambio aceptado
- Precisión de recuperación en varias posiciones del contexto
- Llamadas válidas a herramientas, recuperación y parada limpia
- Calidad de verificación y lectura correcta de fallos
- Tiempo P50 y P95, incluido el exceso de razonamiento
- Excepciones de seguridad, secretos y anulaciones manuales
Si un modelo no gana todas las funciones, separa el routing de esta reseña. Nuestra guía de compra para agentes multimodelo distribuye planificación, implementación y verificación según capacidad medida.
Ayuda para IA en producción
Si estás construyendo un producto de IA y te preocupan el coste de inferencia, la arquitectura o la preparación para producción, Wavect ayuda a fundadores a convertir prototipos de IA en sistemas fiables.
Ruta de servicio:
Recomendación
Prueba Hy4 cuando las ejecuciones largas sean un cuello de botella medido y exista una referencia real. Empieza alojado, estructura el contexto, instrumenta la caché y deja que las pruebas, no la confianza del modelo, decidan.
Espera si las tareas caben en una ventana menor, faltan tests fiables o nadie controla riesgo de proveedor y permisos. Autoaloja solo cuando un trabajo validado, la necesidad de control y la utilización estable justifiquen entre 8 y 16 GPU de centro de datos y su operación.
Fuentes primarias y vigencia
Arquitectura, acceso, precios, evaluación interna y oferta inicial proceden del anuncio de Tencent del 28 de agosto. Especificaciones, resultados públicos, límites y Apache 2.0 provienen de la ficha y el repositorio. El hardware procede de vLLM. LongCodeBench aporta un método general y no probó Hy4. Wavect no reprodujo la batería de Tencent. Precios, condiciones y límites pueden cambiar después del 1 de septiembre de 2026.
Preguntas frecuentes sobre Tencent Hy4 Preview
¿Qué es Tencent Hy4 preview?
¿Hy4 admite realmente un millón de tokens?
¿Hy4 preview es open source?
¿Cuánto cuesta la API de Hy4?
¿Hy4 funciona en un portátil o una GPU?
¿Hy4 es mejor que GLM-5.3 o Kimi K3?
¿Cuál es el mayor riesgo para agentes de programación?
Reflexiones finales
Hy4 preview merece atención porque combina un modelo abierto enorme, un millón de tokens, herramientas para agentes y precios alojados agresivos. La prueba del panel en WorkBuddy sugiere que puede sostener implementación y verificación en una tarea full stack significativa.
La compra depende de tu evidencia. Prueba repositorios reales, compara cambios aceptados, calcula todo el flujo y mantén permisos y tests externos bajo control.
