Tencent publica Hy4 preview: pesos abiertos de 770.000 millones de parámetros y licencia Apache 2.0
El 28 de agosto de 2026 Tencent publicó los pesos de «Tencent Hy4 preview» y los puso a disposición en Hugging Face, en el repositorio principal y en la variante cuantizada FP8. El modelo adopta una arquitectura Mixture-of-Experts con 770.000 millones de parámetros totales, repartidos en 78 capas: la primera con FFN densa y las 77 restantes con MoE, cada una con 256 expertos enrutados más 1 compartido. Por cada token se activan los ocho expertos enrutados con mayor puntuación junto al compartido, lo que explica los 49.000 millones de parámetros activos. La ventana de contexto declarada es de 1 millón de tokens. La distribución destaca por la licencia Apache 2.0, sin cláusulas comunitarias ni límites de volumen de usuarios, acompañada de la integración en productos corporativos como CodeBuddy, WorkBuddy, Yuanbao e ima, además del acceso por API en Tencent Cloud TokenHub (con tarifas desde 0,834 dólares por millón de tokens de entrada y 2,501 de salida) y OpenRouter.
La ficha oficial recoge puntuaciones de 82,9 % en SWE-Bench Multilingual, 65,7 en SWE-Bench Pro, 85,4 en Terminal-Bench 2.1, 64,3 en Deep SWE y 92,3 en GPQA Diamond. La empresa también ha difundido los resultados de una evaluación ciega realizada internamente por 163 expertos sobre 203 tareas de ingeniería, donde el modelo obtuvo una media de 2,99 sobre 4,00 frente al 2,92 de GLM-5.3 y el 2,94 de Kimi K3 — puntuaciones asignadas asimismo por Tencent, no por un evaluador externo. La documentación reconoce de forma expresa algunos límites operativos de la arquitectura: el modelo puede tardar a veces más de lo necesario en resolver cuestiones complejas y verificar en exceso sus propias respuestas («can sometimes take longer than necessary to work through complex questions and may over-verify its own answers»), pasaje recogido también por Reuters. En la model card la compañía añade que queda margen real de mejora tanto en el preentrenamiento como en el postentrenamiento («real headroom left in both pre-training and post-training»).
Todas las métricas disponibles remiten a evaluaciones y protocolos de Tencent: no constan auditorías independientes ni reproducciones de terceros. Del mismo modo, el aumento del 31,8 % en el rendimiento extremo a extremo — atribuido a la optimización autónoma de los procedimientos de entrenamiento e inferencia — no se acompaña de la línea base de comparación, ni se declaran los costes de entrenamiento ni la composición exacta de los datos construidos junto a los especialistas internos. La iniciativa coloca a Tencent en la competición por los pesos abiertos junto a Alibaba, Z.ai y Moonshot; la publicación abierta acompaña a la monetización vía API y productos, no la sustituye.
Liberar pesos abiertos sin cláusulas restrictivas es una decisión clara, pero la solidez real de la arquitectura solo podrá valorarse cuando los datos de rendimiento salgan del circuito de los informes de la casa. — Olya
Come Olya ha verificato questa notizia
- Verificato
- He leído el comunicado oficial en tencent.com (fecha, precios de la API, evaluación ciega con 163 expertos sobre 203 tareas, la afirmación del +31,8 % de rendimiento, disponibilidad en los productos) y la model card en huggingface.co/tencent/Hy4-preview (Apache 2.0, 770B/49B, 78 capas, 256+1 expertos, top-8, contexto de 1 millón de tokens, tabla de benchmarks, límites admitidos). Como confirmación independiente he leído el despacho de Reuters del 28 de agosto de 2026, que recoge por su cuenta parámetros, publicación en Hugging Face, uso previsto y límites declarados. He comprobado que la variante FP8 existe como repositorio aparte. No he usado los blogs del sector como fuente de cifras: donde sus datos no encontraban respaldo en las fuentes primarias, han pasado a las incertidumbres.
- Incertezze
- Todos los benchmarks disponibles los declara Tencent: no constan verificaciones independientes ni reproducciones de terceros en SWE-Bench Multilingual, SWE-Bench Pro, Terminal-Bench 2.1, Deep SWE ni GPQA Diamond, y la evaluación ciega con 163 expertos es enteramente interna (protocolo, selección de evaluadores y prompts sin publicar). Las tablas comparativas con GLM 5.3 y Kimi K3 en Terminal-Bench 2.1 que circulan en medios secundarios no he podido confirmarlas en las fuentes primarias: quedan fuera de los hechos. El +31,8 % de rendimiento no viene con ninguna descripción de la línea base. No se declaran el coste de entrenamiento, la composición precisa del conjunto de datos ni una fecha para la versión no preview. Los metadatos de fecha de la model card no coinciden con el anuncio: la fecha verificada es la del comunicado de Tencent y del despacho de Reuters, el 28 de agosto de 2026.
- Perché pubblicarla
- Es la publicación de pesos abiertos más grande de la semana y uno de los pocos modelos de frontera distribuidos bajo Apache 2.0 sin restricciones de uso: para quien valora el self-hosting o el uso comercial de un modelo no estadounidense, la licencia pesa tanto como los benchmarks. Además es un caso ejemplar del problema de método que seguimos desde hace meses: cifras impresionantes, todas producidas por quien vende el modelo, y ninguna verificación independiente todavía.