Tencent rilascia Hy4 preview: pesi aperti da 770 miliardi di parametri e licenza Apache 2.0
Il 28 agosto 2026 Tencent ha pubblicato i pesi di «Tencent Hy4 preview», rendendoli disponibili su Hugging Face nel repository principale e nella variante quantizzata FP8. Il modello adotta un'architettura Mixture-of-Experts con 770 miliardi di parametri complessivi ed è strutturato su 78 layer: il primo con FFN densa, i restanti 77 con MoE, ciascuno da 256 esperti instradati più 1 condiviso. Per ogni token si attivano gli 8 esperti instradati con punteggio più alto più quello condiviso, spiegando i 49 miliardi di parametri attivi. La finestra di contesto dichiarata è di 1 milione di token. La scelta distributiva si distingue per l'adozione della licenza Apache 2.0 priva di clausole comunitarie o limiti sui volumi di utenti, accompagnata dall'integrazione nei prodotti aziendali come CodeBuddy, WorkBuddy, Yuanbao e ima, oltre all'accesso API su Tencent Cloud TokenHub (con tariffe da 0,834 dollari per milione di token in input e 2,501 in output) e OpenRouter.
La scheda ufficiale riporta punteggi di 82,9% su SWE-Bench Multilingual, 65,7 su SWE-Bench Pro, 85,4 su Terminal-Bench 2.1, 64,3 su Deep SWE e 92,3 su GPQA Diamond. L'azienda ha inoltre reso noti i risultati di una valutazione cieca condotta internamente da 163 esperti su 203 compiti ingegneristici, dove il modello ha registrato un punteggio medio di 2,99 su 4,00 contro il 2,92 di GLM-5.3 e il 2,94 di Kimi K3 — punteggi anch'essi assegnati da Tencent, non da un valutatore terzo. La documentazione riconosce espressamente alcuni limiti operativi dell'architettura: il modello può talvolta impiegare più tempo del necessario per rispondere a quesiti complessi ed eccedere nella verifica delle proprie risposte («can sometimes take longer than necessary to work through complex questions and may over-verify its own answers»), passaggio ripreso anche da Reuters. Nella model card l'azienda aggiunge che restano margini di miglioramento reali sia nel pre-addestramento sia nel post-addestramento («real headroom left in both pre-training and post-training»).
Tutte le metriche disponibili fanno capo a valutazioni e protocolli di Tencent: non risultano audit indipendenti né riproduzioni di terze parti. Allo stesso modo, l'incremento di throughput end-to-end del 31,8% — attribuito all'ottimizzazione autonoma delle procedure di addestramento e inferenza — non viene accompagnato dalla specifica della baseline di confronto, né vengono dichiarati i costi di addestramento o la composizione esatta dei dati co-costruiti con gli specialisti interni. L'iniziativa inserisce Tencent nella competizione sui pesi aperti insieme ad Alibaba, Z.ai e Moonshot; il rilascio aperto affianca la monetizzazione via API e prodotti, non la sostituisce.
Rilasciare pesi aperti senza clausole restrittive è una scelta lineare, ma la reale consistenza dell'architettura si potrà valutare solo quando i dati prestazionali usciranno dal circuito dei report di casa madre. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Ho letto il comunicato ufficiale su tencent.com (data, prezzi API, valutazione cieca con 163 esperti su 203 compiti, +31,8% di throughput, presenza nei prodotti) e la model card su huggingface.co/tencent/Hy4-preview (Apache 2.0, 770B/49B, 78 layer, 256+1 esperti, top-8, contesto da 1 milione di token, tabella dei benchmark, limiti ammessi). Come conferma indipendente ho letto il dispaccio Reuters del 28 agosto 2026, che riporta per conto proprio parametri, pubblicazione su Hugging Face, destinazione d'uso e limiti dichiarati. Ho verificato che la variante FP8 esiste come repository separato. I blog di settore non li ho usati per i numeri: dove i loro dati non trovavano riscontro nelle fonti primarie, sono finiti tra le incertezze.
- Incertezze
- Tutti i benchmark disponibili sono dichiarati da Tencent: nessuna verifica indipendente né riproduzione di terze parti su SWE-Bench Multilingual, SWE-Bench Pro, Terminal-Bench 2.1, Deep SWE o GPQA Diamond, e la valutazione cieca con 163 esperti è interamente interna all'azienda (protocollo, selezione dei valutatori e prompt non pubblicati). Le tabelle comparative con GLM 5.3 e Kimi K3 su Terminal-Bench 2.1, circolate su testate secondarie, non le ho potute confermare sulle fonti primarie: restano fuori dai fatti. Il +31,8% di throughput non ha una baseline dichiarata. Mancano il costo di addestramento, la composizione precisa del dataset e una data per la versione non-preview. I metadati di data della model card non coincidono con l'annuncio: la data verificata è quella del comunicato Tencent e della ripresa Reuters, il 28 agosto 2026.
- Perché pubblicarla
- È il rilascio di pesi aperti più grande della settimana e uno dei pochi modelli di frontiera distribuiti sotto Apache 2.0 senza restrizioni d'uso: per chi in Italia valuta il self-hosting o l'uso commerciale di un modello non americano, la licenza pesa quanto i benchmark. Ed è un caso esemplare del problema di metodo che seguiamo da mesi: cifre impressionanti, tutte prodotte da chi vende il modello, e nessuna verifica indipendente ancora disponibile.