Tencent veröffentlicht Hy4 preview: offene Gewichte mit 770 Milliarden Parametern und Apache-2.0-Lizenz
Am 28. August 2026 hat Tencent die Gewichte von „Tencent Hy4 preview“ veröffentlicht und auf Hugging Face im Hauptrepository sowie in der FP8-quantisierten Variante bereitgestellt. Das Modell nutzt eine Mixture-of-Experts-Architektur mit insgesamt 770 Milliarden Parametern, verteilt auf 78 Layer: der erste mit dichtem FFN, die übrigen 77 mit MoE, jeder davon mit 256 gerouteten Experten plus 1 geteiltem. Pro Token werden die acht am höchsten bewerteten gerouteten Experten aktiviert, dazu der geteilte — daher die 49 Milliarden aktiven Parameter. Das angegebene Kontextfenster liegt bei 1 Million Token. Bemerkenswert an der Distribution ist die Apache-2.0-Lizenz ohne Community-Klauseln und ohne Obergrenzen bei den Nutzerzahlen, begleitet von der Integration in Unternehmensprodukte wie CodeBuddy, WorkBuddy, Yuanbao und ima sowie vom API-Zugang über Tencent Cloud TokenHub (Tarife ab 0,834 Dollar je Million Token im Input und 2,501 im Output) und OpenRouter.
Das offizielle Datenblatt nennt 82,9 % auf SWE-Bench Multilingual, 65,7 auf SWE-Bench Pro, 85,4 auf Terminal-Bench 2.1, 64,3 auf Deep SWE und 92,3 auf GPQA Diamond. Zudem hat das Unternehmen die Ergebnisse einer intern durchgeführten Blindbewertung veröffentlicht: 163 Fachleute, 203 Engineering-Aufgaben, ein Durchschnitt von 2,99 von 4,00 gegenüber 2,92 für GLM-5.3 und 2,94 für Kimi K3 — auch diese Punktzahlen vergibt Tencent selbst, nicht eine dritte Instanz. Die Dokumentation räumt einige betriebliche Grenzen der Architektur ausdrücklich ein: Das Modell brauche bei komplexen Fragen mitunter länger als nötig und überprüfe seine eigenen Antworten unter Umständen zu ausgiebig („can sometimes take longer than necessary to work through complex questions and may over-verify its own answers“) — eine Passage, die auch Reuters aufgegriffen hat. In der Model Card ergänzt das Unternehmen, es bleibe echter Spielraum nach oben sowohl im Pre- als auch im Post-Training („real headroom left in both pre-training and post-training“).
Sämtliche verfügbaren Kennzahlen gehen auf Bewertungen und Protokolle von Tencent zurück: unabhängige Audits oder Reproduktionen Dritter liegen nicht vor. Ebenso fehlt beim Zuwachs von 31,8 % beim End-to-End-Durchsatz — zugeschrieben der autonomen Optimierung von Trainings- und Inferenzabläufen — jede Angabe zur Vergleichsbasis; ebenso wenig genannt werden die Trainingskosten oder die genaue Zusammensetzung der gemeinsam mit internen Fachleuten aufgebauten Daten. Der Schritt stellt Tencent neben Alibaba, Z.ai und Moonshot in den Wettbewerb um offene Gewichte; die offene Veröffentlichung tritt neben die Monetarisierung über API und Produkte, sie ersetzt sie nicht.
Offene Gewichte ohne einschränkende Klauseln freizugeben ist eine geradlinige Entscheidung. Wie belastbar die Architektur wirklich ist, lässt sich aber erst beurteilen, wenn die Leistungsdaten den Kreislauf der hauseigenen Berichte verlassen. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Ich habe die offizielle Mitteilung auf tencent.com gelesen (Datum, API-Preise, Blindbewertung mit 163 Fachleuten und 203 Aufgaben, die Behauptung von +31,8 % Durchsatz, Verfügbarkeit in den Produkten) sowie die Model Card auf huggingface.co/tencent/Hy4-preview (Apache 2.0, 770B/49B, 78 Layer, 256+1 Experten, Top-8, Kontext von 1 Million Token, Benchmark-Tabelle, eingeräumte Grenzen). Als unabhängige Bestätigung habe ich die Reuters-Meldung vom 28. August 2026 gelesen, die Parameter, Veröffentlichung auf Hugging Face, Einsatzzweck und erklärte Grenzen eigenständig wiedergibt. Ich habe geprüft, dass die FP8-Variante als eigenes Repository existiert. Branchenblogs habe ich nicht als Quelle für Zahlen genutzt: Wo ihre Angaben in den Primärquellen keine Entsprechung fanden, sind sie unter den Unsicherheiten gelandet.
- Incertezze
- Alle verfügbaren Benchmarks stammen von Tencent: Es gibt derzeit keine unabhängigen Prüfungen und keine Reproduktionen Dritter zu SWE-Bench Multilingual, SWE-Bench Pro, Terminal-Bench 2.1, Deep SWE oder GPQA Diamond, und die Blindbewertung mit 163 Fachleuten ist vollständig hausintern (Protokoll, Auswahl der Bewertenden und Prompts unveröffentlicht). Vergleichstabellen mit GLM 5.3 und Kimi K3 auf Terminal-Bench 2.1, die in Zweitmedien kursieren, konnte ich an den Primärquellen nicht bestätigen: Sie bleiben außerhalb der Fakten. Zum Plus von 31,8 % beim Durchsatz fehlt jede Beschreibung der Vergleichsbasis. Trainingskosten, genaue Datensatzzusammensetzung und ein Termin für die Nicht-Preview-Version sind nicht angegeben. Die Datums-Metadaten der Model Card passen nicht zur Ankündigung: Das verifizierte Datum ist das der Tencent-Mitteilung und der Reuters-Meldung, der 28. August 2026.
- Perché pubblicarla
- Es ist die größte Freigabe offener Gewichte dieser Woche und eines der wenigen Frontier-Modelle unter Apache 2.0 ohne Nutzungsbeschränkungen: Wer Self-Hosting oder die kommerzielle Nutzung eines nicht-amerikanischen Modells abwägt, dem zählt die Lizenz so viel wie die Benchmarks. Der Fall steht zugleich beispielhaft für das methodische Problem, das wir seit Monaten verfolgen: beeindruckende Zahlen, allesamt von dem erzeugt, der das Modell verkauft, und bislang keine unabhängige Überprüfung.