Tencent udostępnia Hy4 preview: otwarte wagi o 770 miliardach parametrów na licencji Apache 2.0
28 sierpnia 2026 roku Tencent opublikował wagi „Tencent Hy4 preview”, udostępniając je na Hugging Face w głównym repozytorium oraz w wariancie skwantyzowanym FP8. Model korzysta z architektury Mixture-of-Experts o łącznej liczbie 770 miliardów parametrów, rozłożonych na 78 warstw: pierwsza z gęstym FFN, pozostałe 77 z MoE, każda z 256 ekspertami routowanymi i 1 współdzielonym. Dla każdego tokena uruchamia się ośmiu najwyżej ocenionych ekspertów routowanych oraz ekspert współdzielony, co tłumaczy 49 miliardów parametrów aktywnych. Deklarowane okno kontekstu wynosi 1 milion tokenów. W sposobie dystrybucji wyróżnia się licencja Apache 2.0, bez klauzul społecznościowych i bez limitów liczby użytkowników, a towarzyszy jej integracja z produktami firmy, takimi jak CodeBuddy, WorkBuddy, Yuanbao i ima, oraz dostęp przez API w Tencent Cloud TokenHub (stawki od 0,834 dolara za milion tokenów wejściowych i 2,501 za wyjściowe) i OpenRouter.
Oficjalna karta podaje wyniki 82,9% w SWE-Bench Multilingual, 65,7 w SWE-Bench Pro, 85,4 w Terminal-Bench 2.1, 64,3 w Deep SWE i 92,3 w GPQA Diamond. Firma ujawniła też rezultaty ślepej oceny przeprowadzonej wewnętrznie przez 163 ekspertów na 203 zadaniach inżynieryjnych: model uzyskał średnio 2,99 na 4,00 wobec 2,92 dla GLM-5.3 i 2,94 dla Kimi K3 — punktacje również przyznane przez Tencent, nie przez zewnętrznego oceniającego. Dokumentacja wprost przyznaje kilka operacyjnych ograniczeń architektury: model bywa wolniejszy, niż to konieczne, przy złożonych pytaniach i potrafi nadmiernie weryfikować własne odpowiedzi („can sometimes take longer than necessary to work through complex questions and may over-verify its own answers”) — fragment ten przytoczył także Reuters. W karcie modelu firma dodaje, że realny zapas do poprawy pozostaje zarówno w pretreningu, jak i w posttreningu („real headroom left in both pre-training and post-training”).
Wszystkie dostępne metryki pochodzą z ocen i procedur samego Tencentu: nie ma niezależnych audytów ani odtworzeń przez podmioty trzecie. Podobnie wzrost przepustowości end-to-end o 31,8% — przypisywany samodzielnej optymalizacji procedur treningu i inferencji — nie został opatrzony wskazaniem punktu odniesienia, nie podano też kosztów treningu ani dokładnego składu danych budowanych wspólnie z wewnętrznymi specjalistami. Ten krok stawia Tencent w wyścigu o otwarte wagi obok Alibaby, Z.ai i Moonshotu; otwarte wydanie towarzyszy monetyzacji przez API i produkty, a nie ją zastępuje.
Udostępnienie otwartych wag bez klauzul ograniczających to decyzja prosta i czytelna, ale rzeczywistą solidność architektury da się ocenić dopiero wtedy, gdy dane o wydajności wyjdą poza obieg raportów firmowych. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Przeczytałam oficjalny komunikat na tencent.com (data, ceny API, ślepa ocena z udziałem 163 ekspertów na 203 zadaniach, deklaracja +31,8% przepustowości, dostępność w produktach) oraz kartę modelu na huggingface.co/tencent/Hy4-preview (Apache 2.0, 770B/49B, 78 warstw, 256+1 ekspertów, top-8, kontekst 1 miliona tokenów, tabela benchmarków, przyznane ograniczenia). Jako niezależne potwierdzenie przeczytałam depeszę Reutersa z 28 sierpnia 2026, która samodzielnie podaje parametry, publikację na Hugging Face, przeznaczenie i zadeklarowane ograniczenia. Sprawdziłam, że wariant FP8 istnieje jako osobne repozytorium. Blogów branżowych nie użyłam jako źródła liczb: tam, gdzie ich dane nie znajdowały pokrycia w źródłach pierwotnych, trafiły do niepewności.
- Incertezze
- Wszystkie dostępne benchmarki deklaruje Tencent: brak niezależnych weryfikacji i odtworzeń przez podmioty trzecie dla SWE-Bench Multilingual, SWE-Bench Pro, Terminal-Bench 2.1, Deep SWE i GPQA Diamond, a ślepa ocena z 163 ekspertami jest w całości wewnętrzna (protokół, dobór oceniających i prompty nieopublikowane). Tabel porównawczych z GLM 5.3 i Kimi K3 na Terminal-Bench 2.1, krążących w mediach wtórnych, nie zdołałam potwierdzić w źródłach pierwotnych: pozostają poza faktami. Deklaracji o +31,8% przepustowości nie towarzyszy opis punktu odniesienia. Nie podano kosztu treningu, dokładnego składu zbioru danych ani terminu wersji innej niż preview. Metadane daty w karcie modelu nie zgadzają się z ogłoszeniem: zweryfikowana data to data komunikatu Tencentu i depeszy Reutersa, 28 sierpnia 2026.
- Perché pubblicarla
- To największe w tym tygodniu udostępnienie otwartych wag i jeden z niewielu modeli z pierwszej linii rozpowszechnianych na Apache 2.0 bez ograniczeń użycia: dla kogoś, kto rozważa self-hosting albo komercyjne wykorzystanie modelu spoza USA, licencja waży tyle co benchmarki. Sprawa jest też wzorcowym przykładem problemu metodologicznego, który śledzimy od miesięcy: imponujące liczby, wszystkie wytworzone przez tego, kto model sprzedaje, i wciąż żadnej niezależnej weryfikacji.