SpaceXAI wypuszcza Grok 4.6: aktualizacja post‑treningu, ceny bez zmian i nowy poziom rozumowania xhigh
12 sierpnia 2026 roku SpaceXAI (dawniej xAI) opublikowała na oficjalnym blogu zapowiedź modelu Grok 4.6, bezpośredniego następcy Groka 4.5. Model jest dostępny od razu w Cursorze i Grok Build, przez API na console.x.ai oraz u partnerów: OpenRouter, Vercel i Cloudflare, z podwojonym limitem użycia w pierwszym tygodniu (źródło: SpaceXAI, oficjalna zapowiedź). Dokumentacja API podaje 2 USD za milion tokenów wejściowych, 0,50 USD za milion tokenów wejściowych z cache’u i 6 USD za milion tokenów wyjściowych — do 200 000 tokenów promptu; powyżej tego progu stawki się podwajają (4 USD / 1 USD / 12 USD). Wariant „fast” kosztuje dwa razy tyle co stawka standardowa. Okno kontekstu ma 500 000 tokenów, tak samo jak w Groku 4.5, a model przyjmuje na wejściu tekst i obrazy, ale generuje wyłącznie tekst (źródło: SpaceXAI, API release notes).
SpaceXAI wymienia cztery poziomy rozumowania — low, medium, high (domyślny) oraz nowy xhigh — i publikuje zestaw benchmarków dla konfiguracji High: Artificial Analysis Intelligence Index 61, GDPval‑AA v2 1753 Elo, CursorBench v3.2 69,9%, DeepSWE v1.1 65,9%, FrontierCode v1.1 61,3%, APEX‑Agents 57,5%, APEX‑SWE 56,4%, AA‑Briefcase 1577, Harvey LAB 15,8% i Terminal‑Bench v3.0 26% (źródło: SpaceXAI, oficjalna zapowiedź). Niezależna instytucja Artificial Analysis potwierdza indeks inteligencji 61, ceny 2 USD i 6 USD za milion tokenów oraz szerokość okna, dodając szybkość generowania 65,5 tokena na sekundę — poniżej mediany porównywalnych modeli (źródło: Artificial Analysis, niezależna karta modelu).
VentureBeat pisze, że z takimi wynikami Grok 4.6 wyprzedza Kimi K3 i zrównuje się z GPT‑5.6 Sol, zajmując trzecie miejsce w rankingu Artificial Analysis. Wszystkie benchmarki poza indeksem Artificial Analysis pochodzą jednak od producenta i nie zostały zweryfikowane przez niezależne strony trzecie. Liczbę parametrów (około 1,5 biliona) podają niektóre agregatory, ale nie pojawia się ona w żadnym oficjalnym źródle i nie da się jej sprawdzić (źródło: nieokreślone agregatory). Również data odcięcia wiedzy (1 lutego 2026) pochodzi ze źródeł nieoficjalnych (MarkTechPost) i nie ma potwierdzenia w dokumentacji SpaceXAI. Nikt też niezależnie nie policzył, ile realnie kosztuje podwojenie stawek powyżej 200 000 tokenów promptu przy długich obciążeniach agentowych — rzeczywisty koszt intensywnego użycia pozostaje niewiadomą.
W Terminal‑Bench v3.0, który mierzy inżynierię oprogramowania z wiersza poleceń, Grok 4.6 zatrzymuje się na 26% wobec 34% przypisywanych GPT‑5.6 Sol Max: według tabel rozpowszechnianych przez samą SpaceXAI to najsłabszy punkt modelu.
SpaceXAI przypisuje skok wydajności dodatkowemu treningowi na wyselekcjonowanych danych wygenerowanych przez sam model, ulepszonemu optymalizatorowi i agentowemu uczeniu przez wzmacnianie w wielu domenach — a nie większemu modelowi bazowemu. Publikacja wag nie jest przewidziana: model pozostaje dostępny wyłącznie przez API i platformy partnerskie.
Grok 4.6 pojawia się jakieś pięć tygodni po Groku 4.5 i nie rusza cennika. W roku, w którym porównanie czołowych modeli przesunęło się z bezwzględnego wyniku na stosunek inteligencji do ceny — zwłaszcza przy obciążeniach agentowych, gdzie jedno zadanie potrafi pochłonąć miliony tokenów — pozycjonowanie jest jasne: tania alternatywa dla modeli o tym samym wyniku.
Podsumowując, Grok 4.6 to przyrostowa aktualizacja post‑treningu, z wyraźną poprawą w części benchmarków (DeepSWE, APEX‑Agents, GDPval‑AA v2, AA‑Briefcase) i polityką cenową niezmienioną wobec Groka 4.5. Brak niezależnej weryfikacji większości wyników, brak danych o kosztach w dłuższym okresie i słaby punkt w Terminal‑Bench każą jednak podchodzić do całościowej oceny ostrożnie.
Come Olya ha verificato questa notizia
- Verificato
- Otworzyłam oficjalną zapowiedź na x.ai/news/grok-4-6 i notatki wydania dla deweloperów na docs.x.ai: potwierdzają datę, dostępność, dwuprogowy cennik, kontekst 500 000 tokenów i nowy poziom rozumowania xhigh. Wynik 61 w indeksie, ceny i szerokość okna znalazłam niezależnie także na karcie Artificial Analysis, która dokłada pomiar szybkości (65,5 tokena/s). Miejsce w rankingu oraz porównanie z Kimi K3 i GPT‑5.6 Sol pochodzą z materiału VentureBeat; analiza techniczna MarkTechPost potwierdza modalności, progi cenowe i brak otwartych wag. Nic nie opiera się na przeciekach ani nieoficjalnych zapowiedziach: dane bez źródła pierwotnego (parametry, data odcięcia wiedzy) przeniosłam do niepewności.
- Incertezze
- Wszystkie benchmarki poza indeksem Artificial Analysis to deklaracje producenta, nieodtworzone przez niezależne strony trzecie. Liczba parametrów (część agregatorów mówi o 1,5 biliona) nie występuje w żadnym oficjalnym źródle i jest niesprawdzalna. Data odcięcia wiedzy (1 lutego 2026, podawana przez MarkTechPost) również nie ma potwierdzenia w oficjalnej dokumentacji. Niektóre serwisy agregujące podają 7 sierpnia jako datę premiery: oficjalna zapowiedź i branżowe media datują start na 12 sierpnia 2026. Brakuje wreszcie niezależnych danych o realnym koszcie długich sesji agentowych, gdzie podwojenie stawek powyżej 200 000 tokenów promptu potrafi mocno zmienić rachunek.
- Perché pubblicarla
- To premiera z pierwszej linii, udokumentowana źródłem pierwotnym, ze sprawdzalnymi liczbami i danymi cenowymi, które ważą więcej niż sam wynik: deklarowany poziom GPT‑5.6 w indeksie Artificial Analysis przy ułamku kosztu za token. Dotyczy wprost tych, którzy wybierają model do agentów i programowania, i pozwala opisać bez patosu zarówno słaby punkt (26% w Terminal‑Bench), jak i ograniczenie strukturalne (żadnych otwartych wag, żadnego self‑hostingu), które ciąży wszystkim z wymogami suwerenności danych.