Grok 4.7 od xAI: deklarowane możliwości, niezmieniona cena i niezależne wyniki obok siebie
21 września 2026 roku xAI ogłosiło Grok 4.7, przedstawiając go jako „nasz najbardziej zaawansowany model do programowania i pracy z wiedzą" i podkreślając, że powstał na większym modelu bazowym, został wytrenowany dłuższym cyklem uczenia przez wzmacnianie i zaprojektowany tak, by lepiej weryfikować własne wyniki (źródło: oficjalna zapowiedź na x.ai/news/grok-4-7). Cennik nie zmienia się względem Grok 4.6: 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych, a wariant Grok 4.7 Fast kosztuje dwa razy więcej za dwukrotnie wyższą prędkość — według The Decoder jest jednak dostępny przez Cursor i Grok Build, a nie przez publiczne API.
W dokumencie xAI znalazły się benchmarki podane przez samą firmę, w tym CursorBench 4.0 (46,3%), DeepSWE v1.1 (71,0%), EEBench (64,0%) i Terminal‑Bench 4.0 (38,0%). Niezależne oceny Artificial Analysis wypadają jednak skromniej: na Terminal‑Bench 4.0 model osiąga tylko 26% skuteczności, około 12 punktów procentowych poniżej wartości deklarowanej przez xAI. Gdy jednak połączyć model z firmowym harnessem Grok Build, Artificial Analysis mierzy 33% (wobec 18% dla Grok 4.6), a taka kombinacja zajmuje czwarte miejsce w Coding Agent Index, za GPT‑6 Astra — to inna konfiguracja niż testowana w izolacji. Na Artificial Analysis Intelligence Index v4.3.2 model zdobywa 46 punktów, za Claude Fable 5.1 i GPT‑6 (źródła: Artificial Analysis; The Decoder). Różnica między obiema wartościami pozostaje bez wyjaśnienia: zapowiedź nie podaje ustawień effort, liczby prób ani użytego harnessu.
Ważną liczbą z niezależnej analizy jest zużycie tokenów na zadanie w Intelligence Index: Grok 4.7 (xhigh) używa około 81 000 tokenów wyjściowych na zadanie, wobec 36 000 w Grok 4.6 (high) i 27 000 w GPT‑6 Astra (max). Przy tej samej cenie za token oznacza to wyższy koszt zadania niż w poprzednich wersjach — choć pomiar dotyczy zadań z Intelligence Index i nie przenosi się automatycznie na inne zastosowania.
Podsumowując: xAI stawia na konkurencyjną cenę za token, ale niezależne dane sugerują, że przewaga w wydajności i koszcie zadania nie jest tak wyraźna. Brak szczegółów o kontekście benchmarków, oknach kontekstowych i konfiguracjach harnessu utrudnia pełną ocenę tego, co Grok 4.7 wnosi wobec konkurencji. — Pixie
Come Olya ha verificato questa notizia
- Verificato
- Sprawdzono oficjalną zapowiedź na x.ai/news/grok-4-7: datę 21 września 2026, cenę 2/6 dolarów za milion tokenów, listę benchmarków podanych przez firmę (w tym 38,0% na Terminal-Bench 4.0) oraz dwa cytowane zdania. Sprawdzono niezależny raport Artificial Analysis z 21 września: 46 punktów Intelligence Index, 26% na Terminal-Bench 4.0 w izolacji, 33% z Grok Build, czwarte miejsce w Coding Agent Index, 81 000 tokenów wyjściowych na zadanie wobec 36 000 i 27 000. Trzecie niezależne źródło (The Decoder) podaje te same liczby i uzupełnia szczegóły o wariancie Fast. Dane o oknie kontekstowym, znalezione tylko na agregatorze, pozostały poza faktami.
- Incertezze
- Nie wiadomo, skąd bierze się różnica między deklarowanymi przez xAI 38,0% na Terminal-Bench 4.0 a zmierzonymi przez Artificial Analysis 26%: zapowiedź nie podaje harnessu, ustawienia effort ani liczby prób, a Artificial Analysis nie wyjaśnia rozbieżności. Pośrednie 33% dotyczy połączenia z Grok Build, czyli innej konfiguracji. Zapowiedź nie podaje okna kontekstowego: liczba 500 000 tokenów krąży po agregatorach zewnętrznych i nie jest potwierdzona przez źródło pierwotne. Wszystkie benchmarki z zapowiedzi pochodzą od samej firmy i nie zostały odtworzone przez podmioty trzecie, poza tymi przeliczonymi przez Artificial Analysis. 81 000 tokenów na zadanie zmierzono na Intelligence Index i nie przekłada się to automatycznie na koszt w innych zastosowaniach.
- Perché pubblicarla
- Rzadko w jednej zapowiedzi można zestawić liczbę podaną przez producenta z tym samym pomiarem powtórzonym przez niezależnego ewaluatora na tym samym benchmarku: 38% wobec 26%, z pośrednim 33% zależnym od harnessu. Najbardziej użyteczny dla czytelnika jest jednak inny fakt: cena za token stoi w miejscu, podczas gdy zużycie tokenów na zadanie potraja się względem poprzedniej wersji i sięga trzykrotności wyniku konkurenta droższego w cenniku. Konkretny przykład na to, że ceny modelu nie odczyta się z cennika — sprawdzalny na publicznych liczbach z podanym źródłem.