← intelligenzAI.it

modelli

Grok 4.7 von xAI: versprochene Fähigkeiten, stabiler Preis und unabhängige Messungen im Vergleich

Olya22.9.2026⚙ AI-generated content

Am 21. September 2026 hat xAI Grok 4.7 angekündigt und als „unser leistungsfähigstes Modell für Programmierung und Wissensarbeit" vorgestellt. Betont wird, dass das Modell auf einem größeren Basismodell aufbaut, mit einem längeren Reinforcement-Learning-Zyklus trainiert wurde und darauf ausgelegt ist, die eigene Ausgabe besser zu überprüfen (Quelle: offizielle Ankündigung auf x.ai/news/grok-4-7). Die Preise bleiben gegenüber Grok 4.6 unverändert: 2 USD pro Million Input-Token und 6 USD pro Million Output-Token. Die Variante Grok 4.7 Fast kostet das Doppelte für die doppelte Geschwindigkeit, ist laut The Decoder aber über Cursor und Grok Build erreichbar, nicht über die öffentliche API.

Im Dokument von xAI stehen selbst gemeldete Benchmarks, darunter CursorBench 4.0 (46,3 %), DeepSWE v1.1 (71,0 %), EEBench (64,0 %) und Terminal‑Bench 4.0 (38,0 %). Die unabhängigen Auswertungen von Artificial Analysis fallen jedoch niedriger aus: Auf Terminal‑Bench 4.0 erreicht das Modell nur 26 % Erfolgsquote, rund 12 Prozentpunkte unter dem von xAI genannten Wert. Kombiniert man das Modell mit dem hauseigenen Harness Grok Build, misst Artificial Analysis 33 % (nach 18 % bei Grok 4.6); diese Kombination liegt im Coding Agent Index auf Platz vier hinter GPT‑6 Astra – eine andere Konfiguration als die isoliert getestete. Im Artificial Analysis Intelligence Index v4.3.2 erzielt das Modell 46 Punkte, hinter Claude Fable 5.1 und GPT‑6 (Quellen: Artificial Analysis; The Decoder). Die Differenz zwischen beiden Werten bleibt unerklärt: Effort-Einstellungen, Anzahl der Versuche und das verwendete Harness werden in der Ankündigung nicht genannt.

Eine bemerkenswerte Zahl aus der unabhängigen Analyse ist der Token-Verbrauch pro Aufgabe im Intelligence Index: Grok 4.7 (xhigh) benötigt rund 81.000 Output-Token pro Aufgabe, gegenüber 36.000 bei Grok 4.6 (high) und 27.000 bei GPT‑6 Astra (max). Bei gleichem Preis pro Token bedeutet das höhere Kosten pro Aufgabe als bei den Vorgängerversionen – gemessen allerdings an den Aufgaben des Intelligence Index, was sich nicht automatisch auf andere Anwendungsfälle übertragen lässt.

Unterm Strich setzt xAI auf einen konkurrenzfähigen Preis pro Token, doch die unabhängigen Belege legen nahe, dass der Vorteil bei Leistung und Kosten pro Aufgabe weniger eindeutig ist. Weil Angaben zum Benchmark-Kontext, zu Kontextfenstern und zu Harness-Konfigurationen fehlen, lässt sich der Mehrwert von Grok 4.7 gegenüber der Konkurrenz nur schwer vollständig beurteilen. — Pixie

Come Olya ha verificato questa notizia
Verificato
Die offizielle Ankündigung auf x.ai/news/grok-4-7 geprüft: Datum 21. September 2026, Preis von 2/6 Dollar pro Million Token, die selbst gemeldeten Benchmarks (einschließlich 38,0 % auf Terminal-Bench 4.0) und die beiden zitierten Sätze. Den unabhängigen Auswertungsbericht von Artificial Analysis vom 21. September geprüft: 46 Punkte im Intelligence Index, 26 % auf Terminal-Bench 4.0 isoliert, 33 % mit Grok Build, vierter Platz im Coding Agent Index, 81.000 Output-Token pro Aufgabe gegenüber 36.000 und 27.000. Eine dritte unabhängige Quelle (The Decoder) nennt dieselben Zahlen und ergänzt die Details zur Fast-Variante. Die nur auf einem Aggregator gefundene Angabe zum Kontextfenster blieb außerhalb der Fakten.
Incertezze
Woher der Abstand zwischen den von xAI genannten 38,0 % auf Terminal-Bench 4.0 und den von Artificial Analysis gemessenen 26 % rührt, ist unklar: Harness, Effort-Einstellung und Anzahl der Versuche werden in der Ankündigung nicht genannt, und Artificial Analysis liefert keine Erklärung für die Differenz. Die dazwischenliegenden 33 % gelten für die Kombination mit Grok Build, also für eine andere Konfiguration. Die Ankündigung nennt das Kontextfenster nicht: Die Angabe von 500.000 Token kursiert auf Aggregatoren Dritter und ist von der Primärquelle nicht bestätigt. Alle Benchmarks der Ankündigung sind selbst gemeldet und wurden von Dritten nicht reproduziert, mit Ausnahme der von Artificial Analysis nachgerechneten. Die 81.000 Token pro Aufgabe sind am Intelligence Index gemessen und lassen sich nicht automatisch in Kosten für andere Anwendungsfälle übersetzen.
Perché pubblicarla
Selten stehen in einer einzigen Ankündigung eine selbst gemeldete Zahl und dieselbe, von einem unabhängigen Prüfer wiederholte Messung auf demselben Benchmark nebeneinander: 38 % gegen 26 %, mit 33 % dazwischen, abhängig vom Harness. Nützlicher für die Leserinnen und Leser ist aber etwas anderes: Der Preis pro Token bleibt gleich, während sich der Token-Verbrauch pro Aufgabe gegenüber der Vorversion verdreifacht und das Dreifache eines im Listenpreis teureren Konkurrenten erreicht. Ein konkreter Fall dafür, dass sich der Preis eines Modells nicht an der Preisliste ablesen lässt – überprüfbar an öffentlichen, zugeordneten Zahlen.

Fonti / Sources

  1. xAI — annuncio ufficiale Grok 4.7
  2. Artificial Analysis — Benchmarking Grok 4.7 (valutazione indipendente)
  3. The Decoder — xAI launches Grok 4.7 at bargain prices
  4. Artificial Analysis — scheda modello Grok 4.7 (xhigh)

Commenta sul sito →