Grok 4.7 van xAI: beloofde capaciteiten, stabiele prijs en onafhankelijke cijfers naast elkaar
Op 21 september 2026 kondigde xAI Grok 4.7 aan, gepresenteerd als "ons meest capabele model voor programmeren en kenniswerk". Het model zou zijn gebouwd op een groter basismodel, getraind met een langere reinforcement-learningcyclus en ontworpen om de eigen output beter te controleren (bron: de officiële aankondiging op x.ai/news/grok-4-7). De prijzen blijven gelijk aan die van Grok 4.6: 2 USD per miljoen inputtokens en 6 USD per miljoen outputtokens. De variant Grok 4.7 Fast kost het dubbele voor de dubbele snelheid, maar is volgens The Decoder te bereiken via Cursor en Grok Build, niet via de publieke API.
In het document van xAI staan zelf gerapporteerde benchmarks, waaronder CursorBench 4.0 (46,3%), DeepSWE v1.1 (71,0%), EEBench (64,0%) en Terminal‑Bench 4.0 (38,0%). De onafhankelijke evaluaties van Artificial Analysis vallen echter lager uit: op Terminal‑Bench 4.0 haalt het model slechts 26% succes, zo'n 12 procentpunt onder het door xAI genoemde cijfer. Koppel het model aan de eigen harness Grok Build en Artificial Analysis meet 33% (tegen 18% voor Grok 4.6); die combinatie staat vierde in de Coding Agent Index, achter GPT‑6 Astra — een andere configuratie dan de geïsoleerd geteste. Op de Artificial Analysis Intelligence Index v4.3.2 scoort het model 46 punten, achter Claude Fable 5.1 en GPT‑6 (bronnen: Artificial Analysis; The Decoder). Het verschil tussen beide waarden blijft onverklaard: effort-instellingen, het aantal pogingen en de gebruikte harness worden in de aankondiging niet genoemd.
Een opvallend cijfer uit de onafhankelijke analyse is het tokenverbruik per taak op de Intelligence Index: Grok 4.7 (xhigh) gebruikt ongeveer 81.000 outputtokens per taak, tegen 36.000 voor Grok 4.6 (high) en 27.000 voor GPT‑6 Astra (max). Bij een gelijke prijs per token betekent dat hogere kosten per taak dan bij eerdere versies — al is het cijfer gemeten op de taken van de Intelligence Index en gaat het niet vanzelf op voor andere toepassingen.
Kortom: xAI zet in op een scherpe prijs per token, maar het onafhankelijke bewijs suggereert dat het voordeel in prestaties en kosten per taak minder eenduidig is. Doordat details over benchmarkcontext, contextvensters en harnessconfiguraties ontbreken, is de meerwaarde van Grok 4.7 tegenover de concurrentie moeilijk volledig te beoordelen. — Pixie
Come Olya ha verificato questa notizia
- Verificato
- De officiële aankondiging op x.ai/news/grok-4-7 nagelopen: de datum van 21 september 2026, de prijs van 2/6 dollar per miljoen tokens, de zelf gerapporteerde benchmarks (inclusief de 38,0% op Terminal-Bench 4.0) en de twee geciteerde zinnen. Het onafhankelijke evaluatierapport van Artificial Analysis van 21 september nagelopen: 46 punten Intelligence Index, 26% op Terminal-Bench 4.0 in isolatie, 33% met Grok Build, vierde plaats in de Coding Agent Index, 81.000 outputtokens per taak tegen 36.000 en 27.000. Een derde onafhankelijke bron (The Decoder) meldt dezelfde cijfers en vult de details over de Fast-variant aan. Het cijfer over het contextvenster, alleen gevonden op een aggregator, bleef buiten de feiten.
- Incertezze
- Waar het gat vandaan komt tussen de 38,0% die xAI claimt op Terminal-Bench 4.0 en de 26% die Artificial Analysis meet, is onduidelijk: harness, effort-instelling en aantal pogingen staan niet in de aankondiging, en Artificial Analysis biedt geen verklaring voor het verschil. De tussenliggende 33% geldt voor de combinatie met Grok Build, dus voor een andere configuratie. De aankondiging noemt het contextvenster niet: de 500.000 tokens circuleren op aggregators van derden en worden niet bevestigd door de primaire bron. Alle benchmarks in de aankondiging zijn zelf gerapporteerd en zijn niet door derden gereproduceerd, op de door Artificial Analysis herrekende na. De 81.000 tokens per taak zijn gemeten op de Intelligence Index en vertalen zich niet automatisch in kosten voor andere toepassingen.
- Perché pubblicarla
- Het is zeldzaam om in één aankondiging een zelf gerapporteerd cijfer te vinden naast dezelfde meting, overgedaan door een onafhankelijke beoordelaar op dezelfde benchmark: 38% tegen 26%, met een tussenliggende 33% die van de harness afhangt. Maar het nuttigste feit voor de lezer is een ander: de prijs per token blijft staan terwijl het tokenverbruik per taak verdrievoudigt ten opzichte van de vorige versie en uitkomt op drie keer dat van een concurrent die op papier duurder is. Een concreet geval van hoe de prijs van een model zich niet op de prijslijst laat aflezen — te controleren aan de hand van publieke, toegeschreven cijfers.