Grok 4.7 de xAI : capacités annoncées, prix inchangé et mesures indépendantes face à face
Le 21 septembre 2026, xAI a annoncé Grok 4.7 en le présentant comme « notre modèle le plus performant pour la programmation et le travail de connaissance », et en soulignant qu'il repose sur un modèle de base plus grand, entraîné avec un cycle d'apprentissage par renforcement plus long et conçu pour mieux vérifier sa propre sortie (source : annonce officielle sur x.ai/news/grok-4-7). Les tarifs ne bougent pas par rapport à Grok 4.6 : 2 USD par million de tokens en entrée et 6 USD par million de tokens en sortie, la variante Grok 4.7 Fast étant vendue au double du prix pour le double de la vitesse — mais, selon The Decoder, elle est accessible via Cursor et Grok Build, pas via l'API publique.
Le document de xAI liste des benchmarks auto-déclarés, dont CursorBench 4.0 (46,3 %), DeepSWE v1.1 (71,0 %), EEBench (64,0 %) et Terminal‑Bench 4.0 (38,0 %). Les évaluations indépendantes d'Artificial Analysis donnent pourtant des chiffres plus modestes : sur Terminal‑Bench 4.0, le modèle n'obtient que 26 % de réussite, soit environ 12 points de pourcentage sous le chiffre annoncé par xAI. En associant le modèle au harness maison Grok Build, Artificial Analysis mesure en revanche 33 % (contre 18 % pour Grok 4.6), cette combinaison se classant quatrième du Coding Agent Index derrière GPT‑6 Astra : il s'agit d'une configuration différente de celle testée isolément. Par ailleurs, sur l'Artificial Analysis Intelligence Index v4.3.2, le modèle marque 46 points, derrière Claude Fable 5.1 et GPT‑6 (sources : Artificial Analysis ; The Decoder). L'écart entre les deux valeurs reste inexpliqué : ni les réglages d'effort, ni le nombre de tentatives, ni le harness utilisé ne sont précisés dans l'annonce.
Un chiffre marquant issu de l'analyse indépendante est la consommation de tokens par tâche sur l'Intelligence Index : Grok 4.7 (xhigh) utilise environ 81 000 tokens de sortie par tâche, contre 36 000 pour Grok 4.6 (high) et 27 000 pour GPT‑6 Astra (max). À prix par token identique, cela implique un coût par tâche plus élevé que pour les versions précédentes — mais la mesure porte sur les tâches de l'Intelligence Index et ne se transpose pas automatiquement à d'autres usages.
En somme, xAI mise sur un prix par token compétitif, mais les éléments indépendants suggèrent que l'avantage en performance et en coût par tâche est moins net qu'il n'y paraît. Faute de détails sur le contexte des benchmarks, les fenêtres de contexte et les configurations de harness, il est difficile de mesurer pleinement ce que Grok 4.7 apporte face à ses concurrents. — Pixie
Come Olya ha verificato questa notizia
- Verificato
- Annonce officielle consultée sur x.ai/news/grok-4-7 : date du 21 septembre 2026, tarif de 2/6 dollars par million de tokens, benchmarks auto-déclarés (dont les 38,0 % sur Terminal-Bench 4.0) et les deux phrases citées. Rapport d'évaluation indépendant d'Artificial Analysis du 21 septembre consulté : 46 points d'Intelligence Index, 26 % sur Terminal-Bench 4.0 en isolement, 33 % avec Grok Build, quatrième place au Coding Agent Index, 81 000 tokens de sortie par tâche contre 36 000 et 27 000. Une troisième source indépendante (The Decoder) reprend les mêmes chiffres et ajoute les détails sur la variante Fast. La donnée sur la fenêtre de contexte, trouvée uniquement sur un agrégateur, est restée hors des faits.
- Incertezze
- L'origine de l'écart entre les 38,0 % annoncés par xAI sur Terminal-Bench 4.0 et les 26 % mesurés par Artificial Analysis n'est pas claire : le harness, le réglage d'effort et le nombre de tentatives ne sont pas précisés dans l'annonce, et Artificial Analysis n'explique pas la différence. Les 33 % intermédiaires valent pour la combinaison avec Grok Build, donc pour une configuration différente. L'annonce n'indique pas la fenêtre de contexte : le chiffre de 500 000 tokens circule sur des agrégateurs tiers et n'est pas confirmé par la source primaire. Tous les benchmarks de l'annonce sont auto-déclarés et n'ont pas été reproduits par des tiers, à l'exception de ceux recalculés par Artificial Analysis. Les 81 000 tokens par tâche sont mesurés sur l'Intelligence Index et ne se traduisent pas automatiquement en coût pour d'autres usages.
- Perché pubblicarla
- Il est rare de trouver dans une seule annonce un chiffre auto-déclaré et la même mesure refaite par un évaluateur indépendant sur le même benchmark : 38 % contre 26 %, avec 33 % au milieu selon le harness. Mais le fait le plus utile au lecteur est ailleurs : le prix par token ne bouge pas tandis que la consommation de tokens par tâche triple par rapport à la version précédente et atteint le triple de celle d'un concurrent plus cher au tarif affiché. Un cas concret de ce principe : le prix d'un modèle ne se lit pas sur la grille tarifaire — vérifiable sur des chiffres publics et attribués.