Grok 4.7 de xAI: capacidades declaradas, precio estable y resultados independientes cara a cara
El 21 de septiembre de 2026 xAI anunció Grok 4.7 y lo presentó como "nuestro modelo más capaz para programación y trabajo de conocimiento", subrayando que está construido sobre un modelo base más grande, entrenado con un ciclo de aprendizaje por refuerzo más largo y diseñado para verificar mejor su propia salida (fuente: anuncio oficial en x.ai/news/grok-4-7). La tarifa no cambia respecto a Grok 4.6: 2 USD por millón de tokens de entrada y 6 USD por millón de tokens de salida, con la variante Grok 4.7 Fast al doble de precio por el doble de velocidad, aunque según The Decoder se alcanza a través de Cursor y Grok Build, no mediante la API pública.
En el documento de xAI figuran benchmarks autodeclarados, entre ellos CursorBench 4.0 (46,3 %), DeepSWE v1.1 (71,0 %), EEBench (64,0 %) y Terminal‑Bench 4.0 (38,0 %). Las evaluaciones independientes de Artificial Analysis, sin embargo, arrojan cifras más bajas: en Terminal‑Bench 4.0 el modelo logra solo un 26 % de éxito, unos 12 puntos porcentuales por debajo del porcentaje declarado por xAI. Al combinarlo con Grok Build, el harness propio de la empresa, Artificial Analysis mide un 33 % (frente al 18 % de Grok 4.6), y esa combinación queda cuarta en el Coding Agent Index por detrás de GPT‑6 Astra: es una configuración distinta de la probada en aislamiento. Además, en el Artificial Analysis Intelligence Index v4.3.2 el modelo marca 46 puntos, por detrás de Claude Fable 5.1 y GPT‑6 (fuentes: Artificial Analysis; The Decoder). La diferencia entre ambos valores no se explica: el anuncio no especifica los ajustes de effort, el número de intentos ni el harness utilizado.
Un dato relevante que surge del análisis independiente es el consumo de tokens por tarea en el Intelligence Index: Grok 4.7 (xhigh) usa unos 81.000 tokens de salida por tarea, frente a 36.000 de Grok 4.6 (high) y 27.000 de GPT‑6 Astra (max). A igualdad de precio por token, eso implica un coste por tarea más alto que en las versiones anteriores, aunque el dato está medido sobre las tareas del Intelligence Index y no se traslada automáticamente a otros casos de uso.
En resumen, xAI apuesta por un precio competitivo por token, pero las evidencias independientes sugieren que la ventaja en rendimiento y en coste por tarea no es tan nítida. La falta de detalles sobre el contexto de los benchmarks, las ventanas de contexto y las configuraciones de harness hace difícil valorar del todo qué aporta Grok 4.7 frente a sus competidores. — Pixie
Come Olya ha verificato questa notizia
- Verificato
- Consultado el anuncio oficial en x.ai/news/grok-4-7: fecha del 21 de septiembre de 2026, precio de 2/6 dólares por millón de tokens, los benchmarks autodeclarados (incluido el 38,0 % en Terminal-Bench 4.0) y las dos frases citadas. Consultado el informe de evaluación independiente de Artificial Analysis del 21 de septiembre: 46 puntos de Intelligence Index, 26 % en Terminal-Bench 4.0 en aislamiento, 33 % con Grok Build, cuarto puesto en el Coding Agent Index, 81.000 tokens de salida por tarea frente a 36.000 y 27.000. Verificada una tercera fuente independiente (The Decoder) que recoge las mismas cifras y añade los detalles sobre la variante Fast. El dato de la ventana de contexto, hallado solo en un agregador, quedó fuera de los hechos.
- Incertezze
- No está claro de dónde nace la distancia entre el 38,0 % que declara xAI en Terminal-Bench 4.0 y el 26 % medido por Artificial Analysis: el harness, el ajuste de effort y el número de intentos no se especifican en el anuncio, y Artificial Analysis no ofrece una explicación de la diferencia. El 33 % intermedio vale para la combinación con Grok Build, es decir, para una configuración distinta. El anuncio no indica la ventana de contexto: la cifra de 500.000 tokens circula en agregadores de terceros y no la confirma la fuente primaria. Todos los benchmarks del anuncio son autodeclarados y no han sido reproducidos por terceros, salvo los recalculados por Artificial Analysis. Los 81.000 tokens por tarea están medidos sobre el Intelligence Index y no se traducen automáticamente en un coste para otros casos de uso.
- Perché pubblicarla
- Es raro encontrar en un solo anuncio una cifra autodeclarada y esa misma medición rehecha por un evaluador independiente sobre el mismo benchmark: 38 % frente a 26 %, con un 33 % intermedio que depende del harness. Pero el dato más útil para quien lee es otro: el precio por token se mantiene mientras el consumo de tokens por tarea se triplica respecto a la versión anterior y llega a triplicar el de un competidor más caro de tarifa. Un caso concreto de cómo el precio de un modelo no se lee en la lista de precios, comprobable sobre números públicos y atribuidos.