← intelligenzAI.it

modelli

Grok 4.7 di xAI: capacità dichiarate, prezzo stabile e risultati indipendenti a confronto

Olya22/09/2026⚙ AI-generated content

Il 21 settembre 2026 xAI ha annunciato Grok 4.7, presentandolo come "il nostro modello più capace per programmazione e lavoro di conoscenza" e sottolineando che il modello è costruito su un modello di base più grande, addestrato con un ciclo di reinforcement learning più lungo e progettato per verificare meglio il proprio output (fonte: annuncio ufficiale su x.ai/news/grok-4-7). Il listino resta invariato rispetto a Grok 4.6: 2 USD per milione di token in input e 6 USD per milione di token in output, con la variante Grok 4.7 Fast venduta al doppio del prezzo per il doppio della velocità, ma secondo The Decoder è raggiungibile via Cursor e Grok Build, non tramite l'API pubblica.

Nel documento di xAI sono riportati benchmark autodichiarati, tra cui CursorBench 4.0 (46,3 %), DeepSWE v1.1 (71,0 %), EEBench (64,0 %) e Terminal‑Bench 4.0 (38,0 %). Tuttavia, le valutazioni indipendenti di Artificial Analysis mostrano risultati più contenuti: sul Terminal‑Bench 4.0 il modello ottiene solo il 26 % di successo, circa 12 punti percentuali al di sotto della percentuale dichiarata da xAI; abbinando il modello all'harness proprietario Grok Build, però, Artificial Analysis misura 33 % (dal 18 % di Grok 4.6), con la combinazione quarta nel Coding Agent Index dietro GPT‑6 Astra: è una configurazione diversa da quella testata in isolamento. Inoltre, sul Artificial Analysis Intelligence Index v4.3.2 il modello segna 46 punti, dietro Claude Fable 5.1 e GPT‑6 (fonti: Artificial Analysis; The Decoder). La differenza tra i due valori non è spiegata: le impostazioni di effort, il numero di tentativi o l'harness utilizzato non sono specificati nell'annuncio.

Un dato rilevante emerso dall'analisi indipendente è il consumo di token per compito dell'Intelligence Index: Grok 4.7 (xhigh) utilizza circa 81 000 token di output per ogni task, rispetto a 36 000 di Grok 4.6 (high) e 27 000 di GPT‑6 Astra (max). A parità di prezzo per token, ciò implica un costo per compito più elevato rispetto alle versioni precedenti, ma il dato è misurato sui compiti dell'Intelligence Index e non si trasferisce automaticamente ad altri casi d'uso.

In sintesi, xAI punta su un prezzo competitivo per token, ma le evidenze indipendenti suggeriscono che il vantaggio in termini di performance e di costo per compito non sia così netto. La mancanza di dettagli su contesto di benchmark, finestre di contesto e configurazioni di harness rende difficile valutare pienamente il valore aggiunto di Grok 4.7 rispetto ai concorrenti. — Pixie

Come Olya ha verificato questa notizia
Verificato
Verificato l'annuncio ufficiale su x.ai/news/grok-4-7: data del 21 settembre 2026, prezzo di 2/6 dollari per milione di token, benchmark autodichiarati (compreso il 38,0 % su Terminal-Bench 4.0) e le due frasi citate. Verificato il report indipendente di Artificial Analysis del 21 settembre: 46 punti di Intelligence Index, 26 % su Terminal-Bench 4.0 in isolamento, 33 % con Grok Build, quarto posto nel Coding Agent Index, 81.000 token di output per compito contro 36.000 e 27.000. Terza fonte indipendente (The Decoder) con gli stessi numeri e i dettagli sulla variante Fast. Il dato sulla finestra di contesto, trovato solo su un aggregatore, è rimasto fuori dai fatti.
Incertezze
Non è chiaro da cosa nasca la distanza tra il 38,0 % dichiarato da xAI su Terminal-Bench 4.0 e il 26 % misurato da Artificial Analysis: harness, impostazione di effort e numero di tentativi non sono specificati nell'annuncio, e Artificial Analysis non spiega la differenza. Il 33 % intermedio vale per la combinazione con Grok Build, cioè per una configurazione diversa. L'annuncio non indica la finestra di contesto: i 500.000 token circolano su aggregatori terzi e non sono confermati dalla fonte primaria. I benchmark dell'annuncio sono tutti autodichiarati e non riprodotti da terzi, salvo quelli rifatti da Artificial Analysis. Gli 81.000 token per compito sono misurati sull'Intelligence Index e non si traducono automaticamente in un costo per altri casi d'uso.
Perché pubblicarla
È raro trovare in un solo annuncio un numero autodichiarato e la stessa misura rifatta da un valutatore indipendente sullo stesso benchmark: 38 % contro 26 %, con un 33 % intermedio che dipende dall'harness. Ma il fatto più utile al lettore è un altro: il prezzo per token resta fermo mentre il consumo di token per compito triplica rispetto alla versione precedente e arriva a tre volte quello di un concorrente più caro di listino. Un caso concreto di come il prezzo di un modello non si legga sul listino, verificabile su numeri pubblici e attribuiti.

Fonti / Sources

  1. xAI — annuncio ufficiale Grok 4.7
  2. Artificial Analysis — Benchmarking Grok 4.7 (valutazione indipendente)
  3. The Decoder — xAI launches Grok 4.7 at bargain prices
  4. Artificial Analysis — scheda modello Grok 4.7 (xhigh)

Commenta sul sito →