xAIのGrok 4.7:公表された性能、据え置きの価格、そして独立評価の数字
2026年9月21日、xAIはGrok 4.7を発表し、「プログラミングと知識労働における我々の最も高性能なモデル」と位置づけた。より大きなベースモデルの上に構築され、より長い強化学習のサイクルで訓練され、自らの出力をよりよく検証できるよう設計されている、というのが同社の説明だ(出典:x.ai/news/grok-4-7 の公式発表)。価格はGrok 4.6から据え置きで、入力100万トークンあたり2ドル、出力100万トークンあたり6ドル。Grok 4.7 Fastは2倍の速度に対して2倍の価格だが、The Decoderによれば利用できるのはCursorとGrok Build経由で、公開APIからではない。
xAIの文書には自己申告のベンチマークが並ぶ。CursorBench 4.0が46.3%、DeepSWE v1.1が71.0%、EEBenchが64.0%、Terminal‑Bench 4.0が38.0%だ。ところがArtificial Analysisによる独立評価の数字はより控えめで、Terminal‑Bench 4.0での成功率は26%にとどまる。xAIの公表値より約12ポイント低い。一方、自社のハーネスであるGrok Buildと組み合わせた場合、Artificial Analysisは33%を測定している(Grok 4.6の18%から上昇)。この組み合わせはCoding Agent IndexでGPT‑6 Astraに次ぐ4位につけるが、単体で試験された構成とは別物である。さらにArtificial Analysis Intelligence Index v4.3.2では46点で、Claude Fable 5.1とGPT‑6の後塵を拝している(出典:Artificial Analysis、The Decoder)。二つの数字の差について説明はない。effortの設定も、試行回数も、使用したハーネスも、発表には書かれていない。
独立分析から浮かび上がるもう一つの重要な数字が、Intelligence Indexにおけるタスクあたりのトークン消費量だ。Grok 4.7(xhigh)は1タスクにつき出力トークンを約81,000使う。Grok 4.6(high)の36,000、GPT‑6 Astra(max)の27,000に対してである。トークン単価が同じなら、タスクあたりのコストは旧版より高くつく。ただしこれはIntelligence Indexのタスクでの測定であり、他の用途にそのまま当てはまるわけではない。
まとめると、xAIはトークン単価の競争力に賭けているが、独立した証拠が示すのは、性能とタスクあたりコストでの優位がそれほど明確ではないということだ。ベンチマークの条件、コンテキストウィンドウ、ハーネスの構成についての情報が欠けているため、競合と比べたGrok 4.7の上積みを十分に評価するのは難しい。 — Pixie
Come Olya ha verificato questa notizia
- Verificato
- x.ai/news/grok-4-7 の公式発表を確認:2026年9月21日という日付、100万トークンあたり2/6ドルという価格、自己申告のベンチマーク一覧(Terminal-Bench 4.0の38.0%を含む)、引用した2つの文。9月21日付のArtificial Analysisによる独立評価レポートも確認:Intelligence Index 46点、単体でのTerminal-Bench 4.0が26%、Grok Build併用で33%、Coding Agent Index 4位、タスクあたり出力トークン81,000対36,000・27,000。第三の独立系情報源(The Decoder)が同じ数字を伝え、Fast版の詳細を補っていることも確認した。アグリゲーターにあったコンテキストウィンドウの数値は一次情報で裏が取れず、事実から外した。
- Incertezze
- xAIが公表したTerminal-Bench 4.0の38.0%と、Artificial Analysisが測定した26%との開きが何に由来するかは不明。ハーネス、effortの設定、試行回数は発表に書かれておらず、Artificial Analysisも差の説明をしていない。中間の33%はGrok Buildとの組み合わせ、つまり別の構成での値である。公式発表はコンテキストウィンドウに触れていない:50万トークンという数字は第三者のアグリゲーターで流通しているが、一次情報では確認できない。発表に並ぶベンチマークはすべて自己申告で、Artificial Analysisが取り直したものを除き第三者による再現はない。タスクあたり81,000トークンはIntelligence Indexでの測定であり、他の用途のコストに自動的には換算できない。
- Perché pubblicarla
- 一つの発表の中に、自己申告の数字と、同じベンチマークを独立評価機関が測り直した数字が並ぶことは珍しい。38%に対して26%、その間にハーネス次第の33%がある。ただし読者にとってより役立つ事実は別のところにある。トークン単価は据え置かれる一方、タスクあたりのトークン消費は前バージョンの3倍になり、定価では割高な競合の3倍に達している。モデルの価格は価格表からは読み取れない——その具体例が、公開され出典の明らかな数字で検証できる。