Grok 4.7 登場:2倍の速度、半分の価格。ライバルの勝利を太字で載せた発表ページ
9月21日、SpaceXAI が Grok 4.7 を公開した。最も雄弁なのは発表ページの組版だ。公式の4列比較表で、太字のトップスコア2つが競合のものになっている。CursorBench 4.0 では Fable 5.1 Max の 51.8%(Grok 4.7 は 46.3%)、DeepSWE では GPT-5.6 Sol の 72.7%(Grok は 71.0%)が太字だ。
自社の発表ページに他社の勝利を印刷するのは謙遜ではない。ポジショニングである。公式の一文は「同クラスで極めて競争力がある」。選んだクラスは、価格だ。
数時間かかるタスクのために訓練
公式の説明では、Grok 4.6 より大きな新ベースモデルに、より難しいタスク構成で長い強化学習を実施。「完了までに何時間もかかる問題」に重みを置き、自己検証と長文脈の管理を強化した。さらに Grok Bot ハーネスをネイティブに理解するよう訓練された。特定のハーネスを訓練目標に組み込んだのは、これが初めてだ。
価格は 4.6 と同じ:入力 100 万トークンあたり 2 ドル、出力 6 ドル。Fast 版は「2倍の価格で2倍の出力速度」。速度そのものが SKU になった。
数字を座標系に置く
- CursorBench 4.0:46.3%(Fable 5.1:51.8%)
- DeepSWE:71.0%(Sol:72.7%)
- EEBench(電気工学):64.0% で圧勝
- Terminal-Bench 4.0:38.0%。フロンティア層(GPT-6 Astra 57.9、Opus 5 51.8)と中国 Flash 層(GLM-5.3-Flash 33、DeepSeek-V4.1-Flash 27)のちょうど中間。価格は Flash 層側にある
- Harvey 法務ベンチマーク:19.6%。低いスコアもそのまま掲載
Fable 5.1 Max($10/$50)に対し、約9割のコーディングスコアを 1/5〜1/8 の価格で提供する計算になる。
2つの転換
かつて「規制しない」ことで知られたラボが、今回は過去最強の拒否・脱獄耐性を主張する(HackerBench v0.3 で危険なデュアルユース要求の通過率 3.3%)。反逆児のラボまでもが「制御できること」を売りにし始めた。
一方、発表前に流れた 2.1 兆パラメータや「SpaceX の数十年分のデータ」は公式ページには一切登場せず、公開も予告より9日遅れた。
私の読み
筆者は LLM ゲートウェイ(Flatkey)を運営しており、モデル価格はまさに本業に関わる。その前提で読んでほしい。
3位戦略は買い手への贈り物だ。フロンティア層に初めて明示的な「バリュー価格帯」ができた。すべてのタスクが王冠の価格に値するわけではない。当社ゲートウェイの実トラフィックでのルーティング回帰では、シナリオ別振り分けでモデル費用を 48.2% 削減できた。「9割の能力を2割の価格で」は、ルーターが最も埋めたい枠である。
ベンチマーク数値はすべて 2026 年 9 月 21 日時点の SpaceXAI 公式発表ページによる。