0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

Grok 4.7 登場:2倍の速度、半分の価格。ライバルの勝利を太字で載せた発表ページ

0
Posted at

Grok 4.7 登場:2倍の速度、半分の価格。ライバルの勝利を太字で載せた発表ページ

9月21日、SpaceXAI が Grok 4.7 を公開した。最も雄弁なのは発表ページの組版だ。公式の4列比較表で、太字のトップスコア2つが競合のものになっている。CursorBench 4.0 では Fable 5.1 Max の 51.8%(Grok 4.7 は 46.3%)、DeepSWE では GPT-5.6 Sol の 72.7%(Grok は 71.0%)が太字だ。

自社の発表ページに他社の勝利を印刷するのは謙遜ではない。ポジショニングである。公式の一文は「同クラスで極めて競争力がある」。選んだクラスは、価格だ。

数時間かかるタスクのために訓練

公式の説明では、Grok 4.6 より大きな新ベースモデルに、より難しいタスク構成で長い強化学習を実施。「完了までに何時間もかかる問題」に重みを置き、自己検証と長文脈の管理を強化した。さらに Grok Bot ハーネスをネイティブに理解するよう訓練された。特定のハーネスを訓練目標に組み込んだのは、これが初めてだ。

価格は 4.6 と同じ:入力 100 万トークンあたり 2 ドル、出力 6 ドル。Fast 版は「2倍の価格で2倍の出力速度」。速度そのものが SKU になった。

数字を座標系に置く

  • CursorBench 4.0:46.3%(Fable 5.1:51.8%)
  • DeepSWE:71.0%(Sol:72.7%)
  • EEBench(電気工学):64.0% で圧勝
  • Terminal-Bench 4.0:38.0%。フロンティア層(GPT-6 Astra 57.9、Opus 5 51.8)と中国 Flash 層(GLM-5.3-Flash 33、DeepSeek-V4.1-Flash 27)のちょうど中間。価格は Flash 層側にある
  • Harvey 法務ベンチマーク:19.6%。低いスコアもそのまま掲載

Fable 5.1 Max($10/$50)に対し、約9割のコーディングスコアを 1/5〜1/8 の価格で提供する計算になる。

2つの転換

かつて「規制しない」ことで知られたラボが、今回は過去最強の拒否・脱獄耐性を主張する(HackerBench v0.3 で危険なデュアルユース要求の通過率 3.3%)。反逆児のラボまでもが「制御できること」を売りにし始めた。

一方、発表前に流れた 2.1 兆パラメータや「SpaceX の数十年分のデータ」は公式ページには一切登場せず、公開も予告より9日遅れた。

私の読み

筆者は LLM ゲートウェイ(Flatkey)を運営しており、モデル価格はまさに本業に関わる。その前提で読んでほしい。

3位戦略は買い手への贈り物だ。フロンティア層に初めて明示的な「バリュー価格帯」ができた。すべてのタスクが王冠の価格に値するわけではない。当社ゲートウェイの実トラフィックでのルーティング回帰では、シナリオ別振り分けでモデル費用を 48.2% 削減できた。「9割の能力を2割の価格で」は、ルーターが最も埋めたい枠である。

ベンチマーク数値はすべて 2026 年 9 月 21 日時点の SpaceXAI 公式発表ページによる。

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?