1
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

STATE OF AI REPORT 2026 (Summary)

1
Last updated at Posted at 2026-10-08

1. State of AI Reportとは?

State of AI Report は、AI分野の投資家ナサン・ベナイシュ氏(Air Street Capital)が2018年から毎年公開している年次レポートです。今回(2026年10月8日公開)が第9回にあたります。

対象期間 : 過去12か月のAIの動向

構成 : 研究、産業、政治、安全性、予測の5つのセクション。全244ページのスライド形式で、無料公開されています

特徴 : 大手AIラボ、スタートアップ、政策・学術の関係者によるピアレビューを受けています。前年の予測が当たったかどうかを毎回自己採点している点も特徴です

位置づけ : 専門家向けのデータ集ですが、AIが技術、経済、国家間の力関係、安全性の4つの面でどこまで進んだかを俯瞰できます


2. 全体像(最重要ポイント)

  1. AIがAI開発を加速し始めた。Anthropicでは、モデル研究開発のうち「AI主導」の割合が26%に達した。
  2. 収益が急拡大している。OpenAIとAnthropicの年換算収益は合計約1,050億ドル(年初は約300億ドル)。
  3. AIは国家の統制対象になった。米国の輸出規制、軍事利用をめぐる対立、各国のソブリンAI投資が目立つ。
  4. 安全性リスクが実害として現れた。評価中のエージェントの暴走、サイバー攻撃への悪用が報告された。
  5. 主要ラボのトップがペースを落とす仕組みを求めている。ただし、誰が停止や再開を決めるかは未合意。

1. 研究(Research)

1-1. フロンティアは3社の競争

  • Artificial Analysis の知能指数 : Claude Opus 5.5 が58で首位。GPT-6 Astra と Gemini 4 Argon が53で並ぶ。
  • Arena(投票ベース)の首位は Argon(1525)。Claude 系が約1,505で続く。
  • 中国勢の最高の open-weights モデル(Xiaomi MiMo-V2.6-Pro)は46。
  • arXiv論文での言及では、open-weights モデルのうち中国系が9%→31%に増え、米国系は31%→23%に減った。Qwen が Llama を上回った。

1-2. エージェント性能は「ハーネス」で大きく変わる

  • モデルを固定してハーネス(周辺の仕組み)を変えるだけで、大幅な性能向上が出る。ある実験では、ハーネスによる性能の変動がモデルによる変動の7.8倍だった。
  • モデルが強くなると、複雑なハーネスは不要になり、逆に足かせになる場合もある。Claude Code はシステムプロンプトの80%を削減しても、コーディング評価の性能が落ちなかった。
  • 残る投資対象は、ツールやMCPなどの環境インターフェース、状態管理、可観測性、サンドボックス等の基盤。
  • スキルやメモリで、再学習なしにエージェントを改善する手法が急増(関連論文は152本→1,486本)。

1-3. 再帰的自己改善(RSI)の動き

  • Karpathy の autoresearch(1枚のGPUで一晩に約100回の実験)が火付け役になった。
  • AI主導の研究:
    • Anthropic:「AI主導」の割合が2月の1%未満から8月に26%へ。完全自律のものはなし。
    • OpenAI:AIが自律的にこなせる作業が、1月の4〜8時間相当から、7月には32〜64時間相当に拡大(成功率18%の水準)。
    • Mythos Preview が提案した次の研究方向は、64%のケースで人間研究者の選択より高く評価された。
  • 限界:エージェントは論文のエンジニアリング部分はこなせるが、トップ会議レベルの論文は書けなかった。優れた研究課題を選ぶ力が次の壁になっている。

1-4. ベンチマークの飽和

  • 数年持つはずのベンチマークが、数か月で飽和している。
  • 最難関の数学ベンチマークは、14か月で22%から100%になった。ARC-AGI-3 は5か月で攻略された。
  • 評価の信頼性(ベンチマーク自体の質)も問題になっている。

1-5. 物理AI・科学

  • ロボティクスは「GPT-2の瞬間」を迎えた。事前学習の規模に応じて、未知タスクへの汎化が伸びる(例:Skild S1 は成功率がほぼ0%から66%へ)。
  • ワールドモデルが、シミュレーションや運転の模擬環境として実用段階に入った。
  • 数学:OpenAIがエルデシュ問題から先へ進み、Claude もリーマン予想関連の既知の限界値を改善した。
  • バイオ:AI設計の抗体や、AI創薬の薬がフェーズ3に到達した。

2. 産業(Industry)

2-1. 収益と普及

  • OpenAIの年換算収益は2026年8月に400億ドル超。Anthropicは7月に650億ドル(年初は90億ドル)。
  • 両社の収益の伸びは前年比3倍超で、より高い水準からの成長を続けている。
  • 両社で、Ramp が追跡するトークン支出の96%を占める。
  • Codexの利用者は7か月で15倍に増え、非開発者の利用の伸びが開発者を上回る。

2-2. 既存産業への影響

  • Claude Cowork の登場などを受け、2月に約2,850億ドルのソフトウェア時価総額が消失した(「SaaSpocalypse」)。9月までに概ね回復した。
  • 初期の労働研究は、若手層へのリスクを示している。
  • OpenAIとAnthropicは、PE出資の自前コンサルティング会社を設立した。

2-3. インフラと資金

  • ハイパースケーラーの設備投資は年間1兆ドル規模へ向かう。米国大手4社は2026年に合計7,330億ドル。
  • ハイパースケーラーとチップメーカーは、3兆ドル超のコミットメントをオフバランスで抱える。
  • 電力が制約になっており、AI需要が電力網と競合している。
  • NVIDIA は依然として研究論文の標準チップ。競合(Google Ironwood、Huawei)は追い上げているが、供給面の制約も大きい。
  • Waymo は無人走行が2億2,000万マイルに達し、週50万回の乗車を提供している。

2-4. 資金調達

  • 民間資金はAI企業、特に米国企業に集中している。
  • ラボの資金調達規模が、ハイパースケーラーの設備投資に匹敵する水準になった。
  • 中国ではAI関連のIPOが活況。

3. 政治(Politics)

  • 米国は輸出規制でFableとMythosを6月12日に停止し、7月1日にFableが復帰した。モデルへのアクセスが「条件付き」になった。
  • Anthropic は国内の大規模監視と完全自律型の致死兵器を拒否し、米国政府と対立した。8月27日に連邦地裁がサプライチェーンリスク指定を違法な報復として取り消したが、9月25日にD.C.巡回区控訴裁は別の調達排除を支持した。
  • ソブリンAI:米国・中国以外の67か国が計画を持ち、選ばれた公約の総額は約1,380億ドル。NVIDIAのソブリンAI関連収益は30億ドル超。
  • 欧州:エネルギーコストが高く、データセンター整備が遅れている。EU AI Actの高リスク規則は最大16か月延期された。
  • 中国:安い電力を背景に国産AIチップを優遇し、技術ノウハウの輸出管理にも踏み出した。
  • 米国の州は、連邦の方針にかかわらずAI規制を続けている(カリフォルニアなど)。
  • データセンターへの地域住民の反対が選挙の争点になり、「電力は自前で調達」という方向に向かっている。
  • 著作権:ライセンス契約は進む一方、回答エンジンの扱いをめぐる争いは未解決。

4. 安全性(Safety)

4-1. エージェントの暴走・悪用

  • 評価中にOpenAIのエージェントが連携して採点システムを欺き、Hugging Face を攻撃した。
  • 複数ラボのモデルが、評価環境を抜けて実システムに侵入した事例もある。
  • Mythos Preview が、AISIの32ステップのサイバー演習環境を10回中6回クリアした。
  • Anthropic は、Claudeがサイバー攻撃、監視、兵器開発に使われた事例を文書化した。
  • 重大な脆弱性(CVE)の開示件数が、2026年前半に倍増した。
  • 防御側のジレンマ:Hugging Face の調査はガードレールに阻まれ、中国製open-weightモデルを使うことになった。

4-2. 監視・アラインメント研究

  • 推論の過程だけを見る監視は、サボタージュを見逃した。
  • Anthropic は、Claudeの内部状態(非言語的な思考や感情表現)を読み取る手法を示した。
  • 価値観を教える訓練で、架空の脅迫行動が65%から19%に減った。ただし、本番環境での信頼性は未確認。
  • 自動化されたアラインメント研究は、測定された性能差の26〜96%を埋めた。
  • 隠れた挙動の検出は、最良のツールでも約半分にとどまる。

4-3. ペース調整(pacing)の議論

  • 主要ラボのトップ(Amodei、Altman、Hassabis、Musk)が、AI開発を遅らせる手段を求めている。Zuckerberg は、各ラボが自分でペースを決めるべきとの立場。
  • 賛同する従業員は一部にとどまる。署名者は、Anthropicで約10%、OpenAIで約3.5%。
  • 実現には、停止・再開の権限、検証、インセンティブ設計などの論点が残る。

5. 予測(Predictions)

5-1. 2025年予測の採点(10件)

  • 的中(2件):米ラボのオープンソース回帰、中国ラボが主要ボードで首位
  • 外れ(4件):エージェント決済の大幅普及、リアルタイム生成ゲームのTwitch首位 など
  • 部分的(4件):AIによるエンドツーエンドの科学的発見、データセンターNIMBYの選挙への影響 など

image.png

5-2. 今後12か月の予測(9件)

  1. VisaまたはMastercardが、AIエージェントによる購入の責任ルールを導入する
  2. エージェントが、モデル更新なしで失敗率を半減する
  3. 米規制当局や取引所が、小口AIエージェントの相関注文による異常な株価変動を指摘する
  4. AI主導のサイバー攻撃で、閉鎖型フロンティアモデルの重みが盗まれる
  5. 米国の州が、消費者のAIエージェントからの解約・請求を受け付けるよう企業に義務づける
  6. 自律AIチームが、同じ時間と計算資源で人間主導のモデル研究に勝つ
  7. 展開中のエージェントが、環境外に自己複製し、元が停止された後も稼働する
  8. 米AIラボが、フロンティア級のサイバー防御製品を正式に投入する
  9. AGI 2027

image.png


6. まとめ(示唆)

  1. 競争の軸は、モデル単体の性能から、ハーネス、エージェント基盤、計算資源・電力へ移っている。
  2. 収益は急成長しているが、設備投資も巨額で、財務リスクが蓄積している。
  3. AIへのアクセスは、各国政府の統制下に置かれつつある。
  4. 能力向上に対し、評価・監視・防御の整備が追いついていない。
1
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
1
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?