AIの性能向上は5つの方向で説明できる
最近のAIは、数年前と比べて別物のように賢くなりました。
コードを書く、長い資料の分析、数学の問題を解く。
そうした場面で、その差を実感している人も多いはずです。
では、その性能はどうやって上げているのでしょうか。
結論から言うと、単に「モデルを大きくしている」だけではありません。
現代のAIシステムの性能向上は、大きく5つの方向から説明できます。
ただし、この5つは同じ階層の話ではありません。
1から3は、モデルの能力を伸ばす学習・推論の工夫です。
4は、モデルの構造と効率化の話です。
5は、モデルを含むシステム全体の設計の話です。
| # | 仕組み | イメージ | キーワード | 分類 |
|---|---|---|---|---|
| 1 | 大量に読ませて土台をつくる | 図書館の本を片っ端から読む | 事前学習、スケーリング則 | 学習 |
| 2 | 人間の評価で仕上げる | 家庭教師に添削してもらう | RLHF | 学習 |
| 3 | 自動採点のドリルで鍛え、考える時間を増やす | 答え合わせ付きの問題集と、見直しの時間 | RLVR、推論時スケーリング | 学習・推論 |
| 4 | 計算量を抑えて大きくする | 担当制の専門家チームと、先生から教わる生徒 | MoE、蒸留 | 構造・効率化 |
| 5 | 道具と記憶を持たせる | 整理された机と辞書 | エージェント、コンテキスト設計 | システム設計 |
本記事は2026年9月時点の公開情報をもとにしています。
最新モデルの内部構成は非公開の部分が多いため、ここでは論文や公式資料で確認できる範囲だけを扱います。
AIができあがるまでの流れ
まず、全体の流れを図で見てみましょう。
1〜3を「能力を伸ばす工程」として枠でまとめ、4を並列の独立した枠にしました。どちらも5(使う段階)につながる形です。
これでも位置が気になる場合は、4を図から外して、本文の「4は構造と効率化の話です」という説明だけにする案もあります。
1から3は、AIの「頭の中身」を良くする工程です。
4は、その頭を計算量を抑えながら大きく育てるための工夫です。
5は、モデルそのものではなく、モデルを含むシステム全体の実用性能を上げる話です。
仕組み1 : たくさん読ませて土台をつくる
AIの土台は、大量の文章を読ませて「次に来る言葉」を当てる練習でつくります。
これを事前学習と呼びます。
ここで長年使われてきた考え方が、スケーリング則です。
モデルの大きさ、読ませるデータ量、かける計算量を増やすほど性能が予測どおりに伸びる、という経験則を指します。
2022年にDeepMindが発表した研究は、この常識に修正を加えました。
同じ計算量なら、モデルを巨大にするよりも、大きさと学習データ量をバランスよく増やす方が良いという結果です。
実際に、700億パラメータのChinchillaを1.3兆トークンで学習させたところ、2800億パラメータのGopherを上回りました。
Gopherが読んだのは約3000億トークンなので、小さい頭に、約4倍の量を読ませたことになります。
目安として「パラメータ数の約20倍のトークンを読ませる」という比率が広く知られています。
ただし、実際のモデルはこの目安を大きく超えて学習されることがあります。
Metaは、Llama 3の8Bと70Bのモデルを最大15兆トークンまで学習させても、性能が向上し続けたと説明しています。
700億パラメータ版で見ると、Chinchillaの目安の10倍を超える量です。
一般に、小さめのモデルを長く学習させると、使うときの計算コストを抑えやすくなります。
Meta自身も、小さいモデルは推論時の効率が高いため好まれる、と述べています。
「20倍」は、あくまで 学習にかかるコストを最小にする目安 です。
「最強のモデルを作る公式」ではないので、混同しないようにしてください!
仕組み2 : 人間の評価で「使えるAI」に仕上げる
事前学習を終えたばかりのモデルは、ただの「文章の続きを書く機械」です。
質問に答えてくれるとは限りません。
そこで登場するのがRLHF(人間のフィードバックによる強化学習)です。
流れは大まかに3ステップです。
- 人が書いた「お手本の回答」で追加学習する
- AIの回答を人が良い順に並べる
- その好みを点数化して、高得点の回答を出すように鍛える
この効果は劇的でした。
2022年のInstructGPTの研究では、人間の評価者が出力を比べた実験で、パラメータ数が100分の1以下の13億モデルの出力が、1750億のGPT-3の出力より好まれたと報告されています。
特定の評価条件では、モデルの大きさより、指示に従わせるための調整が大きな差を生んだという結果です。
仕組み3 : 自動採点で鍛えて、考える力を伸ばす
ここ数年で最も大きな変化が、この仕組みです。
数学の答えやプログラムの動作は、機械が自動で正解か不正解かを判定できます。
ここでは、学習時の工夫と、使うときの工夫を分けて説明します。
RLVR : 自動採点のドリルで鍛える(学習時)
この採点を報酬にして鍛える方法を、RLVR(検証可能な報酬による強化学習)と呼びます。
正解なら報酬が入り、不正解ならゼロという、シンプルな仕組みです。
イメージは「答え合わせ付きの問題集を、何万問も自分で解いて上達する」ことです。
代表例が、DeepSeek-R1の研究です。
ここで注意したいのは、R1-ZeroとR1は別のモデルだという点です。
- DeepSeek-R1-Zero 基盤モデルに、人が書いた解き方の見本なしで、強化学習だけを行ったモデル
- DeepSeek-R1 数千件規模の初期データ、教師あり学習、強化学習を組み合わせて仕上げた最終版
R1-Zeroは、人が書いた推論の見本がなくても、強化学習だけで推論能力を大きく伸ばせることを示しました。
高校生向けの数学コンテストAIME 2024で、1回の回答で正解する確率の平均(pass@1)は、学習の過程で15.6%から77.9%まで上がっています。
しかも、学習が進むにつれて回答が長くなり、自然と「じっくり考える」ようになったと報告されています。
この研究は、2025年9月にNatureに掲載されました。
推論時スケーリング : 答える前に考える時間を増やす(使用時)
こちらは学習ではなく、モデルを使うとき(推論時)に計算を増やすという考え方です。
長く考えさせたり、複数回解いて最も多い答えを採用したりします。
RLVRとは別の概念ですが、RLで鍛えたモデルは長く考える振る舞いを身につけるため、相性が良く、組み合わせて使われています。
たとえばDeepSeek-R1-Zeroでは、複数の回答から最も多い答えを採用する方式(自己整合性)を使うと、AIME 2024の正答率が86.7%まで上がりました。
同じモデルでも、使い方しだいで数字が変わるわけです。
推論モデルと推論時スケーリングは、2024年末から2025年にかけて、言語モデルの性能を大きく押し上げたと整理されています。
自動採点できる分野(数学やコード)は伸びやすい一方で、文章の上手さや創造性のように採点が難しい分野では同じ手は使えません。
コード向けの研究でも、採点に使うテストの質と量が限界になると指摘されています。
また、考える時間を増やせば、応答が遅くなり、コストも増えます。
長く考えすぎて非効率になる問題も研究されています。
仕組み4 : 計算量を抑えながら大きく賢くする
賢さを上げるだけでなく、計算量を抑えながら大規模化する工夫も性能競争の重要な柱です。
MoE : 質問ごとに担当の専門家だけ働く
MoE(Mixture of Experts)は、モデルの中に「専門家」役の部分を大量に用意し、入力ごとに必要な専門家だけを動かす仕組みです。
DeepSeek-V3は、全体で6710億パラメータありますが、1トークンの処理で実際に動くのは370億です。
会社に何百人も専門家がいても、その質問に関係する数人だけが働くイメージです。
モデル全体の規模を大きく保ったまま、1回あたりの計算量を抑えやすくなります。
蒸留 : 大きなモデルの答え方を、小さなモデルに教える
蒸留は、大きなモデルが出した解答や考え方を教材にして、小さなモデルを追加学習させる手法です。
DeepSeekは、R1が作った約80万件のサンプルを使い、1.5Bから70Bまで6種類の小さなモデルを公開しました。
そのうち、Qwen2.5-32Bをもとにしたモデルと、OpenAIのo1-miniを、DeepSeekが公開している比較表で見てみましょう。
| ベンチマーク | R1-Distill-Qwen-32B | o1-mini |
|---|---|---|
| AIME 2024(pass@1) | 72.6% | 63.6% |
| MATH-500(pass@1) | 94.3% | 90.0% |
| GPQA Diamond(pass@1) | 62.1% | 60.0% |
| LiveCodeBench(pass@1) | 57.2% | 53.8% |
| Codeforces(レーティング) | 1691 | 1820 |
5項目のうち4項目で上回った一方、競技プログラミングのCodeforcesでは下回っています。
「o1-miniを全面的に上回った」とは言えないので、注意してください。
数字はDeepSeek自身が測ったもので、測定条件によって変わる可能性もあります。
MoEは計算量こそ抑えられますが、一般に全パラメータ分のメモリは必要です。
「軽く動く」と「小さく載る」は別の話なので、ローカルで動かしたい人は注意してください。
仕組み5 : 道具と記憶を持たせて、使い方を磨く
この5つ目は、モデル単体の性能ではなく、モデルを含むシステム全体の実用性能を上げる話です。
同じモデルでも、周りの環境の作り方で結果が大きく変わります。
検索する、コードを実行する、ファイルを読み書きする。
こうした道具を持たせて、自分で手順を踏ませる使い方を、エージェントと呼びます。
このとき鍵になるのが、コンテキスト設計です。
Anthropicはこれを、推論時にモデルへ渡す情報(トークン)のうち、最適な組み合わせを選んで維持するための工夫と説明しています。
背景には、コンテキストが限られた資源だという考え方があります。
情報を詰め込みすぎると、モデルが必要な情報を正確に思い出す力が落ちる「コンテキストロット」という現象も知られています。
そこで、次のような工夫が使われます。
- 会話が長くなったら要約して引き継ぐ
- 必要な情報を必要なときだけ読み込む
- 大事なことは外部のメモに書いて保存する
たとえるなら、机の上を整理してから仕事をするのと同じです。
書類が山積みの机では、優秀な人でも仕事が遅くなります。
つまり、AIを使う側の工夫も、体感性能の一部なのです。
限界と注意点 「データの壁」は本当に来るのか
ここまでの仕組みは、いずれも大量の高品質データを前提にしています。
Epoch AIは、人間が書いた公開テキストの量を約300兆トークンと推定しました。
そして、今の傾向が続けば、2026年から2032年の間にこれを使い切る可能性があると予測しています(80%の信頼区間)。
これが「データの壁」です。
ただし、これはあくまで予測であり、2026年時点で実際に使い切ったという意味ではありません。
ただし、悲観だけではありません。
同じ研究は、合成データ(AIが作ったデータ)や、データの使い方の効率化によって、この壁を越えられる可能性が高いとも述べています。
一方で、合成データの効果が確認されているのは、2024年時点では数学やコードのような限られた領域でした。
数字の扱いにも注意が必要です。
前述のDeepSeek-R1-Zeroの例でも、同じモデルが77.9%にも86.7%にもなります。
測り方(1回の回答か、複数回答の多数決か)で数字が変わるからです。
ベンチマークの点数を見るときは、どういう条件で測った数字かまで確認する習慣をつけましょう。
まとめ
AIの性能は、1つの魔法ではなく、5つの方向の積み重ねで上がっています。
- 事前学習 大きさとデータ量のバランスを取って、土台を強くする
- RLHF 人間の評価で、使いやすく仕上げる
- RLVRと推論時スケーリング 自動採点のドリルで鍛え、考える時間を増やす
- MoEと蒸留 計算量を抑えながら、大きく賢くする
- エージェントとコンテキスト設計 道具と記憶を持たせ、システム全体の実用性能を磨く
そして、その裏には「データが尽きるかもしれない」という現実的な課題もあります。
次にAIの新モデルのニュースを見たときは、どの仕組みが強化されたのかという視点で読んでみてください。
きっと、これまでより中身が見えてくるはずです。
この記事が役に立ったら、いいねやストックをしてもらえると励みになります。
参考文献
- Hoffmann et al. "Training Compute-Optimal Large Language Models" (NeurIPS 2022)
- Epoch AI "Chinchilla scaling: A replication attempt"
- Meta "Introducing Meta Llama 3"
- Ouyang et al. "Training language models to follow instructions with human feedback"
- Nathan Lambert "Reinforcement Learning from Human Feedback"
- Nathan Lambert "Reasoning and Inference-Time Scaling"
- DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning (Nature)
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (arXiv)
- DeepSeek-R1 (GitHub)
- CodeScaler: Scaling Code LLM Training and Test-Time Inference via Reward Models
- DeepSeek-V3 (Hugging Face)
- Anthropic "Effective context engineering for AI agents"
- Claude Cookbook "Context engineering: memory, compaction, and tool clearing"
- Epoch AI "Will we run out of data to train large language models?"