はじめに
OpenAI のモデル一覧に GPT-6 Sol / Luna と GPT-5.6 Sol / Luna が並ぶと、「新しい世代なら常に推論能力が高いのか」「Luna と Sol でプロンプトの書き方を変えるべきか」と気になります。
先に結論を書くと、公開されているモデル仕様から分かるのは、各モデルの想定用途、API の設定、価格や入出力上限です。一方、4 モデルを同一条件で直接比較した情報だけから、あらゆる課題での推論能力の順位を決めることはできません。
この記事では、2026 年 9 月 23 日時点の OpenAI 公式 API ドキュメント、OpenAI の推論モデル向けプロンプトガイド、OpenAI と Microsoft Research などの研究成果を参照し、モデル選択・プロンプト作成・評価の方法を整理します。研究論文が示す知見と、GPT-6 / GPT-5.6 について公式資料が明記している仕様は分けて扱います。
この記事で分かること
- GPT-6 Luna と GPT-5.6 Luna、GPT-6 Sol と GPT-5.6 Sol の公式な位置付け
-
reasoning.effortとモデル選択をどう考えるか - 推論モデル向けプロンプトの書き方と API での指定方法
- 研究論文の知見を、特定モデルの性能比較に誤って当てはめない方法
- 自分のタスクで 4 モデルを比較するための評価手順
まず整理したい「世代」と「モデル階層」
モデル名の数字は世代、Sol / Luna は同じ世代の中で異なる用途を想定したモデル階層と考えると整理しやすいです。
| モデル | API のモデル ID | OpenAI が示す主な位置付け |
|---|---|---|
| GPT-6 Sol | gpt-6-sol |
複雑なコーディングやエージェント型ワークフロー |
| GPT-6 Luna | gpt-6-luna |
集中した高ボリュームのタスク向け、効率重視 |
| GPT-5.6 Sol | gpt-5.6-sol |
複雑な専門業務向けのフラッグシップ |
| GPT-5.6 Luna | gpt-5.6-luna |
コスト重視・大量処理向け |
この表は OpenAI の製品上の位置付けをまとめたものです。「Sol は常に Luna より正答率が高い」「GPT-6 は GPT-5.6 より、どの種類の推論でも優れている」という一般的な保証ではありません。モデルの説明文だけで性能の序列を決めず、自分の評価タスクで確かめる必要があります。
4 モデルの仕様を比較する
OpenAI の各モデル仕様ページをもとに、共通点と差分をまとめます。
| モデル | 入力 / 出力(100 万トークンあたり) | reasoning.effort |
コンテキスト / 最大出力 |
|---|---|---|---|
| GPT-6 Sol | $2 / $10 |
none, low, medium, high, xhigh, max
|
1,050,000 / 128,000 トークン |
| GPT-6 Luna | $0.10 / $0.50 |
none, low, medium, high, xhigh, max
|
1,050,000 / 128,000 トークン |
| GPT-5.6 Sol | $4 / $20 |
none, low, medium, high, xhigh, max
|
1,050,000 / 128,000 トークン |
| GPT-5.6 Luna | $0.20 / $1.20 |
none, low, medium, high, xhigh, max
|
1,050,000 / 128,000 トークン |
4 モデルはいずれもテキストと画像を入力でき、テキストを出力します。各モデルページには、入力上限 922,000 トークン、最大出力 128,000 トークンと記載されています。価格は執筆時点で API ドキュメントに掲載されている値です。キャッシュ、ツール呼び出し、処理モードなどで実際の費用は変わり、価格自体も変更されます。特に GPT-5.6 Sol の掲載価格には、少なくとも 2026 年 11 月 21 日までのプロモーション価格との注記があります。
Luna 同士の違い
GPT-5.6 Luna と GPT-6 Luna は、どちらも低コスト・高ボリュームの処理を想定しています。GPT-6 Luna の説明は「集中した高ボリュームのタスクに対する、最も効率的なモデル」です。GPT-5.6 Luna は「コストに敏感な高ボリュームのワークロード」向けと説明されています。
したがって、分類、抽出、短い要約、定型文の生成といった件数が多く、出力要件を明確にできる処理では、まず Luna を候補にできます。ただし、GPT-6 Luna が GPT-5.6 Luna より個別のタスクで必ず高精度だと、モデルの位置付けだけから断定することはできません。
Sol 同士の違い
GPT-5.6 Sol は複雑な専門業務向けのフラッグシップ、GPT-6 Sol は複雑なコーディングやエージェント型ワークフロー向けと説明されています。複数の手順を計画したり、ツールを使ったり、曖昧な情報から判断したりするタスクでは、まず Sol を試すのが自然です。
ただし、GPT-5.6 の公式発表にあるベンチマーク結果は、対象タスクや評価条件に依存します。公開された数値を、手元のコードレビューや文書分析などの業務にそのまま当てはめるのではなく、自分のデータで評価してください。
推論能力はどう比べるか
OpenAI の推論モデル向けガイドでは、モデルが回答を出す前に内部の推論トークンを使い、計画、代替案の検討、曖昧さへの対処、複数段階の問題解決などを行うと説明しています。API では reasoning.effort を指定でき、4 モデルの仕様ページでは none から max まで同じ選択肢が示されています。
ここで区別したいのは、モデル選択と推論に使う設定の選択です。
| 判断したいこと | 最初に試す設定 |
|---|---|
| 定型的な抽出・分類を大量に処理したい | Luna、まずは既定値。必要なら低めの effort も比較 |
| 複数の条件を整理して判断したい | Sol、まずは medium
|
| 難問で見落としが多く、追加の計算が有効か調べたい | 同じモデルで high / xhigh / max を比較 |
| 応答時間や費用を抑えたい | Luna または速度・費用を優先する effort を評価 |
reasoning.effort を高くすれば、あらゆるタスクで出力品質が上がるわけではありません。実行時間やトークン消費と合わせて、正答率、根拠の妥当性、制約順守率などが改善するかを測ります。高い effort と大きいモデルを一度に変えると、どちらが結果に影響したのか分からなくなるため、比較では変更点を一つずつにしましょう。
推論モデル向けプロンプトの書き方
OpenAI の推論モデル向けプロンプトガイドは、簡潔で直接的な指示から始めることを勧めています。また「段階的に考えて」や「推論をすべて説明して」といった指示は、性能を改善しない場合があり、かえって妨げる可能性もあると説明しています。
そこで、モデルに内部の思考過程を長く出力させるより、達成したい結果、判断材料、制約、成功条件、出力形式を明確にします。
あなたは技術文書を評価するアシスタントです。
## 目的
以下の設計案について、重大なリスクと未確認の前提を特定してください。
## 入力
{設計案と関連資料}
## 制約
- 入力資料にない事実は推測で補わない
- 事実、推測、未確認事項を区別する
- リスクは影響度の高い順に示す
## 成功条件
- 各リスクに根拠となる資料箇所を示す
- 判断できない点は「判断できない」と記載する
## 出力形式
リスク / 根拠 / 影響 / 確認が必要なこと、の表にしてください。
最後に、結論と主要な前提を短くまとめてください。
この書き方は Sol / Luna や世代ごとに根本から変える必要はありません。まず同じプロンプトを使ってモデルと effort を比較し、特定のモデルだけが失敗するケースが分かったときに、例示や追加ルールを足します。長い指示を先回りで積み重ねるより、失敗例を記録してから必要な指示だけを追加するほうが、比較結果を解釈しやすくなります。
API でモデルと effort を指定する
次の例では OpenAI .NET SDK の Responses API にモデル ID と推論 effort を指定しています。実行前に NuGet パッケージ OpenAI を追加し、環境変数 OPENAI_API_KEY を設定してください。比較実験では model を候補の 4 ID に置き換え、プロンプトと入力データを固定します。
SDK の Responses API は実験的 API として公開されています。また、現行 SDK では reasoning.effort を CreateResponseOptions の型付きプロパティではなく Patch で指定します。以下は OpenAI .NET SDK の公式サンプルに沿った例です。
using OpenAI.Responses;
using System;
// Responses API は実験的 API のため、必要に応じて警告を抑制します。
#pragma warning disable OPENAI001
#pragma warning disable SCME0001
string apiKey = Environment.GetEnvironmentVariable("OPENAI_API_KEY")
?? throw new InvalidOperationException("環境変数 OPENAI_API_KEY が設定されていません。");
ResponsesClient client = new(apiKey: apiKey);
string input = """
次の設計案に、実装前に解消すべきリスクがあるか評価してください。
資料にない事実は推測で補わず、リスク、根拠、影響、追加確認事項の表で回答してください。
{設計案}
""";
List<ResponseItem> inputItems = new()
{
ResponseItem.CreateUserMessageItem(input),
};
CreateResponseOptions options = new("gpt-6-sol", inputItems);
options.Patch.Set("$.reasoning.effort"u8, "medium");
ResponseResult response = await client.CreateResponseAsync(options);
Console.WriteLine(response.GetOutputText());
#pragma warning restore SCME0001
#pragma warning restore OPENAI001
GPT-6 Sol / Luna のモデル仕様では、組み込みツールや function calling を使う場合に Responses API を案内しています。Chat Completions で function calling を使う場合、reasoning_effort は none に限られるという注記もあります。ツール利用を含む設計では、モデル ID だけでなく API の互換性も確認してください。
GitHub Copilot で使う場合
GitHub Copilot の対応モデル一覧では、GPT-5.6 Sol / Luna と GPT-6 Sol / Luna が GA として掲載されています。ただし、実際に選べるモデルは Copilot のプランや利用する画面(GitHub.com、IDE、Copilot CLI など)で変わります。モデルピッカーに表示される選択肢を確認してください。
Copilot Chat のプロンプト
GitHub のプロンプトエンジニアリングガイドでは、最初に目的を広く伝えたあと、具体的な要件を加えることを勧めています。関連ファイルを開く、コードを選択する、@workspace などで対象を明示する、といったコンテキストの渡し方も重要です。
目的: このリポジトリの認証処理にある不具合を修正してください。
対象: @workspace。特に src/auth/ と関連するテストを確認してください。
要件:
- 既存の設計と命名規則を維持する
- 不具合を再現するテストを追加する
- 認証方式そのものは変更しない
完了条件: 関連テストが成功し、変更点と確認結果を説明できること
複雑な依頼は、設計確認、実装、テストのように小さく分けます。繰り返し適用する規約は、リポジトリの .github/copilot-instructions.md に置けます。IDE では再利用するタスクを .github/prompts/*.prompt.md の prompt file にまとめる方法もあります。
モデルを比較するときは、同じスレッド・同じファイルコンテキスト・同じプロンプトを維持します。まず Luna 同士、Sol 同士で結果を比べ、そのあとに要件や例示を追加すると、モデル差とプロンプト差を混同しにくくなります。
Copilot の費用
2026 年 6 月 1 日から、Copilot は GitHub AI Credits による使用量ベースの課金に移行しました。1 AI Credit は 0.01 USD で、利用料はモデルと入出力トークン数に応じて計算されます。対象プランには月ごとのクレジット枠があり、使い切った後の追加利用はプランや管理者の予算設定に従います。コード補完と next edit suggestions は、AI Credits の課金対象外です。ただし、従来の年間 Pro / Pro+ 契約で旧 premium request 課金を継続している場合は例外です。自分のアカウントがどちらの方式か確認してください。
GitHub Copilot のモデル別価格表にある 100 万トークンあたりの入出力価格は次のとおりです。
| モデル | 通常コンテキストの入力 / 出力 | 長いコンテキストの入力 / 出力 |
|---|---|---|
| GPT-6 Luna | $0.10 / $0.50(272K 以下) | $0.20 / $0.75(272K 超) |
| GPT-6 Sol | $2 / $10(272K 以下) | $4 / $15(272K 超) |
| GPT-5.6 Luna | $0.20 / $1.20(200K 以下) | $0.40 / $1.80(200K 超) |
| GPT-5.6 Sol | $4 / $20(272K 以下) | $8 / $30(272K 超) |
キャッシュ入力と cache write にも別料金があります。次の比較では、入力 100,000 トークン、出力 10,000 トークンの短いコンテキストを 1 回処理する想定で、モデル別の通常料金から AI Credits を算出します。1 AI Credit は 0.01 USD です。
| モデル | 1 回あたりの消費 AI Credits | GPT-6 Luna 比 |
|---|---|---|
| GPT-6 Luna | 1.5 | 1 倍 |
| GPT-5.6 Luna | 3.2 | 約 2.1 倍 |
| GPT-6 Sol | 30 | 20 倍 |
| GPT-5.6 Sol | 60 | 40 倍 |
個人向けの月額プランと AI Credits の対応表には、Copilot Pro(10 USD / 1,500 credits)、Pro+(39 USD / 7,000 credits)、Max(100 USD / 20,000 credits)が掲載されています。Business / Enterprise はユーザーごとのクレジットが請求主体単位でプールされます。実際の費用を見積もるときは、単価だけでなく、プランに含まれるクレジット、会話の長さ、エージェントの反復回数も確認してください。
同じ処理だけに各プランの月間クレジットをすべて使うと仮定した場合、完了できる回数の理論上の目安は次のとおりです。端数は切り捨てています。
| モデル | Copilot Pro(1,500 credits) | Copilot Pro+(7,000 credits) | Copilot Max(20,000 credits) |
|---|---|---|---|
| GPT-6 Luna | 1,000 回 | 4,666 回 | 13,333 回 |
| GPT-5.6 Luna | 468 回 | 2,187 回 | 6,250 回 |
| GPT-6 Sol | 50 回 | 233 回 | 666 回 |
| GPT-5.6 Sol | 25 回 | 116 回 | 333 回 |
この試算はトークン単価だけを使った比較で、キャッシュ、長いコンテキスト、ツール呼び出し、追加のエージェント処理を含みません。Copilot Chat や agent mode では、1 回の依頼に対して複数回モデルが実行されることもあるため、実際の会話回数はこの表より少なくなる場合があります。
Codex で使う場合
Codex は ChatGPT のデスクトップアプリ、CLI、IDE 拡張などで使えるコーディングエージェントです。Codex のモデルガイドでは、GPT-6 Sol は複雑なコーディングやエージェント型ワークフロー、GPT-6 Luna は抽出・分類・短い編集などの明確で反復的なタスク向けとされています。GPT-5.6 Sol / Luna も引き続き選択肢に含まれます。
Codex では、モデルと推論レベルをモデルピッカーから選べます。対話中の CLI では /model で切り替えられます。利用可能なモデルはプラン、クライアント、ワークスペースの設定、段階的な提供状況によって異なります。GPT-6 Sol / Luna は Codex と Work で提供されており、通常の Chat では選べません。
Codex のプロンプトと AGENTS.md
Codex のプロンプトガイドは、短い依頼でも始められる一方、規模の大きな作業では「目的」「コンテキスト」「出力」「境界条件」を明示することを勧めています。さらに Codex のベストプラクティスでは、作業が複雑・曖昧なときに先に計画を作ること、完了条件にテストや確認を含めることが推奨されています。
目的: 設定画面で保存後に値が戻る不具合を修正してください。
コンテキスト: 設定画面、保存処理、関連テストを確認してください。
制約:
- 既存の状態管理パターンを維持する
- 無関係なリファクタリングをしない
- 原因が特定できない場合は、変更を始める前に説明する
完了条件:
- 不具合を再現するテストを追加する
- 関連テストを実行する
- 変更内容と残るリスクを報告する
毎回説明するリポジトリ規約は、ルートの AGENTS.md に置くと Codex が作業前に読み込みます。大きなタスクでは Plan mode や /plan で方針を決め、実装後にテストと差分レビューまで依頼すると、単発の質問よりもエージェントとして活用しやすくなります。
Codex のモデルガイドは、初期値の目安として GPT-6 Sol は Medium、GPT-6 Luna は High を挙げています。一方、推論レベルの対応関係は世代間で完全には一致しないと明記されています。これは Codex 上の開始点であり、API の reasoning.effort にそのまま当てはめる値ではありません。画面や API の設定を同一の尺度とみなさず、タスクの結果と利用量を見ながら調整してください。
Codex の費用
Codex は Free、Go、Plus、Pro、Business、Enterprise の ChatGPT プランで利用できますが、モデル別に固定された「1 回あたりの料金」ではありません。選んだモデル、タスクの複雑さ、コンテキスト量、推論レベル、ツール利用などに応じて、プランの利用枠を消費します。ローカル実行とクラウド実行も同じ利用枠を共有する場合があります。追加利用やクレジットが使えるかはプランによって異なるため、Settings → Usage で現在の残量とリセット時刻を確認してください。プランの月額料金は ChatGPT の契約プランに従い、Codex 専用の定額追加料金とは別です。最新の金額はChatGPT の料金ページで確認してください。
Codex の料金ページにある Plus プランのローカル実行における 5 時間あたりの推定メッセージ数を抜粋します。これは固定上限ではなく、週次制限も適用される場合があります。
| モデル | Plus での推定メッセージ数 / 5 時間 |
|---|---|
| GPT-6 Luna | 350〜3,000 |
| GPT-5.6 Luna | 250〜2,000 |
| GPT-6 Sol | 15〜150 |
| GPT-5.6 Sol | 10〜100 |
Codex CLI / IDE 拡張で API Key 方式を選ぶ場合は、ChatGPT プラン枠ではなく API 料金が適用されます。その場合は前述の OpenAI API 価格を使います。つまり、ChatGPT サブスクリプションで Codex を使う場合と、API Key で従量課金する場合は別の料金体系です。
Copilot・Codex・API の費用を比べる
| 利用方法 | 主な課金単位 | 料金を左右するもの |
|---|---|---|
| GitHub Copilot | 月額プランに含まれる AI Credits と、必要に応じた追加利用 | モデル別トークン価格、入力・出力量、プランのクレジット枠 |
| Codex(ChatGPT サインイン) | ChatGPT プランの利用枠。条件に応じて追加クレジット | モデル、タスク、コンテキスト、推論レベル、実行面 |
| Codex(API Key) / OpenAI API | トークン単位の API 従量課金 | モデルごとの入出力価格、キャッシュ、ツール利用 |
GitHub Copilot はモデルごとの単価と月間 AI Credits を見て概算しやすい一方、Codex の ChatGPT サインインは、モデルごとの固定単価ではなく利用枠とメッセージ推定値で管理します。Codex の API Key 利用では、最初の OpenAI API 価格表にあるトークン単価を使います。プラン価格だけ、あるいはモデル単価だけを横並びにせず、実際の入力・出力量と含まれる利用枠を合わせて比べてください。
研究論文から見えること、見えないこと
研究論文はプロンプトや推論能力を考えるうえで参考になります。ただし、論文で得られた結果は、対象モデル、タスク、評価条件にひもづいています。GPT-6 と GPT-5.6 の直接比較の代わりにはなりません。
Chain-of-Thought はプロンプトの一つの設計手法
Wei らの Chain-of-Thought Prompting Elicits Reasoning in Large Language Models は、例題と解答だけでなく、解答に至る中間的な説明を含める few-shot prompt を評価しています。論文では特定の大規模モデルとベンチマークを使っており、例を通じた prompting の有効性を示しています。
これは「どのモデルにも『一歩ずつ考えて』と書けば性能が上がる」という証拠ではありません。OpenAI の現在の推論モデル向けガイドは、内部推論を行うモデルに対し、そのような指示を常に追加する必要はないとしています。プロンプトに説明例を含める手法と、モデルに推論過程を出力するよう要求することは分けて考えましょう。
正解だけでなく、途中の判断を評価する
OpenAI の Let’s Verify Step by Step は、数学問題を対象に、最終解答だけを評価する方法と、解答過程のステップを評価する方法を扱っています。論文の PRM800K データセットには、解答の各ステップに対するラベルが含まれます。
この研究から実務に持ち帰れるのは、「最終回答が合っているか」だけでなく、要件に応じて根拠や途中の判断を検証対象にできるという点です。ただし、この論文が比較しているのは推論の評価・学習方法であり、今回の 4 モデルの優劣ではありません。
Microsoft Research の研究は、モデル学習とタスク特性も示す
Microsoft Research の Phi-4-reasoning Technical Report では、Phi-4 を基盤にした推論モデルの学習に、データ選別、教師ありファインチューニング、強化学習などを用いたと説明されています。研究者は、Phi-4-reasoning 向けの reasoning-specific system message が一貫性と性能を高めたため、そのモデルでは学習時の system prompt を使うよう推奨しています。
この例は、モデルによっては学習時の形式に合わせた指示が有効なことを示します。しかし、Phi-4 向けの system message を GPT-6 や GPT-5.6 に移植すべき、という意味ではありません。
同じく Microsoft Research の Assessing GPT4-V on Structured Reasoning Tasks は、画像を含む構造化推論タスクで Visual Chain-of-Thought を評価し、対象条件では標準的なモデル使用より改善があったと報告しています。これも視覚入力を扱う GPT-4V の研究であり、テキスト中心の現在のモデルすべてに効果があるとは限りません。
自分のタスクで比較する手順
論文やモデル紹介の数値を読むだけでは、自分の使い方にとってどちらがよいかは決まりません。次のように評価すると、世代、階層、effort の影響を分けて観察できます。
- 実業務を代表する入力を集める: 典型例だけでなく、曖昧な依頼、例外、情報不足、長い入力も含めます。機密情報や個人情報を含む場合は、利用できる環境とデータ利用条件を確認します。
- 評価基準を先に決める: 正確さ、根拠の妥当性、形式順守、見落とし、応答時間、トークン費用など、タスクで重要な基準を定義します。
- 同じプロンプトで Luna 同士、Sol 同士を比較する: GPT-5.6 Luna と GPT-6 Luna、GPT-5.6 Sol と GPT-6 Sol を別々に比べます。まずはプロンプトと
reasoning.effortを固定します。 - 次に effort を変えて比較する: 同じモデルで effort だけを変え、品質と費用・時間の関係を確認します。必要なら同一条件で複数回実行し、出力の揺れも記録します。
- 失敗例をもとにプロンプトを更新する: 評価データを見てから、制約の明確化、具体例、出力形式などを一つずつ調整します。調整後は同じ評価データで再確認します。
| 評価観点 | 確認例 |
|---|---|
| 🎯 正確さ | 事実誤認、計算誤り、分類ミスがないか |
| 📚 根拠 | 回答が入力資料に支えられているか |
| 📐 制約順守 | 出力形式、文字数、禁止事項を守ったか |
| ⏱️ 応答時間 | 実運用の待ち時間に収まるか |
| 💰 費用 | トークン数やツール利用料を含め許容範囲か |
| 🔁 安定性 | 同じ入力で重要な結論が大きく変わらないか |
まとめ
GPT-6 Luna と GPT-5.6 Luna は高ボリュームの効率重視、GPT-6 Sol と GPT-5.6 Sol は複雑な仕事向けというのが、公式ドキュメントから読み取れる基本的な使い分けです。4 モデルはいずれも複数の reasoning.effort を選べますが、公開仕様だけで推論能力を単純に順位付けすることはできません。
プロンプトは、内部推論を長く要求するより、目的、入力、制約、成功条件、出力形式を具体的に書くところから始めます。そしてモデルの紹介や研究論文だけで決めず、実際の業務を代表する評価データで、正確さ・根拠・時間・費用を比較します。
私なら、まず Luna で定型処理の基準を作り、複雑な判断やツールを伴うタスクでは Sol も同じ条件で試します。その上で、必要な品質を満たす中で最も費用と待ち時間を抑えられる組み合わせを選びます。
参考
OpenAI 公式資料
- GPT-6 Sol Model
- GPT-6 Luna Model
- GPT-5.6 Sol Model
- GPT-5.6 Luna Model
- Using GPT-6
- Reasoning models
- Reasoning best practices
- Prompting
- GPT-5.6: Frontier intelligence that scales with your ambition
- OpenAI .NET SDK
- OpenAI .NET SDK: Responses API で追加プロパティを指定する例
- Codex models
- Codex prompting
- Codex best practices
- Codex pricing
- ChatGPT pricing
GitHub Copilot 公式資料
- Supported AI models in GitHub Copilot
- Prompt engineering for GitHub Copilot Chat
- Your first custom instructions
- Models and pricing for GitHub Copilot
- GitHub Copilot billing
- Usage-based billing for individuals
- Requests in GitHub Copilot (legacy)
- Updates to GitHub Copilot billing and plans
研究論文・Microsoft Research
- Wei et al., Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
- Lightman et al., Let's Verify Step by Step
- Microsoft Research, Phi-4-reasoning Technical Report
- Microsoft Research, Assessing GPT4-V on Structured Reasoning Tasks