本記事は AIHubMix が作成しています。実測結果はすべて2026年10月9日時点のものです。Mistral Large 4 はパブリックプレビュー版のため、挙動が予告なく変わる可能性があります。
TL;DR
- Mistral Large 4 は Mistral AI の新しいフラッグシップで、総パラメータ数 1.05T の混合エキスパート(MoE)モデルです。2026年10月6日にパブリックプレビューとして公開されました。
- 入力はテキストと画像、出力はテキスト。防御的セキュリティ、画像内の物体の位置特定、法務エージェントのベンチマークで上位に入る一方、総合的な知能は中位です。
- AIHubMix 経由で呼ぶと、思考(reasoning)はデフォルトでオンです。
reasoning_effort="none"では止まらず、リクエストボディに"reasoning": {"effort": "none"}を入れる必要があります。 - トークン単価は安めでも、タスクあたりのコストは高くつくことがあります。
Mistral Large 4 の基本情報
Mistral が欧州の自社データセンターで、他社のベースモデルを使わずに一から学習したモデルです。愛称は「Le Chonk」。オープンウェイトは2026年10月末に公開予定ですが、ライセンスはまだ発表されていません。
| 項目 | 値 |
|---|---|
| モデル ID(AIHubMix) | mistral-large-4-0 |
| モデル ID(Mistral) | mistral-large-4(エイリアス mistral-large-4-0) |
| パラメータ数 | 総 1.05T、アクティブ約 50B |
| 入力 | テキスト+画像(1リクエスト最大100枚) |
| 出力 | テキストのみ |
| コンテキスト長 | 1M トークン |
| 最大出力 | 262,144 トークン(思考を含む) |
| 思考(AIHubMix) | デフォルトでオン、reasoning.effort = none でオフ |
| 思考の返却先 | reasoning_details |
| 料金(100万トークンあたり) | 入力 $1.36、キャッシュ $0.14、出力 $4.18 |
仕様は Mistral のモデルカードに従っています。アクティブパラメータ数について、Mistral は 49B と 52B の2つの数字を出しています。
得意なこと・苦手なこと
数値は Mistral の発表記事(自己申告)と、Artificial Analysis および Vals AI による独立評価から引用しています。いずれもプレビュー段階の結果です。
| タスク | Large 4 | 参考 |
|---|---|---|
| CyberGym-E2E(脆弱性の再現とパッチ作成) | 82%、1位 | MiMo-V2.6-Pro 79% |
| DIOR-RSVG(航空画像での位置特定) | 73% | GPT-6 Astra 68% |
| Harvey Legal Agent | 15.8%、76モデル中6位 | オープンモデル中1位 |
| Terminal-Bench 4(Vals) | 22.7%、45モデル中21位 | Claude Opus 5.5 65.2% |
| AA Intelligence Index | 38 | GLM-5.3 45 |
セキュリティの数字には背景があります。Mistral によると、Claude Opus 5.5 と GPT-6 Astra は CyberGym-E2E でほぼ0点ですが、これはタスク自体を拒否するためです。Large 4 は最後までやり切ります。一方で Mistral は、本当に有害なサイバー攻撃の依頼に対する Large 4 の拒否率は、比較したどのオープンモデルよりも高いとしています。
向いているのは、防御的セキュリティのツール、衛星画像・航空画像・設計図面での物体の位置特定、法務や金融のリサーチエージェントです。ターミナル操作の多いコーディングエージェントが主な用途なら、先に他のモデルを試すことをおすすめします。
準備
- AIHubMix の API キーを環境変数
AIHUBMIX_API_KEYに設定します(クイックスタート参照)。 - OpenAI の Python SDK をインストールします。AIHubMix は OpenAI 互換の Chat Completions エンドポイント
https://aihubmix.com/v1で Large 4 を提供しています。
pip install openai
export AIHUBMIX_API_KEY="(AIHubMix の API キー)"
AIHubMix 経由での思考モードの挙動
Mistral 公式 API では reasoning_effort に "none" か "high" を指定でき、"high" のときは content がチャンクのリストになります。AIHubMix 経由では挙動が異なります。以下は2026年10月9日に約30リクエストで検証した結果で、プロンプトには「2**31 と 3**20 はどちらが大きいか」という質問を使いました。
| リクエスト | 思考する? | 推論トークン |
|---|---|---|
| reasoning_effort を指定しない | する | 1,492 |
| reasoning_effort = none | する | 427 |
| reasoning_effort = high | する | 764 |
| reasoning.effort = none(ボディのフィールド) | しない | 0 |
各行とも1回ずつしか計測していないため、トークン数からわかるのは「思考したかどうか」だけで、設定ごとのコスト比較には使えません。"low" と "medium" も受け付けられ、どちらも思考しました。
コードを書くうえでのポイントは次のとおりです。
-
contentは常に通常の文字列です。ストリーミングでも同じで、思考中は""が返ります。 - 思考内容は
reasoning_contentではなくreasoning_detailsに入ります。形式は{"type": "reasoning.text", "text": ...}のリストです。OpenAI SDK ではmessage.model_extraから読み取ります。 - 思考をオフにするには、リクエストボディに
"reasoning": {"effort": "none"}を入れます。 - 思考トークンは
completion_tokensに含まれ、出力として課金されます。
実装例
思考のオン/オフ切り替え、思考内容の取り出し、マルチターンでの受け渡しをまとめると次のようになります。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
def ask(messages, think=True, max_tokens=16000):
"""Large 4 を呼び出し、(choice, thinking) を返す。think=False でなければ思考オン。"""
response = client.chat.completions.create(
model="mistral-large-4-0",
messages=messages,
max_tokens=max_tokens, # 思考トークンもこの上限に含まれる
extra_body=None if think else {"reasoning": {"effort": "none"}},
)
choice = response.choices[0]
details = (choice.message.model_extra or {}).get("reasoning_details") or []
thinking = "".join(d.get("text", "") for d in details)
return choice, thinking
messages = [{
"role": "user",
"content": "Office アプリから起動された PowerShell を検出する Sigma ルールを書いてください。",
}]
choice, thinking = ask(messages)
print(choice.message.content)
print(choice.finish_reason, len(thinking), "characters of thinking")
# マルチターン:アシスタントのメッセージを reasoning_details ごとそのまま戻す
messages.append(choice.message.model_dump(exclude_none=True))
messages.append({"role": "user", "content": "署名済みの社内アドインは除外してください。"})
choice, _ = ask(messages)
print(choice.message.content)
Mistral の推論ドキュメントは、次のターンで思考内容を戻すよう求めており、捨てると出力品質が「大きく下がる」と注意しています。AIHubMix 経由では、reasoning_details を含めて戻したメッセージは毎回問題なく受け付けられました。ただし戻した思考内容は、次のターンで入力として課金されます。あるテストでは、思考内容ごと戻した追加質問の入力が 948 トークン、回答だけを戻した場合は 57 トークンでした。
ハマりどころと対処法
頼んでいない思考に課金される
AIHubMix 経由では、reasoning_effort="none" で思考は止まりません。実測では、"none" を指定した短い Sigma ルールのリクエストでも 2,059 の推論トークンが発生しました。リクエストボディに "reasoning": {"effort": "none"} を入れてください。上の ask(..., think=False) がこの書き方です。
回答が空で finish_reason == "length" になる
回答が始まる前に、思考が max_tokens を使い切っています。実測では、小さな論理パズルに 300 トークンの上限を設定したところ content が None で返り、300 トークンのうち 280 が思考に使われていました。上限には十分な余裕を持たせ、文字列メソッドを呼ぶ前に content が空でないか確認しましょう。
ログに思考内容が出てこない
多くのゲートウェイが使う reasoning_content フィールドを読んでいる可能性があります。AIHubMix 経由の Large 4 は、通常のレスポンスでもストリーミングでも reasoning_details を返します。
Mistral 直結で AttributeError: 'list' object has no attribute ...
Mistral 公式 API では、reasoning_effort="high" にすると content がチャンクのリストになります。LiteLLM、Roo Code、openlit はいずれもこの件で Mistral のパース処理を修正しています。AIHubMix は文字列で返すので、この問題は起きません。
出力が週ごとに変わる
プレビュー版の仕様です。Mistral のモデルライフサイクルポリシーでは、プレビュー版は名前を変えないまま更新されることがあり、提供終了は1か月前に通知されます。小さな回帰テストを用意して、定期的に回しましょう。
コスト:トークン単価ではなくタスク単価で見る
100万トークンあたり $1.36 / $4.18 という単価は、GPT-6.1 Sol($2 / $10)より安く見えます。しかし Vals AI の総合評価では、1問あたりのコストが Large 4 は $13.78、Sol は $3.24 で、スコアも Sol のほうが上でした(61.2% 対 48.1%)。Vals の Finance Agent v2 では逆転し、スコアはほぼ同じで、1問あたり Large 4 が $1.20、GPT-6 Astra が $6.82 でした。本番に入れる前に、自分のタスクで一度測っておくのが確実です。
その他の実測結果と未検証の点
10月9日の同じ検証では、次のこともわかりました。
-
キャッシュ: 3,927 トークンのプロンプトを繰り返し送ると、3,052 トークンがキャッシュにヒットしました。
prompt_cache_keyの有無は関係ありませんでした。ただし毎回ヒットするとは限らず、キーなしで繰り返した1回はヒットしませんでした。 -
画像: 400×300 の PNG 1枚で入力は約 176 トークン。0〜1000 のスケールでボックス座標を出すよう指示すると、
box_2dの座標は実際の境界から 50 以内の誤差でした。 - コンテキスト: 559,988 トークンのプロンプトは受け付けられました。それより長いプロンプトは拒否され、ゲートウェイのエラーには上限 1,048,576 トークンと書かれていました。
まだ検証できていないのは、"low"/"medium"/"high" で思考量が変わるかどうか(1回ずつの計測では傾向が見えません)、上で引用したベンチマークのスコア、アクティブパラメータ数(Mistral は 49B と 52B の両方を公表)、オープンウェイトのライセンスです。
まとめ
- Large 4 は「何でもできる最強モデル」ではなく、防御的セキュリティ、画像内の位置特定、法務・金融エージェントに強い専門型のモデルです。
- AIHubMix 経由で思考を止めたいときは、
reasoning_effortではなくボディの"reasoning": {"effort": "none"}を使います。 -
max_tokensは思考の分も見込んで設定し、マルチターンではreasoning_detailsごと戻します。 - トークン単価ではなく、自分のタスクでのタスク単価で比べましょう。
AIHubMix のモデルページからすぐに試せます。
参考
- Introducing Mistral Large 4(Mistral AI)
- Reasoning(推論)ドキュメント(Mistral Docs)
- Mistral Large 4.0(AIHubMix)
- Mistral Large 4 の分析(Artificial Analysis)
- Mistral Large 4 のベンチマーク(Vals AI)