0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

Mistral Large 4 とは? API で呼ぶ前に確認したい思考モード・コスト・ハマりどころ

0
Last updated at Posted at 2026-10-10

本記事は AIHubMix が作成しています。実測結果はすべて2026年10月9日時点のものです。Mistral Large 4 はパブリックプレビュー版のため、挙動が予告なく変わる可能性があります。

TL;DR

  • Mistral Large 4 は Mistral AI の新しいフラッグシップで、総パラメータ数 1.05T の混合エキスパート(MoE)モデルです。2026年10月6日にパブリックプレビューとして公開されました。
  • 入力はテキストと画像、出力はテキスト。防御的セキュリティ、画像内の物体の位置特定、法務エージェントのベンチマークで上位に入る一方、総合的な知能は中位です。
  • AIHubMix 経由で呼ぶと、思考(reasoning)はデフォルトでオンです。reasoning_effort="none" では止まらず、リクエストボディに "reasoning": {"effort": "none"} を入れる必要があります。
  • トークン単価は安めでも、タスクあたりのコストは高くつくことがあります。

Mistral Large 4 の基本情報

Mistral が欧州の自社データセンターで、他社のベースモデルを使わずに一から学習したモデルです。愛称は「Le Chonk」。オープンウェイトは2026年10月末に公開予定ですが、ライセンスはまだ発表されていません。

項目 値
モデル ID(AIHubMix) mistral-large-4-0
モデル ID(Mistral) mistral-large-4(エイリアス mistral-large-4-0)
パラメータ数 総 1.05T、アクティブ約 50B
入力 テキスト+画像(1リクエスト最大100枚)
出力 テキストのみ
コンテキスト長 1M トークン
最大出力 262,144 トークン(思考を含む)
思考(AIHubMix) デフォルトでオン、reasoning.effort = none でオフ
思考の返却先 reasoning_details
料金(100万トークンあたり) 入力 $1.36、キャッシュ $0.14、出力 $4.18

仕様は Mistral のモデルカードに従っています。アクティブパラメータ数について、Mistral は 49B と 52B の2つの数字を出しています。

得意なこと・苦手なこと

数値は Mistral の発表記事(自己申告)と、Artificial Analysis および Vals AI による独立評価から引用しています。いずれもプレビュー段階の結果です。

タスク Large 4 参考
CyberGym-E2E(脆弱性の再現とパッチ作成) 82%、1位 MiMo-V2.6-Pro 79%
DIOR-RSVG(航空画像での位置特定) 73% GPT-6 Astra 68%
Harvey Legal Agent 15.8%、76モデル中6位 オープンモデル中1位
Terminal-Bench 4(Vals) 22.7%、45モデル中21位 Claude Opus 5.5 65.2%
AA Intelligence Index 38 GLM-5.3 45

セキュリティの数字には背景があります。Mistral によると、Claude Opus 5.5 と GPT-6 Astra は CyberGym-E2E でほぼ0点ですが、これはタスク自体を拒否するためです。Large 4 は最後までやり切ります。一方で Mistral は、本当に有害なサイバー攻撃の依頼に対する Large 4 の拒否率は、比較したどのオープンモデルよりも高いとしています。

向いているのは、防御的セキュリティのツール、衛星画像・航空画像・設計図面での物体の位置特定、法務や金融のリサーチエージェントです。ターミナル操作の多いコーディングエージェントが主な用途なら、先に他のモデルを試すことをおすすめします。

準備

  • AIHubMix の API キーを環境変数 AIHUBMIX_API_KEY に設定します(クイックスタート参照)。
  • OpenAI の Python SDK をインストールします。AIHubMix は OpenAI 互換の Chat Completions エンドポイント https://aihubmix.com/v1 で Large 4 を提供しています。
pip install openai
export AIHUBMIX_API_KEY="(AIHubMix の API キー)"

AIHubMix 経由での思考モードの挙動

Mistral 公式 API では reasoning_effort に "none" か "high" を指定でき、"high" のときは content がチャンクのリストになります。AIHubMix 経由では挙動が異なります。以下は2026年10月9日に約30リクエストで検証した結果で、プロンプトには「2**31 と 3**20 はどちらが大きいか」という質問を使いました。

リクエスト 思考する? 推論トークン
reasoning_effort を指定しない する 1,492
reasoning_effort = none する 427
reasoning_effort = high する 764
reasoning.effort = none(ボディのフィールド) しない 0

各行とも1回ずつしか計測していないため、トークン数からわかるのは「思考したかどうか」だけで、設定ごとのコスト比較には使えません。"low" と "medium" も受け付けられ、どちらも思考しました。

コードを書くうえでのポイントは次のとおりです。

  • content は常に通常の文字列です。ストリーミングでも同じで、思考中は "" が返ります。
  • 思考内容は reasoning_content ではなく reasoning_details に入ります。形式は {"type": "reasoning.text", "text": ...} のリストです。OpenAI SDK では message.model_extra から読み取ります。
  • 思考をオフにするには、リクエストボディに "reasoning": {"effort": "none"} を入れます。
  • 思考トークンは completion_tokens に含まれ、出力として課金されます。

実装例

思考のオン/オフ切り替え、思考内容の取り出し、マルチターンでの受け渡しをまとめると次のようになります。

large4_client.py
import os

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)


def ask(messages, think=True, max_tokens=16000):
    """Large 4 を呼び出し、(choice, thinking) を返す。think=False でなければ思考オン。"""
    response = client.chat.completions.create(
        model="mistral-large-4-0",
        messages=messages,
        max_tokens=max_tokens,  # 思考トークンもこの上限に含まれる
        extra_body=None if think else {"reasoning": {"effort": "none"}},
    )
    choice = response.choices[0]
    details = (choice.message.model_extra or {}).get("reasoning_details") or []
    thinking = "".join(d.get("text", "") for d in details)
    return choice, thinking


messages = [{
    "role": "user",
    "content": "Office アプリから起動された PowerShell を検出する Sigma ルールを書いてください。",
}]
choice, thinking = ask(messages)
print(choice.message.content)
print(choice.finish_reason, len(thinking), "characters of thinking")

# マルチターン:アシスタントのメッセージを reasoning_details ごとそのまま戻す
messages.append(choice.message.model_dump(exclude_none=True))
messages.append({"role": "user", "content": "署名済みの社内アドインは除外してください。"})
choice, _ = ask(messages)
print(choice.message.content)

Mistral の推論ドキュメントは、次のターンで思考内容を戻すよう求めており、捨てると出力品質が「大きく下がる」と注意しています。AIHubMix 経由では、reasoning_details を含めて戻したメッセージは毎回問題なく受け付けられました。ただし戻した思考内容は、次のターンで入力として課金されます。あるテストでは、思考内容ごと戻した追加質問の入力が 948 トークン、回答だけを戻した場合は 57 トークンでした。

ハマりどころと対処法

頼んでいない思考に課金される

AIHubMix 経由では、reasoning_effort="none" で思考は止まりません。実測では、"none" を指定した短い Sigma ルールのリクエストでも 2,059 の推論トークンが発生しました。リクエストボディに "reasoning": {"effort": "none"} を入れてください。上の ask(..., think=False) がこの書き方です。

回答が空で finish_reason == "length" になる

回答が始まる前に、思考が max_tokens を使い切っています。実測では、小さな論理パズルに 300 トークンの上限を設定したところ content が None で返り、300 トークンのうち 280 が思考に使われていました。上限には十分な余裕を持たせ、文字列メソッドを呼ぶ前に content が空でないか確認しましょう。

ログに思考内容が出てこない

多くのゲートウェイが使う reasoning_content フィールドを読んでいる可能性があります。AIHubMix 経由の Large 4 は、通常のレスポンスでもストリーミングでも reasoning_details を返します。

Mistral 直結で AttributeError: 'list' object has no attribute ...

Mistral 公式 API では、reasoning_effort="high" にすると content がチャンクのリストになります。LiteLLM、Roo Code、openlit はいずれもこの件で Mistral のパース処理を修正しています。AIHubMix は文字列で返すので、この問題は起きません。

出力が週ごとに変わる

プレビュー版の仕様です。Mistral のモデルライフサイクルポリシーでは、プレビュー版は名前を変えないまま更新されることがあり、提供終了は1か月前に通知されます。小さな回帰テストを用意して、定期的に回しましょう。

コスト:トークン単価ではなくタスク単価で見る

100万トークンあたり $1.36 / $4.18 という単価は、GPT-6.1 Sol($2 / $10)より安く見えます。しかし Vals AI の総合評価では、1問あたりのコストが Large 4 は $13.78、Sol は $3.24 で、スコアも Sol のほうが上でした(61.2% 対 48.1%)。Vals の Finance Agent v2 では逆転し、スコアはほぼ同じで、1問あたり Large 4 が $1.20、GPT-6 Astra が $6.82 でした。本番に入れる前に、自分のタスクで一度測っておくのが確実です。

その他の実測結果と未検証の点

10月9日の同じ検証では、次のこともわかりました。

  • キャッシュ: 3,927 トークンのプロンプトを繰り返し送ると、3,052 トークンがキャッシュにヒットしました。prompt_cache_key の有無は関係ありませんでした。ただし毎回ヒットするとは限らず、キーなしで繰り返した1回はヒットしませんでした。
  • 画像: 400×300 の PNG 1枚で入力は約 176 トークン。0〜1000 のスケールでボックス座標を出すよう指示すると、box_2d の座標は実際の境界から 50 以内の誤差でした。
  • コンテキスト: 559,988 トークンのプロンプトは受け付けられました。それより長いプロンプトは拒否され、ゲートウェイのエラーには上限 1,048,576 トークンと書かれていました。

まだ検証できていないのは、"low"/"medium"/"high" で思考量が変わるかどうか(1回ずつの計測では傾向が見えません)、上で引用したベンチマークのスコア、アクティブパラメータ数(Mistral は 49B と 52B の両方を公表)、オープンウェイトのライセンスです。

まとめ

  • Large 4 は「何でもできる最強モデル」ではなく、防御的セキュリティ、画像内の位置特定、法務・金融エージェントに強い専門型のモデルです。
  • AIHubMix 経由で思考を止めたいときは、reasoning_effort ではなくボディの "reasoning": {"effort": "none"} を使います。
  • max_tokens は思考の分も見込んで設定し、マルチターンでは reasoning_details ごと戻します。
  • トークン単価ではなく、自分のタスクでのタスク単価で比べましょう。

AIHubMix のモデルページからすぐに試せます。

参考

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?