この記事の目的
Google I/O 2026で発表されたGemini 3.5 Flashのベンチマークを整理し、Claude Opus 4.7・GPT-5.5との使い分けをまとめます。
モデルスペック
| 項目 | 値 |
|---|---|
| モデルID | gemini-3.5-flash |
| コンテキスト | 入力1M / 出力65Kトークン |
| マルチモーダル | テキスト・画像・音声・動画・PDF |
| 料金 | 入力 $1.50/M、出力 $9.00/M、キャッシュ入力 $0.15/M |
| 知識カットオフ | 2026年1月 |
| Dynamic Thinking | デフォルトON(中強度) |
エージェント・コーディングベンチマーク(Google公式発表)
| ベンチマーク | 3.5 Flash | 3.1 Pro | 差分 |
|---|---|---|---|
| Terminal-Bench 2.1(ターミナルコーディング) | 76.2% | 70.3% | +5.9 |
| MCP Atlas(ツールコール精度) | 83.6% | 78.2% | +5.4 |
| Finance Agent v2(金融エージェントタスク) | 57.9% | 43.0% | +14.9 |
| GDPval-AA(汎用意思決定) | 1,656 Elo | 1,314 Elo | +342 |
| CharXiv Reasoning(マルチモーダル理解) | 84.2% | — | — |
3.1 Proが優位なベンチマーク:Humanity's Last Exam(44.4% vs 40.2%)、ARC-AGI-2(77.1% vs 72.1%)。いずれも抽象推論タスクです。
タスク別モデル選択
| タスクの種類 | 推奨モデル | 理由 |
|---|---|---|
| マルチツール連携・MCPエージェントループ | Gemini 3.5 Flash | MCP Atlas最高スコア、4倍速、最安 |
| リポジトリレベルのコードリファクタリング | Claude Opus 4.7 | SWE-Bench Proリーダー |
| GUI自動化・Computer Use | GPT-5.5 | 唯一のプロダクションComputer Use対応 |
ツールサポート
対応済み:
- Function Calling
- Structured Output
- Search-as-a-tool
- Code Execution
未対応:Computer Use(画面操作・GUIナビゲーション不可)
Dynamic Thinking
デフォルトで中強度がON。低強度モードも利用可能で、レイテンシに敏感なステップでは品質低下を最小限に抑えつつ高速化できます。
注意点:思考トークンは出力として課金されます。エージェントループのコストを抑えるには、ワークロードに応じてlow/mediumを使い分けてください。
EvoLink経由のAPI呼び出し
EvoLinkを使えば、同じエンドポイント・同じAPIキーでGemini 3.5 Flash、Claude Opus 4.7、GPT-5.5を切り替えられます。
curl -X POST https://direct.evolink.ai/v1beta/models/gemini-3.5-flash:generateContent \
-H "Authorization: Bearer YOUR_EVOLINK_KEY" \
-H "Content-Type: application/json" \
-d '{"contents": [{"role": "user", "parts": [{"text": "このプロジェクトの依存関係を分析してください"}]}]}'
以前のGeminiモデルを使用中の場合、モデルIDを差し替えるだけで移行できます。
注意点
- ベンチマーク数値はすべてGoogleの公式発表です。独立検証は今後になります
- エージェントコストは単価ではなくワークフロー全体で考慮してください
- Gemini 3.5 Proは来月リリース予定。最高精度の汎用推論が必要な場合は待つ選択肢もあります
参考リンク
tags: Gemini, Google, AI, LLM, エージェント, API