0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

Claude Code + OpenRouter 無料モデル 5 選:2026年版クオリティ・速度・コスト完全比較

0
Posted at

TL;DR

  • OpenRouter の :free モデルは 2026 年時点で 5 モデル以上が実用レベルに達した
  • コーディング補助・要約・翻訳など 用途別に最適モデルが異なる
  • 無料枠のレート制限と文脈長を把握すれば 月 $0 でエージェント運用が現実的

背景:なぜ今 OpenRouter 無料モデルなのか

LLM を自社プロダクトや社内ツールに組み込むとき、最初のハードルはコストだ。OpenAI GPT-4o や Anthropic Claude 3.5 Sonnet はクオリティが高い反面、バッチ処理・自動化・社内ハーネスで回し続けると月額が青天井になる。

OpenRouter は複数プロバイダの LLM を単一 API で呼び出せるアグリゲーターで、Provider が試用・宣伝目的で提供するモデルを :free サフィックスで無料公開している。

2024 年末〜2026 年にかけて Qwen / Mistral / Meta / Google / DeepSeek などが相次いで高性能モデルを無料公開したことで、実務ユースケースに耐えるモデルが一気に増えた

モデル識別子の例:
  qwen/qwen3-235b-a22b:free
  meta-llama/llama-3.3-70b-instruct:free
  google/gemma-3-27b-it:free
  mistralai/mistral-7b-instruct:free
  deepseek/deepseek-r1:free   ← 推論特化

評価軸と方法論

本記事では以下 4 軸で各モデルを評価する。数値は公式発表値・ベンチマーク論文・コミュニティレポートを元にした定性〜定量の混合評価であり、環境依存がある点はご了承いただきたい。

説明
コーディング精度 HumanEval / MBPP 相当タスクの正答率傾向
レイテンシ 初回トークン到達時間 (TTFT) の体感
コンテキスト長 最大入力トークン数
レート制限 :free 枠の req/min・RPD (requests per day)

モデル別詳細

1. qwen/qwen3-235b-a22b:free ── 推論×コーディング最強クラス

Alibaba Cloud の Qwen3 シリーズ最大モデル。MoE (Mixture of Experts) アーキテクチャにより 有効パラメータ 22B 相当の計算量で 235B 規模の表現力を引き出す。

強み

  • コーディング・数学・推論タスクで GPT-4o に匹敵する結果が複数ベンチマークで報告されている
  • 日本語・中国語・英語の多言語対応が優秀
  • thinking モードで CoT (Chain of Thought) を内部展開し、複雑なタスクに自動適用

弱み

  • :free 枠は混雑時にレイテンシが跳ね上がる
  • RPD が低めに設定されているため、バッチ処理には注意

推奨ユースケース
コードレビュー・複雑な要件定義の整理・多言語ドキュメント生成

# OpenRouter 呼び出し例 (最小構成)
import openai

client = openai.OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key="YOUR_OPENROUTER_KEY",  # 実際のキーは環境変数に格納すること
)

response = client.chat.completions.create(
    model="qwen/qwen3-235b-a22b:free",
    messages=[
        {"role": "user", "content": "Python で非同期 HTTP クライアントを実装して"}
    ],
)
print(response.choices[0].message.content)

2. meta-llama/llama-3.3-70b-instruct:free ── バランス型定番

Meta の Llama 3.3 70B は「ちょうど良い」モデルの代名詞。前世代の Llama 3.1 から命令追従性が大幅に向上し、ビジネス文書・コード説明・要約で安定したアウトプットを出す。

強み

  • レート制限が比較的緩め ← 自動化ハーネスと相性が良い
  • 128K トークンのコンテキスト窓
  • Apache 2.0 ライセンスで商用利用可 (モデルウェイト自体)

弱み

  • 最先端の推論タスクでは Qwen3 235B に劣る
  • コーディングはソリッドだが、複雑なアルゴリズム設計では Qwen3 が優位

推奨ユースケース

  • API ドキュメントの自動生成
  • PR description の下書き
  • ログ・エラーメッセージの自然言語説明

3. google/gemma-3-27b-it:free ── マルチモーダル対応の軽量枠

Google の Gemma 3 シリーズは テキスト+画像入力に対応した初のオープンモデル群。27B モデルは商用利用可能な Gemma Terms of Use の下で提供されている。

強み

  • 画像 → テキスト変換、スクリーンショット解析などマルチモーダルタスクが可能
  • レスポンス速度が速い (軽量なアーキテクチャ)
  • Google のインフラが裏にある安定性

弱み

  • 純テキストのコーディング精度は Llama 3.3 70B よりやや低い
  • 長文生成での一貫性がやや落ちる場面がある

推奨ユースケース

  • UI スクリーンショットから HTML のたたき台生成
  • 図表・グラフ画像の説明生成
  • 画像付きサポートチケットの自動トリアージ

4. deepseek/deepseek-r1:free ── 推論特化・OSS の異端児

DeepSeek R1 は強化学習ベースの推論トレーニング (GRPO) を採用し、数学・コーディング・論理パズルで GPT-o1 に迫る性能を誇る。MIT ライセンスで公開されているため、ローカルデプロイも可能。

強み

  • CoT (思考連鎖) の過程が <think> タグで明示的に出力されるため、デバッグがしやすい
  • アルゴリズム問題・競技プログラミング相当のタスクが得意
  • ローカル量子化版 (GGUF) が Ollama / LM Studio で動く

弱み

  • :free 枠は思考ステップが長いためレイテンシが高い
  • 思考過程が長くなり、出力トークンが膨らむ → RPD の消費が速い
  • 日本語の自然さは Qwen3 に劣る

推奨ユースケース

  • バグの根本原因分析 (RCA)
  • アルゴリズム最適化の相談
  • SQL クエリのパフォーマンスチューニング案
<think> タグの出力例 (DeepSeek R1)
<think>
まず問題を分解する...
ソートが O(n²) になっている原因は...
ここで merge sort を適用すると...
</think>

**結論**: ここをヒープソートに変えると O(n log n) に改善できます。

5. mistralai/mistral-7b-instruct:free ── 軽量・高速の先駆者

2023 年末に登場し、「7B でここまでできるのか」と業界を驚かせた Mistral 7B。2026 年現在は絶対性能では後続に抜かれているが、軽量・低レイテンシ・安定稼働の三点で今でも現役だ。

強み

  • TTFT (Time to First Token) が :free モデル中トップクラスに速い
  • レート制限が緩め → 高頻度の簡易タスクに最適
  • Apache 2.0 ライセンス

弱み

  • コンテキスト長は 32K と他モデルに比べ短め
  • 複雑な推論・コーディングは他 4 モデルに劣る

推奨ユースケース

  • コミットメッセージの自動生成 (短文・高頻度)
  • 変数名・関数名のサジェスト
  • CI コメントの生成

5 モデル比較サマリー

モデル コーディング レイテンシ コンテキスト 日本語 推奨用途
Qwen3 235B A22B ⭐⭐⭐⭐⭐ 中〜遅 128K ⭐⭐⭐⭐⭐ 推論・多言語
Llama 3.3 70B ⭐⭐⭐⭐ 128K ⭐⭐⭐⭐ バランス・自動化
Gemma 3 27B ⭐⭐⭐ 128K ⭐⭐⭐ マルチモーダル
DeepSeek R1 ⭐⭐⭐⭐⭐ 128K ⭐⭐⭐ 数学・RCA
Mistral 7B ⭐⭐ 最速 32K ⭐⭐ 高頻度・短文

⚠️ :free 枠のレート制限は OpenRouter の方針変更で予告なく変わることがある。本番環境での SLA が必要な場合は有料プランへの移行を検討すること。


実践:用途別モデル選択フロー

タスクを受け取ったとき:
│
├─ 画像が含まれる?
│    └─ YES → Gemma 3 27B
│
├─ 数学・アルゴリズム・複雑な RCA?
│    └─ YES → DeepSeek R1
│
├─ 短文・高頻度 (コミットメッセージ等)?
│    └─ YES → Mistral 7B
│
├─ 多言語・長文コード生成?
│    └─ YES → Qwen3 235B A22B
│
└─ それ以外 (汎用・自動化ハーネス)?
     └─ Llama 3.3 70B

OpenRouter でモデルをフォールバック運用する実装パターン

:free モデルはレート制限に達すると 429 Too Many Requests を返す。以下のパターンでフォールバックを実装すると可用性が上がる。

import openai
import time

FREE_MODELS = [
    "qwen/qwen3-235b-a22b:free",
    "meta-llama/llama-3.3-70b-instruct:free",
    "mistralai/mistral-7b-instruct:free",
]

def call_with_fallback(messages: list[dict], max_retries: int = 3) -> str:
    client = openai.OpenAI(
        base_url="https://openrouter.ai/api/v1",
        api_key="YOUR_OPENROUTER_KEY",
    )
    for model in FREE_MODELS:
        for attempt in range(max_retries):
            try:
                resp = client.chat.completions.create(
                    model=model,
                    messages=messages,
                    timeout=30,
                )
                return resp.choices[0].message.content
            except openai.RateLimitError:
                wait = 2 ** attempt
                print(f"[{model}] 429 - {wait}s 待機してリトライ")
                time.sleep(wait)
            except openai.APIError as e:
                print(f"[{model}] エラー: {e} - 次のモデルへ")
                break
    raise RuntimeError("全モデルがレート制限に達しました")

このパターンの要点:

  1. モデルリストの順序 = 優先度。高品質モデルを先頭に置く
  2. 指数バックオフ (2 ** attempt) でバースト超過を回避
  3. APIError (サーバーエラー) は即次のモデルへ切り替え

レート制限の現実的な管理

:free モデルの制限は OpenRouter の公式ダッシュボード (openrouter.ai/activity) でリアルタイム確認できる。2026 年時点の一般的な傾向:

  • RPM (requests per minute): 10〜20 req/min が多い
  • RPD (requests per day): 100〜500 req/day の範囲
  • TPM (tokens per minute): モデルによって 40K〜200K 程度

自動化ハーネスで朝〜昼に大量消費すると夕方以降に枯渇するケースがある。タスクの優先度に応じてスロットリングを実装することを推奨。


まとめ

OpenRouter の :free モデルは 2026 年現在、実務ユースケースの 7〜8 割をカバーできる水準に達した。コスト $0 でエージェント駆動の自動化を組む際の出発点として十分だ。

用途別の選択基準を整理すると:

  • 品質最優先の多言語タスク → Qwen3 235B A22B
  • バランス・量産系 → Llama 3.3 70B
  • 画像入力あり → Gemma 3 27B
  • 難問・推論デバッグ → DeepSeek R1
  • 高頻度・低レイテンシ → Mistral 7B

レート制限とフォールバックを正しく設計すれば、有料モデルへのフォールバックが必要な場面を大幅に減らせる。まずは :free 枠で動かしてみて、本当にボトルネックになった箇所だけ有料モデルへ切り替えるというアプローチが現実的だ。


参考リンク


✍️ 本記事の著者: 合同会社ジモラボ

ジモラボは、八王子を拠点に AI を活用した SaaS を多数開発しています。本記事の技術検証もそうした開発過程の副産物です。

興味を持っていただけたら、ぜひ各 SNS のフォローもお願いします!

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?