0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

「ひとりで安くて速いLLM選べそう」って それってねえ、褒めているの?【軽量LLM 7モデル比較】

0
Posted at

安くて速いLLM!?

はい、Juice=Juiceの名曲

『「ひとりで生きられそう」って それってねえ、褒めているの?』

が好きですw

私は人狼知能エージェントを開発してたりもします。

その中で、

  • 発話が「提案」なのか「同意」なのか
  • 過去の発話と同じ意味なのか
  • 役職COをしているのか

といった、ちょっとした意味判定をLLMにさせています。

この判定用として、OpenRouter経由で使っているのが Laguna XS 2.1 です。

採用理由は単純。

安くて速かったからです(´ω`)

でも最近、「他にも安くて速いモデルがあるし、本当にLagunaでいいんかな?」

って思ったので、7モデルで比較してみました。

忙しい人のために:結論

比較したのはこちら。

  • Laguna XS 2.1
  • Qwen3.5 Flash
  • Hermes 4 70B
  • Qwen3 32B
  • gpt-oss-120b
  • Laguna S 2.1
  • DeepSeek V4 Flash 0731

1モデル321件、合計 2,247 API コール。

結果はこちら

モデル 4-task macro F1 Median 実費(321件)
Laguna XS 2.1 0.9431 265ms 約0.42円
DeepSeek V4 Flash 0731 0.9392 707ms 約0.51円
Qwen3.5 Flash 0.9305 431ms 約0.70円
Qwen3 32B 0.9259 4315ms 約6.45円
gpt-oss-120b 0.9252 3142ms 約1.34円
Laguna S 2.1 0.9155 343ms 約0.46円
Hermes 4 70B 0.6715 598ms 約1.41円
  • 4-task macro F1:4種類の判定タスクについて、それぞれのF1スコアを計算して平均した値。1.0に近いほど高精度。
  • F1スコア:見逃しの少なさ(Recall)と、誤判定の少なさ(Precision)の両方を考慮した指標。
  • Median:APIリクエストから応答完了までの時間の中央値。小さいほど高速。
  • 執筆時点のレート: 1ドル=約159.24円で換算しています。

……

Laguna先生、一番やん!?w

もともと精度比較をして選んだわけではありません。

安い! 速い!

じゃ、これでいっかw

ってノリで選んでいたんですよね。

後からちゃんと比較したら、今回の用途では精度まで一番でした。

価格や速度は2026年8月時点のものです。
いくつかのモデルは執筆時点では割引中なので、最新価格は確認してください。

何を測ったの?

一般的なLLMベンチマークではなく、 実際に人狼知能でLagunaにやらせている処理を、そのまま全モデルに実行させました。

たとえば、


Let's do that. (そうしよう。)

という発言が、直前の襲撃提案への


AGREE (同意)

なのかどうかを判定させる、といった処理です。

つまり長文推論ではなく、 自然言語を理解して、短く正確に答えてほしい という用途です。

provider固定、fallbackなし、retryなし、temperature=0で比較しました。

大きいモデルなら強いわけでもなかった

Hermes 4 70Bは今回 0.6715 で、

一方Laguna XS 2.1は 0.9431 でした。

もちろん、 Lagunaの方が一般的に賢い、という意味ではなく、

単純に、 今回の仕事にはLagunaの方が合っていた 、ということだと思います。

Qwen3 32Bも精度は悪くありませんでしたが、今回の環境ではreasoningをOFFにできず、Median約4.3秒。

私が聞いているのは、「これAGREEかな?」くらいです。

そんなに考えなくていいですw

ちなみに費用

7モデル、2,247回実行して、 実費合計は約11.3円 でした。

やすっ!w

これくらいなら候補をしぼるより、 全部測った方が早い ですね。

まとめ

今回わかったのは、 Laguna XS 2.1が覇権をとった! ってことじゃなくて、

実際に自分のアプリで使う処理だと、 汎用ベンチとは違う結果になることもある ってことです。

そして今回は、 安くて速いから選んだモデルが、あとから7モデルで試したらたまたまトップだったw んですよ。

ということで、交代せずにLaguna先生はしばらく続投です。

最後までお読みいただきありがとうございました。
この記事が少しでもお役に立ちましたら、今後の励みになりますので『いいね』をいただけると嬉しいです!

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?