0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

公開された d1-3B・d1-omni-600M と d1 API の日本語ベンチマークでの比較

0
Last updated at Posted at 2026-10-08

Liquid AI が 10 月 5 日に、判断専用モデル d1 の系列から、重みを公開したモデル d1-3B と d1-omni-600M を Hugging Face に出しました。同社のブログの題は「Open d1: Edge decision models for text, vision, and audio」で、手元の機械や組み込み機器で動かす判断モデルとして位置づけています。d1-3B は 3.12B パラメータで、自社の視覚言語モデル LFM2.5-VL-3B から学習したものです。d1-omni-600M は 587M パラメータで、エンコーダの LFM2.5-Encoder-350M を土台に、画像と音声も読めるようにしたもので、モデルカードは開発中の試験版と書いています。本作業の大半を Claude Code で実行・文書化したものです。何を測るかの判断と、結果の読み取りは筆者が行いました。

API の d1 より精度が低いことは、Liquid AI 自身が示しています。モデルカードの図「Decision Index against model size」では、横軸にパラメータ数を取って各モデルを点で打つなか、API の d1 は「d1 (hosted API)」という横線で描かれています。その線は Decision Index 0.2.1 で 60 付近にあり(図からの読み取り)、d1-3B の 48.57 より上です。d1-omni-600M は 15.95 です。API の d1 の大きさは書かれていません。

そこでこの記事では、その差が日本語ではどう出るのかを、以前 API の d1 を測ったのと同じ日本語のベンチマークで確かめました。結果は、3 つのベンチのうち 2 つで d1-3B が API の d1 を 8〜11 ポイント下回り、残る 1 つはほぼ同じでした。d1-omni-600M は、JNLI で偶然と同じ水準にとどまりました。応答時間も並べています。

測ったもの

ベンチ 内容 件数 偶然の正解率
JNLI 2 つの文の関係(含意・矛盾・中立)を選ぶ 500 33%
JCommonsenseQA 常識を問う 5 択 500 20%
ライブドアニュース分類 記事のカテゴリを 9 つから選ぶ 7,367(全件) 11%

3 つのモデルとも 1 回の要求に 1 件だけ入れ、同じ項目を同じ順で測りました。

  • d1 API: Liquid AI の API。測定は 2026 年 10 月 1 日です。
  • d1-3B: Hugging Face の LiquidAI/d1-3B(3.1B、BF16)。RTX 4080 1 枚に載せ、モデルカードどおり model.system_one(state, questions) で判断させました。compile はしていません。
  • d1-omni-600M: Hugging Face の LiquidAI/d1-omni-600M(587M)。同じ RTX 4080 で、モデルカードが GPU で勧める float16 にしました。

要求の中身は 3 つとも同じで、選択肢には説明文を付けています。

{
  "state": {"sentence1": "男性が犬を散歩させている。", "sentence2": "男性が外にいる。"},
  "questions": {"relation": {"type": "choice", "instructions": "文1と文2の関係を選べ。",
                             "criteria": {"entailment": "文2は文1から論理的に導ける(含意する)",
                                          "contradiction": "文2は文1と矛盾する",
                                          "neutral": "文2は文1から導けるとも矛盾するとも言えない"}}}
}

補足しておくと、d1 API の数字は今回新しく測ったものではありません。d1-3B が公開される前の 10 月 1 日に、別の記事のために測った結果をそのまま使っています。d1-3B と d1-omni-600M は 10 月 8 日の測定なので、1 週間の開きがあります。

正解率

3 つのベンチの正解率。d1-3B は JNLI と JCommonsenseQA で d1 API を下回り、d1-omni-600M はさらに大きく下回る

d1-3B は d1 API より、JNLI で 10.8 ポイント、JCommonsenseQA で 8.4 ポイント低く、ライブドアでは 0.7 ポイントの差でした。同じ項目で見比べると、JNLI では API だけが正解した項目が 68 件、d1-3B だけが正解した項目が 14 件でした(符号検定で p = 1.1e-9)。JCommonsenseQA は 47 件対 5 件(p = 1.3e-9)です。どちらも偶然の揺れでは説明できない差です。ライブドアは 517 件対 461 件(p = 0.08)で、差があるとは言えません。

d1-omni-600M は、JNLI が 32.0%、JCommonsenseQA が 46.4%、ライブドアが 49.2% でした。JNLI は偶然の 33% と同じ水準で、500 件のうち 383 件を「含意」と答えています(正解が含意なのは 73 件)。ライブドアでも 2,851 件をトピックニュースと答えていて、答えが偏っています。使い方の誤りでないことは、モデルカードの英語の例が正しく答えられること、float16 と float32 で JNLI の先頭 100 件の正解数が同じ(30 件)であることで確かめました。モデルカードは対応言語に日本語を挙げていますが、この 3 つのベンチでは日本語の判断にはほぼ使えませんでした。

応答時間

1 件あたりの応答時間。d1 API は約 400 ms、d1-3B は 16〜57 ms、d1-omni-600M は 5〜13 ms

1 件ずつ、同時実行なしで各 100 件を送って測りました。手元の 2 つは通信を挟まないので、API と比べて有利です。d1-3B は JNLI で 16 ms、ライブドアで 57 ms で、モデルカードが RTX 4090 で示す compile なしの値(16 ms)と同じでした。d1-omni-600M はその 3 分の 1 ほどで、5 ms と 13 ms です。d1 API は約 400 ms で、混んでいた時間帯の測定では JNLI の中央値が 5.2 秒まで延びました。

限界

  • 測ったのは日本語の 3 つのベンチだけです。モデルカードの Decision Index の値は、この記事では確かめていません。
  • 手元の 2 つの応答時間は RTX 4080 1 枚での値で、機械が変われば変わります。
  • API の d1 は 10 月 1 日に測った結果の流用です。d1-3B の公開に合わせて API の中身が変わっていても、この記事には反映されていません。

出典

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?