AIにソフトの使い方を説明する文章を書かせると、見た目はきれいに整う。でも、その通りに操作すると途中で詰まることがある。この弱点を数字にした採点表が公開された。どのAIの説明文をどこまで信じていいか、目安ができた。
ひとことで言うと、AIはソフトの説明文がまだ苦手で、いちばん良い組み合わせでも100点満点中47点だった、という話だ。
目次
- 🐶 「直すべきか」の判断から試される
- 📊 トップでも47点、人の専門家には遠い
- うそより多い「手順が途中で終わる」
🐶 「直すべきか」の判断から試される
この採点表の名前はDoGBench。ベンチマークとは、ひとことで言うと、同じ問題を解かせてAIの実力を点数で比べる仕組みだ。作ったのは文書作成AIの企業Promptless。HelmやPostHogなど公開ソフト(OSS)の管理者も加わった。
おもしろいのは、ただ書かせるだけではない点だ。本物のリポジトリ(プログラムの保管場所)の変更を見せる。まず「説明文を直すか、何もしないか」を選ばせる。必要なときだけ正しく直せるか、を見る。
問題は全部で292問。約3割は「何もしないのが正解」だ。むやみに書き換えないことも実力のうち、という設計になっている。現場でも、触らない判断こそ事故を防ぐ。そこを測るのは理にかなっている。
元の説明文は隠してあり、AIは答えを写せない。採点項目は「正確さ」「抜けのなさ」「置き場所」など細かい。重大なミスが1つでもあると60点で頭打ちだ。
📊 トップでも47点、人の専門家には遠い
採点したのは7つの組み合わせ(AIモデルと、それを動かす道具)。公開された117問での結果はこうだ。
| AIの組み合わせ | 点数(100点満点) |
|---|---|
| Qwen3.8 Max + OpenCode | 47.3 |
| GPT-5.6 Sol + Codex | 46.2 |
| Claude Opus 4.8 + Claude Code | 41.2 |
全部が半分に届かない。重大なミスなく仕上げられた割合は、最高でも39%どまりだった。開発元は「47点は専門家の47%の力という意味ではない」と断っている。今のAIの説明文は、人の手直しを前提に読むのが安全だ。
ただし、作ったPromptless自身が文書作成AIを売る会社である点は、割り引いて見る必要がある。
うそより多い「手順が途中で終わる」
いちばんの発見は、失敗の中身だ。でたらめを書くハルシネーション(それっぽい嘘をAIが作ること)は6.1%と少数派だった。多かったのは別の失敗だ。文は正しいのに手順が足りず、読者が最後までたどり着けない。これが45.5%にのぼる。
これまでの心配: AIが書く → でたらめが混じる (6%)
実際に多い失敗: AIが書く → 文は正しい → でも手順が足りず終われない (45%)
矢印はAIが説明文を書く流れを表す。怖いのは嘘よりも、正しそうに見えて肝心の一歩が抜ける方だった、ということだ。
よくある失敗はハルシネーションではなく、もっともらしいのに読者が作業を終えられない説明だった(論文より要約)
なぜ外すのか。読者が実際どう使うかを見ずに機能だけ説明する。決め手の証拠を探さず「たぶんこう」で埋める。直すべき別のページを放置する。おもにこうした理由で外していた。コードと違い、説明文は「正しいけど役に立たない」が検査をすり抜けやすい。レビューでいちばん見落とすところだと感じる。
✅ 今日覚えること
- AIが書いた説明文は、嘘より「手順の抜け」を疑う
- 特に「この後どうなるか」「確認のやり方」が抜けやすい
- 自分が最近AIに書かせた手順を、何も知らない人の目で頭から実行してみるとズレが見える
採点表とデータは公開されている。中身を見たい人はこちらから。
論文: dogbench.ai/paper / コードとデータ: GitHub、Hugging Face
※本記事は一次情報の調査をAIが行い、事実確認のうえ執筆・公開しています。