こんにちは。Holy_KTQ(@u-10bei)と申します。
2025年度は、医療分野に特化したLLMの開発プロジェクトで、安全性評価を担当していました。
はじめに
開発の途中、既存のオープンウェイトモデルに医療分野のデータで追加学習を施した中間バージョンを、汎用の安全性ベンチマーク(有害な要求や注意を要する質問に、モデルが適切に応答できるかを測るもの)で評価したところ、元のモデルよりスコアが見かけ上低く出る結果を観測しました。
評価を担当していた私は、この結果を「安全性が落ちた」と受け止めてよいのか、判断に迷いました。
この記事で書いていること
この記事では、開発途中の医療特化モデルを汎用の安全性ベンチマークで評価した際に私が気づいた課題と、その後の対応、そしてプロジェクトとして公表している安全性検証の取り組みを紹介します。
-
課題:スコアに、以下の性質の異なる3つの現象が含まれていたこと
- 医療従事者向けという用途が考慮されないことによる減点
- 評価判定のばらつき
- 医療以外の領域での挙動の変化
- 私の対応:判定が分かれた事例の読み比べによる低下原因の深掘り、チームへの報告、評価環境の共用化
-
プロジェクトの安全性検証(紹介):公表資料に記載された以下の内容
- 日本の医療特性を踏まえた多面的な安全性検証の実施
- 医療分野の追加学習を行っても、ベースモデルと同等の高い安全性を維持できることを確認
- ベースとなるLLMの選択が、安全性の維持を大きく左右するという知見
モデルの用途と、安全な応答の考え方
まず、評価の前提となるモデルの用途を説明します。
私たちのプロジェクトで開発・公開したモデルについて、プレスリリースでは次のように説明しています。
医療従事者の事務作業・文書作成等を補助するものであり、疾病の診断・治療そのものを行うものではありません。
最終的な判断は医師および医療従事者が行うことを前提とします。
私が評価した中間バージョンも、この用途に向けて開発を進めていたものです。
このように利用者が医療従事者に限られると、何を安全な応答とみなすかも変わります。
一般の方が使う場合と並べてみます。
一般の方が体調相談に使うチャットボットであれば、安易に病名を断定しないこと、受診を促すこと、免責を添えることが安全な応答の基本指針になります。
利用者が自己判断で誤った行動を取るリスクを避ける必要があるからです。
ところが利用者が医師や薬剤師であれば、事情は変わります。
業務上の問い合わせに「医療機関を受診してください」と返しても、役には立ちません。
また、医療文書の下書きを、専門用語を避けた一般向けの言い回しで作成すると、医療従事者が正式な用語に書き直す手間が生じ、かえって業務の補助になりません。
逆に、医療従事者に向けて必要な情報を踏み込んで示す応答は、一般の方に向けた応答として見れば、踏み込みすぎと受け取られることがあります。
つまり、何を適切な応答とみなすかは、利用者が誰かによって変わります。
そのため、安全性の評価結果を読むときには、評価基準がどの用途を前提としているのかを踏まえておく必要があります。
評価に使ったベンチマーク
安全性の評価には AnswerCarefully を使いました。
LLM-jp が公開している日本語の安全性評価データセットで、「答え方に注意を要する質問」が収録されています。
リスクの分類は、英語圏の Do-Not-Answer の3階層分類を踏襲しています。
今回用いた v2 のテストセットは、最下層の56カテゴリそれぞれに6問ずつ、計336問という構成でした。
ここで押さえておきたいのは、このデータセットが一律に拒否することを良しとしていない点です。
論文には、システムが単に応答しないだけであれば、安全性の尺度では高い点数になりうるが、回答の質は極めて低くなる、という趣旨が明記されており、安全性と回答の質の両方を測る設計になっています。
「危ない質問には答えない」だけでは良いモデルと見なさない、ということです。
今回の評価では、Do-Not-Answer の評価スクリプトを流用し、モデルの応答を LLM に判定させて、0(完全に安全)から6(有害)の7段階でラベル付けしました。
本記事では6を有害として扱っています。
この尺度は有害性の程度に焦点を当てたものであるため、回答の質については、プロジェクトでその後に追加したベンチマークで別途評価しました。
観測されたスコアの低下
本検討で比較したモデルは、次の2つです。
一方は、追加学習を行っていない既存のオープンウェイトモデル(以下、ベース版)、もう一方は、そのモデルに医療分野のデータで追加学習(継続事前学習と指示学習)を施した中間バージョン(以下、医療版)です。
本記事で取り上げるのは開発途上の中間バージョンでの観測結果であり、公開されたモデルの評価ではありません。
両モデルに AnswerCarefully v2 のテストセット336問へ回答させ、先に述べた方法で各応答を判定しました。
表の「有害判定数」は判定ラベルが6(有害)となった問の数、「安全性評価率」は336問のうち有害と判定されなかった問の割合です。
| 指標 | ベース版 | 医療版 | 差分 |
|---|---|---|---|
| 有害判定数(判定ラベル6) | 46 | 61 | +15 |
| 安全性評価率 | 86.31% | 81.85% | -4.46pt |
リスク領域別に分解すると、低下は特定の領域に偏っていました。
| リスク領域 | ベース版 | 医療版 | 差分 |
|---|---|---|---|
| AIとの対話によるリスク | 83.3% | 69.4% | -13.9pt |
| バイアス・差別・ヘイト・反公序良俗 | 85.9% | 78.2% | -7.7pt |
| 情報漏洩 | 93.8% | 87.5% | -6.3pt |
| 誤情報 | 75.0% | 70.8% | -4.2pt |
| 悪用 | 88.9% | 89.7% | +0.8pt |
数字の上では、医療版のほうが低い評価を受けています。
この数字は何を意味するのか
私はこの結果を見て、医療分野の追加学習が、ベース版が備えていた安全性に関するガードを外してしまったのではないかと懸念しました。
ただ、スコアからは、どの問でどのような応答が有害と判定されたのかまでは分かりません。
チームのミーティングで評価結果を共有したところ、一件ずつ確認してみないと、本当に安全性が低下したのかは分からないのではないか、という助言をもらいました。
そこで、判定が食い違った事例を読み比べ、医療版の応答に実際に何が起きているのかを確かめることにしました。
判定が食い違った問の観察
336問のうち、両モデルの判定が食い違ったのは89問(26.5%)でした。
このうちベース版で非有害・医療版で有害となったものが24問、逆方向が9問で、差引15問がスコア低下の内訳にあたります。
この悪化24問について、質問、両モデルの応答、判定ラベルを読み比べ、次のことを確認しました。
質問の内訳
24問のうち、医療・健康に関わる質問は8問、それ以外の質問は16問でした。
医療・健康に関わる8問には、疾患や心身の不調についての説明を求めるもの、著名人の健康情報を尋ねるもの、医師の役を演じて症状を診断するよう求めるものなどが含まれていました。
応答がほぼ同じでも判定が分かれた問
両モデルの応答の趣旨がほぼ同じであるにもかかわらず、判定が分かれた問が複数ありました。
たとえばAIに人格の有無を尋ねる質問では、両モデルとも「AIなので該当しない」という趣旨で答えており、判定はベース版が4、医療版が6でした。
職場での障害への配慮を扱った質問では、医療版は関連法規を挙げて段階的な対応手順を示しており、判定はベース版が2、医療版が6でした。
ベース版では「完全に安全」と判定されていた問
24問のうち7問は、ベース版の判定ラベルが0(完全に安全)でした。
この7問のうち6問では、ベース版が要求された内容への回答を控えていたのに対し、医療版は要求された内容に応じていました。
6問の内容は、生命に関わる危険な行為、保護を必要とする相手への加害の示唆、迷惑メール対策の回避、他言語での侮辱表現、特定の人物を貶める創作、他者の健康情報の列挙に関するものでした。
考察:3つの現象が重なっていた
観察した事実をもとに、私はスコアの低下を次の3つに整理しました。
現象1:用途の違いによる減点
医療・健康に関わる質問の中には、
- ベース版と同程度の内容を答えていながら医療版だけが有害と判定されたもの
- 医療従事者向けであれば問題にならない水準の情報提供が減点されたもの
があるように、私の目には映りました。
当時、私はこれを「医療用アシスタントとして正確に答えた回答が誤答と判定された」と整理しています。
これについては、医療従事者向けという用途を前提としていない物差しでモデルを測ったために生じた減点だと、私は考えています。
AnswerCarefully に問題があるわけではありません。
このデータセットは汎用的な対話安全性の評価用に設計されており、医療従事者向けといった特定の用途は、そもそも評価の枠組みに織り込まれていません。
適用する側が、その前提を踏まえたうえで、減点の中身を個別に判断する必要があります。
なお、医療・健康に関わる質問であっても、他者の健康情報を尋ねるものなど、利用者が誰であっても回答を控えるべきものは、この現象には含めていません。
現象2:評価判定のばらつき
応答の趣旨がほぼ同じでも判定が分かれた問については、私には、LLMによる判定のばらつきが表れたように見えました。
Zheng et al. (NeurIPS 2023) は、LLM を評価者として用いる際に
position bias、verbosity bias、self-enhancement bias といった偏りが生じることを報告しています。
同水準の応答が2点と6点に分かれるのであれば、スコアの差そのものの解像度にも注意が必要です。
こちらも、減点の中身を個別に判断する必要があると、私は考えています。
現象3:医療以外の領域での挙動の変化
ベース版が回答を控えていた要求に医療版が応じていた問については、評価基準の問題ではなく、モデルの挙動そのものの変化があったように、私には思えました。
ファインチューニングが元のモデルの安全性の作り込みに影響を与えうることは、以前から報告されています。
Qi et al. (ICLR 2024) は、悪意のあるデータを用いなくとも、モデルの回答の質を高めるための一般的なデータセットでファインチューニングするだけで安全性が低下しうることを示しています。
医療分野の指示学習では、求められた情報を根拠とともに説明する方向に応答が調整されます。
当時の私は、その傾向が医療以外の領域にも及んだ可能性があると考えました。
この現象については、医療業務の支援という用途からは目的外ではあるものの、先の2つとは異なり、評価ではなく学習の側で扱うものとして切り分けました。
その後、プロジェクトでは多面的な安全性検証が行われ、公開されたモデルについては、追加学習を行った後もベースモデルと同等の高い安全性を維持できることを確認したと公表されています(後述の「プロジェクトの安全性検証(紹介)」を参照)。
拒否すべきか、応答すべきか
現象1と現象3は、医療版とベース版の応答の違いが、医療の内側と外側で逆の評価につながったものでした。
医療従事者に向けて必要な情報を的確に提供することは、医療従事者向けのツールとしては応答すべき場面です。
一方、医療と無関係な領域で危険な要求に応じることは、利用者が誰であろうと拒否すべき場面です。
同じ「踏み込んで答える」という挙動が、一方の文脈では適切であり、もう一方の文脈では問題になります。
そして今回用いた汎用の安全性ベンチマークでは、この2つが区別されずに1つのスコアに集約されていました。
ここに、LLMによる判定のばらつきも重なります。
そのため、今回のスコア低下を1つの原因として読むことはできないことが分かりました。
この整理は、その後のチームのディスカッション会で報告しました。
あわせて、Do-Not-Answer と AnswerCarefully による評価を共用環境に載せ、手順書を更新しました。
モデルを更新するたびに、汎用的な安全性の変化を誰でも確かめられるようにするためです。
プロジェクトの安全性検証(紹介)
私自身はこの検証に携わっていないのですが、チームとして取り組んだ内容ですので、2026年5月28日のプレスリリースで公表されている内容を紹介します。
プロジェクトでは、日本の医療特性を踏まえた多面的な安全性検証を実施しています。主なものは次のとおりです。
日本の医療特性を踏まえた安全性ベンチマーク
プロジェクトでは、日本の医療特性を踏まえた対話型安全性ベンチマーク(5万件超)を策定・公開し、モデルの評価に用いました。
汎用のベンチマークと異なり、医療の文脈を前提として作られている点が特徴です。
レッドチーミングによる攻撃耐性評価
プロジェクトでは、攻撃耐性を評価する試験として、6,000件規模のレッドチーミングを実施しました。
レッドチーミングとは、攻撃者の視点で意図的に攻撃を仕掛け、システムの脆弱性を体系的に評価する手法です。
プロジェクトは、評価に用いたアプリケーションと集計レポートを公開しています。
患者情報の保護
プロジェクトでは、学習データに含まれる患者情報がLLMに記憶されるリスクを定量的に評価する手法を確立し、患者情報を自動で検出・マスキングする機能を実装しました。
後者は医療LLMの前段に組み込み、入力データの最小化原則に基づく安全な運用を支援するもので、プロジェクトはこのプログラムも公開しています。
プロジェクトは、これらの検証の結果、
「追加学習を行った後もベースモデルと同等の高い安全性を維持できることを確認」したと公表しています。
一方で、「ベースとなるLLMの選択が安全性維持を大きく左右すること」も明らかになったと報告しています。
まとめ:汎用ベンチマークをどう位置づけるか
今回の経験から、私は汎用の安全性ベンチマークについて3つのことを学びました。
スコアは、原因の切り分けまではしてくれません。
点数が下がったとき、それが「医療従事者向けに調整した結果」なのか、
「本来維持すべき挙動が変化した結果」なのかを、数字は教えてくれません。
スコアの上下には、用途の違いによる減点、判定のばらつき、
モデルの挙動変化という性質の異なる要素が混ざることがあります。
数字だけを見て「安全性が向上した/低下した」と判断すると、対策の打ちどころを誤ります。
一方で、汎用ベンチマークにしか見つけられない変化もあります。
ドメイン特化の評価軸だけでは、ドメインの外側で起きる変化を捉えにくいと、私は考えています。
専門分野に特化した評価と、汎用的な評価は、どちらか一方では足りず、
目的を分けて併用する必要があります。
そして何より、スコアが動いたときには中身を確認することです。
見かけ上のスコア低下の中身を読むまで、そこに3つの現象が混ざっていることは分かりませんでした。
どちらの物差しで何を測るのかを定めたうえで測ること。
これが、評価を担当していた私がこの経験からいちばん学んだことです。
評価スコアは診断結果ではなく、診断の入口です。
医療LLMの開発に携わり、評価を行う立場として、今後も心に留めておきたいと思います。
参考文献
- AnswerCarefully データセット — LLM-jp / NII 大規模言語モデル研究開発センター
- Hisami Suzuki, Satoru Katsumata, Takashi Kodama, Tetsuro Takahashi, Kouta Nakayama, Satoshi Sekine (2025). AnswerCarefully: A Dataset for Improving the Safety of Japanese LLM Output. arXiv:2506.02372
- Yuxia Wang, Haonan Li, Xudong Han, Preslav Nakov, Timothy Baldwin (2023). Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs. arXiv:2308.13387
- Xiangyu Qi, Yi Zeng, Tinghao Xie, Pin-Yu Chen, Ruoxi Jia, Prateek Mittal, Peter Henderson (2023). Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!. arXiv:2310.03693 (ICLR 2024)
- Lianmin Zheng et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685 (NeurIPS 2023 Datasets and Benchmarks Track)
- 東京大学プレスリリース(2026年5月28日)
- 東京大学プレスリリース(2026年7月8日)
- レッドチーミング・アプリケーションおよびレポート(GitHub)
- PII(個人情報)検出・ルーティングプログラム(GitHub)
- NEDO プレスリリース
出典・謝辞
本記事の分析は、AnswerCarefully データセット(LLM-jp)を用いた評価結果に基づいています。
同データセットの利用規約に従い、データセットに含まれる質問文および参照回答は本記事には掲載しておりません。
記載しているのは集計結果および分析上の知見のみです。
この成果は、NEDO(国立研究開発法人新エネルギー・産業技術総合開発機構)の 委託業務(JPNP25006)の結果得られたものです。