「追加学習したのは一部だから、ほかの能力や応答は変わらない」
そう考えたくなりますが、学習・入力・生成の条件が変わると、想定外の影響が出ることがあります。
生成AIの挙動は、モデルそのものの性能だけで決まるわけではありません。
- 追加学習やモデル更新で、以前できていたことが変わる
- 長い資料のどこに情報を置くかで、回答精度が変わる
- 生成条件によって、出力が単調になったり不適切になったりする
こうした現象は、「AIは一度確認すれば、同じように動き続ける」という前提が危ういことを示しています。
「AIの取扱説明書」第4章では、追加学習・長文入力・文章生成に関わる6つの注意点を、日常的なたとえとともに整理します。
- Catastrophic Forgetting(破滅的忘却)
- Shortcut Learning(ショートカット学習)
- Position Bias / Lost in the Middle(位置バイアス)
- Toxicity(有害な出力)
- Neural Text Degeneration(文章生成の劣化)
- Emergent Misalignment(創発的ミスアラインメント)
これまでの記事はこちらです。
1. 新しい科目を学んだら、前の科目が苦手になった ― Catastrophic Forgetting
継続的な追加学習では、新しいタスクへの適応と引き換えに、以前学習したタスクの性能が低下する場合があります。この現象は、一般に Catastrophic Forgetting(破滅的忘却) と呼ばれます。
たとえば、英語を集中して勉強しているうちに、以前覚えたフランス語が出てこなくなるようなものです。
ただし、これは会話履歴が長くなって冒頭の内容を参照しにくくなる現象とは別です。また、モデル更新後の挙動変化がすべて破滅的忘却によるものとも限りません。学習データ、調整方法、安全対策、システム設定など、複数の要因が関わります。
実務での見方
- モデルの追加学習や更新後は、改善対象だけでなく既存の主要業務も再テストする
- 「以前は通ったプロンプト」を回帰テストとして保存する
- 正答率だけでなく、形式、拒否傾向、説明の詳しさなども比較する
- 重要な用途では、モデルや設定の変更履歴を残す
「新しい能力が増えた」と「既存の能力が維持された」は、別々に確認する必要があります。
2. 本質ではなく、見かけの特徴で答えてしまう ― Shortcut Learning
AIは、問題の本質を学んだように見えても、実際にはデータに含まれる表面的な手がかりを利用していることがあります。これが Shortcut Learning(ショートカット学習) です。
面接官が応募者の経験や能力を十分に見ず、「結論から話す人だから優秀だろう」と判断するようなものです。普段の評価ではうまく見えても、条件が変わると急に通用しなくなります。
自然言語推論の研究では、仮説文だけを見た単純なモデルでも、データ中の語彙的な偏りを利用して一定の精度を出せることが示されました。たとえば、否定表現や曖昧な語が特定のラベルと結びついていると、意味関係を十分に理解せずに予測できてしまいます。
実務での見方
- 同じ内容を、言い回しや順序を変えて質問する
- 固有名詞、属性、数値、文体を置き換えて結果を比較する
- 通常例だけでなく、反例や境界例も評価に含める
- 一貫した回答が得られない場合は、「理解していない」と即断せず、使っている手がかりを疑う
ベンチマークの点数だけでなく、条件を少し変えても判断が保たれるかを見ることが重要です。
3. 長い会議では、真ん中の発言が忘れられやすい ― Position Bias / Lost in the Middle
長い入力を扱えるモデルでも、その中の情報を同じ精度で利用できるとは限りません。関連情報の位置によって性能が変わり、特に中央付近の情報を使いにくくなる傾向は Lost in the Middle として報告されています。
長い会議で、冒頭の議題と最後の結論は覚えていても、途中で出た重要な条件を聞き落とすようなものです。
これは「中央に置けば必ず失敗する」という法則ではありません。モデル、タスク、入力長、質問形式によって傾向は変わります。それでも、「コンテキストに入っているから参照できる」とは限らない点は、長文活用の設計で重要です。
実務での見方
- 長い資料は、意味のまとまりごとに分割して処理する
- 重要な指示や制約は、明示的に整理して提示する
- 回答には根拠となるページ、節、引用箇所を付けさせる
- 要約結果だけを信頼せず、原文と照合できる状態を保つ
- 検索やRAGを使う場合も、取得した情報の位置と取りこぼしを検証する
「入力できる長さ」と「正確に使える長さ」は、同じではありません。
4. 無害な話題からでも、不適切な文章が続くことがある ― Toxicity
言語モデルは、大量の文章から言葉のつながりを学びます。その中に攻撃的、差別的、有害な表現が含まれていれば、生成結果にも影響が現れる可能性があります。
2020年の研究では、複数の事前学習済み言語モデルを対象に、明確に有害ではない入力からでも有害な続きが生成され得ることが示されました。
ただし、この結果は「特定の出力が、学習データ中の特定の一文をそのまま再現した」と証明するものではありません。また、現在の製品はモデルや安全対策が異なるため、当時のモデルと同じ挙動をするとは限りません。
実務での見方
- 子ども向け、相談窓口、採用、医療・福祉など、影響の大きい用途では安全性評価を独立して行う
- 通常の入力だけでなく、曖昧な表現や誘導的な入力でも確認する
- 出力フィルターだけに頼らず、利用範囲、監視、通報、再確認の手順を設ける
- 不適切な出力が出たときの停止条件と対応責任を決めておく
便利さの評価と、安全性の評価は分けて実施する必要があります。
5. 同じ溝を回り続けるレコードのようになる ― Neural Text Degeneration
文章生成では、同じ語句を繰り返したり、単調で不自然な文章になったりする場合があります。こうした現象は Neural Text Degeneration として研究されてきました。
特に、各時点で最も確率の高い語を選び続けるような生成方法では、流暢に見えても退屈で反復的な文章に陥ることがあります。レコードの針が同じ溝を回り続けるような状態です。
temperature や top-p などの設定は、出力の多様性に影響します。ただし、同じ設定値でもモデルやサービスによって挙動は異なり、「この値なら必ず安全」という共通の基準はありません。
実務での見方
- 繰り返しが始まったら、その続きに固執せず生成をやり直す
- 指示を短く整理し、必要な形式や論点を明示する
- 長い文章は一度に生成せず、構成、節、最終稿の順に分ける
- API利用では、生成設定とモデルの組み合わせを記録して比較する
- 重要文書では、人が重複、論理の飛躍、事実関係を確認する
文章が自然に見えることと、内容が正確で有用であることも別の評価です。
6. 一部の調整が、無関係な領域にも影響する ― Emergent Misalignment
特定の狭い課題に対する追加学習が、別の領域で予想外の応答変化につながる場合があります。2026年にNatureで発表された研究では、安全でないコードを書くように微調整したモデルが、コードと直接関係のない質問にも広く不整合な回答を示すケースが報告されました。
一方で、安全なコードを学習した対照条件や、教育・研究上の文脈を明示した条件などでは、同じ傾向は見られませんでした。このため、「狭い追加学習を行うと必ず広範な問題が起きる」と一般化することはできません。どの条件で発生し、なぜ広がるのかは、なお研究中です。
実務での見方
- 微調整後は、対象タスク以外の安全性・誠実性・拒否傾向も再評価する
- 学習データの内容だけでなく、その文脈や目的の示し方も確認する
- ベースモデル、学習データ、学習手順、評価結果を対応づけて残す
- 小規模な検証から始め、影響範囲を確認してから利用を広げる
- 「期待した課題の性能が上がった」だけで本番投入を判断しない
局所的な変更であっても、確認範囲まで局所的にしてよいとは限りません。
6つの注意点を整理する
| 現象 | 起こり得ること | 確認のポイント |
|---|---|---|
| Catastrophic Forgetting | 新しい学習後に、以前のタスク性能が低下する | 既存業務の回帰テスト |
| Shortcut Learning | 本質ではなく、表面的な手がかりで判断する | 言い換え、反例、条件変更 |
| Position Bias | 長文中の情報位置で利用精度が変わる | 分割、明示、根拠照合 |
| Toxicity | 無害な入力からも有害な文章が生成され得る | 用途別の安全性評価と運用設計 |
| Text Degeneration | 反復的・単調な文章になる | 再生成、分割、生成設定の記録 |
| Emergent Misalignment | 狭い追加学習が別領域の挙動にも影響する | 対象外領域を含む再評価 |
まとめ ― 変更した場所だけを確認しない
追加学習、長文入力、生成設定は、AIを実務で使いやすくするための大切な手段です。しかし、調整した箇所だけを見ていると、別の場所で起きた変化を見落とす可能性があります。
導入・更新時には、次の点を確認しておくとよいでしょう。
- 改善対象だけでなく、以前から使っている主要タスクも再確認したか
- 表現や条件を変えても、判断が一貫しているか
- 長い入力の中央にある重要情報を取りこぼしていないか
- 有害・不適切な出力への対策と対応手順があるか
- 生成の反復や単調化を検知できるか
- 微調整後に、無関係に見える領域も評価したか
AIの確認は、一度きりの検収ではありません。モデル、データ、設定、用途が変わるたびに、必要な範囲を見直す継続的な工程です。
次回の第5章(補章)では、調査型AIを取り上げます。Single-Turn Generation、ReAct、Multi-hop Retrieval、Tool Use、Long-Horizon Memoryなどを通じて、「答えを生成するAI」と「調べながら答えるAI」の仕組みの違いを整理します。
参考文献
- Luo, Y. et al., An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning, 2023.
- Geirhos, R. et al., Shortcut learning in deep neural networks, Nature Machine Intelligence, 2020.
- Gururangan, S. et al., Annotation Artifacts in Natural Language Inference Data, NAACL, 2018.
- Liu, N. F. et al., Lost in the Middle: How Language Models Use Long Contexts, Transactions of the Association for Computational Linguistics, 2024.
- Gehman, S. et al., RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models, Findings of EMNLP, 2020.
- Holtzman, A. et al., The Curious Case of Neural Text Degeneration, ICLR, 2020.
- Betley, J. et al., Training large language models on narrow tasks can lead to broad misalignment, Nature, 2026. (preprint)
※ 本記事は、各研究で報告された現象を実務上の注意点として整理したものです。結果は研究で使用されたモデル、データ、評価方法、生成条件に依存し、すべてのAI製品や利用状況にそのまま当てはまるとは限りません。また、本文中の日常的なたとえは、概念を理解しやすくするための説明です。





