0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

「クリーンなLLM」は作れるのか――Webクロール、蒸留、反蒸留から見る学習データの現実

0
Posted at

本記事は筆者の考えをベースに、GPT-5.6 Sol を用いて構成・推敲したものです。
内容の主張と判断は筆者によるものであり、文章表現の整理にChatGPTを活用しています。

ChatGPTは、なぜLinuxカーネルを説明できるのか。

なぜRustのコンパイルエラーを直し、量子力学を解説し、ピカチュウの姿を知り、十年以上前に開発が止まったライブラリの仕様まで答えられるのか。

答えは単純だ。

それだけ多くのものを学習してきたからである。

LLMの能力は無から生まれない。コードを書く能力も、自然な日本語も、世界知識も、最終的には何らかの訓練データに由来する。

すると、一つの嫌な問題が出てくる。

完全に「クリーンなデータ」だけを使うモデルは、使えるものを最大限使う競争相手と同じ条件で戦えるのだろうか。

本稿では、あえて「盗む」という言葉も使う。

ただし、これは法律上の窃盗という意味ではない。

他人が作った情報を、本人が必ずしも想定していない形で自分のモデル能力へ変換することに対する、倫理的な比喩である。

合法かどうか、本人が同意したかどうか、そして公平だと感じられるかどうかは、それぞれ別の問題だ。


1. 「インターネットを学習する」とは、実際には何をしているのか

LLMの事前学習自体は、概念的にはかなり単純だ。

前のトークン列

x_1,x_2,\ldots,x_{t-1}

から、

P(x_t\mid x_1,\ldots,x_{t-1})

を学習する。

つまり、次のトークンを予測する。

予測が外れれば損失を計算し、パラメータを更新する。

\theta_{t+1}
=
\theta_t-\eta\nabla_\theta L

これを巨大なコーパスに対して繰り返す。

ただし、実際のWebデータは、そのままモデルに流し込めるほど綺麗ではない。

たとえばCommon Crawlを使った代表的なデータ処理基盤CCNetでは、Webクロールから得たテキストに対して、重複除去、言語判定、言語モデルによる品質評価などを行っている。1

DataComp-LMでは、Common Crawlから抽出した240兆トークンの候補コーパスを用意し、その中からどのデータを選択するか自体を研究対象にしている。2

かなり乱暴にまとめれば、

Common Crawl
     ↓
Text Extraction
     ↓
Language Detection
     ↓
Quality Filtering
     ↓
Deduplication
     ↓
Tokenization
     ↓
Pretraining

となる。

重要なのは、Crawlerで取ってきた量そのものがモデル性能ではないということだ。

DataComp-LMでは、同じ候補コーパスからでもデータの選び方によって結果が大きく変わり、model-based filteringが高品質な訓練データ構築に重要であることが報告されている。2

RefinedWebでも、Common Crawlに強いフィルタリングと重複除去を施すことで、大規模なWebデータのみから有力な訓練コーパスを構成できることが示されている。3

つまり、現代のLLM開発におけるデータ戦略とは、

Webページをできるだけたくさん保存する

そして、その巨大な情報空間から、何を残し、何を捨てるかを選別すること。

この二つを組み合わせたデータエンジニアリングそのものなのである。


2. 「学習」と「記憶」は別物である

ここは著作権の話をする上で重要なので、分けて考えたい。

モデルが、

ピカチュウは黄色く、赤い頬を持ち、稲妻のような尻尾をしている

と知っているとする。

だからといって、モデル内部に公式設定画が一枚そのまま保存されているとは限らない。

仮に公式のゲーム画像や設定資料をすべて除外しても、インターネットには、

  • Wikipedia
  • 商品ページ
  • 攻略記事
  • レビュー
  • 掲示板

が大量にある。

Wikipedia ──┐
商品ページ ─┤
攻略記事 ───┤
レビュー ───┤
掲示板 ─────┘
             ↓
            LLM
             ↓
 「ピカチュウとは何か」

こうした多数の情報から特徴や関係を学ぶことと、訓練データ中の一つの文章をほぼそのまま再現することは違う。

後者が memorization である。

memorizationは机上の問題でもない。

CarliniらはGPT-2への問い合わせによって、訓練データ中の文章を逐語的に抽出できることを実験で示している。その後の研究でも、より大規模な言語モデルから訓練データを抽出する攻撃が研究され続けている。4

つまりLLMについては、

統計的なパターンを学習する

ことも、

個別の訓練データを記憶してしまう

ことも起こり得る。

しかし、ここで重要なのはもう一つある。

memorizationを完全に防げたとしても、著作物に関する「学習」まで消えるわけではない。


3. 原作品を除外しても、その情報まで消えるとは限らない

たとえば、ピカチュウの公式コンテンツをすべて訓練対象から除外したとする。

それでも先ほどのような無数の二次情報が残る。

文章でも同じことが起こる。

ある記事そのものは訓練データに入っていなくても、

サイトA:一部を引用
サイトB:内容を要約
掲示板C:主張を議論
ブログD:別の言葉で説明
サイトE:記事中の事実を整理

という形で、その情報はネット全体に散らばる。

だから、

原作品を訓練データから除外すること

と、

原作品に由来する情報をモデルから除外すること

は別物である。5

さらに厄介なのが provenance(情報の出自・来歴) だ。

インターネットでは、

Original
   ↓
引用
   ↓
要約
   ↓
翻訳
   ↓
転載
   ↓
改稿
   ↓
Crawler

のようなことが何年、何十年も繰り返される。

Crawlerが最後に取得したURLは記録できる。

しかし、

この文章中の知識は、最初に誰が作ったものなのか

を同じ精度で記録できるとは限らない。

数十億ページを対象にすれば、なおさらである。

「インターネットから学習する」という言葉は綺麗だが、そのインターネット自体が、すでに無数のコピー、引用、要約、翻訳、再編集によって作られている。5


ここで、法律と倫理を分けなければならない。

日本では、著作権法第30条の4などによって、情報解析や機械学習に関する著作物利用には一定の余地がある。6

したがって、

「許諾を取っていない」=「違法」

とは単純に言えない。

しかし、

「合法」≠「明示的な同意」

でもある。

AI企業側が、

法律上利用可能なので学習しました。

と言うことと、

著作者側が、

私は人間に読ませるために公開したのであって、企業の基盤モデルを育てるために公開したわけではない。

と言うことは、矛盾せず同時に成立する。

「合法」と「納得されている」の間には、かなり広い空間がある。

本稿でいうグレーとは、その空間のことである。


4. 「クリーン」であることは競争上の不利になり得る

最先端LLMが必要とするのは、大量の高品質なデータである。

ある企業が、明示的に許諾されたデータだけを使い、出所の曖昧なものをすべて捨てたとする。

それ自体は可能だ。

問題は、競争相手まで同じ基準を守る保証がないことである。

競争相手がより広い範囲のデータを利用し、それによってモデル性能を上げたなら、「クリーン」を守る企業は選択を迫られる。

性能差を受け入れる。

あるいは、

自分も同じところまで踏み込む。

一社が踏み込めば、他社にも同じ圧力がかかる。

だから問題は、Sam Altmanに倫理観があるかどうかではない。

経営者を入れ替えても、競争条件が同じなら同じ圧力が残る。

一社が境界線を越えて性能を得れば、他社も追随するしかない。
これは、より卑劣な者ほど勝ちやすいゲームである。


5. そしてモデルは、モデルを食べ始めた

ここから話がさらに面白くなる。

現在の訓練データは、人間が書いたWebページだけではない。

AI自身が訓練データを生成できる。

たとえば強いモデルに、

{
  "prompt": "このコードがdeadlockする理由を説明してください",
  "response": "このコードではSynchronizationContext上で..."
}

のようなデータを大量に生成させる。

すると、

D_{\text{synthetic}}
=
\{(x_i,M_T(x_i))\}_{i=1}^{N}

というSynthetic Datasetを作れる。

Self-Instructは、モデル自身にinstruction・input・outputを生成させ、フィルタした上でinstruction tuningに利用することで、自己生成データによる能力改善を示した代表例の一つである。7

そして、より古典的なのが Knowledge Distillation だ。

Hintonらが整理した方法では、Teacher Modelの出力分布

p_T(y|x)

をStudent Model

p_S(y|x)

に学ばせることで、大きなモデルの能力をより小さなモデルへ移す。8

蒸留自体は普通の機械学習技術である。

自社モデルを蒸留することに何の問題もない。

許可されたTeacher Modelを使うことにも問題はない。

しかし、Teacherが競争相手のFrontier Modelになった瞬間、同じ技術の意味が変わる。

Internet
   ↓
Frontier Model A
   ↓
大量のPrompt
   ↓
大量のResponse
   ↓
Synthetic Dataset
   ↓
Model B

ここで、AI産業の「学習」に対する態度は非常に面白いものになる。


6. 「彼らは、我々が合法的に盗んだものを盗んでいる」

モデルが公開Webから情報を吸収するとき、私たちは普通、

Learning

と呼ぶ。

一方、競争相手が商用モデルを大量に呼び出し、その出力を使って別のモデルを育てれば、

Unauthorized Distillation

Model Extraction

といった言葉が出てくる。

もちろん両者は法律上同一ではない。

Webページと商用APIでは、

  • 契約
  • 利用規約
  • Access Control
  • サービス提供コスト
  • 権利関係

が違う。

この差を無視して、

Web学習と無断蒸留は完全に同じだ

と言うのは乱暴である。

それでも、倫理的な構図だけを極端に圧縮すると、奇妙な一文が浮かんでくる。

「彼らは、我々が合法的に盗んだものを盗んでいる。」

半分は冗談である。

しかし半分は、本気で考える価値がある。

人間が公開した情報から機械が能力を得ることをLearningと呼ぶなら、
その機械が公開した出力から別の機械が能力を得ることとの境界は、どこにあるのか。

そして、この問いはすでに技術的な攻防になり始めている。

2026年には、Teacher Modelのreasoning traceを書き換えることで、通常ユーザーへの回答品質を保ちながらStudent Modelへの学習効果を下げる anti-distillation や、蒸留されたStudentを後から検出する API watermarking を扱う研究も発表されている。まだ一般的な産業標準という意味ではなく、まさに現在進行形の研究テーマである。9

つまり、

Distillation
      ↓
Anti-Distillation
      ↓
Distillation Evasion
      ↓
Watermarking
      ↓
Watermark Removal
      ↓
...

という軍拡競争が成立し得る。

AIとは本来、

機械に情報を学習させる技術

だった。

ところが今では、

他人の機械に、自分の機械を学習させないための技術

まで必要になり始めている。

かなり皮肉な状況である。


さらに深刻なのは、その先だ。

Human Author
      ↓
Internet
      ↓
Model A
      ↓
Synthetic Data
      ↓
Model B
      ↓
Synthetic Data
      ↓
Model C

Model Cの開発者は、本当に一度も元の著作者のWebサイトをクロールしていないかもしれない。

訓練データについて、

AI生成データです。

と答えることさえできる。

しかし、その知識は無から生まれたわけではない。

Model BはModel Aから学び、

Model Aは人間が作った情報から学んでいる。

すると、一つの厄介な問いが残る。

情報は、一度AIを通せば「クリーン」になるのか。

Yesなら、AIは巨大なprovenance laundering装置になり得る。

Noなら、Model Cのデータ倫理を評価するために、Model B、Model A、そのさらに前まで遡らなければならない。

商用Frontier Modelの完全な訓練データが公開されていなければ、それは現実には難しい。

モデルを何世代も通過するほど、

情報は残る。

しかし、

情報の出自は遠ざかっていく。


  1. Guillaume Wenzek et al., CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data, 2019. ↩

  2. Jeffrey Li et al., DataComp-LM: In search of the next generation of training sets for language models, 2024. ↩ ↩2

  3. Guilherme Penedo et al., The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only, 2023. ↩

  4. Nicholas Carlini et al., Extracting Training Data from Large Language Models, 2020. ↩

  5. Jason Willems, AI Didn't Break Copyright Law, It Just Exposed How Broken It Already Was, 2026. ↩ ↩2

  6. 文化庁, AIと著作権について. ↩

  7. Yizhong Wang et al., Self-Instruct: Aligning Language Models with Self-Generated Instructions, 2022. ↩

  8. Geoffrey Hinton, Oriol Vinyals, Jeff Dean, Distilling the Knowledge in a Neural Network, 2015. ↩

  9. Xinhang Ma et al., Protecting Language Models Against Unauthorized Distillation through Trace Rewriting, 2026. ↩

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?