1. 導入
「AIが書いた文章には電子透かしが入っている」という話は、これまでSNSや技術系記事でたびたび囁かれてきた。多くの場合は根拠の薄い噂か、Googleの SynthID(画像・動画向け)の話と混同されたものだった。
なお、Anthropic公式は英語で「mark」「embedded watermark」という語を使っており、日本語の定訳が定まっているわけではない。本記事では便宜上、こうした技術全般を指す一般的な訳語として「電子透かし」と呼ぶことにする。
しかしClaudeに関しては、この話はもう噂の段階ではない。2026年8月11日ごろから、Anthropicが「Claudeの生成物に電子透かしを埋め込む」方針を明らかにしたと各メディアが報じ、Anthropic公式のヘルプセンター記事にもその内容が掲載されている。 本記事はその公式ヘルプ記事の内容を軸に整理し、何が確定していて何がまだ不明・未確認なのかを切り分ける。
2. 何が起きたのか
公式ヘルプ記事によると、Anthropicは「生成AIモデルおよび生成AIシステムの提供者として」、EU AI Act(AI法)第50条2項に基づく「AI生成コンテンツの透明性に関する行動規範(Code of Practice)」に署名したとしている。この行動規範自体は法律そのものではなく、EUが用意した自主的な取り組みの枠組みであり、署名は法律への直接的な服従とイコールではない(ただし署名した企業として、規範が求める内容を実施していく立場を取ったことにはなる)。
Anthropicは、この行動規範への自らのコミットメントを説明する文脈で、2026年8月2日以降にリリースされたClaudeモデルに機械可読な「マーク」を標準搭載すると述べている。この記事では「透かし導入=EU AI Act対応のためだけ」と断定はしない。Anthropic自身がそう説明している以上それを紹介はするが、法施行のタイミングとClaude側の対応時期が近いことだけから因果関係を強く主張するのは避け、あくまで一次資料(Anthropicの説明)に基づく範囲にとどめる。対象は生成されたテキストと、対応するファイル形式の両方。
重要なのは適用範囲がEU域内に限定されない点だ。Anthropicは「Claudeが提供されている場所であれば世界中どこでも」適用すると明言しており、日本からのAPI利用やClaude.ai利用にもそのまま及ぶ。
3. そもそもLLMはどうやって文章を作っているのか
透かしの仕組みを理解するには、まずLLM(大規模言語モデル)がどうやって文章を生成しているかを知っておく必要がある。難しい話ではない。
LLMは文章を「一気に」書いているわけではない。一つの単語(正確には「トークン」という、単語より少し細かい単位)を選んでは、また次の一つを選ぶ、という作業を何百回、何千回と繰り返して文章を作っている。
各ステップでLLMがやっていることは、次のようなイメージだ。
ここまでの文章:「今日の天気は」
次に来る単語の候補と、それぞれの「もっともらしさ」:
「晴れ」→ 40%
「雨」→ 25%
「曇り」→ 20%
「最悪」→ 3%
…(語彙全体、数万〜数十万語について同様に確率を計算)
LLMは、この確率分布の中から次の一語を選ぶ。常に一番確率が高いものを選ぶわけではなく、確率に応じてある程度ランダムに選ぶ(これを「サンプリング」と呼ぶ)。だからこそ同じ質問を2回しても、毎回少しずつ違う文章が返ってくる。
これを最後まで繰り返した結果が、私たちの読む「文章」になる。ポイントは、LLMは文章を書く各瞬間に、いくつもの選択肢の中から一つを選んでいるということだ。透かしは、この「選び方」に細工をすることで埋め込まれる。
4. その「選び方」にどう細工するのか
注意:以下はClaudeの実装の説明ではない。
ここから先で説明する「グループA/グループB」方式は、学術研究(後述のKirchenbauer et al., 2023など)や他社の実装(Google DeepMindのSynthIDなど)で知られている、LLM向け電子透かしの一般論にすぎない。Anthropicが実際にClaudeでこの方式(あるいはこれに類する方式)を使っているとは、公式には一切確認されていない。 Anthropicは具体的なアルゴリズムを公開しておらず(8節で後述)、独自の方式を使っている可能性も十分にある。それでも一般論を知っておく意味はある。Anthropicが公表している透かしの「性質」(意味を変えない、短文で検出しにくい、言い換えで消えうる、など)が、なぜそうなりうるのかを直感的に理解する助けになるからだ。あくまで「こういう仕組みなら辻褄が合う」という参考程度に読んでほしい。
代表的な発想はこうだ。
- 各ステップで語彙(候補となる単語の一覧)を、秘密の鍵(キー)を使って「グループA」と「グループB」の2つに、あたかもコイントスのように分ける。この分け方は直前の数単語の並びなどから機械的に計算されるので、外から見ても規則性は分からない
- LLMは、確率的にもっともらしい単語であれば、わずかにグループA寄りに選ぶよう調整される(グループBの単語が完全に使えなくなるわけではなく、あくまで「ちょっと偏る」程度)
- 人間がこの文章を読んでも、不自然さはまったく感じない。「今日の天気は晴れです」も「今日の天気は快晴です」も、どちらも自然な日本語だからだ
- しかし鍵を知っている検出側は、文章中の単語がグループAとグループBのどちらに属するかを一語ずつ数え上げることができる。もし文章全体でグループAの単語が偶然とは思えないほど多ければ、「この文章はこの鍵で生成された可能性が高い」と統計的に判定できる
つまり透かしは、特定の単語や記号を「埋め込む」のではない。一語一語を選ぶ確率にわずかな偏りを継続的に作り、その偏りの蓄積を統計的に検出するという仕組みだ。1文だけでは偏りは誤差の範囲に埋もれてしまうが、文章が長くなるほど「これは偶然ではない」と言えるだけの証拠が積み上がっていく。
この一般論に照らすと、Anthropicの公式説明にある「意味・品質・読みやすさを変えない」「短い文章では検出しにくい」「大幅な言い換えや翻訳で消えうる」という特徴は、いずれも矛盾なく説明できる(あくまで「説明できてしまう」という話で、これがClaudeの実装だと確認されたわけではない点を重ねて断っておく)。
- 意味を変えない理由:同じくらい自然な単語同士(例:「晴れ」と「快晴」)の間で選び方を偏らせているだけだから
- 短文で検出しにくい理由:統計的な偏りは、サンプル数(単語数)が少ないと信頼できる差として現れないから
- 言い換え・翻訳で消える理由:単語を丸ごと別の単語に置き換えたり、別言語に訳したりすると、元の「グループA/B」の偏りパターンごと失われるから
- コピペで残る理由:単語の並びそのものは変わらないので、偏りのパターンも保持されるから
5. Claude公式の仕組み:2つの異なる技術
以上の一般論はいったん脇に置いて、ここからはAnthropicの公式ヘルプ記事が実際に書いている内容に戻る。公式記事は、透かしを「どういう理屈で成立させているか」というアルゴリズムレベルの説明はしておらず、「何をするか」というレベルの説明にとどまっている。Claudeは目的の異なる2つの技術を併用しているという。
(1) テキストへの電子透かし(embedded watermark)
対応モデルがテキストを生成する際、見た目には分からない形で透かしがテキスト生成時に埋め込まれる、とAnthropicは説明している。具体的にどんな実装(バイト列への細工なのか、単語選択への介入なのか等)で「埋め込む」のかという方式そのものは公開されておらず、ここでは公式の説明の範囲にとどめる。読んでいる分には気づかず、意味・品質・読みやすさにも影響しない、とされている。上で説明した「単語選択の統計的偏り」という一般的な仕組みと矛盾しない説明にはなっているが、それが実際の実装かどうかは不明である点は繰り返し断っておく。
Anthropicの公式説明では、透かしはテキストの一部であるため、コピー&ペーストしても一緒に移動する、と述べられている。この部分は公式記事でも比較的言い切りに近い表現になっている。一方、編集後の残存については「ある程度の編集を経ても残る場合がある(may persist through some editing)」という、こちらは明確に限定的な表現が使われている。両者の確信度が異なる点は区別しておきたい。「必ず残る」という保証ではなく、公式記事自身が7節で述べるように、大幅な編集・言い換え・翻訳などによって検出できなくなるケースがあることも同時に説明されている。Anthropicは「モデルのレベルで適用される」ため「どのClaude製品からの出力であっても present になる」という趣旨の説明をしている。ただしこれは「対応モデルであれば、どの製品経路でもマークが乗る」という適用範囲についての説明であって、各経路(API、Claude.ai、Claude Codeなど)で技術的な実装が完全に同一であることまでを保証した記述ではない。そこまで踏み込んだ技術詳細は公式には公開されていない。
繰り返しになるが、Anthropicが実際に4節で説明したような一般論通りの方式を使っているかどうかは公式には確認されていない。 独自の改良版である可能性も十分にある。
(2) ファイルへの署名付きプロベナンスメタデータ
Claudeが .svg .png .jpg のような対応ファイル形式を生成する場合は、これとは別に、C2PA(Coalition for Content Provenance and Authenticity)という業界標準に基づく署名付きメタデータを付与する。
ここで注意したいのは、C2PAは本質的に「そのコンテンツをClaudeが作った証明書」ではなく、コンテンツの来歴(プロベナンス)情報を扱う仕組みだという点だ。公式記事の表現も「そのファイルがClaudeによって**処理された(processed)ことを示し、改ざんの有無を確認できる」というもので、「Claudeが生成した(generated)**ことの証明」とは書かれていない。人が持ち込んだ画像をClaudeが加工しただけでもメタデータが付く可能性があるということで、「生成」と「処理」は意味が異なる。
つまり「テキストの透かし」と「ファイルのメタデータ」は別物であり、片方が検出できても、それがもう一方の存在を意味するわけではない。またどちらも、それ単体で「Claudeがゼロから生成したものである」ことまでを証明する仕組みではない。
6. 適用範囲
公式記事によると、対象となるのは以下。
- モデル:2026年8月2日以降にリリースされた対応モデル(それ以前のモデルへの対応は開発中)。基準になるのは「文章が生成された日」ではなく「そのモデル自体がいつリリースされたか」である点に注意したい。公式記事は7節で述べる「マークが検出されない場合」の一因として、対応前のモデルで生成された場合を明示的に挙げている
- 製品:Claude Platform(API)、Claude(chat)、Claude Code、Claude Cowork、Claude Tag
- クラウド経由:AWS、Google Cloud、Microsoft Foundry経由でも埋め込み型のテキスト透かしは適用される(ただし署名付きメタデータはプラットフォームによって対応状況が異なる)
- 地域:世界中(EU域外でも適用)
7. 限界 — ここが一番重要
Anthropic自身が、この仕組みの限界をかなり率直に認めている。テキストの透かしとC2PAメタデータでは性質が異なる部分もあるため、分けて整理する。
7-1. テキスト透かしの限界
検出されても、それだけでは完全な証明にならない
- Claudeは元の著者とは限らない。人が自分で書いた文章をClaudeに校正・翻訳・要約させただけでも、出力には透かしが残りうる
- Claudeが処理した後で、その文章がさらに編集・抜粋・他の文章と混ぜられている可能性がある
検出されなくても、AIが関わっていないとは言えない
- 対応していない旧モデル(2026年8月2日より前にリリースされたモデル)で生成された場合
- 大幅な編集・言い換え・翻訳・他の文章への混入があった場合
- 文章が短すぎて、信頼できる統計的シグナルが得られない場合
7-2. C2PAメタデータの限界
検出されても、それだけでは完全な証明にならない
- 5節で触れた通り、C2PAは「処理」の来歴情報であり「生成」の証明ではない。人が持ち込んだファイルをClaudeが加工しただけでも付与されうる
検出されなくても、AIが関わっていないとは言えない
- メタデータが形式変換・再保存・スクリーンショットなどで失われた場合
- そもそもその機能・ファイル形式・提供元プラットフォームが対応していない場合(署名付きメタデータの対応状況はプラットフォームによって異なるとAnthropicも明記している)
つまりどちらの仕組みも「検出=AI生成の確定的証拠」ではなく、あくまで「処理された可能性を示すシグナル」というのがAnthropic自身の位置づけだ。透かしの有無だけを根拠に「AIが書いた/書いていない」を断定することには注意が必要である。
8. 検出ツールについて
現時点(2026年8月13日)で、透かしの検出方法やアルゴリズムの技術的詳細は公開されていない。Anthropicは「ユーザーや第三者が透かしを検出できるよう支援していく」「今後の技術文書で詳細を共有する」としているが、具体的な検出APIやツールは未公開の状態にある。
9. 反応(補足)
Forbesの報道によれば、発表後にSNS上で反発の声が強まり、「AIが書いたものにAnthropicが手柄を主張しているのでは」という批判と、「AI生成であることを示しているだけ」という擁護論の両方が見られたという(個々の投稿の検証は行っていない)。本記事の主眼は技術的な仕組みの整理にあるため、この点については深入りせず紹介にとどめる。
比較として、Googleの SynthID はテキストだけでなく画像・動画・音声にも対応する点で対象範囲が広い(SiliconANGLEの報道より)。OpenAIも同じEUの行動規範に署名しており、今後同様の仕組みを導入する可能性がある。
10. まとめ
- Claudeの電子透かしは、もはや噂ではなく、2026年8月11日ごろの報道と、Anthropic公式ヘルプ記事(本記事執筆時点で8月12日更新)の両方で確認できる事実
- Anthropicはこれを、自らが署名したEU AI Actの行動規範への取り組みの一環として説明している。適用範囲は世界中のClaude製品全体に及ぶとされる
- テキストへの透かしとファイルのC2PAメタデータは別の仕組み
- 検出できても「確定的な証明」にはならず、検出できなくても「AIが関与していない証明」にもならない、とAnthropic自身が明言している
- 検出の技術的詳細(アルゴリズム、精度、検出ツール)は本記事執筆時点では未公開
「Claudeに透かしがあるか」という問い自体はもう決着している。残っている問いは「その透かしがどこまで頑健か」「検出ツールが実際にどう機能するか」であり、これは今後の技術文書の公開を待つ必要がある。
疑問や気になる点があれば、ぜひコメント欄から質問してください。できる限り調べて回答します。
11. 参考資料
一次資料
- Anthropic公式:How Claude marks AI-generated content(本記事執筆時点=2026年8月13日の閲覧時、ページ上の表示では「Updated yesterday」=8月12日更新。公開時に再確認のこと)
- EU AI Act 第50条 原文:Article 50: Transparency Obligations for Providers and Deployers of Certain AI Systems
- EU AI Act 第50条 実務解説:The EU AI Act's Transparency Rules: A Practical Guide to Article 50
- Kirchenbauer et al., "A Watermark for Large Language Models"(2023, ICML):arXiv:2301.10226
- Google DeepMind, SynthID for Text 公式解説:SynthID: Tools for watermarking and detecting LLM-generated Text
報道記事(2026年8月11日前後)
- TechCrunch: Anthropic says it will watermark text generated by its AI models
- Forbes: Claude Will Put Invisible Watermarks On AI Text And Images—And The Internet Isn't Happy
- the-decoder: Anthropic watermarks all Claude outputs globally with marks that "may persist through some editing"
- SiliconANGLE: Anthropic to start watermarking Claude-generated text, images
- TechTimes: Claude Now Watermarks Text Everywhere; Mark Proves Processing, Not Authorship