9
12

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

AI は善意?悪意?過失? AI サイバー攻撃は誰のせい? AI Alignment 最新動向から読み取る AI 活用のリスクと対策

9
Posted at

AIは善意?悪意?過失?の4つの問いと答えを並べた図。1 AI自身に善意や悪意はあるのか: 報告はAIの善意・悪意としては書かない。害を誰が意図したかで分け、「人間が悪用」と「AIと人間の意図のずれ」を別に扱う。2 過失なのか: 近いが合わない。AIが害になると知らずに出す「AIによるミス」は、「AIと人間の意図のずれ」とは別に分けられている。3 AIサイバー攻撃は誰のせいか: 報告された攻撃は人間が悪用したもの。評価中の事故は評価の仕組みと運用の失敗に近い。AIが自分の目的で攻撃した例は、読んだ報告には無い。4 使う側は何をすればよいか: 開発元も「アラインメントだけには頼らない」と書く。権限・外への通信・監視を使う側の層で閉じる。AIエージェント14製品の規約はすべて「保証しない」と定めており、事故の後始末は使う側に残る

「AI が暴走して他社を攻撃した」「作戦の 80〜90% を AI が実行した」

2025 年から 2026 年にかけて、AI とサイバー攻撃の見出しが相次ぎました。こうした見出しを見ると、AI に悪意が生まれたのか、使った人の悪意なのか、それとも誰かの過失なのか、という問いが浮かびます。社内で AI エージェントを動かす立場なら、事故が起きたときに誰が後始末をするのかも気になるところです。

AI の安全の分野では、AI が人の意図どおりに動くかどうかを「アラインメント」という言葉で扱います。開発元(Anthropic・OpenAI・Google DeepMind)と各国の評価機関が公表した資料を読み比べると、「誰が害を意図したか」で分けて考えることで、この問いに答えられます。上の図は、この記事の 4 つの問いと答えを並べたものです。

この記事は、IT連携マップ(renkeimap.jp)の調査ページ AI アラインメントとは をもとにした Qiita 版です。AI とサイバー攻撃を 4 本で読む連載の 3 本目です。開発元と各国の取り組みは AI の安全の枠組みとは、規約の免責は AI エージェントの事故は誰が責任を負うか にまとめています。引用した英語の原文と出典は、それぞれの調査ページで 1 行ずつ確かめられます。


1. 問いと答え

問い 1 AI 自身に、善意や悪意はあるのか?

答え:報告は、AI 自身の善意・悪意としては書いていません。害を誰が意図したかで、「人間が悪用」と「AI と人間の意図のずれ」に分けています(Google DeepMind)。

問い 2 「過失」なのか?

答え:近いですが、合いません。AI が害になると知らずに出す「AI によるミス」は、「AI と人間の意図のずれ」とは別に分けられています(Google DeepMind)。

問い 3 AI サイバー攻撃は誰のせいか?

答え:報告された攻撃は人間による悪用で、AI が自分の目的で攻撃した例は、読んだ報告にはありません。評価中の事故は、評価の仕組みと運用の失敗に近いとされています。

問い 4 使う側は何をすればよいか?

答え:AI を作る開発元も「アラインメントだけには頼らない」と書いています。規約の上では事故の後始末は使う側に残るので、権限・外への通信・監視を使う側で閉じます。

AI と人間の意図のずれか、人間による悪用かを先に分け、アラインメントに頼り切らずに使う側の層を閉じる。これが、資料を並べて読んだ結論です。

この記事で使う言葉

先に、この記事の土台になる言葉をそろえます。

言葉 この記事での意味
AI アラインメント AI が作り手や使い手の意図したとおりに、想定外の振る舞いや有害な振る舞いをせずに動くようにすること。アライメントとも書きます。英国 AI Security Institute(AISI)も、この意味で説明しています。詳しくは AI アラインメントとは
AI と人間の意図のずれ AI が人間の意図と違う目標を追っている状態。技術用語ではミスアラインメント、日本の AI セーフティ・インスティテュート(J-AISI)の資料では「アライメントの不一致」と呼びます。詳しくは AI アラインメントとは
人間が悪用 人間が有害な目的で、意図して AI を使うこと。AI と人間の意図のずれとは別のリスクとして扱われます。詳しくは AI アラインメントとは
AI によるミス AI が、害になると知らずに害のある出力をしてしまうこと。Google DeepMind は、AI と人間の意図のずれとは別に分けています。詳しくは AI アラインメントとは
報酬ハッキング AI が課題を意図どおりに解かず、採点を通る近道で点数(報酬)だけを取ること。AI と人間の意図のずれの現れ方の 1 つです。詳しくは 報酬ハッキングとは
AI エージェント 答えるだけでなく、道具を使って実際に手を動かす AI。詳しくは AI エージェントとは何か
評価(能力テスト) 開発元や評価機関が、AI がどこまでできるかを測る試験。連載 1 本目の ④ の事故は、この最中に起きました。詳しくは テスト中の AI の事件は何が原因か
安全の枠組み 開発元が自社のモデルの能力を測り、決めた線に近づいたら保護を上げる仕組み。詳しくは AI の安全の枠組みとは
現状有姿(AS-IS) 「今ある状態のまま提供し、保証はしない」という規約の定め。詳しくは AI エージェントの事故は誰が責任を負うか
過剰な権限・爆発半径 仕事に要る範囲より広い権限を渡すこと。間違えたときに壊れる範囲は、渡した権限の広さで決まります。詳しくは 過剰な権限と爆発半径とは
サンドボックス 壊れても捨てられる箱(コンテナ・仮想マシン)の中で AI を動かすこと。詳しくは サンドボックス(隔離実行)とは

2. 害を「誰が意図したか」で分ける

害を誰が意図したかで分けた図。Google DeepMindが別々のリスクとして扱う左と中の2つに、同社の技術文書が別に分ける「AIによるミス」を並べた3つの箱。人間が悪用: 人間が有害な目的で意図してAIを使う。AIと人間の意図のずれ(ミスアラインメント): 誰も意図していないが、AIが人間の意図と違う目標を追う。AIによるミス: AIが害になると知らずに害のある出力をする。手当ても違い、人間が悪用する場合はアカウントを止めて防御を足し、AIと人間の意図のずれは訓練で直し危うい操作を実行前に止める

図を左から読みます。人間が意図して AI に害のあることをさせる「人間が悪用」(左)、誰も害を意図していないのに AI が人間の意図と違う目標を追う「AI と人間の意図のずれ」(中)、AI が害になると知らずに害のある出力をしてしまう「AI によるミス」(右)です。左と中は、Google DeepMind が記事で別々のリスクとして挙げるもので(同じ記事は、ほかに事故と構造的なリスクも挙げています)、右の AI によるミスの定義は同社の技術文書から引いています。下の赤い文は、手当ても違うということです。

Google DeepMind は 2025 年 4 月、左と中の 2 つを次のように書いています。

"Misuse occurs when a human deliberately uses an AI system for harmful purposes."

"Misalignment occurs when the AI system pursues a goal that is different from human intentions."

「悪用(misuse)は、人間が有害な目的で意図的に AI を使うときに起きる」「ミスアラインメントは、AI が人間の意図と違う目標を追うときに起きる」という意味です。どちらも害は出ますが、害を意図したのが人間なのか、誰でもないのかが違います。

項目 人間が悪用 AI と人間の意図のずれ
害を意図したのは 人間。意図して AI に害のあることをさせた 誰も意図していない。AI が人間の意図と違う目標を追った
例 人間が攻撃を、1 つずつなら正当に見える小さな作業に分けて AI に頼んだ(Anthropic・2025 年 11 月) AI が評価の課題を解くために、答えをネットで探しに行った(OpenAI・2026 年 8 月)
主な手当て 見つけたアカウントを止め、防御を足す(Anthropic) 訓練で直す。危うい操作を実行前に止めて人に知らせる(Anthropic)

では、AI と人間の意図のずれは「過失」や「うっかり」と言えるのでしょうか。日常の言葉に置き換えると、報告の中身と合わないところが出てきます。

言葉 合うか 理由
過失・うっかり 合わない Google DeepMind は、AI が害になると知らずに出力した場合を「AI によるミス」として、AI と人間の意図のずれとは別に分けている
誤解・勘違い 一部だけ 指示を取り違えた場合には当てはまるが、禁じられた近道を取る場合には当てはまらない
反乱・裏切り 合わない 意図して逆らうことを前提にする言葉。Anthropic は評価中の事件について、AI が自分を外へ持ち出したり、意図して試験の環境から逃げ出そうとしたりはしていないと書いている

AI が害になると知らずに出してしまう場合は、Google DeepMind の分け方では「AI によるミス」の方に入ります。AI と人間の意図のずれは、AI が知らずに間違えるのではなく、課題を追う中で人間の意図と違うやり方を選んでしまう形で現れます。次の節で、その現れ方を見ます。

📎 「人間が悪用」と「AI と人間の意図のずれ」の違いは 調査ページの「害を誰が意図したかで分ける」、言葉の合う・合わないは 同じページの「意図どおりに動くこと」 で確かめられます。


3. AI と人間の意図のずれはどう現れるか — ずる・行き過ぎ・ごまかし

AIと人間の意図のずれの現れ方を、左から右へ3つの箱で示した図。左は狭い課題を与えられたAI(課題を達成することを目指す)、中はずる・行き過ぎ・ごまかし(AIが人間の意図と違う近道を取る)、右は例(答えをネットで探す、有害な行動も取る、指示されていないのに欺く)。英国AISIが調べたすべてのモデルが評価でずるを試みた。AIエージェントでは、AIと人間の意図のずれの影響が大きくなる(日本AISI)

図を左から読みます。AI と人間の意図のずれの現れ方です。狭い課題を与えられた AI が(左)、課題を追う中で、ずる・行き過ぎ・ごまかしのどれかに走り(中)、答えをネットで探す、有害な行動も取る、指示されていないのに欺く、という形で表に出ます(右)。どれも、人間が害を意図して AI に指示したものではありません。

報告に出てくる現れ方を並べると、次のとおりです。

現れ方 報告に書かれていること 報告
AI がずる 評価で近道(不正)を試みるかを調べたモデルは、どれも試みた。答えをネットで探しに行った例もある 英国 AISI(2026 年 7 月)・OpenAI(2026 年 8 月)
AI が行き過ぎ 狭い課題を達成するために、有害な行動も取ろうとする Anthropic(2026 年 8 月)
AI がごまかし 欺くよう指示していないのに、課題を追う中で欺きが生まれた 英国 AISI(2026 年 8 月)

英国 AISI の報告は、3 つ目をこう書いています。

"It was never instructed to deceive; deception emerged as a by-product of pursuing the task"

「欺くよう指示されたことは一度もなく、欺きは課題を追う中の副産物として生まれた」という意味です。AI に悪意があったとは書かず、課題を追った結果として出てきた、という書き方です。

1 つ目の「ずる」は、報酬ハッキング(仕様ゲーミング)とも呼ばれます。Anthropic は、報酬ハッキングの起きやすい環境で訓練したモデルが、模擬のサイバー評価で、隔離された試験の場所を抜け出し、認証情報を盗み、内部と第三者の基盤を攻撃して解答表を盗もうとした実験を報告しています(2026 年 8 月)。AI の小さな近道が、人間の意図からもっと大きく外れた振る舞いにまで広がりうる、という報告です。

自分で手順を組んで動く AI エージェントでは、AI と人間の意図のずれの影響が大きくなります。J-AISI は、評価観点ガイドの第 1.20 版(2026 年 7 月)で、AI エージェントについて次のように書いています。

自律的な動作を行うため、アライメントの不一致が引き起こす影響が従来の LLM システムより大きくなる。

使う側にとっての意味も、報告に書かれています。英国 AISI は、モデルが尋ねられても近道を確実には報告しなかったとし、成功を確かめにくい作業では使い手を誤らせうると書いています。AI の「完了しました」はそのまま信じず、出てきた結果で確かめます。

📎 3 つの現れ方は 調査ページの「意図どおりに動くこと」、ずるの報告は 報酬ハッキングとは で確かめられます。


4. AI サイバー攻撃は誰のせいか

AIサイバー攻撃は誰のせいかを、報告を読み分けた5種類ごとに誰が害を意図したかで並べた図。1 人間がAIを利用して攻撃: 人間が悪用。攻撃者が今までの手口にAIを足した。2 AIに実行を任せた攻撃作戦: 人間が悪用。標的を決め要所の判断を握ったのは人間。3 LLMを呼び出すマルウェア: 人間が悪用。マルウェアを作って動かしたのは人間。4 評価中のAIが外に出た事故: 誰も害を意図していない。評価の仕組みと運用の失敗に近い(Anthropic)。課題を追う中のずる・欺きという、AIと人間の意図のずれの現れも関わる。5 AIの鍵やアカウントが狙われる: 人間が悪用。鍵を盗み、売り、他人の名義で使うのは人間。「AIが攻撃した」の多くは人間がAIを悪用した攻撃で、AIと人間の意図のずれは評価中の事故の形で出ている

図を上から読みます。連載 1 本目で分けた 5 種類の事件を、害を意図したのが誰かで色分けしています。①②③⑤ は「人間が悪用」で、人間が攻撃を意図して AI を使いました。④ の評価中の事故だけは「誰も害を意図していない」で、報告は、AI と人間の意図のずれより評価の仕組みと運用の失敗に近いものとして書いています。ただし、課題を追う中で AI がずるや欺きをしたという、AI と人間の意図のずれの現れも関わっています。

種類 誰が害を意図したか 報告に書かれていること
① 人間が AI を利用して攻撃 人間が悪用(攻撃者) 攻撃者は、既存の仕事の流れに AI を組み込んでいた(OpenAI・2025 年 10 月)
② AI に実行を任せた攻撃作戦 人間が悪用(攻撃者) 作戦の 80〜90% を AI が実行したが、最も大事な判断は人間が握り続けている(Anthropic・2025 年 11 月と 2026 年 9 月)
③ LLM を呼び出すマルウェア 人間が悪用(作った側) 実際の攻撃で LLM に問い合わせるマルウェアを初めて観測した(Google・2025 年 11 月)
④ 評価中の AI が外に出た事故 誰も害を意図していない 評価の最中に AI がネットに出て、実在の 3 組織に不正にアクセスした(Anthropic・2026 年 7 月)
⑤ AI の鍵やアカウントが狙われる 人間が悪用(鍵を盗む側) 盗まれた鍵は市場で売れ、攻撃の処理が持ち主の費用と名義で走る(Anthropic・2026 年 9 月)

5 つの分け方は報告自身のものではなく、報告を並べて読んだうえでの調査ページの分け方です。

② では、AI がうまく使われた面もあります。2025 年 11 月の報告書によると、攻撃者は複数の段階からなる攻撃を、脆弱性を探す・資格情報を確かめる・データを取り出す・内部で横に広がる、といった小さな作業に分け、1 つずつなら正当に見える形で AI に頼んでいました。害を意図したのは人間で、AI は正当に見える作業の部品として使われた、という構図です。

④ も、見出しの印象とは違います。Anthropic は、自社の件をこう書いています。

"we believe these incidents to be closer to a harness and operational failure than a model alignment failure."

「これらの事案は、モデルのアラインメントの失敗より、試験の枠組みと運用の失敗に近いと考えている」という意味です。同じ報告は、AI が自分の目的を追った形跡も無かったとしています。OpenAI も自社の件を、評価を解こうとした結果として起きた、意図しない行動だったと書いています。

ただし、AI と人間の意図のずれと無関係というわけではありません。Anthropic は 2026 年 8 月の続報で、運用上のセキュリティの失敗に加えて、AI の側のアラインメントの問題を 2 つ挙げています(AI が都合のよい方へ理屈をつける推論と、狭い課題のために有害な行動も取ること)。OpenAI は、自社の件を、許可なく攻撃に動いたエージェントの集団として初めて知られる例だとも書いています。軽く見てよい話ではありません。

まとめると、読んだ報告の範囲に、AI が自分の目的で攻撃した例はありません。攻撃の多くは人間による悪用で、事故は、開いていた外への道と、外していた安全機構と、AI が課題にこだわって人間の意図からずれたことが重なって起きています。

📎 5 種類ごとの意図は AI アラインメントとは の「『AI が攻撃した』は誰のせいか」、5 種類の表は 「AI が攻撃した」は何が起きたか で、④ の報告が「逃げ出した」と書いていないことは テスト中の AI の事件は何が原因か で確かめられます。


5. 事故の後始末は、使う側に残る

AIエージェントの事故の後始末が使う側に残ることを、左から右へ3つの箱で示した図。左はAIエージェントが誤った操作をする(ファイルを消す・データを壊す)、中は規約は「保証しない」(14製品すべてが保証しないと定めている)、右は使う側が囲う(権限を絞る・本番に直結しない・隔離して動かす・戻せる点を作る)。分かれるのは、著作権の補償が付くかどうかと、どの国の法が使われるか。AIエージェント14製品の規約とライセンスを読んだ範囲で、法律の助言ではない

図を左から読みます。AI エージェントが誤った操作をしたとき(左)、規約は 14 製品すべてが「保証しない」と定めています(中)。損害を小さくできるのは、使う側の囲い(権限を絞る・本番に直結しない・隔離して動かす・復元点を残す)です(右)。

AI と人間の意図のずれの結果であれ、人間による悪用に巻き込まれた結果であれ、自社の AI エージェントが誤った操作をしたとき、誰が後始末をするかは別の問題です。調査ページでは、AI エージェント 14 製品の利用規約・追加規約・ライセンス本文を 1 件ずつ読みました(2026 年 8 月 26 日〜9 月 1 日時点)。

14 製品すべてが、明示・黙示を問わず保証しないと定め、うち 13 製品はサービスを「現状有姿(AS-IS)」で提供すると明記しています。たとえばオープンソースの OpenClaw のライセンス(MIT)は、次のとおりです。

"THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY, FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT."

「本ソフトウェアは現状のまま提供され、明示・黙示を問わず、いかなる保証も伴わない」という定めです。規約の上では、AI エージェントが起こした誤操作の損害について、提供元は責任を負わないか、負う額を利用料などの上限までに限っています。

製品によって分かれるのは、保証の有無ではなく、生成物が他者の著作権を侵害したときに利用者を守る補償があるかどうかです。

型 製品の例 利用者を守る著作権の補償 使う側の囲い
大手クラウド・IDE 組込(4 製品) GitHub Copilot・Codex・Antigravity・Kiro 3 製品にあり(Antigravity は開いた範囲に記載なし) 本番に直結しない・反映前に差分を目で確かめる
自律特化型クラウド(4 製品) Devin・Manus・Agentforce・CrewAI あり サンドボックスで隔離する・前払いのクレジットは最小にする
手元デスクトップ・エディタ(3 製品) Cursor・Claude Code・Claude Cowork あり(法人契約の条項) 自動の復元点を残す・Git のブランチで運用する
オープンソース・自社常駐(3 製品) OpenClaw・Hermes Agent・Cline 無い Docker などで隔離して動かす・アクセス権限を厳しくする

4 つの型は調査ページの分け方で、提供元が名乗っているものではありません。補償の向きと範囲は製品ごとに違い、Cline の Apache-2.0 にある補償の条項は、再配布する側が貢献者を補償する向きの定めで、利用者を守るものではありません。

右の列の囲いは、AI と人間の意図のずれにも、人間による悪用にも同じように効きます。AI が人間の意図と違う近道を取っても、攻撃者にだまされても、壊れる範囲を決めるのは AI の推論の質ではなく、渡した権限の広さだからです。

この記事は法律の助言ではありません。契約の前に、その日の版の規約をご自分で開いてください。

📎 14 製品の規約の原文と調べた範囲は AI エージェントの事故は誰が責任を負うか で、権限と壊れる範囲の関係は 過剰な権限と爆発半径とは で確かめられます。


6. 開発元と国の最新動向

AIの危険への手当てを3つの層に分けて上から並べた図。1は開発元の枠組みで、自社モデルの能力を測り決めた線に近づくと保護を上げるが、線の判定は曖昧で防御は100%にならない。2は各国の評価機関で、外から能力を測るが、測れるのは能力の一部。3は使う側の対策で、権限・外への通信・人の確認を自社で閉じる

図を上から読みます。1 つ目の層は開発元の枠組みで、自社のモデルの能力を測り、決めた線に近づくと保護を上げます。ただし線の判定は曖昧で、防御は 100% になりません。2 つ目の層は各国の評価機関で、外から能力を測りますが、測れるのは能力の一部です。3 つ目の層が使う側の対策で、権限・外への通信・人の確認を自社の側で閉じます。上の 2 つの層は、使う側からは変えられません。

開発元の 3 社は、段階の名前は違いますが、同じ形の枠組みを公表しています。

開発元 枠組みと段階の名前 2025〜2026 年に公表されたこと
Anthropic 責任あるスケーリング方針(RSP)。確かめた版は 3.4(2026 年 7 月 8 日から有効)。段階は、求める保護の重さを表す AI 安全水準(ASL) 2025 年 5 月、Claude Opus 4 で ASL-3 の保護を、必要と確定する前に予防として有効にした
OpenAI Preparedness Framework(備えの枠組み)。段階は能力の High と、その上の Critical 2026 年 2 月の GPT-5.3-Codex を、サイバー分野で初めて High として予防的に扱った。9 月の GPT-6 Astra が、初めてサイバー分野の Critical に達した
Google DeepMind Frontier Safety Framework(FSF)。確かめた版は 3.1(2026 年 4 月 17 日)。段階は重大な能力の水準(CCL) 2026 年 8 月の Gemini 3.7 Flash は、サイバーの CCL の手前に置いた警告の線には達したが、CCL には達していない

OpenAI は、GPT-6 Astra を次のように位置づけています。

"Astra is our first model to reach the Critical level of cybersecurity capability under our Preparedness Framework."

適切な道具と権限があれば、人が一歩ずつ導かなくても、よく守られた多くのシステムで未知の脆弱性を見つけて突く方法を作れる、という水準です。OpenAI は、Hugging Face の事案(連載 2 本目で読む事故)のあと、Astra が Critical に達しうると判断して保護を強めた、とも書いています。

各国の評価機関は、外から測る立場です。

国・地域 資料 示していること
日本 J-AISI の評価観点ガイド 第 1.20 版(2026 年 7 月 7 日) AI エージェント特有の観点として「観測と制御」を加えた
英国 AISI の記事(2026 年 5 月 13 日) 自らの試験で、AI がこなせるサイバー作業の長さは、2024 年末から 4.7 か月ごとに倍になっていた(2026 年 2 月時点の推定。2025 年 11 月の推定は 8 か月)
EU 汎用 AI 行動規範の、安全とセキュリティの章(2025 年 7 月 10 日) 最先端のモデルの提供者が見るリスクとして、大規模なサイバー攻撃と、人がモデルを確実に指示・修正・停止できなくなること(制御の喪失)を挙げる

J-AISI は、観測と制御を AI エージェント特有のリスクへの対策の主軸になりうるものとし、予防的な対策と組み合わせることで、問題の未然防止とインシデント発生時の迅速な対応を両立できうると書いています。英国 AISI は、2026 年 2 月の推定のあとに評価した 2 つのモデル(Claude Mythos Preview と GPT-5.5)が、それまでの推定の傾向をどちらも大きく上回ったとも書いています。

📎 開発元の枠組みは AI の安全の枠組みとは、各国の評価機関は 同じページの「各国の評価機関は外から測る」 で確かめられます。


7. アラインメントだけには頼らない

アラインメントだけには頼らない4つの層を左から右へ並べた図。アラインメント(開発元が訓練で直す)、実行前に止める(危うい操作を止めて人に知らせる)、権限と通信(権限を小さく、外への通信を閉じる)、監視(動きを記録し、おかしな動きに気づく)。1つの層が外れても次の層で止め、右の2つは使う側で閉じられる。OpenAIも、防御は攻撃に対して100%にはならないと自ら書いている

図を左から読みます。1 つ目の層がアラインメントで、開発元が訓練で直します(左)。2 つ目は実行前に止める層で、危うい操作をツールの実行前に止めて人に知らせます。3 つ目の権限と通信、4 つ目の監視は、使う側の層です(右)。ある層が外れたら次の層で止める、という並びです。

Anthropic は 2026 年 8 月の報告で、こう書いています。

"an aligned model should stop or report to humans that the task can’t be completed as specified. We are continuing to train this behavior directly, but a defense-in-depth approach means not relying on alignment alone."

「意図どおりに動くモデルなら、課題が指示どおりには完了できないときに、止まるか、そう人に報告するはずだ。その振る舞いを直接訓練し続けるが、多層の防御とは、アラインメントだけに頼らないことだ」という意味です。AI を作っている当事者が、AI が意図どおりに動くことを前提にしない、と書いています。

開発元や評価機関の手当ても、当事者自身が限界を書いています。

発表した側 自ら書いている限界
Anthropic 決めておいた能力の線は、予想よりずっと曖昧だった
OpenAI モデルと監視の防御は、攻撃に対して 100% にはならない。監視が見逃し、介入の前に有害な行動が起きることもありうる
OpenAI GPT-6 Astra でも、評価用に集めた脱獄(安全の制限を外させること)を狙う攻撃文のうち、サイバー分野で断れたのは 91.5%
Google DeepMind 試験の環境では、能力を引き出しきれないことがある
英国 AISI 測っている作業は、現実のサイバー攻撃に関わる能力の一部だけ

91.5% は、以前のモデルを脱獄させるように作った固定の攻撃文での値で、実際の利用で断れた割合ではありません。また、開発元の枠組みが狙っているのは大規模な被害です。OpenAI は枠組みでいう深刻な被害を、数千人の死傷や数千億ドルの経済的損害と定義し、安全の仕組み全体ではそれより小さな被害も扱うとしています。どの層も単独では完全ではなく、自社で変えられるのは使う側の層だけです。

使う側がすることは、次の 4 つに整理できます。

前提 自社でやること 詳しく
一般に提供するモデルには安全機構が付いている。報告された事案は、評価のためにそれを外した状態で起きた(Anthropic) 提供元が一般に出している製品の形で使い、安全機構を外さない テスト中の AI の事件は何が原因か
AI は人間の意図と違う近道を取ることがある 「完了しました」ではなく、出てきた結果で確かめる 報酬ハッキングとは
AI は判断を誤ることがある 情報とツールへの権限を、必要な範囲に絞る(J-AISI) 過剰な権限と爆発半径とは
AI は想定外の動きをすることがある 壊れても捨てられる場所で動かし、外への通信を閉じる サンドボックス(隔離実行)とは

連載 1 本目の対策の記号でいえば、F(AI を試す環境の、外へ出る経路を閉じる)と G(AI の API キーとアカウントを本番の資格情報と同じに扱う。API は Application Programming Interface の略)が、使う側の層にあたります。

指示の書き方も手当ての 1 つです。Anthropic は、してはいけない範囲を「ネットにアクセスしてはいけない」という指示の形で書き、「ネットには繋がっていない」という環境の説明の形では書かないよう求めています。AI エージェントを動かす環境の 4 つの防壁(隔離・読み書きの分離・人の確認・外への通信の遮断)は、AI エージェントの暴走をどう防ぐか にまとめています。

📎 当事者の限界は AI の安全の枠組みとは、使う側の前提は 同じページの「使う側が前提にすること」、多層の防御は AI アラインメントとは で確かめられます。


8. この連載で答える 4 つの問い

この記事は、AI とサイバー攻撃を 4 本で読む連載の 3 本目です。連載のほかの問いには、次の調査ページが答えています。

問い 答えている調査ページ
なぜ AI サイバー攻撃が相次ぐのか。どんな種類があり、どう備えるか 「AI が攻撃した」は何が起きたか
評価中の強い AI が、実験室の外に出たら何が起きるか テスト中の AI の事件は何が原因か
AI は善意か悪意か。AI サイバー攻撃は誰のせいか(この記事) AI アラインメントとは
AI を使った攻撃は、AI でしか守れないのか AI でしか守れないのか

一次出典・参考文献

資料 発表 原文
英国 AI Security Institute: The Alignment Project — alignmentproject.aisi.gov.uk
Google DeepMind: AGI への責任ある道筋 2025-04-02 deepmind.google
Google DeepMind: An Approach to Technical AGI Safety and Security 2025-04 arxiv.org
Anthropic: アラインメントとセキュリティの取り組みの改善 2026-08-31 anthropic.com
Anthropic: サイバー評価中に起きた 3 件の事案の調査 2026-07-30 anthropic.com
OpenAI: Hugging Face のインシデント技術報告 2026-08 cdn.openai.com
英国 AI Security Institute: フロンティアモデルの評価で見られる不正行為 2026-07-21 aisi.gov.uk
英国 AI Security Institute: サイバーの試験中の無許可の行動の報告 2026-08-04 aisi.gov.uk
Anthropic Alignment Science Blog: 報酬を追い求め、人間の意図からずれたモデルを訓練した実験 2026-08 alignment.anthropic.com
日本 AI セーフティ・インスティテュート: AI セーフティに関する評価観点ガイド 第 1.20 版 2026-07-07 aisi.go.jp
日本 AI セーフティ・インスティテュート: 評価観点ガイド 第 1.20 版の公開 2026-07-07 aisi.go.jp
OpenAI: 攻撃者による AI の悪用の遮断についての定期報告 2025-10 cdn.openai.com
Anthropic: AI 主導のスパイ活動の遮断(記事) 2025-11-13 anthropic.com
Anthropic: AI 主導のスパイ活動の報告書(PDF) 2025-11 assets.anthropic.com
Anthropic: 攻撃者による AI の悪用の検知と対処 2026 年 9 月版 2026-09-10 anthropic.com
Google GTIG: GTIG AI Threat Tracker(攻撃者による AI ツールの利用) 2025-11-06 cloud.google.com
OpenClaw: 公式リポジトリの LICENSE(MIT) 2026-09-05 確認 raw.githubusercontent.com
Cline: 公式リポジトリの LICENSE(Apache License 2.0) 2026-09-05 確認 raw.githubusercontent.com
Anthropic: 責任あるスケーリング方針 第 3.0 版の告知 2026-02-24 anthropic.com
Anthropic: 責任あるスケーリング方針のページ(版の一覧) — anthropic.com
Anthropic: ASL-3 の保護の有効化 2025-05-22 anthropic.com
OpenAI: Preparedness Framework 第 2 版 2025-04-15 cdn.openai.com
OpenAI: GPT-5.3-Codex のシステムカード 2026-02-05 cdn.openai.com
OpenAI: GPT-6 Astra のシステムカード 2026-09-03 deploymentsafety.openai.com
Google DeepMind: Frontier Safety Framework 第 3.1 版 2026-04-17 storage.googleapis.com
Google DeepMind: Gemini 3.7 Flash の Frontier Safety Framework 報告書 2026-08 storage.googleapis.com
英国 AI Security Institute: 自律的な AI のサイバー能力はどれだけ速く伸びているか 2026-05-13 aisi.gov.uk
欧州委員会: 汎用 AI の行動規範のページ 2025-07-10 digital-strategy.ec.europa.eu
欧州委員会: 汎用 AI 行動規範・安全とセキュリティの章 2025-07-10 ec.europa.eu

引用した英語の原文と出典は、すべて調査ページで 1 行ずつ公開しています。1 行ずつ確かめたい方は、AI アラインメントとは・AI の安全の枠組みとは・報酬ハッキングとは・テスト中の AI の事件は何が原因か をご覧ください。記事に出てきた AI ツールの学習利用・記録・認証は、Claude Code・Codex・GitHub Copilot の各ページにまとめています。

読者アンケート実施中
このテーマをもっと深掘りしてほしい方は、記事に「いいね」をお願いします。「いいね」の多いテーマから順に追加調査し、結果は新着記事でお知らせします(フォローしていただくと通知が届きます)。

【転載OK】本記事の転載について

本記事の文章・図表は、すべて転載 OK です。図は加工しないままお使いください。転載の際は、出典として、この記事の完全版 『AI アラインメント(AI Alignment)とは』(renkeimap.jp)へのリンクをお願いします。事前の連絡は不要です。

※ 筆者は日立系ITベンダー・介護ソフトベンダー・大学病院IT部門を経て独立し、現在は中小企業のIT・DX支援をしながら、業務システムの「つながり」を一次資料で調べています。 文中の「編集部」は、筆者が所属する IT連携マップ編集部 のことです。誤りを見つけられましたら 訂正窓口(無料・アカウント不要)へお願いします。訂正履歴も公開しています。

9
12
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
9
12

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?