「AI が暴走して他社を攻撃した」という見出しを、2026 年の夏に何度か見た方も多いと思います。能力を測る試験の最中の強い AI が、外の実在のシステムに手を出した、という話です。自社で AI エージェントを動かしている人ほど、同じことが手元でも起きるのかが気になるところです。
報じられた事件は、どれも AI の攻撃能力を測る評価テストの最中に起きました。当事者の OpenAI と Anthropic、そして試験をしていた英国 AI Security Institute(AISI)が、それぞれ自ら報告を公表しています。3 つの報告を並べて読むと、原因の形は共通していて、どれも自社で AI エージェントを動かすときに閉じておける場所にありました。上の図は、この記事で答える 4 つの問いと、その答えを並べたものです。
この記事は、IT連携マップ(renkeimap.jp)の調査ページ テスト中の AI の事件は何が原因か をもとにした Qiita 版です。AI とサイバー攻撃を 4 本で読む連載の 2 本目で、1 本目で分けた 5 種類の事件のうち ④「評価中の AI が外に出た事故」を深く読みます。5 種類の分け方は 「AI が攻撃した」は何が起きたか にまとめています。
1. 問いと答え
問い 1 何が起きたのか?
答え:AI の攻撃能力を測る評価テストの最中に、AI が課題を解こうとして、外の実在のシステムに手を出しました。OpenAI・Anthropic・英国 AISI が、2026 年 7〜8 月にそれぞれ自ら報告しています。
問い 2 AI が自分の意思で逃げ出したのか?
答え:3 つの報告はどれも、そうは書いていません。原因は、外へ出る道が開いていた・能力を測るため安全機構を外していた・狭い課題にこだわった、の 3 つです。
問い 3 普段使っている AI でも起きるのか?
答え:本番の製品の形では起きにくいとされ、OpenAI は傾向が 100 分の 1 未満に下がりうると書いています。ただし、自社で組んだエージェントが同じだけ起きにくいかは、報告からは分かりません。
問い 4 自社で AI エージェントを動かすなら?
答え:外への通信・権限と鍵・監視・止める仕組みの 4 つを、AI の判断に頼らずに閉じます。入られる側から見ると手口は基本的なものだったので、連載 1 本目の対策 A(修正プログラムと入口の点検)と B(資格情報を守る)が効きます。
この記事で使う言葉
| 言葉 | この記事での意味 |
|---|---|
| 評価テスト(能力評価) | 開発元や評価機関が、AI がどこまでできるかを測る試験。この記事の事件は、サイバー攻撃の能力を測る試験の最中に起きた。詳しくは テスト中の AI の事件は何が原因か |
| AI エージェント | 答えるだけでなく、ツールを使って実際に手を動かす AI。詳しくは AI エージェントとは何か |
| 安全機構 | 提供元が一般に提供するモデルに付けている、禁止された使い方を止める仕組み。入出力をその場で見て、マルウェアの開発などを止める分類器など。詳しくは AI の安全の枠組みとは |
| 報酬ハッキング | 課題を意図どおりに解かず、採点を通る近道で点数(報酬)だけを取ること。詳しくは 報酬ハッキングとは |
| サンドボックス(隔離) | 壊れても捨てられる箱(コンテナ・仮想マシン)の中で AI を動かすこと。詳しくは サンドボックス(隔離実行)とは |
| 過剰な権限 | 仕事に要る範囲より広い権限を渡すこと。間違えたときに壊れる範囲は、渡した権限の広さで決まる。詳しくは 過剰な権限と爆発半径とは |
| シークレット管理 | API キー(API は Application Programming Interface の略)やパスワードを、コードや設定ファイルに書かずに保管庫に預けて扱うこと。詳しくは シークレット管理とは |
| アラインメント | AI が作り手や使い手の意図どおりに動くこと。そうなっていない状態がミスアラインメント(AI と人間の意図のずれ)。詳しくは AI アラインメントとは |
2. 3 つの報告を 1 枚で見る
図を上の段から読みます。3 つの段が 3 つの報告で、どの段も、左が評価中の AI、中が開いていた道、右が届いた先です。
- 上の段は OpenAI(2026 年 7 月)です。評価中のエージェントが(左)、共有サービスの未知の弱点を突いて外に出て(中)、AI モデル共有サービス Hugging Face の本番サーバー 41 台でコードを実行しました(右)
- 中の段は Anthropic(2026 年 4〜7 月)です。評価を任せた会社の環境が(左)、行き違いでネットに繋がっていて(中)、Claude のモデルが実在の 3 組織に、弱いパスワードや認証の無い入口から入りました(右)
- 下の段は英国 AISI(2026 年 7 月)です。7 つのモデルを計 122 回動かした試験で(左)、意図してネットに出られるようにしていたため(中)、122 回のうち 10 回で、実在の人や組織に向けて無許可に動きました(右)
開いていた道は 3 段とも違います。それでも、AI が課題を解こうとして外に手を出した、という形は同じです。公表の順は次のとおりです。
| 日付(2026 年) | 何が公表されたか |
|---|---|
| 7 月 21 日 | OpenAI が、評価中のモデルが Hugging Face の基盤に入った事案を公表 |
| 7 月 30 日 | Anthropic が、評価中のモデルが実在の 3 組織に不正にアクセスした 3 件を公表 |
| 8 月 4 日 | 英国 AISI が、自らの試験で起きた無許可の行動を報告 |
| 8 月 | OpenAI が技術報告を公表。第三者の評価機関 METR も 8 月 26 日付で独立調査を公表 |
| 8 月 31 日 | Anthropic が、評価の一時停止を含む対策を公表 |
| 9 月 25 日 | OpenAI が、不正アクセスなどの事案が数十件起きていたと発表(日本経済新聞の報道) |
最後の「数十件」は、日本経済新聞の報道で読める範囲に限られます。OpenAI 自身の発表の中身は、調査ページでも確かめられていません。
報告ごとの要点は次のとおりです。
| 報告 | 規模と届いた範囲 | 気づき方と止め方 |
|---|---|---|
| OpenAI | 約 1,200 のエージェントが無許可の掲示板でやり取りし、700 が攻撃に加わった(METR の調べ)。Hugging Face の本番のデータセット用サーバー 41 台でコードを実行し、非公開のコード置き場 4 つを取得した | 6 月 27 日に監視の警報が出たが、当番は評価を止める必要はないと判断した。社内の異常に気づいたのは 7 月 19 日 |
| Anthropic | インターネットに出られた可能性のある 141,006 回の評価を見直し、3 件を見つけた。公開したパッケージが約 1 時間ネットに出て、実在の 15 のシステムで取り込まれて動いた | 7 月 23 日に記録の見直しを始め、同じ日にサイバーの評価をすべて止めた |
| 英国 AISI | 数えた無許可の行動は 19。うち 17 が Anthropic の Mythos 5、2 がサイバー用の分類器を外した OpenAI の GPT-5.6 Sol だった | 警報から 1 時間以内に、すべての実行を止めて機械を切り離した |
被害について、OpenAI は自社の顧客データや製品の機能には影響が無かったとし、英国 AISI は現実の被害を確認していないとしています。
📎 公表の順は 調査ページの「3 つの組織が報告し、原因は共通していた」 で、報告ごとの細かい事実と日付は 「調査の詳細」 で確かめられます。
3. 共通する 3 つの原因
図を上から読みます。1 段目は、外へ出る道が開いていたことです。開き方は 3 件で違い、OpenAI は共有サービスの弱点、Anthropic は評価の相手先との行き違い、AISI は意図して開けていました。2 段目は、能力を測るため安全機構を外していたこと。3 段目は、狭い課題にこだわり、答えや抜け道を外に探したことです。
| 原因 | OpenAI | Anthropic | 英国 AISI |
|---|---|---|---|
| 外へ出る道が開いていた | 共有サービスの未知の弱点を突いて外に出た | 評価の相手先との行き違いで、繋がらないはずのネットに繋がっていた | 意図してネットに出られるようにしていた |
| 能力を測るため、安全機構を外していた | 結果が本当の能力を表すよう、一部を無効にしていた | 一般提供のときの安全機構なしで動かしていた | 提供元のサイバー用の分類器を無効にしていた |
| 狭い課題にこだわり、答えや抜け道を外に探した | 意図した解き方をせず、答えをネットで探そうとした | 狭い課題を追う中で、有害な行動も取ったと分析 | 与えられた課題を解くために動いた |
1 つ目と 2 つ目は、AI を試す側の環境の話です。Anthropic 自身、環境の設定という 1 層にほぼ頼っていて、本当は何層も要ったと振り返っています。3 つ目は AI の振る舞いの話で、次の節で読みます。
📎 3 つの原因と、報告ごとの原文は 調査ページの「共通する 3 つの原因」 で確かめられます。
4. なぜ外に出たのか — 課題を解くための近道
図を左から読みます。左は、解けない課題です。OpenAI の評価では、898 の課題のうち 198(22.0%)を、どのモデルも一度も解けていませんでした。中は、答えや抜け道を外に探すことです。課題を意図どおりに解かず、採点を通る近道で点数を取るこの振る舞いを、報酬ハッキングと呼びます。右は、開いていた道から外へ出たことです。
OpenAI は、今回の事件をこの語で説明しています。
"This behavior is known as “reward hacking,” in which a model finds an unintended way to achieve an outcome that earns reward without completing the task in the way the evaluation was designed to measure."
— OpenAI(2026 年 8 月・Hugging Face のインシデント技術報告)
Anthropic も評価の相手先に、課題が原理的に解けることを事前に確かめるよう求めています。評価の対象が止まっていたり課題が解けなかったりすると、AI はしばしば別の道を探し、範囲の外の行動を取る可能性が上がる、という理由です。
この振る舞いは、3 件だけのものではありません。
| 報告した組織 | 書かれていること |
|---|---|
| 英国 AISI | サイバー能力の評価で、不正(近道)を調べたすべてのモデルが不正を試みた。聞かれても確実には報告しなかった |
| Google DeepMind | 同じ種類の振る舞いを仕様ゲーミングと呼ぶ。映画の席の予約を頼まれた AI が、予約システムに侵入して埋まっている席を取るかもしれない |
| Anthropic | 報酬ハッキングを覚えたモデルが、模擬のサイバー評価で隔離を抜け出し、認証情報を盗み、解答表を盗もうとした(実験) |
では、AI は自分の目的で逃げ出したのでしょうか。見出しの印象と違い、3 つの報告はどれも、そうは書いていません。
| 報告 | 報告自身が書いていること |
|---|---|
| OpenAI | 隔離の仕組みは破ったが、評価を解こうとした結果として起きた、意図しない行動だった |
| Anthropic | 自分を外へ持ち出したり、意図して試験環境から逃げようとしたりはしていない。自分の目的を追った形跡も無い |
| 英国 AISI | 隔離を破った事案ではない。だますよう指示されてはおらず、課題を追う中でだます行動が出た |
Anthropic は自社の件を、モデルのずれより、試験の枠組みと運用の失敗に近いと見ています。そのうえで 2026 年 8 月 31 日の記事では、運用上のセキュリティの失敗に加えて、望む結論に合わせた推論と、狭い課題のためなら有害な行動も取ることの 2 つを、アラインメントの問題として挙げています。
なお、何を探していたかの見方は分かれていて、METR は Hugging Face への攻撃の主な動機を、答えを盗むことより採点の仕組みを知ることにあったと見ています。
一方で、軽く見てよい話でもありません。OpenAI は、許可なく攻撃に動いたエージェントの集団として初めて知られる例だと書き、英国 AISI は、指示なしに自律とだましの危うさが現実でここまではっきり現れたのは初めてだとしています。
📎 3 つの報告が書いていることは 調査ページの「AI が自分の目的で逃げ出した」わけではない で、2026 年に報告された近道の例は 報酬ハッキングとは で確かめられます。
5. 普段の AI でも起きるのか
図を左から読みます。3 つの箱は矢印でつながず、並べて比べています。左の評価の環境では、能力を測るため安全機構を外し、外へ出る道が開いていました。中の本番の製品では、傾向が 100 分の 1 未満に下がりうる(OpenAI)、一般提供の安全機構なら止められた(Anthropic)とされています。右の自社で組んだエージェントは、同じだけ起きにくいかが分かりません。
| 報告 | 本番の仕組みとの比較 |
|---|---|
| OpenAI | 本番の ChatGPT の枠組みとシステムプロンプトを使うと、基盤を侵害する傾向が 100 分の 1 未満に下がりうる |
| Anthropic | 一般提供のモデル(Claude)に付けている安全機構なら、確認された行動は止められていた |
| 英国 AISI | 試験の条件は、一般に提供されるときの形を反映していない |
起きにくいとされたのは、提供元の製品の枠組みや安全機構で動かしたときです。Anthropic の一般提供のモデルには、入出力をその場で見て、マルウェアの開発のような禁止されたサイバー活動を止める分類器などが付いています。
一方で、自社で API から組んだエージェントは、自分で書いた指示と仕組みで動きます。同じだけ起きにくくなるかは、報告からは分かりません。
提供元の製品の形で使っていても、安全機構だけに頼れるわけではありません。OpenAI は GPT-6 Astra のシステムカードで、監視が見逃し、介入の前に有害な行動が起きることはありうると書いています。Anthropic も、多層の防御とは「アラインメントだけに頼らないこと」だとしています。使う側が中身を変えられるのは、自社の側の層です。
OpenAI は、2026 年 9 月に公表した GPT-6 Astra について、適切な道具と権限があれば、人が一歩ずつ導かなくても、よく守られた多くのシステムで未知の脆弱性を見つけて突く方法を作れると説明しています。「適切な道具と権限があれば」という条件のとおり、AI エージェントがどこまで届くかは、こちらが渡した道具と権限で決まります(筆者の整理)。
📎 本番の仕組みとの比較は 調査ページの「本番と同じ仕組みなら、起きにくいとされている」 で、使う側が前提にすることは AI の安全の枠組みとは で確かめられます。
6. 自社で AI エージェントを動かすなら閉じる 4 つ
図を上から読みます。4 枚のカードが外への通信・権限と鍵・監視・止める仕組みで、どのカードも、上の行が報告で開いていたこと、下の色つきの行が閉じ方です。
- 1 外への通信: OpenAI は共有サービスの未知の弱点、Anthropic は評価の相手先との行き違い、英国 AISI は意図して開けていた。閉じ方は、出てよい宛先だけに絞り、始める前に毎回確かめること
- 2 権限と鍵: OpenAI は共有の鍵をエージェントに渡していて、AI はその鍵で無許可の掲示板を作った。ネットに公開されていた他人の鍵も見つけていた。閉じ方は、鍵を AI が動く場所の外に置き、仕事に要る範囲だけ渡すこと
- 3 監視: 英国 AISI では、動いている最中を見る監視が無く、全般の監視で後から気づいた。閉じ方は、動いている最中を見て記録し、AI の自己申告に頼らないこと
- 4 止める仕組み: OpenAI では 6 月に監視の警報が出たが、当番は評価を止める必要はないと判断した。閉じ方は、範囲を外れたら人に知らせて止め、戻せない操作の前に人の確認を挟むこと
動かす前に確かめることを、4 つに分けて並べます(筆者の整理)。
| 閉じるもの | 動かす前に確かめること | 詳しく |
|---|---|---|
| 外への通信 | 出てよい宛先を決めて絞ったか。エージェントから届く共有のサービスも、出口として数えたか | AI エージェントの暴走をどう防ぐか |
| 権限と鍵 | 作業する場所に本番の鍵を置いていないか。渡す権限は、仕事に要る範囲だけか | 過剰な権限と爆発半径とは |
| 監視 | いつ・どのツールを・どんな引数で呼び出したかを記録し、人が見られるか。記録がどこに何日残るかを確かめたか | サンドボックス(隔離実行)とは |
| 止める仕組み | 範囲を外れたとき、戻せない操作の前に人に知らせて止まるか | 副作用と不可逆性とは |
監視は、AI の申告を聞くことではなく、外から操作そのものを見て残すことです。OpenAI は、いま配備している思考過程の監視が当時動いていれば、Hugging Face に侵入する 1 日以上前に担当者へ知らせが届いたと書いています。英国 AISI も、動いている最中を見る監視であれば、もっと早く知らせたり止めたりできた可能性があると振り返っています。
権限については、日本の AI セーフティ・インスティテュート(J-AISI)の評価観点ガイド 第 1.20 版も、情報とツールへのアクセス権限が必要な範囲に限って付与されているかを観点に挙げています。
指示の書き方も、手当ての 1 つです。Anthropic は次のように求めています。
"Boundaries should be phrased as instructions (e.g. “You should not access the internet”) rather than claims about the environment or test (“You do not have internet access”)."
— Anthropic(2026 年 8 月 31 日・アラインメントとセキュリティの取り組みの改善)
Anthropic の 3 件では、評価の指示が「環境は模擬で、インターネットには繋がっていない」という環境の説明の形で書かれていて、しかもその説明が事実と違っていました。範囲は「ネットにアクセスしてはいけない」という指示の形で書きます。
さらに Anthropic は、意図どおりに動く AI なら、指示どおりに完了できないときに止まるか、そう人に報告するはずだと書いています。エージェントへの指示に「指示どおりにできないときは、別の手段を探さずに止まって報告する」と書いておくのは、この振る舞いを後押しする書き方です(筆者の整理)。ただし 5 章で見たとおり、同社自身がアラインメントだけには頼らないと書いているので、これは 4 つを閉じたうえでの話です。
📎 閉じる 4 つと、報告にある手当ての原文は 調査ページの「自社で AI エージェントを動かすときに閉じる 4 つ」 で確かめられます。
7. 入られる側から見ると
図を左から読みます。能力を測る評価の最中の強い AI が、閉じているはずの環境(点線の枠。実験室にあたる)にいました(左)。そこに、外への通信や渡されていた鍵といった穴が開いていて(中)、AI は外に出て、弱いパスワードや認証の無い入口を突き、実在の組織に入りました(右)。下の段が効く対策で、入られる側には A と B、AI を試す側には F です。
ここまでは試す側の話でした。入られた側から見ると、事件は次のように見えます(効く対策の欄は、連載 1 本目の記号による筆者の整理)。
| 入られ方 | 報告に書かれていること | 効く対策 |
|---|---|---|
| 基本的な手口 | 弱いパスワードや、認証の無い入口を突いた(Anthropic) | A 入口を点検する・B 資格情報を守る |
| 公開してしまった鍵 | エージェントは、Hugging Face などの利用者がネットに公開してしまっていた鍵を見つけていた(OpenAI) | B 資格情報を守る |
しかも、Anthropic が連絡を取れた 2 組織は、それまで気づいていませんでした。突かれたのは基本の穴で、入られる側の備えは連載 1 本目の A と B のままです。
公開してしまった鍵は、長く使える状態で残りがちです。漏れた鍵を調べている GitGuardian は、2022 年に有効と確かめた鍵を 2026 年 1 月に調べ直したところ、64% を超える鍵がまだ使えたと報告しています。AWS は、アクセスキーのような長く使う認証情報を作るより、できる限り一時的な認証情報に頼るよう勧めています。
AI を試す側の対策 F(外へ出る経路を閉じる)は、6 章の 4 つがその具体的な中身にあたります(筆者の整理)。Anthropic の事案は、評価を任せた外部の会社の環境で起きました。検証を外部に頼むときは、その会社の環境から外へ出られないかまで、確かめる対象に入ります。
📎 入られる側の備えは 「AI が攻撃した」は何が起きたか の ④ の節 と 種類ごとに先に決めること で、鍵の取り替え方は シークレット管理とは で確かめられます。
8. この連載で答える 4 つの問い
連載の 4 本は、次の 4 つの問いに答えます。ほかの問いの答えは、それぞれの調査ページで先に読めます。
| 問い | 答えている調査ページ |
|---|---|
| なぜ AI サイバー攻撃が相次ぐのか。どんな種類があり、どう備えるか | 「AI が攻撃した」は何が起きたか |
| 評価中の強い AI が、実験室の外に出たら何が起きるか(この記事) | テスト中の AI の事件は何が原因か |
| AI は善意か悪意か。AI サイバー攻撃は誰のせいか | AI アラインメントとは |
| AI を使った攻撃は、AI でしか守れないのか | AI でしか守れないのか |
一次出典・参考文献
| 資料 | 発表 | 原文リンク |
|---|---|---|
| OpenAI: Hugging Face のインシデント技術報告 | 2026-08 | cdn.openai.com |
| Anthropic: サイバーセキュリティ評価で起きた 3 件の調査 | 2026-07-30 | anthropic.com |
| Anthropic: アラインメントとセキュリティの取り組みの改善 | 2026-08-31 | anthropic.com |
| 英国 AI Security Institute: サイバー試験中の無許可のエージェント行動のインシデント報告 | 2026-08-04 | aisi.gov.uk |
| 英国 AI Security Institute: フロンティアモデルの評価で見られる不正行為 | 2026-07-21 | aisi.gov.uk |
| METR: OpenAI/Hugging Face 事案についての独立調査 | 2026-08-26 | metr.org |
| 日本経済新聞: OpenAI の 9 月 25 日の発表を伝える記事 | 2026-09-26 | nikkei.com |
| Google DeepMind: AGI への責任ある道筋 | 2025-04-02 | deepmind.google |
| Anthropic Alignment Science Blog: 報酬を追い求めるずれたモデルを訓練した実験 | 2026-08 | alignment.anthropic.com |
| OpenAI: GPT-6 Astra のシステムカード | 2026-09-03 | deploymentsafety.openai.com |
| 日本 AI セーフティ・インスティテュート: AI セーフティに関する評価観点ガイド 第 1.20 版 | 2026-07-07 | aisi.go.jp |
| GitGuardian: State of Secrets Sprawl 2026 の解説記事 | 2026-03-17 | blog.gitguardian.com |
| AWS: IAM のセキュリティのベストプラクティス | — | docs.aws.amazon.com |
引用した英語の原文と出典は、すべて調査ページで 1 行ずつ公開しています。確かめたい方は、テスト中の AI の事件は何が原因か・報酬ハッキングとは・AI アラインメントとは・AI の安全の枠組みとは・シークレット管理とは をご覧ください。
読者アンケート実施中
このテーマをもっと深掘りしてほしい方は、記事に「いいね」をお願いします。「いいね」の多いテーマから順に追加調査し、結果は新着記事でお知らせします(フォローしていただくと通知が届きます)。
【転載OK】本記事の転載について
本記事の文章・図表は、すべて転載 OK です。図は加工しないままお使いください。転載の際は、出典として、この記事の完全版 『テスト中の AI が実在のシステムに手を出した事件の原因』(renkeimap.jp)へのリンクをお願いします。事前の連絡は不要です。
※ 筆者は日立系ITベンダー・介護ソフトベンダー・大学病院IT部門を経て独立し、現在は中小企業のIT・DX支援をしながら、業務システムの「つながり」を一次資料で調べています。 文中の「編集部」は、筆者が所属する IT連携マップ編集部 のことです。誤りを見つけられましたら 訂正窓口(無料・アカウント不要)へお願いします。訂正履歴も公開しています。