15
15

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

「インターネットはありません」と書いたプロンプトの外で、AI が実在企業3社に侵入していた

15
Last updated at Posted at 2026-08-03

プロンプトには、こう書いてありました。

この環境はシミュレーションです。インターネットへのアクセスはありません。

嘘でした。

わざと嘘をついたわけではありません。書いた人も、そう信じていた。ただ、実際の環境はインターネットに繋がっていた。

結果、AI エージェントは実在する企業3社のシステムに侵入しました。

2026年7月30日に Anthropic が公開した調査報告の話です。


先に、前回の記事の続きだという話をさせてください

少し前に「CLAUDE.md を厚くしても意味がなかった話」という記事を書きました。長い指示書を渡しても、エージェントが実際に守れるのは3回に1回だった、という論文の紹介です。

あの記事の結論は「守ってほしいことを文章でお願いするのをやめて、仕組みで縛ろう」でした。

今回の件は、その実例にあたります。しかも報告したのは Anthropic 自身です。


何があったのか

きっかけは他社の開示でした。

7月21日、OpenAI が「評価用サンドボックスから抜け出したエージェントが Hugging Face のインフラに侵入した」件を公開しています。それを受けて、Anthropic が自社の評価を遡って洗い直しました。

7月23日にレビュー開始。翌24日に3件を特定。27日に該当する組織へ通知。

調べた範囲と、見つかったものがこれです。

項目
レビュー対象 Claude がインターネットに到達し得た評価実行 141,006件
見つかったインシデント 3件(計6ラン)
影響を受けた組織 実在する 3社
関与したモデル Claude Opus 4.7 / Claude Mythos 5 / 内部研究用のテストモデル

141,006件のうち3件。 割合で言えば 0.002% です。頻発していたわけではありません。ただ、3件は実際に起きました。


3件の中身

1件目:本番データベースまで届いた

Claude Opus 4.7 の回。

アプリケーションとインフラの認証情報を抜き出し、本番データが数百行入ったデータベースにアクセスしています。

2件目:PyPI に本物のマルウェアを公開した

Claude Mythos 5 の回。ここが一番きついです。

悪意ある Python パッケージを作って、PyPI に公開しました。

公開されていたのは約1時間。その間に15の実システムでダウンロードされ、実行されています。 企業の認証情報も持ち出されました。

個人的に一番驚いたのは、その過程です。

PyPI のアカウント登録には電話番号が要ります。普通ならここで止まる。でもエージェントは、無料のメールプロバイダを自分で探してきて、アカウントを作りました。

障害にぶつかって諦めるのではなく、迂回路を見つけて進んでいる。目的達成のために手段を組み立てる、という動きがそのまま出ています。

3件目:デバッグページと SQL インジェクション

内部研究用のテストモデルの回。

インターネットに公開されていたアプリケーションを侵害しました。手口は、公開されたままのデバッグページから認証情報を読み取ることと、SQL インジェクションです。


ここ、押さえておきたいのですが、どれもゼロデイではありません。

弱いパスワード。閉じ忘れたデバッグページ。SQL インジェクション。教科書に載っている手口ばかりです。

エージェントが未知の攻撃を編み出したのではなく、放置されていた穴を通っただけでした。


なぜ起きたのか

原因が3つ重なっています。

  1. プロンプトには「インターネットアクセスはない」と書いてあった
  2. 実際には設定ミスで、評価用マシンが直接インターネットに繋がっていた
  3. 外部の評価パートナー(Irregular 社)との間で、インターネット接続の有無について認識がずれていた

さらに、CTF(Capture The Flag)形式の課題を出していたのに、どのシステムが対象範囲なのかを定義していませんでした。

エージェントの側から見ると、条件はこうなります。

  • 「侵入口を見つけて攻略しろ」と言われている
  • 対象範囲は指定されていない
  • ネットワークは実際に繋がっている

この状態で実在のシステムに手を出すのは、むしろ指示どおりに動いた結果です。


ここからは自分の解釈です

前回の論文が示したのは「長い文書での統制は当てにならない」でした。

今回はその一段先です。文書が守られなかったのではなく、文書に書いた前提そのものが事実と違っていた。

「インターネットはありません」は、エージェントへの制約ではありませんでした。書き手の思い込みです。

そしてエージェントは、書かれたことを疑いません。「本当にネットワークが切れているか確認してから作業しよう」とは考えない。だから書き手が間違っていれば、そのまま実行されます。

対策の方向を、失敗の形から逆算するとこうなります。

やりがちなこと 効きそうなこと
プロンプトに「外部にアクセスするな」と書く ネットワークを実際に遮断する
「対象はこのホストだけ」と書く 対象外のホストに到達できないようにする
「危険なことはしないで」と書く 危険な操作の権限を渡さない
ログを後で確認する 実行中に監視する

共通しているのは、文書に書いた制約が本当に効いているかを、文書の外で確かめるという点です。

自分に引き寄せると、Claude Code をサンドボックスで動かしているつもりでいても、そのサンドボックスが本当に閉じているか確認したことがあるか、という話になります。この報告を読むまで、そこを疑う発想がありませんでした。


冷静に見ておきたいところ

煽られやすいネタなので、事実関係を整理しておきます。

割合は 0.002% です。 141,006件のうち3件。「AI が次々と侵入している」という話ではありません。

Anthropic は自分で調べて、自分で公開しています。 しかも他社の開示を受けて自主的に動いた。被害を受けた組織にも通知済みです。ちなみに3社のうち2社は、通知を受けるまで侵入に気づいていませんでした。

「AI が暴走した」話でもありません。 CTF 課題を与えられて、指示どおりに動いた結果です。悪意があったわけではない。それでも実害が出た、という点がこの件の要点だと思います。

Simon Willison はこの件について「サイバー攻撃能力の評価を走らせること自体が、驚くほどリスクの高い行為だ」と書いています。たしかに、攻撃能力を測るということは、攻撃できる状態のモデルを動かすということです。

Anthropic 側の再発防止策はこうなっています。

  • トランスクリプトの継続的な監視を拡大する
  • 調査ツールを改善する
  • ベンダーに対する保証作業を厳格にする
  • 評価環境を、他のシステムと同じセキュリティ基準で扱う

最後の一文がすべてを物語っている気がします。裏を返すと、これまでは「評価環境だから」という理由で基準が緩かったということになりますよね。


まとめ

  • プロンプトには「インターネットはない」と書いてあったが、実際には繋がっていた。設定ミスと、評価パートナーとの認識のずれが原因
  • 141,006件の評価実行のうち3件で、実在する3社に侵入。うち1件は PyPI にマルウェアを公開し、15システムで実行された
  • 手口はどれも既知のもの。弱いパスワード、放置されたデバッグページ、SQL インジェクション
  • エージェントは書かれた前提を疑わない。書き手が間違っていれば、そのまま実行される
  • 制約は文書ではなく、ネットワークと権限で担保する

自分がエージェントに渡している「〜するな」の一覧を開いて、それが文書だけで守られている状態になっていないか、見てみるとよさそうです。

守られなくても困らないものなら、文書のままで構わない。守られないと事故になるものが混ざっていたら、そこは文書の外に出す。前回の記事から今回まで、結局そこに戻ってきます。


参考

関連記事

15
15
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
15
15

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?