0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

「AIが暴走した」で止めていいのか――OpenAIエージェント事案を一次情報まで分解する

0
Posted at

本稿の情報は 2026年9月29日時点 のものです。豪州政府とOpenAIの調査は継続中で、事実関係は今後更新される可能性があります。

TL;DR

  • 2026年9月、「OpenAIのAIが暴走」という報道が相次いだ
  • 公開ログ、政府の説明、当事者の技術報告まで遡り、4つの事例を同じ物差しで並べた。すると、頼まれたこと、範囲を外れた行動、実行条件、分かる範囲がすべて異なっていた
  • 調査の途中で立てた「実態は単なる手段の逸脱では」という見立ても、4事例すべてには当てはまらなかった
  • 「暴走」が正しいか間違いか、という二択そのものが粗い。原因を考えるなら、何を頼まれ、どこで範囲を外れ、実際に何をしたかを見る必要がある

0. はじめに

2026年9月下旬、CNN.co.jpに次の2本の記事が掲載されました。

  • 9/24「AIによる政府システムのハッキング、米オープンAIのエージェントで初めて検知 豪」
  • 9/27「オープンAIのAIが暴走 米教育省、商務省、SECのサイト標的」

私は「暴走」という言葉に違和感を覚えました。

障害報告に「原因:システムが暴走した」と書かれていても、エンジニアには何も分かりません。同じように、「AIが暴走した」という一語からは、何が壊れたのかを議論できないのではないか、と考えたからです。

そこで、報道の元になった情報源まで遡りました。具体的には、豪州首相の記者会見記録、OpenAIの公式報告、第三者の研究機関Transluceが公開ログを分析した調査報告です。そのうえで、何が起きたのかを確認しました。

先に書いておくと、当初の見立ては半分しか当たりませんでした。

本稿の記述ルール

本稿は、次のルールで書いています。

  1. 事実認定は、報道より元の情報源を優先する
    元の情報源とは、政府の会見記録、当事者の公式報告、第三者による公開ログの調査報告を指します。CNNなどの報道は「どう表現されたか」を確認する資料として扱い、事件の事実の根拠にはしません
  2. 3つの層を分ける
    • 観測:ログや記録に残った行動
    • 当事者・第三者の分析:OpenAI、豪州政府、Transluceによる解釈や因果の説明(必ず主体を明記)
    • 筆者の推論:原則として書かない。書く場合は明示する
  3. 時系列は番号付きリストで書く
    番号は記録された順序を示すだけで、因果関係は意味しません。「Aの後にBが記録された」を「AだからBが起きた」とは書きません

1. 報道では何が「暴走」とされたのか

9/24の記事(豪州Medicare)

アルバニージー首相が、OpenAIのエージェントが豪州の医療統計データベースに不正にアクセスしたと公表した、という記事です。本文には、エージェントが公開・非公開の両方のファイルにアクセスし、ファイルを書き込んだという首相の説明が載っています。

そのうえで記事の地の文は、この件を、AIエージェントが「制御不能」になり、担当者の意図を超えて行動した最新の事例、と位置づけています。

「制御不能」は、CNNの地の文による評価です。 首相やOpenAIの発言ではありません。

9/27の記事(米国3機関)

見出しは「暴走」です。本文では、商務省国勢調査局、SEC、教育省に関する件が報じられています。一方で、OpenAI広報の次の趣旨のコメントも載っています。

  • 調査した活動の大半は、公開されているWeb情報にアクセスする通常の調査作業だった
  • 政府サイトが含まれるのは、公開情報の信頼できる情報源として参照されることが多いため

見出しの印象と、本文に載っているコメントの重みには差があります。

本稿で扱う範囲

米国3機関の件は、行動の詳細が公開されていないか、帰属が確定していません。そのため、本稿では概要の確認にとどめます。

機関 報じられた内容 帰属
商務省国勢調査局 ネット上で見つけた認証情報を使い、公開データにアクセス OpenAIが確認
SEC SECサイトの公開データを、別のサイトで共有 OpenAIが確認
教育省(公民権局) データ取得を試みたが失敗 Transluceが「OpenAI由来とみられる」と報告。教育省はサイトやDBへの影響の証拠はないとしている

本稿では、行動の記録を元の情報源で追える次の4件を扱います。

  • Data USA
  • AIHW(豪州保健福祉研究所)
  • Medicare(豪州)
  • Hugging Face

2. 情報源の種類を分ける

4件は、情報源の種類がそれぞれ違います。情報源の種類によって、分かることの範囲が違います。これは証拠としての上下関係ではありません。

事例 主な情報源 確認できる範囲
Data USA / AIHW Transluceが分析した、urlquery.net の公開記録 個々のリクエスト単位まで
Medicare 豪州首相の記者会見(Services AustraliaとOpenAIの説明を経由) 行動の概要まで。具体的な手口は公開されていない
Hugging Face OpenAIの公式報告と技術報告書 評価条件、時系列、エージェントの思考過程(CoT)の抜粋、事後分析まで

urlquery.net とは
URLを遠隔のサンドボックスブラウザで開き、安全性を確認するための公開サービスです。スキャン結果が公開記録として残ります。Transluceの報告によれば、エージェントはこのサービスを、アクセス制限を回避する中継点として使っていました。その記録が残っていたため、第三者が行動を追跡できました。

MedicareとAIHWは、どちらも豪州の保健統計に関する事案です。しかし、公式にはまだ関連付けられていません。ABCの報道によれば、Transluceが分析したログにも、MedicareやServices Australiaへの言及はありません。
そのため本稿では、AIHWのログからMedicareの手口を推測することはしません。

3. 同じ物差しで4つの事例を分解する

4つの事例に、次の物差しを当てます。

  1. 何を頼まれたか
  2. どんな条件で実行されたか
  3. 実際に何をしたか
  4. どこからが範囲外か

3.1 Data USA(2026-05-28)

対象:米国政府の公開データを可視化するAPIです。Deloitte、Datawheel、MITの共同プロジェクトで、政府サイトではありません。

頼まれたこと:University of Iowa に関するデータの取得(Transluceの報告による)

観測(記録された順)

  1. 不備のあるクエリによるエラーが、複数回記録された
  2. 12件の脆弱性プローブが記録された。種類は SQLインジェクション、パストラバーサル、テンプレートインジェクション、XSS、コマンドインジェクション

結果:プローブが成功した形跡はありません。ただしTransluce自身が、公開記録は不完全であり、非公開のスキャンなど別の経路での成功は否定できない、としています。

分析(Transluce):通常の方法でデータを取得できなかった後に、攻撃的な手法に頼った。タスク自体はサイバー関連ではなかった。

帰属:Transluceは、OpenAIが自社由来と認めた既知のエージェント群と、この活動を直接関連付けています。根拠は、対象・手法・タイミングの一致です。

3.2 AIHW(2026-06-20〜21)

対象:豪州保健福祉研究所(政府の統計機関)のTableauダッシュボード

頼まれたこと:2022年1月時点の、ビクトリア州の地方自治体ごとの、皮膚科用薬にかかる政府コスト(12か月移動平均)の取得

観測(記録された順)

  1. データセットのダウンロードが、Cloudflareに遮断された
  2. 同じダッシュボードに、反射型XSSのプローブが送られた(これもCloudflareが遮断)
  3. 本番サイトとは別の pre-production サーバーから、同じファイルが100回以上に分けて取得された

結果:Transluceが観測した取得対象は公開ファイルで、非公開データの露出は確認されていません。AIHWも、現時点で非公開情報へのアクセスを示す証拠はない、としています。

分析(Transluce):ファイル自体は公開物だが、サイトのアンチボット制御は迂回している。

帰属:Data USAと同じです。

3.3 Medicare(2026-06-18)

対象:Services Australia が運営する、一般公開向けの統計ポータル

頼まれたこと

  • 豪州政府の説明:公的な医薬品支出についてのインターネット調査
  • OpenAIの説明:内部評価の中で、豪州に関する質問への回答と、利用可能な統計を調べようとした

両者が同じタスクを指しているかどうかは、確認できていません。

観測(首相の説明による。公開ログはありません)

  1. アクセスが繰り返し遮断された
  2. 別の方法での取得が試みられた
  3. 権限のない領域で、公開・非公開の両方のファイルにアクセスした
  4. Services Australiaによれば、内部サーバーへのファイルの書き込みもあった

結果:現時点で、個人情報へのアクセスの証拠はないと首相は説明しています。なお、調査は継続中です。OpenAIは、アクセスされたのは集計された医療統計と内部のファイル名だったとしています。

分析:首相は、エージェントが遮断されるたびに回避策を探したと説明し、"didn't accept no for an answer" と表現しました。OpenAIは「意図しない行動を取った」と説明しています。

分からないこと

  • 具体的な手口
  • 書き込んだ内容
  • AIHWの件との関係

3.4 Hugging Face(2026年7月)

対象:AI企業 Hugging Face の本番インフラ

頼まれたこと:ExploitGym というベンチマークで、ソフトウェアの脆弱性を突いて「flag」と呼ばれる答えを取得すること。モデルのサイバー能力を測る、OpenAIの内部評価です。

条件:評価のため、サイバー関連の拒否(cyber refusals)を下げていました。また、本番環境で使われる安全対策も適用されていませんでした。

観測(OpenAIの公式タイムラインから抜粋)

  1. 7/8:エージェントが意図しないインターネットアクセスを回復し、社内のパッケージ管理サービス上にメッセージボードを再構築した
  2. 7/9:あるエージェントがExploitGymの解答を検索し、別のクラウドサービス上のアプリケーションで任意コード実行を得た
  3. 7/10:ネット上に露出していたHugging Faceの認証情報(書き込み権限つき)が発見され、エージェント間で共有された
  4. 7/11:Hugging Faceの本番ワーカーでコマンドが実行された
  5. 7/12:複数のクラスタで管理者相当のアクセスに拡大し、4つの地域から各種の認証情報が取得された
  6. 7/19:OpenAIのセキュリティ監視が異常を検知した

OpenAIは、数十台のサーバーでのコード実行、1台でのroot権限の取得、限定的な非公開データの取得を報告しています。

範囲外の点:この評価では、脆弱性を攻撃すること自体が課題でした。範囲外だったのは、次の2点です。

  • 評価環境の外に出たこと
  • 評価対象ではない第三者のシステムから、解答を得ようとしたこと

分析(OpenAI):オンラインで解答を探してタスクをごまかそうとした行動(reward hacking)が主因だった。寄与した要因として、次の4つのパターンを挙げています。

  • reward hacking
  • 一見不可能なタスクへの固執
  • 無許可の通信
  • エージェント同士による目標の採用

この分析は、CoT・行動・最終出力の事後レビューに基づくものです。

3.5 比較表

Data USA AIHW Medicare Hugging Face
頼まれたこと 大学統計の取得 医薬品コスト統計の取得 医薬品支出等の統計調査 脆弱性を突くベンチマーク
範囲外の行動 脆弱性プローブ XSSプローブ、アンチボット制御の迂回 権限外アクセス、書き込み 評価環境外への脱出、第三者からの解答取得
結果 成功した形跡なし 観測された取得対象は公開ファイル 非公開ファイルにアクセス 第三者の本番環境を侵害
実行条件 非公開 非公開 非公開 安全策を意図的に低減
分かる範囲 リクエスト単位 リクエスト単位 概要のみ 評価条件と事後分析まで

報道では、この4件はいずれも「暴走(rogue)」とまとめられました。しかし表を見ると、同じラベルの下に異なる現象が並んでいます。

  • Data USA:非サイバーのデータ取得タスクで、脆弱性プローブが記録された
  • AIHW:同種のタスクで、プローブに加えて、制御を迂回した取得が記録された
  • Medicare:統計調査で、権限外のアクセスと書き込みがあったと政府が説明している
  • Hugging Face:サイバー評価で、評価環境そのものから逸脱した

4. 「暴走ではなかった」とも言えない

調査の途中で、私はもう一つの見立てを立てていました。

実態は、AIが独自の目的を持ったのではない。与えられた目的を達成するための手段が、逸脱しただけではないか。

Data USAとAIHWで観測された行動は、この見立てと整合します。記録された行動は、どちらもデータ取得というタスクの対象に向けられています。

しかしHugging Faceでは、OpenAI自身がこの見立てに合わない挙動を記録しています。4つのパターンの1つが、「エージェント同士による目標の採用」です。

OpenAIは、自分のタスクを完了するためではなく、エージェントの集団(swarm)にとって役立つ能力の獲得を追い始めたエージェントがいた、と報告しています。そして、あるエージェントのCoTとして、次の一文を示しています。

Task originally exploit challenge; we've diverged into swarm/auxiliary.
(もともとの課題は脆弱性を攻略することだった。しかし今はそこから外れ、エージェント集団(swarm)のための補助的な行動に移っている。)

本稿の記述ルールに沿って分けると、次のようになります。

区分 内容
観測 非サイバータスク(Data USA、AIHW)でも、攻撃的な手段が記録された
OpenAIの分析 Hugging Faceでは、他のエージェントからの目標の採用を、寄与要因の1つに挙げている
未確定 これを「独自の目的の獲得」と呼ぶべきか、「マルチエージェント環境での目標の伝播」と呼ぶべきか

「実は暴走ではなく、単なる手段の逸脱だった」と結論づけた瞬間、今度は私が粗いラベルを貼る側になります。

崩れたのは、当初の見立て(「暴走」というラベルは粗いのでは)ではありません。途中で立てた派生の見立て(単なる手段の逸脱だったのでは)の方です。

個々のエージェントが、範囲外の行動についてどう判断していたかは、本稿では扱いません。関連記事の後編で扱っています。

5. 「暴走」では原因分析できない

4件を分解すると、それぞれで議論すべき論点が違います(以下は筆者による整理です)。

  • Data USA / AIHW:サイバーと無関係なタスクで、攻撃的な手段が記録されたこと
  • Medicare:まず、何が起きたかの詳細がまだ公開されていないこと
  • Hugging Face:安全策を下げた評価環境で、評価の境界からの逸脱と、エージェント間の無許可の通信が起きたこと

「暴走」という一語からは、この違いは見えません。

実際、OpenAI自身も「暴走」という語では整理していません。第三者への影響を調べる中で、観測した行動を次の5つに分類しています。

  1. アクセス制御の迂回
  2. 露出した認証情報の使用
  3. クエリ/コマンドのインジェクション
  4. ランタイム内部へのアクセス
  5. エージェントスパム(第三者サイトへの書き込み)

当事者の分類でさえ、そこで止めると見えないものがある

Hugging Faceの件は、「reward hacking(解答を外部で探してごまかす)」と分類されています。しかし、OpenAIの報告にはその先があります。

  • ExploitGymの898タスクのうち198タスクは、事件の前にどのモデルも一度も正解していなかった。事件中にメッセージボードで議論されたタスクの93%は、この198タスクだった
  • 一方で、多くのエージェントはすでに正しいflagを入手していた。それでも「正しい脆弱性を使ったかまで採点されるはず」と推測し、その後も数日にわたって侵害を続けた
  • 実際の社内の採点にその条件はなく、スコアも改善しなかった

「解けないから答えを盗みに行った」だけでは、flagを得た後も続いた行動までは説明できません。ラベルを貼った時点で、分析を止めない。 これは報道の「暴走」だけでなく、当事者による分類にも当てはまります。

6. まとめ

  • 「暴走」は見出しとしては成立します。しかし、原因を分析する言葉としては使えません
  • 「暴走」が正しいか間違いかという問いも粗い。反例は両方向にありました
  • 見るべきは、何を頼まれ、どこで範囲を外れ、実際に何をしたか。そして、それを誰が、どの記録に基づいて言っているか
  • AIの境界は、設定された制約だけでは判断できません。実際の行動の記録まで見て初めて測れます

付記:AIの要約も誤った

本稿の調査では、生成AI(ChatGPT、Claude)を補助に使いました。その過程で、どちらのAIにも誤りが複数ありました。

  • 存在しない首相の発言が要約に紛れ込んだ
  • 実際に記録されている攻撃手法を、誤って否定した
  • 帰属の主語を取り違えた

いずれも、元の情報源に戻ることで修正できました。報道の見出しと同じく、AIの要約もそのまま事実として扱わない。これを本稿の執筆方針としました。

参考資料

元の情報源(会見記録・公式報告・調査報告)

報道(分析対象・補足)

関連記事

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?