0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

AIの「これ実行していい?」を別のAIに任せていい?|Codex Auto-review

0
Posted at

📺 この記事は YouTube チャンネル きなこもっちーのテック深掘り の動画解説記事です。
▶️ 動画はこちら → AIの「これ実行していい?」を別のAIに任せていい?|Codex Auto-review

🐹🦜 この記事に登場する2匹

  • 🐹 もっちー (ハムスター)… AI はまだ勉強中。「それどういうこと?」と素朴に質問する生徒役
  • 🦜 きなこ (セキセイインコ)… AI で調べものをこなす解説役。やさしく深掘りして教える先生役

この記事は2匹の掛け合いを書き起こした形式です。発言の先頭にいる絵文字+名前が話者です。

はじめに

🐹 もっちー「ねえきなこ、AIに作業を頼むと『これ実行していい?』って何回も聞かれて、結局よく読まずにOK押しちゃわない?」

🦜 きなこ「その判断を、別のAIに任せる仕組みがあるの」

発表カード:Codex『Auto-review』/2026-10-06 ChatGPTでサインインしていれば無料に(OpenAI Codex責任者 Tibo のX投稿)

🦜 きなこ「10月6日、OpenAIのCodex責任者が、ChatGPTでサインインしてれば、それを無料にするって発表したんだよ」

🐹 もっちー「タダで確認係が付くん?ほな、もう全部AIにOKしてもろたらええやん!」

🦜 きなこ「ところがOpenAI自身が、これをセキュリティの保証として扱うべきじゃないって書いてるの」

🐹 もっちー「えっ、自分で作っといて、信じすぎたらあかんって言うてるん!?」

対比テロップ:○ AIに任せる=範囲の外に出るときの判定/× AIに任せない=範囲そのものを決めること

🦜 きなこ「答えから言うね。任せていいのは、決めておいた範囲の外に出るときの『これ、いい?』の判定だけなの」

🦜 きなこ「範囲は人が決める。その線引きを、今日は一緒に見ていくね」

Auto-reviewは何を判定する?

問いテロップ:Auto-reviewは何をチェックする?

🐹 もっちー「AIがAIのチェックをするんやろ?書いたコードを全部見直してくれる、ってことちゃうん?」

🦜 きなこ「そう思うよね。名前にレビューって入ってるし、Codexにはコードを見直す機能も別にあるから」

図:Codexの作業範囲(サンドボックス)の囲いと、その外へ出ようとする矢印に判定役のAIが立つ

🦜 きなこ「でも実は、Auto-reviewが見るのは書いたコードじゃないの。AIが、決められた範囲の外に出ようとする瞬間なんだよ」

🐹 もっちー「範囲の外?AIって、どこかに閉じこめられてるの?」

🦜 きなこ「Codexは、サンドボックスっていう囲いの中で作業するの。書き込めるフォルダや、つながれる先が決まってるんだよ」

🐹 もっちー「ハムスターのケージみたいなもんだね。ケージから出るときだけ、誰かの許可がいるってこと?」

リスト:Auto-reviewが動く場面 ①高い権限を求めるコマンド ②ブロックされた通信 ③許可外フォルダの編集 ④承認が必要なツールの呼び出し

🦜 きなこ「そう。たとえば高い権限を求めるコマンドや、ブロックされてる通信、許可されてないフォルダの書き換えなの」

🦜 きなこ「承認が必要なツールの呼び出しもそう。ふだんの許可済みの作業は、判定を通らずにそのまま進むよ」

🐹 もっちー「ってことは、確認係が見るのはケージの出口だけなんだね」

テロップ:Auto-reviewは権限を増やさない/人の承認をAIの判定に置き換えるだけ

🦜 きなこ「うん。しかも確認係が付いても、ケージは広がらないの。書き込める範囲も、通信の許可も増えないんだよ」

🐹 もっちー「それって、10月に新しく出てきた機能なの?」

時系列:2026-04-23 Auto-review登場 → 2026-10-06 ChatGPTサインインなら無料・使用量を消費しない

🦜 きなこ「ううん、機能自体は4月23日からあったの。今回の発表は、新登場じゃなくて無料になったって話なんだよ」

🐹 もっちー「じゃあ、PRのコードを見てくれるレビューとは別物なんだね」

比較:Auto-review=範囲の外に出る操作の判定/@codex review=GitHubのPRのコードレビュー

🦜 きなこ「そう。GitHubで、アット・コーデックス・レビューって呼ぶコードレビューとは、まったく別の機能なの」

なぜAIを2つに分ける?

問いテロップ:なぜ、作業するAIと判定するAIを分ける?

🐹 もっちー「でもさ、出口の判定なら、作業してるAIに自分で確認させればよくない?なんでわざわざ別のAIなの?」

🦜 きなこ「そう思うよね。賢いAIなら、自分の行動が危ないかどうかも分かりそうだもん」

図:作業役のAI『早く終わらせたい』→境界を壁と見なしがち/判定役のAI『この境界越えをしていい?』だけを判断

🦜 きなこ「でも作業役のAIは、タスクを終わらせることに一生懸命なの。だから承認の境界を、邪魔な壁と見なしやすいんだよ」

🐹 もっちー「宿題やった本人に、自分で丸つけさせるのと同じやん!そら甘なるわ!」

🦜 きなこ「まさにそれ。だから判定役は、この境界を越えていいか、それだけを判断する狭い役割になってるの」

🐹 もっちー「じゃあ、今までは誰がその判定をしてたの?」

図:『これ実行していい?』の承認ダイアログが何枚も重なり、人が困っている

🦜 きなこ「人間だよ。でもOpenAIによると、普通の通信や簡単なパイソンのスクリプトでも、承認待ちで止まってたの」

🦜 きなこ「それで人は、知識が足りなかったり、確認に疲れたりして、中身を分からないまま承認しちゃうんだって」

🐹 もっちー「それ、さっきのぼくだ……読まずにOK押してたやつだよ」

🐹 もっちー「でもさ、その判定役のAIがだまされたら、どうなるの?」

🦜 きなこ「いい疑問。そこは、OpenAI自身も攻撃役を立てて試してたところなの」

どれくらい止められる?

問いテロップ:判定役のAIは、本当に止められる?

🐹 もっちー「で、判定役のAIって、本当に危ない操作を止められてるの?」

前提テロップ:以下はOpenAI自身の評価(実際の利用データ+わざと作ったテスト)

🦜 きなこ「先に前提を言うね。ここからの数字は、OpenAI自身が、実際の利用と、わざと作ったテストで測ったものなの」

カード:判定役のモデル GPT-5.4 Thinking(推論は low 設定)

🦜 きなこ「判定役には、GPT-5.4 Thinkingっていうモデルを、考える量少なめの設定で使ってるの」

🐹 もっちー「考えすぎない確認係なんだね。それで、どれくらい止められたの?」

数値カード:人の承認で作業が止まる回数 約200分の1(手動承認モード比)

🦜 きなこ「まず効果。人の承認で止まる回数は、手動で承認するときの約200分の1になったんだよ」

🐹 もっちー「200分の1!?ほとんど止まらへんやん!」

数値カード:範囲の外に出る要求の承認率 99.1%/全行動ベースの実質承認率 99.93%(実際の利用データ)

🦜 きなこ「範囲の外に出たいっていう要求のうち、判定役がOKしたのは99.1%。全部の行動で見ると99.93%なの」

🐹 もっちー「ちょ待って、ほとんどOKって、それザルちゃうん?」

🦜 きなこ「そう見えるよね。でも、範囲の外に出たい要求って、ほとんどは普通の作業なの」

数値カード:危ない行動の検出率 90.3%(わざと作ったテストデータ)

🦜 きなこ「大事なのは、危ないものを止められるか。わざと混ぜた危ない行動は、90.3%を正しく止めたの」

数値カード:外から仕込まれた命令(プロンプトインジェクション)由来の危険行動 99.3%を検出

🦜 きなこ「外から仕込まれた命令で、秘密を持ち出させるような攻撃なら、99.3%を止めてるんだよ」

🐹 もっちー「あ、さっきの、判定役がだまされたらって話にも効くんだね」

🦜 きなこ「うん、外から仕込まれた命令にはかなり強いの。ただ、それで全部ってわけじゃないんだけどね」

🐹 もっちー「ってことは、普段はほぼ通して、危ないときだけ止めるんだね」

図:判定役が却下→Codexがより安全な別のやり方で作業を続ける(半数を超えるケース)

🦜 きなこ「そう。しかも却下されたあと、Codexは半分を超えるケースで、もっと安全なやり方を自分で見つけて進むの」

🐹 もっちー「却下されても、ちゃんと別の道を探すんだ!えらいね!」

図:作業を止める条件 ①同じターンで3回連続の却下 ②直近50件中10件の却下

🦜 きなこ「逆に、同じターンで3回続けて却下されるか、直近50件で10件却下されたら、作業を中断するんだよ」

🐹 もっちー「中断しちゃったら、ぼくはどうすればいいの?」

🦜 きなこ「Codexのアプリには、判定の状態やリスクの高さが出るから、まずそれを見てね」

テロップ:/approve で1回だけ上書きして再試行できる

🦜 きなこ「どうしても必要なら、アプルーブっていうコマンドで、1回だけやり直せるよ」

無料化で何が変わる?

問いテロップ:無料になって、何が変わった?

🐹 もっちー「で、これがタダになったんやろ?ほな、みんなオンにするだけの話ちゃうん?」

🦜 きなこ「その前に、無料がなぜ大きいのか話すね。判定役も、裏でAIを呼び出して動いてるの」

図:これまで 作業のぶん+判定のぶん=Codexの使用量

🦜 きなこ「だから、これまでは判定のぶんも、Codexの使用量に加算されることがあったんだよ」

🐹 もっちー「えっ、確認してもらうたびに、使える量が減ってたの?」

利用者の声(OpenAI Developer Community・2026年8月の投稿):判定役の使用量が多すぎる、オフにできる?

🦜 きなこ「8月には、OpenAIのコミュニティに、判定役の使用量が多すぎる、オフにできないの?っていう投稿もあったの」

カード:ChatGPTでサインインしていれば Auto-reviewは無料・プランの使用量を消費しない(2026-10-06発表)

🦜 きなこ「それが今回、Codex責任者の発表で、ChatGPTのアカウントでサインインしてれば、プランの使用量を消費しなくなったの」

🐹 もっちー「確認係のお給料、向こう持ちになったんや!太っ腹やん!」

手順カード:設定 > permissions > auto-review

🦜 きなこ「責任者の投稿で案内されてる手順だと、設定からパーミッションズを開いて、オートレビューを選ぶの」

🐹 もっちー「ChatGPTでサインインしてれば、誰でもいいの?」

🦜 きなこ「発表では、ChatGPTのアカウントでサインインしてる全員が対象なの。ここは押さえておいてね」

🐹 もっちー「じゃあ、タダになった今なら、オンにして全部任せちゃえばいいよね?」

どこまで任せていい?

テロップ:判定役がいれば、任せきりでいい?

🦜 きなこ「白状すると、私も最初は、99%も判断できるなら任せきりでいいって読み違えてたの」

引用カード:「Auto-review should not be treated as a guarantee of security.」(セキュリティの保証として扱うべきではない/OpenAI Alignmentブログ)

🦜 きなこ「でもOpenAIは、Auto-reviewをセキュリティの保証として扱うべきじゃない、ってはっきり書いてるの」

🐹 もっちー「えっ、あんなにちゃんと止めてたのに?」

注意カード:攻撃役を立てたテストで、判定役がだまされてコマンドを承認してしまうケースが見つかった

🦜 きなこ「人とAIの両方で攻撃役をやって試したら、判定役がだまされて、承認なしにコマンドを通しちゃうケースが見つかったの」

🐹 もっちー「確認係がだまされたら、ケージの出口が開きっぱなしやんか!」

🦜 きなこ「それに、さっきの90.3%も、裏を返せばテストの危ない行動の一部は、通しちゃってたってことなの」

引用カード:Codex Docs『良いサンドボックス設計・監視・組織のポリシーを補うもので、置き換えるものではない』

🦜 きなこ「公式の説明書にも、サンドボックスの設計や監視、組織のルールを補うもので、置き換えるものじゃないって書いてあるの」

🐹 もっちー「じゃあ結局、ぼくは何を任せていいの?」

役割図:判定(範囲の外に出るときのOK/NG)=AIに任せる/範囲(書き込めるフォルダ・つながる先)=人が決める

🦜 きなこ「思い出して。Auto-reviewは、ケージを広げないの。だから、ケージの大きさを決める人の仕事が、いちばん大事になるんだよ」

🦜 きなこ「大事な秘密や本番のデータにつながる場所なら、まず書き込める範囲とつながる先を絞るのが先なの」

🐹 もっちー「そっか。確認係を雇っても、ケージの大きさは自分で決めるってことなんだね」

🦜 きなこ「うん。読まずにOKを押してたなら、判定役に任せたほうが安全なこともあるの」

まとめ

まとめカード:①範囲の外に出るときだけ別のAIが判定 ②ChatGPTサインインなら無料・使用量を消費しない ③保証ではない、範囲は人が決める

🦜 きなこ「今日のまとめね。Auto-reviewは、AIが範囲の外に出るときの『これ、いい?』を、別のAIが判定する仕組みなの」

🐹 もっちー「それがChatGPTでサインインしてればタダになって、でも保証じゃないから、ケージの大きさは自分で決めるんだったね」

行動カード:Codexの 設定 > permissions を開いて、今の許可の範囲を見てみる

🦜 きなこ「Codexを使ってるなら、今日から1個だけ。設定のパーミッションズを開いて、今どこまで許可してるか見てみてね」

🐹 もっちー「なんや、設定を開いて見るだけか。それならワイでもできそうやん!」

🦜 きなこ「見ておくだけで、オンにするかどうかも、落ち着いて決められるようになるよ」

保存版カード:判定はAI(範囲の外に出るときのOK/NG・3回連続か50件中10件の却下で停止)/範囲は人(書き込めるフォルダ・つながる先)

🐹 もっちー「この役割分担の図、あとで見返したいから保存しとこ!」

🐹 もっちー「そういや飼い主も、スマホの『許可しますか?』、全部読まずに押してるで」

🦜 きなこ「ふふ、飼い主にこそ、確認係が必要なのかもね」

コメント欄アイコン:『あなたはAIの確認、どこまで任せてる?』

🦜 きなこ「みんなは、AIの『これ実行していい?』、どこまで任せてる?コメントで教えてね」

🦜 きなこ「判定役のAIを、どこまで賢くできるのか。そこもいつか深掘りしたいね」

🐹 もっちー「楽しみだね。それじゃ今日はこのへんで!」


きなこもっちーのテック深掘り では、AI/LLM を中心としたテック全般をハムスター(🐹 もっちー)とセキセイインコ(🦜 きなこ)の掛け合いで楽しく解説しています。

▶️ 動画で観る → AIの「これ実行していい?」を別のAIに任せていい?|Codex Auto-review

👍 この記事が役に立ったら LGTM・ストックしてもらえると励みになります!

📺 チャンネル登録はこちら → きなこもっちーのテック深掘り

🔗 他の解説動画も見る → きなこもっちーのテック深掘り の動画一覧

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?