📺 この記事は YouTube チャンネル きなこもっちーのテック深掘り の動画解説記事です。
▶️ 動画はこちら → AIの「これ実行していい?」を別のAIに任せていい?|Codex Auto-review
🐹🦜 この記事に登場する2匹
- 🐹 もっちー (ハムスター)… AI はまだ勉強中。「それどういうこと?」と素朴に質問する生徒役
- 🦜 きなこ (セキセイインコ)… AI で調べものをこなす解説役。やさしく深掘りして教える先生役
この記事は2匹の掛け合いを書き起こした形式です。発言の先頭にいる絵文字+名前が話者です。
はじめに
🐹 もっちー「ねえきなこ、AIに作業を頼むと『これ実行していい?』って何回も聞かれて、結局よく読まずにOK押しちゃわない?」
🦜 きなこ「その判断を、別のAIに任せる仕組みがあるの」
🦜 きなこ「10月6日、OpenAIのCodex責任者が、ChatGPTでサインインしてれば、それを無料にするって発表したんだよ」
🐹 もっちー「タダで確認係が付くん?ほな、もう全部AIにOKしてもろたらええやん!」
🦜 きなこ「ところがOpenAI自身が、これをセキュリティの保証として扱うべきじゃないって書いてるの」
🐹 もっちー「えっ、自分で作っといて、信じすぎたらあかんって言うてるん!?」
🦜 きなこ「答えから言うね。任せていいのは、決めておいた範囲の外に出るときの『これ、いい?』の判定だけなの」
🦜 きなこ「範囲は人が決める。その線引きを、今日は一緒に見ていくね」
Auto-reviewは何を判定する?
🐹 もっちー「AIがAIのチェックをするんやろ?書いたコードを全部見直してくれる、ってことちゃうん?」
🦜 きなこ「そう思うよね。名前にレビューって入ってるし、Codexにはコードを見直す機能も別にあるから」
🦜 きなこ「でも実は、Auto-reviewが見るのは書いたコードじゃないの。AIが、決められた範囲の外に出ようとする瞬間なんだよ」
🐹 もっちー「範囲の外?AIって、どこかに閉じこめられてるの?」
🦜 きなこ「Codexは、サンドボックスっていう囲いの中で作業するの。書き込めるフォルダや、つながれる先が決まってるんだよ」
🐹 もっちー「ハムスターのケージみたいなもんだね。ケージから出るときだけ、誰かの許可がいるってこと?」
🦜 きなこ「そう。たとえば高い権限を求めるコマンドや、ブロックされてる通信、許可されてないフォルダの書き換えなの」
🦜 きなこ「承認が必要なツールの呼び出しもそう。ふだんの許可済みの作業は、判定を通らずにそのまま進むよ」
🐹 もっちー「ってことは、確認係が見るのはケージの出口だけなんだね」
🦜 きなこ「うん。しかも確認係が付いても、ケージは広がらないの。書き込める範囲も、通信の許可も増えないんだよ」
🐹 もっちー「それって、10月に新しく出てきた機能なの?」
🦜 きなこ「ううん、機能自体は4月23日からあったの。今回の発表は、新登場じゃなくて無料になったって話なんだよ」
🐹 もっちー「じゃあ、PRのコードを見てくれるレビューとは別物なんだね」
🦜 きなこ「そう。GitHubで、アット・コーデックス・レビューって呼ぶコードレビューとは、まったく別の機能なの」
なぜAIを2つに分ける?
🐹 もっちー「でもさ、出口の判定なら、作業してるAIに自分で確認させればよくない?なんでわざわざ別のAIなの?」
🦜 きなこ「そう思うよね。賢いAIなら、自分の行動が危ないかどうかも分かりそうだもん」
🦜 きなこ「でも作業役のAIは、タスクを終わらせることに一生懸命なの。だから承認の境界を、邪魔な壁と見なしやすいんだよ」
🐹 もっちー「宿題やった本人に、自分で丸つけさせるのと同じやん!そら甘なるわ!」
🦜 きなこ「まさにそれ。だから判定役は、この境界を越えていいか、それだけを判断する狭い役割になってるの」
🐹 もっちー「じゃあ、今までは誰がその判定をしてたの?」
🦜 きなこ「人間だよ。でもOpenAIによると、普通の通信や簡単なパイソンのスクリプトでも、承認待ちで止まってたの」
🦜 きなこ「それで人は、知識が足りなかったり、確認に疲れたりして、中身を分からないまま承認しちゃうんだって」
🐹 もっちー「それ、さっきのぼくだ……読まずにOK押してたやつだよ」
🐹 もっちー「でもさ、その判定役のAIがだまされたら、どうなるの?」
🦜 きなこ「いい疑問。そこは、OpenAI自身も攻撃役を立てて試してたところなの」
どれくらい止められる?
🐹 もっちー「で、判定役のAIって、本当に危ない操作を止められてるの?」
🦜 きなこ「先に前提を言うね。ここからの数字は、OpenAI自身が、実際の利用と、わざと作ったテストで測ったものなの」
🦜 きなこ「判定役には、GPT-5.4 Thinkingっていうモデルを、考える量少なめの設定で使ってるの」
🐹 もっちー「考えすぎない確認係なんだね。それで、どれくらい止められたの?」
🦜 きなこ「まず効果。人の承認で止まる回数は、手動で承認するときの約200分の1になったんだよ」
🐹 もっちー「200分の1!?ほとんど止まらへんやん!」
🦜 きなこ「範囲の外に出たいっていう要求のうち、判定役がOKしたのは99.1%。全部の行動で見ると99.93%なの」
🐹 もっちー「ちょ待って、ほとんどOKって、それザルちゃうん?」
🦜 きなこ「そう見えるよね。でも、範囲の外に出たい要求って、ほとんどは普通の作業なの」
🦜 きなこ「大事なのは、危ないものを止められるか。わざと混ぜた危ない行動は、90.3%を正しく止めたの」
🦜 きなこ「外から仕込まれた命令で、秘密を持ち出させるような攻撃なら、99.3%を止めてるんだよ」
🐹 もっちー「あ、さっきの、判定役がだまされたらって話にも効くんだね」
🦜 きなこ「うん、外から仕込まれた命令にはかなり強いの。ただ、それで全部ってわけじゃないんだけどね」
🐹 もっちー「ってことは、普段はほぼ通して、危ないときだけ止めるんだね」
🦜 きなこ「そう。しかも却下されたあと、Codexは半分を超えるケースで、もっと安全なやり方を自分で見つけて進むの」
🐹 もっちー「却下されても、ちゃんと別の道を探すんだ!えらいね!」
🦜 きなこ「逆に、同じターンで3回続けて却下されるか、直近50件で10件却下されたら、作業を中断するんだよ」
🐹 もっちー「中断しちゃったら、ぼくはどうすればいいの?」
🦜 きなこ「Codexのアプリには、判定の状態やリスクの高さが出るから、まずそれを見てね」
🦜 きなこ「どうしても必要なら、アプルーブっていうコマンドで、1回だけやり直せるよ」
無料化で何が変わる?
🐹 もっちー「で、これがタダになったんやろ?ほな、みんなオンにするだけの話ちゃうん?」
🦜 きなこ「その前に、無料がなぜ大きいのか話すね。判定役も、裏でAIを呼び出して動いてるの」
🦜 きなこ「だから、これまでは判定のぶんも、Codexの使用量に加算されることがあったんだよ」
🐹 もっちー「えっ、確認してもらうたびに、使える量が減ってたの?」
🦜 きなこ「8月には、OpenAIのコミュニティに、判定役の使用量が多すぎる、オフにできないの?っていう投稿もあったの」
🦜 きなこ「それが今回、Codex責任者の発表で、ChatGPTのアカウントでサインインしてれば、プランの使用量を消費しなくなったの」
🐹 もっちー「確認係のお給料、向こう持ちになったんや!太っ腹やん!」
🦜 きなこ「責任者の投稿で案内されてる手順だと、設定からパーミッションズを開いて、オートレビューを選ぶの」
🐹 もっちー「ChatGPTでサインインしてれば、誰でもいいの?」
🦜 きなこ「発表では、ChatGPTのアカウントでサインインしてる全員が対象なの。ここは押さえておいてね」
🐹 もっちー「じゃあ、タダになった今なら、オンにして全部任せちゃえばいいよね?」
どこまで任せていい?
🦜 きなこ「白状すると、私も最初は、99%も判断できるなら任せきりでいいって読み違えてたの」
🦜 きなこ「でもOpenAIは、Auto-reviewをセキュリティの保証として扱うべきじゃない、ってはっきり書いてるの」
🐹 もっちー「えっ、あんなにちゃんと止めてたのに?」
🦜 きなこ「人とAIの両方で攻撃役をやって試したら、判定役がだまされて、承認なしにコマンドを通しちゃうケースが見つかったの」
🐹 もっちー「確認係がだまされたら、ケージの出口が開きっぱなしやんか!」
🦜 きなこ「それに、さっきの90.3%も、裏を返せばテストの危ない行動の一部は、通しちゃってたってことなの」
🦜 きなこ「公式の説明書にも、サンドボックスの設計や監視、組織のルールを補うもので、置き換えるものじゃないって書いてあるの」
🐹 もっちー「じゃあ結局、ぼくは何を任せていいの?」
🦜 きなこ「思い出して。Auto-reviewは、ケージを広げないの。だから、ケージの大きさを決める人の仕事が、いちばん大事になるんだよ」
🦜 きなこ「大事な秘密や本番のデータにつながる場所なら、まず書き込める範囲とつながる先を絞るのが先なの」
🐹 もっちー「そっか。確認係を雇っても、ケージの大きさは自分で決めるってことなんだね」
🦜 きなこ「うん。読まずにOKを押してたなら、判定役に任せたほうが安全なこともあるの」
まとめ
🦜 きなこ「今日のまとめね。Auto-reviewは、AIが範囲の外に出るときの『これ、いい?』を、別のAIが判定する仕組みなの」
🐹 もっちー「それがChatGPTでサインインしてればタダになって、でも保証じゃないから、ケージの大きさは自分で決めるんだったね」
🦜 きなこ「Codexを使ってるなら、今日から1個だけ。設定のパーミッションズを開いて、今どこまで許可してるか見てみてね」
🐹 もっちー「なんや、設定を開いて見るだけか。それならワイでもできそうやん!」
🦜 きなこ「見ておくだけで、オンにするかどうかも、落ち着いて決められるようになるよ」
🐹 もっちー「この役割分担の図、あとで見返したいから保存しとこ!」
🐹 もっちー「そういや飼い主も、スマホの『許可しますか?』、全部読まずに押してるで」
🦜 きなこ「ふふ、飼い主にこそ、確認係が必要なのかもね」
🦜 きなこ「みんなは、AIの『これ実行していい?』、どこまで任せてる?コメントで教えてね」
🦜 きなこ「判定役のAIを、どこまで賢くできるのか。そこもいつか深掘りしたいね」
🐹 もっちー「楽しみだね。それじゃ今日はこのへんで!」
きなこもっちーのテック深掘り では、AI/LLM を中心としたテック全般をハムスター(🐹 もっちー)とセキセイインコ(🦜 きなこ)の掛け合いで楽しく解説しています。
▶️ 動画で観る → AIの「これ実行していい?」を別のAIに任せていい?|Codex Auto-review
👍 この記事が役に立ったら LGTM・ストックしてもらえると励みになります!
📺 チャンネル登録はこちら → きなこもっちーのテック深掘り
🔗 他の解説動画も見る → きなこもっちーのテック深掘り の動画一覧


































