AIエージェントを使うとき、どこまで任せてどこで止める?——Anthropicの実測研究が教えてくれたこと
Claude Code や API 経由のエージェントを日々使っている方なら、「この操作は自動でやらせていいのか」「どこで一度止めて確認すべきか」と迷った経験があるかもしれません。Anthropic(アンソロピック)が2026年2月18日に発表した研究「Measuring AI Agent Autonomy in Practice」 は、実際の数百万セッションを分析し、AIエージェントがどの程度「自律的」に動いているのかを、初めて体系的に測定したものです。
このレポートのポイントは、自律性が「モデルの性能」だけで決まるのではなく、ユーザーの使い方や製品設計を含めた「システム全体」で決まるという発見です。本記事では、GIGAZINEの解説とAnthropicの報告書を踏まえ、IT技術者がAIエージェントを使う際に押さえておきたいことを、整理します。
関連記事の読み方: エージェントの役割と設計は消えるのは人ではなく中間工程——エージェント化がすすむ時代、技術者の役割はどう変わるのかや賢いモデルを探す競争は終わった——次世代AIで勝つ「権限・検証・観測・状態」の設計と運用、社内Agent導入の設計書——RAG・Tools・権限・監査を中核に据えるで深掘りできます。筆者の記事一覧もあわせてどうぞ。
自律性の「実態」——伸びているのは時間だけじゃない
研究では、Claude Code や 公開API を通じた実際の利用データが分析されています。ここから分かったことを、技術者が明日から意識しやすい形でまとめます。まず、エージェントが「止まらずに動き続ける時間」から見ていきましょう。
介入なしで動き続ける時間は、ゆっくり伸びている
1回のセッションのうち、人間が一切介入せずにエージェントが動き続けた最長時間(上位0.1%のセッション)は、2025年10月には25分未満だったのが、2026年1月には45分前後まで伸びています。一見「モデルが強くなったから」と思いがちですが、興味深いのはSonnet 4.5 や Opus 4.5 といった新モデルリリースに伴う急なジャンプではなく、緩やかに伸びている点です。
図1.インタラクティブなClaude Codeセッションにおける99.9パーセンタイルのターン継続時間(Claudeが1ターンあたりに作業した時間)、7日間の移動平均。99.9パーセンタイルは、9月下旬の25分未満から1月上旬の45分超まで着実に増加しています。この分析は、すべてのインタラクティブなClaude Codeの使用状況を反映しています(https://www.anthropic.com/research/measuring-agent-autonomyより引用)
Anthropicは、ユーザーがツールに慣れ、任せる範囲を広げていることが主な要因だと分析しています。つまり、「モデル単体の性能」より「人がどこまで任せるか」が自律性を決めているという構図が見えてきます。なお、セッションの中央値は45秒程度と短く、長時間ぶっ続けで動かしているのはごく一部のユースケースに限られます。
では、誰がどれだけ任せているのでしょうか。ユーザーの「任せ方」の違いが、データに表れています。
経験を積むほど「自動承認」は増える——でも介入も増える
新規ユーザーは、エージェントのアクションを一つずつ承認してから実行させる「事前承認型」が多く、全アクションを自動承認する設定を使う割合は約20%に留まります。ところが、セッション数が750回を超える熟練ユーザーでは、その割合が40%以上に跳ね上がります。ツールへの信頼が、利用経験とともに蓄積されている様子がデータから読み取れます。
一方で、熟練ユーザーほど、エージェントの動作を途中で止めて介入する頻度は高いという結果も出ています。新規ユーザーの介入率が約5%なのに対し、熟練ユーザーでは約9%に達しています。Anthropicは、熟練者は**「細かい操作は自動で任せ、怪しいと感じたときだけ止める」能動的モニタリング型**に移行していると解釈しています。つまり、任せる範囲を広げつつ、いざというときにはしっかり止める——その両立が、経験とともに身についていると考えられます。
自律性を決めるのは、実は人間側の「任せ方」だけではありません。エージェント自身の振る舞いも、データに表れていました。
AI自身も「ここは任せられない」と判断している
エージェントは、タスクが複雑になるほど自ら停止し、人間に説明や確認を求める傾向があります。最も複雑なタスクでは、人間が介入する頻度の2倍以上の回数で、AI側から質問や確認が投げかけられていたそうです。自身の不確実性を認識して行動を制限する仕組みが、重要な安全装置として働いていることが分かります。
こうした「実態」を踏まえると、次は明日から何をすればよいかが気になります。以下、任せ方と止め方のバランスを取るための、具体的なアクションに落とし込んでみましょう。
技術者が明日から意識したいこと——任せ方と止め方のバランス
前節で見た「任せる範囲は人が決めている」「熟練者は見守りながら止める」「AI自身も止まって聞いてくる」という三点は、そのまま運用の指針にできます。Anthropicのデータから見えてきた知見を、現場でAIエージェントを使いこなすための具体的なアクションプランに置き換えていきましょう。
「事前承認」から「能動的モニタリング」へプレイスタイルを移行する
初めからすべてをAIに任せる必要はありません。最初はアクションごとに確認する事前承認型からスタートし、ツールの挙動が掴めてきたら「基本は自動、危ない時だけ止める」能動的モニタリング型へシフトしましょう。
これは、新しい課題に取り組む生徒を見守るプロセスによく似ています。最初は手順ごとに確認し、実力がついてきたら自力で進めさせつつ、手が止まったりつまずいたりした時だけサポートに入る。その感覚でエージェントとの距離感を測るのがおすすめです。
プレイスタイルを変えていく一方で、「どこまでを自動にし、どこで必ず人間が止めるか」という権限の線引きも欠かせません。
高リスクな操作は「手動」を残し、権限は段階的に広げる
熟練ユーザーであっても、すべてを全自動にしているわけではありません。取り返しのつかない操作には、必ず**人間の承認(Human-in-the-loop)**を挟みましょう。最初は、本番環境へのデプロイ、データベースの更新・削除(破壊的変更)、外部APIの呼び出しや課金が発生する操作、機密データや個人情報の取り扱いを手動確認にし、安全が確認できてから権限を広げてください。
権限を設計するのと並んで、エージェントが止まって聞いてきたときの向き合い方も大切です。
AIからの「質問」を邪魔者扱いしない
複雑なタスクになるほど、AIは「ここは自信がないから人間に聞こう」と自ら動作を停止します。このアラートは、暴走を防ぐ極めて優秀な安全装置です。システムを設計・利用する際は、「AIが迷った時に、人間が素早く介入して回答できる仕組み」を整えることが、結果的にエージェントの自律性を安全に高める近道になります。
まとめ——「自律性」はシステム全体でデザインするもの
Anthropicの「Measuring AI Agent Autonomy in Practice」から見えてきた、AIエージェント活用の重要ポイントは以下の3点に集約されます。
自律性はモデル性能だけでは決まらない
エージェントが長く動き続けるのは「モデルの強さ」だけでなく、「人間がどこまで任せているか」という運用スタイルの影響が大きい、ということが実データで示されました。
熟練者ほど「見守りながら任せている」
経験を積んだユーザーは自動承認を活用する一方で、「ここぞという時の介入(停止)」も能動的に行っていることが、データから読み取れます。
「AIからのSOS」が最大の安全装置
AI自身が不確実性を検知して人間に確認を求める機能が、安全な運用の要として機能していることが、研究で明らかになっています。
以上三点を踏まえると、エージェント活用の考え方も少し見え方が変わるかもしれません。
AIエージェントを導入する際は、「いかにすべてを自動化するか」に固執する必要はありません。むしろ、「どのタスクを任せ、どこに人間の確認ポイント(チェックポイント)を設けるか」を設計し、運用しながら調整していくことが、これからの技術者に求められる新しい役割と言えるでしょう。
作成日:2026年3月2日

