はじめに
2026年7月20日〜8月8日にかけて、Lenny's Newsletter 上でAI開発者が押さえておきたいトピックがまとまって公開されました。中心となるのは、Claude Opus 5 を7モデル横断でベンチマークした実践レビュー、Anthropic 初のプロダクトマネージャー Dianne Penn によるモデル開発思想の解説、ChatGPT Voice のマルチスレッド管理・画面認識・バックグラウンドタスク対応、そして Codex のブラウザ/コンピュータ利用における「under-prompting(あえて細かく指示しない)」テクニックです。
これらは単発の機能追加ではなく、「AIエージェントをどう実務のワークフローに組み込むか」という共通のテーマでつながっています。モデル選定・音声インターフェース・コーディングエージェントのいずれかを触っている開発者にとって、公式発表だけでは見えない実務目線の評価と設計パターンが多く含まれているため、まとめて把握しておく価値があります。
📌 影響を受ける人
Claude / ChatGPT(Codex) をコーディングや業務自動化に使っている開発者、AIエージェントをプロダクトに組み込もうとしているエンジニア・PM。
変更の全体像
今回のトピックを提供元(Anthropic系 / OpenAI系 / エコシステム)ごとに整理すると、以下のような関係になります。
どの機能を試すべきかは、やりたいことに応じて次のように振り分けると整理しやすくなります。
変更内容
| トピック | 対象 | 概要 | Severity |
|---|---|---|---|
| Claude Opus 5 レビュー | Claude Opus 5 | 7モデル横断ベンチマークで「賢いがうっとうしい」と評価 | high |
| ChatGPT Voice 新機能 | ChatGPT / Codex Voice | マルチスレッド管理・画面認識・BGタスク実行に対応 | high |
| Anthropic初PMインタビュー | Claude / Anthropic | token maxing・jagged edge・eval駆動開発を解説 | medium |
| Claude Code ⇄ Design同期 | Claude Code | デザインと実装の同期ワークフローが議論に | medium(影響大) |
| Codexのブラウザ/コンピュータ利用 | Codex | under-promptingでエージェント性能を引き出す | medium |
| Vercel Eve + Codex PRボット | Vercel Eve, Codex | リスクスコアリングで自動承認/Slack通知 | medium |
| GPT-5.6レビュー・エージェントハーネス | GPT-5.6 | ソロビルダーの24/7運用、ハーネス設計論 | medium |
Claude Opus 5:「賢いが、うっとうしい」
Lenny 独自の7モデル横断ベンチマークで Claude Opus 5 を評価したところ、能力そのものは非常に高い一方、過剰な説明や振る舞いの癖など使い勝手面で「annoying(うっとうしい)」という予想外の評価が出ています。公式ベンチマークのスコアだけでモデルを選ぶと、実運用での体験とギャップが生まれる可能性がある点は注意が必要です。
Anthropicの開発思想:token maxing / jagged edge / eval駆動
Anthropic 初の技術系PM Dianne Penn のインタビューでは、Claude をコーディング用途に振り切った戦略的ピボットの背景として、以下の考え方が語られています。
- token maxing: トークンを惜しまず使い切ることでモデルの能力を最大限引き出す発想
- jagged edge: AIが得意な領域と苦手な領域が不均一に混在する現象への向き合い方
- eval駆動の開発ループ: 評価(eval)を中心に据えて改善サイクルを回す手法
Claude を使ったプロダクト開発をしている場合、なぜ Claude がある種の挙動をするのかを理解する手がかりになります。
ChatGPT Voiceがオーケストレーション用インターフェースに進化
OpenAI の Nick Baumann による実演では、ChatGPT Voice が単なる「ハンズフリーのチャット」を超え、以下の機能を備えたことが示されています。
- 複数の会話スレッドを同時並行で管理
- ユーザーの画面を読み取る画面認識
- バックグラウンドでの長時間タスク実行
音声を起点に複数のエージェントタスクを同時進行させる、エージェント的AI利用の一例です。
Codexのブラウザ/コンピュータ利用と「under-prompting」
Codex のブラウザ操作・コンピュータ操作の実例(アプリQA、SNS管理、旅行の買い物など)で紹介されている重要なテクニックが「under-prompting」です。指示を細かく書き込みすぎるとフロンティアモデルの推論力を制限してしまうため、あえてゴールだけを渡して考えさせる方が良い結果につながる、という逆説的な設計指針です。
Vercel Eve + CodexでPRレビューボットを30分構築
Vercel Eve エージェントフレームワークと Codex を組み合わせ、PRのリスクをスコアリングして低リスクは自動承認、それ以外はSlack通知するボット「Merge Mommy」の構築事例も紹介されています。エージェントをCI/コードレビューに組み込む実装の参考になります。
影響と対応
💡 Tips
公式ベンチマークと実務レビューは別軸で評価する
- モデル選定: Claude Opus 5 を採用する際は公式スコアだけでなく、実際の応答スタイル(冗長さ・癖)も踏まえて評価する
- プロンプト設計: Codexなどのエージェント運用では、詳細な手順書型プロンプトから「ゴール提示+裁量付与」型への切り替えを試す
- 音声インターフェース活用: ChatGPT Voiceのマルチスレッド機能は、単一タスクの音声操作ではなく複数タスクの並行オーケストレーションとして設計し直す
- 開発ワークフローへの組み込み: PRレビュー自動化などエージェントをCI/CDに組み込む場合は、リスクスコアリング+人間レビューの併用パターンから始める
- Claude Code運用: デザインと実装(Claude Design)の同期、および「vibe codingでは?」という顧客の疑念への対応方針をチームで事前に整理しておく
コード例
Before/After: エージェントへの指示の書き方(under-prompting)
# Before(過剰に細かい指示)
1. ブラウザでlocalhost:3000を開く
2. ログインフォームにテストユーザーでログインする
3. ダッシュボードに遷移することを確認する
4. 各ボタンを1つずつクリックしてエラーが出ないか確認する
5. スクリーンショットを撮って報告する
# After(ゴールのみ提示し裁量を渡す)
このアプリの主要な導線(ログイン→ダッシュボード→主要機能)を
一通り触ってみて、壊れている箇所があれば報告して。
コンテンツワークフローにおける「文体コード化」の例
Morning Brew創業者の事例では、自分の文体をMarkdownでコンテキスト化しておくアプローチが紹介されています。CLAUDE.mdの構成にも応用できる考え方です。
# voice.md
- 一人称は「僕」、断定調より問いかけを多用する
- 比喩は1記事に1つまで、抽象論の後は必ず具体例を置く
- 結論を先に書き、理由は3点以内に絞る
このようなファイルをコンテキストとして渡し、下書き前にAIに自分自身をインタビューさせ、投稿前に複数ペルソナで推敲させる、という3段構成が紹介されています。
まとめ
今回のアップデート群は、単体の新機能というより「AIエージェントを実務にどう組み込むか」という一貫したテーマで捉えると理解しやすくなります。
- Claude Opus 5は高性能だが使用感の癖もあり、公式ベンチマークと実務評価は分けて見る
- Anthropicはtoken maxing・jagged edge・eval駆動という思想でClaudeを開発している
- ChatGPT Voiceは並行タスクオーケストレーションのインターフェースへ進化
- Codexのエージェント運用では「指示を減らす」under-promptingが有効な場面がある
- PRレビューなどCI/CD領域へのエージェント組み込みは、リスクスコアリング型の設計が実用的
モデルのスペック表だけでなく、こうした実務者の運用知見を継続的に追うことが、AIエージェントを本番ワークフローに定着させる近道になりそうです。