今日の話題
- 今日の最大の話題は、Anthropicが新モデル「Claude Sonnet 5」を公開したこと。無料・Proの既定モデルになり、コーディングとエージェント用途の性能が上がった一方、サンプリング設定の指定などAPIの使い勝手にも変更が入った。
- モデル以外でも、Anthropicが研究者向けのAIワークベンチ「Claude Science」を、Googleが低コストの画像モデル「Nano Banana 2 Lite」と動画モデル「Gemini Omni Flash」を投入するなど、生成AIを実務に組み込む動きが続いた。
- 開発の現場向けには、Cognitionがモデルを切り替える「Devin Fusion」、Googleがエージェントの品質を自動で高めるスキル、XがAPI向けのMCPサーバーを公開した。
Hot
AnthropicがClaude Sonnet 5を公開、無料・Proの既定モデルに
Anthropicが、新モデル「Claude Sonnet 5」を公開した。無料プランとProプランの既定モデルになり、Max・Team・Enterpriseでも利用できる。コーディングとエージェント用途の性能が大きく向上した。複数のベンチマークで前世代のSonnet 4.6を上回り、全体としてはOpus 4.8に迫るが、最も複雑なタスクでは及ばないとしている。APIでの識別子はclaude-sonnet-5で、8月31日までの割引期間は100万トークンあたり入力2ドル・出力10ドル、その後は3ドル・15ドルに戻る。新しいトークナイザーを採用し、拡張思考の手動指定やtemperatureなどのサンプリング設定には対応しなくなった。
Source: https://www.anthropic.com/news/claude-sonnet-5
Source: https://www.anthropic.com/claude-sonnet-5-system-card
Product
Anthropicが研究者向けのAIワークベンチ「Claude Science」を公開
Anthropicが、研究者向けのAIワークベンチ「Claude Science」をベータ公開した。中心となるエージェントが既存のClaudeモデルを呼び出し、ゲノミクスや構造生物学など60を超える科学データベースに接続する。コードと実行記録を含む再現可能な成果物を生成できる。手元のマシンや研究室のクラスターで動かしながら、必要に応じてModal経由でGPUを増やせる。引用や計算の誤りを点検する検証エージェントも備える。Pro・Max・Team・Enterpriseの有料ユーザーが対象で、TeamとEnterpriseは管理者による有効化が必要となる。
Source: https://www.anthropic.com/news/claude-science-ai-workbench
Launch
Googleが低コストの画像モデル「Nano Banana 2 Lite」と動画モデル「Gemini Omni Flash」を投入
Google DeepMindが、画像生成モデル「Nano Banana 2 Lite」を公開した。Nano Bananaシリーズで最も高速かつ低コストという位置づけで、テキストから画像を4秒以内に生成し、1枚あたりのコストは0.034ドル。画像の編集・生成のEloスコアはNano Banana 2に近く、初代を大きく上回るという。Google AI StudioとGemini API経由で開発者が利用でき、検索のAIモードやGeminiアプリ、NotebookLMなどにも順次広げる。あわせて、動画の生成・編集モデル「Gemini Omni Flash」の開発者向けパブリックベータも始めた。マルチモーダル入力と対話形式での編集に対応し、コストは1秒あたり0.10ドル。
Source: https://deepmind.google/models/gemini-image/flash-lite/
Source: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-flash-nano-banana-2-lite/
Tool
CognitionがコーディングAI向けの新基盤「Devin Fusion」を発表
Cognitionが、コーディングエージェント向けの新しいハイブリッドモデル基盤「Devin Fusion」を発表し、Devinに導入した。小型のエージェントを上位のエージェントと並行して動かし、上位側が作業の割り振りや計画、最終確認を担う「サイドキック」方式を採る。あわせて、タスクの難易度に応じて会話の途中でもモデルを切り替える。同社によれば、テストではFable級の性能にかかるコストを35%削減しつつ、従来のモデル振り分けで課題だったキャッシュのミスや汎化性能の低下を避けられたという。
Googleがエージェントの品質を自動で高めるスキル「Agent Quality Flywheel」を公開
Googleが、AIエージェントの品質を継続的に高める仕組み「Agent Quality Flywheel」を、コーディングエージェントに組み込めるスキルとして公開した。データの準備、推論の実行、採点、失敗の分析、改善という5つの段階に分け、テストと評価、最適化を自動で回す。中核となるのは、Google DeepMindと共同開発した採点用のモデル「AutoRaters」で、評価データが乏しい初期段階を補うためにユーザーの挙動を模擬する仕組みも備える。旅行の計画と不具合対応の2つのエージェントを例に、細かな不具合を自動で見つけて直し、指標を大きく改善できたと説明している。
Source: https://developers.googleblog.com/driving-the-agent-quality-flywheel-from-your-coding-agent/
X APIが公式のMCPサーバーを2つ公開
X(旧Twitter)の開発者向けプラットフォームが、公式のMCPサーバーを2つ公開した。1つはapi.x.comで動く「X MCP」で、オープンソースのxurl mcpブリッジを介して接続し、利用者自身のアカウント権限で投稿の検索やユーザー検索、ブックマーク管理、トレンドやニュースの取得、記事の作成・公開ができる。初回だけブラウザでOAuth2ログインが必要で、以降はトークンが自動で更新される。もう1つはdocs.x.comの「Docs MCP」で、ブリッジや追加の認証なしにX APIのドキュメントを検索・参照できる。
Source: https://docs.x.com/tools/mcp
Research
OpenAIが18年潜んだlibunwindの不具合を突き止めたクラッシュ解析を公開
OpenAIが、データ基盤Rocksetで起きたまれなクラッシュの原因を突き止めた経緯を、技術ブログで公開した。過去1年分のcore dumpを自動化した仕組みで大量に解析し、原因が独立した2つの不具合に切り分けられることを突き止めたという。1つはAzure上の物理サーバー1台で静かに進行していたハードウェアの破損で、スタックポインタがずれる形で現れており、該当のサーバーを切り離した。もう1つはオープンソースのGNU libunwindに18年間潜んでいた競合状態で、近ごろスタックの使用量が増えたことで発現の閾値を越えていた。OpenAIはlibgccのアンワインダーに切り替えて回避し、libunwindの本家にも修正を提出した。
Source: https://openai.com/index/core-dump-epidemiology-data-infrastructure-bug/