0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

Fable 5やOpusのような高性能モデルは賢いけど高い。Devinの新機能「Fusion」がコストを35〜41%削減する仕組みを調べた

0
Posted at

🚀 Devin専門の解説メディア「StartDevin」を運営中!
Devinの導入・使い方・最新アップデート・活用事例を、日本語でまとめています。
👉 StartDevin をチェックする(startdevin.jp)

この記事にぜひ いいね していただけると励みになります 🙌

はじめに

AIコーディングエージェントを本気で使い始めると、必ずぶつかる壁があります。モデル代が高いという壁です。

Fable 5やOpus 4.8のようなフロンティアモデルは、確かに賢い。曖昧な指示から意図を汲み取り、大きなリファクタも破綻せずやり切ってくれます。ただ、その賢さで「READMEを読む」「grepの結果を眺める」といった雑務までこなしているのを見ると、正直「そこは安いモデルでよくない?」と感じたことはありませんか。私はDevinのACU消費を眺めるたびに、ずっとそう思っていました。

かといって、タスクごとに安いモデルへ振り分ける「モデルルーティング」を試すと、今度は品質がガタッと落ちる。ベンチマークの数字は良くても、実際にマージしたいと思えるコードが出てこない——このジレンマに、Cognitionが正面から回答を出してきました。

2026年6月29日に発表された Devin Fusion です。公式ブログの書き出しがなかなか挑発的で、

Conventional model routing sucks.(従来のモデルルーティングはダメだ)

と、自社も含めた業界の既存アプローチを一刀両断しています。この記事では、公式発表をもとに、Fusionのアーキテクチャ・ベンチマーク結果・従来手法との違い、そして現時点で分かっている使い方と注意点を整理します。

⏱️ 先に3行で

  • Devin Fusion = フロンティアモデルの「メイン」と安価な「サイドキック」、2つのエージェントを並列で走らせるハイブリッドモデルハーネス
  • ベンチマーク(FrontierCode Extended)で Fable 5単体と同等スコアのままコスト41%削減(Opusレベル構成では35%削減)
  • 現在プレビュー段階。公式ドキュメント(docs.devin.ai)にはまだ記載がなく、一次情報は公式ブログのみ

Devin Fusionとは何か

一言でいうと、「賢いモデル1体」ではなく「賢いモデル+安いモデルの2体編成」でタスクをこなす仕組みです。

  • メインエージェント: フロンティアモデル(Fable 5など)を搭載。計画の立案、曖昧な指示の解釈、最終レビューといった「間違えるとタスク全体が壊れる判断」を担当
  • サイドキックエージェント: 低コストなモデルを搭載。情報収集、ソースの流し読み、スコープが明確なサブタスクの実行といった「量が多い実務」を担当

ポイントは、サイドキックが単なる「補助ツール」ではなく、独自のツールセットを持ち、自分でコンテキストを集めて行動できる一人前のエージェントだという点です。メインエージェントはタスクの進行に応じて「これはサイドキックに任せる」「これは自分でやる」を都度判断します。

公式ブログによると、メインエージェントの動作方針は「自分では最小限のアクションしか取らず、本当に必要なものだけを読む。デフォルトは委譲と監視に徹する」と設計されています。人間のチームでいえば、テックリードが手を動かしすぎず、レビューと意思決定に集中する体制に近い発想です。

なぜ「従来のモデルルーティング」ではダメだったのか

ここが今回の発表でいちばん面白いところだと私は感じました。安いモデルと賢いモデルを使い分ける発想自体は、まったく新しくありません。実際、Devinにも「Adaptive」というモデルルーターが既にあります(こちらは別記事で解説しています)。ではFusionは何が違うのか。

Cognitionは従来アプローチの問題点を、大きく2つ挙げています。

従来アプローチ 仕組み 問題点
モデルルーター プロンプトを見て1つのモデルに振り分ける ベンチマークには過適合するが、フロンティアモデル特有の創造性・汎用知性が失われる。単発のQA形式が前提で、タスク途中の柔軟な切り替えに弱い
Advisor型ツール
(Smart Friendパターン)
安いモデルが詰まったら賢いモデルに「相談」する 相談のたびにコンテキストを丸ごと渡し直すため、キャッシュが効かず呼び出しごとに高コスト

つまり「振り分ける」のでも「相談する」のでもなく、2つのエージェントを最初から並列で走らせて、それぞれが独立した永続キャッシュを持つ——これがFusionの答えです。

キャッシュの工夫が地味に効いている

LLM APIのプロンプトキャッシュは、多くの場合5分程度で失効します。エージェントのように長いコンテキストを引きずる用途では、キャッシュが効くかどうかでコストが数倍変わることも珍しくありません。

Fusionでは両エージェントがそれぞれのコンテキストをキャッシュし続けるため、Advisor型のような「相談のたびにフルコンテキストを課金」が発生しません。さらに公式ブログには、モデルの切り替えをコンテキスト圧縮のタイミングに相乗りさせるという工夫も紹介されています。圧縮時はどのみちキャッシュミスが発生するので、そこでまとめて切り替えれば追加コストが最小で済む、という理屈です。細かい話ですが、エージェント基盤を作っている人には刺さる設計だと思います。

ベンチマーク結果: スコアを維持したままコスト41%減

Cognition独自のベンチマーク「FrontierCode Extended」での結果が公開されています。

構成 スコア 1タスクあたり平均コスト
Fusion + Fable 5 57.6 $3.00
Fable 5 単体 57.0 $5.12
Opus 4.8 単体 48.8 $3.24
Fusion(Opusレベル構成) 47.9 $2.38
GPT-5.5 単体 44.8 $3.64
GLM-5.2 単体 43.0 $2.70

注目すべきは、Fusion + Fable 5 が単体のFable 5をスコアでわずかに上回りながら(57.6 vs 57.0)、コストを41%削減している点です。Opusレベルの構成でも、スコアほぼ同等でコスト35%減。安くしたら性能が落ちる、というトレードオフを崩しにきています。

公式ブログには「優れたモデルほどサイドキックパターンでのコスト改善が大きい」という興味深い指摘もあります。Fable 5のような強いモデルは委譲の判断そのものが上手いため、マルチエージェント構成が「異常なほど効果的に機能する」のだそうです。賢いモデルは自分で手を動かさせるより、マネージャーをやらせた方がコスパが良い——なんだか人間の組織論みたいな話です。

また社内テストでは、Cognition社内でマージされたPRの88%が、人手のモデル指定なしに自動のFusionルーターだけで駆動されていたと報告されています。「ベンチマーク用のデモ」ではなく社内の実務で回っている、という点は評価材料になります。

使ってみるには

現時点(2026年7月)でDevin Fusionはプレビュー段階です。

  1. app.devin.ai にサインアップ(既存ユーザーはそのまま)
  2. Devinのクラウドエージェントでプレビューとして提供

公式ドキュメントにはまだ記載がありません

docs.devin.aiのリリースノート(2026年6月分)を確認しましたが、執筆時点でFusionの記載はなく、詳細な設定方法・ACU消費への影響・GA時期は公式ブログ以外に一次情報がない状態です。プレビュー中の仕様は変わる可能性が高いので、導入判断の際は最新の公式情報を確認してください。

Adaptiveルーターとの関係は?

Devinには既に「Adaptive」というモデルルーターがあり、CLIの /model からオプトインで選べます。紛らわしいのですが、立ち位置は明確に違います。

Adaptive Fusion
方式 ターンごとに1つのモデルへ振り分け 2つのエージェントが並列稼働
主眼 軽いタスクを安く速く フロンティア級の品質を維持したままコスト削減
提供状況 CLI/デスクトップで選択可能 プレビュー

公式ブログの「Conventional model routing sucks」という書き出しは、ある意味で自社のルーティング路線に対する自己批判でもあり、Cognitionがマルチエージェントハーネス側に舵を切ったシグナルと読むこともできます。

現時点での注意点

実運用を考えるうえで、私が気になっているポイントを挙げておきます。

プレビュー段階の仕様変動。料金体系(DevinのACUにどう反映されるか)が公式に説明されていないため、「ベンチマークで41%減=あなたの請求額が41%減」とは限りません。ここは正式リリースを待つ必要があります。

ベンチマークは自社製。FrontierCode ExtendedはCognition自身のベンチマークです。数字自体は具体的で好感が持てますが、第三者による再現はまだありません。

モデルの可用性。公式ブログには、米国政府の指示により2026年6月12日時点でFable 5へのアクセスが一時停止され、それ以降の追加チューニングが未実施という注記がありました(Fable 5自体は7月1日から再展開されています)。フロンティアモデルの供給状況によって、Fusionの構成モデルも変わりうる点は頭に入れておくとよさそうです。

おわりに

Devin Fusionは「賢いモデルを安く使う」のではなく、「賢いモデルには判断だけさせて、作業は安いモデルにやらせる」という発想の転換でした。モデルルーティングでもAdvisorパターンでもなく、独立キャッシュを持つ2エージェントの並列編成という設計は、自前でエージェントを組んでいる人にとっても参考になるはずです。

フロンティアモデルの料金にため息をついている方は、プレビューの動向をウォッチしてみてください。私も試せる状態になり次第、実際のACU消費がどう変わるのか検証記事を書く予定です。

参考リンク

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?