はじめに
少し前に、Devinの「Fusion」について記事を書きました。賢いモデル1体で全部やるのをやめて、賢い「メイン」と安い「サイドキック」の2体編成にすることで、品質を保ったままコストを41%落とした、という話です。
その記事を書きながら、ひとつ引っかかっていたことがあります。これはDevinだけの工夫なのか、それとも業界全体がそっちに向かっているのか。答えはわりとすぐ出ました。Sakana AIが2026年6月に出した Sakana Fugu が、まさに同じ方向を、別の角度から攻めていたからです。
Fuguのキャッチコピーは「Multi-agent System as a Model」。日本語にすると「1つのモデルとして振る舞う、マルチエージェントシステム」あたりでしょうか。中では複数のエージェントがチームを組んで動いているのに、使う側から見ると普通のモデルを1回叩いているだけに見える。この設計です。
Devin Fusionはエージェント製品の"中身"としてこれをやり、Sakana Fuguは"モデルそのもの"としてこれを売る。切り口は違うのに、行き着く発想が驚くほど似ています。X上でも「マルチエージェントを1つのモデルとして出す流れ」が来ている、という指摘が出ていました。この記事では、Fuguが何をしているのかを整理しつつ、Fusionと並べて「この流れは何なのか」を考えてみます。
先に3行でまとめると
- Sakana Fuguは、複数モデルのチームを内部で組み立てて、OpenAI互換の1つのAPIから使わせる「モデル」
- 支えるのはICLR 2026の2本の論文(TRINITYとConductor)で、役割分担と連携の仕方そのものを学習で獲得
- Devin Fusionと同じく「マルチエージェントを1窓口の裏に隠す」流れ。ただし料金の見せ方や中身の開示度は対照的
この記事に出てくる用語の位置づけ
FuguとFusionの話には、各社が独自に付けた呼び名と、業界で普通に使う言葉が混ざります。読み分けやすいよう、先に整理しておきます。迷ったらここに戻ってくればOKです。
| 用語 | 位置づけ | ざっくりの意味 |
|---|---|---|
| Sakana Fugu | Sakana独自(モデル名) | この記事の主役。マルチエージェントを1モデルとして提供 |
| Fugu Ultra / Fugu Cyber | Sakana独自(階層名) | 高難度向けの上位版と、セキュリティ特化版 |
| TRINITY / Conductor | Sakana独自(研究名) | Fuguの土台になったICLR 2026の2論文 |
| Devin Fusion | Cognition独自(機能名) | 比較対象。メイン+サイドキックの2体構成 |
| サイドキック | Fusion独自の呼び名 | Fusionで安いモデルを積む相棒エージェント |
| マルチエージェント | 一般用語 | 複数のAIエージェントが分担・協調して動く仕組み |
| オーケストレーション | 一般用語 | 複数のモデルやエージェントを指揮・調整すること |
| モデルルーティング | 一般用語 | タスクごとに使うモデルを振り分ける方式 |
| OpenAI互換API | 一般用語 | OpenAIと同じ叩き方で使えるAPIの形式 |
固有名詞(各社独自)は「その製品の世界でだけ通じる言葉」、一般用語は「他社のAI記事でも出てくる言葉」と考えてください。
🚀 Devin専門の解説メディア「StartDevin」を運営中!
Devinの導入・使い方・最新アップデート・活用事例を、日本語でまとめています。
👉 StartDevin をチェックする(startdevin.jp)
この記事にぜひ いいね❤️ していただけると励みになります 🙌
Fuguは「チームを組む」のを自分でやる
すごく雑に言うと、Fuguは「あなたの代わりにAIのチームを編成してくれるモデル」です。
普通、複数モデルを使い分けようとすると、自分でワークフローを設計しないといけません。この処理は安いモデル、ここは賢いモデル、検証は別のモデル、と手で組む。これが地味に大変で、モデルが増えるほど破綻します。Fuguはこの「チーム編成」自体を内部でやってくれる。公式の言葉を借りると、プールの中から動的にエージェントを組み立て、人間には思いつきにくいけれど効率のいい連携パターンで協調させる、とあります。
使う側の体験はシンプルです。OpenAI互換の単一エンドポイントにリクエストを投げるだけ。あとはFuguが「今回はこのモデルたちでチームを作ろう」と勝手に決めて、結果を1つにまとめて返してくれます。
役割の名前(Thinker、Worker、Verifier)が出てきましたが、これは後述の研究に由来します。ここでは「考える人・作業する人・チェックする人でチームを組む」くらいの理解で十分です。
土台になっている2つの研究
Fuguが面白いのは、この「チームの組み方」を人が設計するのではなく、学習で獲得している点です。土台になっているのは、ICLR 2026で発表された2本の論文です。
| 論文 | やっていること |
|---|---|
| TRINITY | 軽量な「進化で獲得したコーディネーター」が、複数のLLMを数ターンにわたって指揮し、Thinker・Worker・Verifierの役を割り当てる |
| Conductor | 強化学習で、自然言語による連携戦略そのものを発見する。エージェント同士の伝え合い方をデザインする |
ポイントは、役割分担をあらかじめ固定していないところです。「このタスクならこういうチーム編成と会話の仕方が効く」を、モデル側が学習で見つけている。人間が組んだワークフローの寄せ集めではなく、連携のパターン自体が学習の成果物になっている、というのがSakanaの主張です。技術報告によれば、TRINITYの指揮役はおよそ0.6Bパラメータの小さなモデルを進化的探索(CMA-ES)で鍛えたもの、Conductorはおよそ7Bのモデルを強化学習で鍛えたものとされています。フロンティアモデルを自前で新しく訓練するのではなく、既存の強いモデルたちの"束ね方"に投資している、という設計思想が見えます。
作っているSakana AIは東京拠点の研究ラボで、共同創業者のLlion Jonesは、Transformerを世に出した論文「Attention Is All You Need」の著者の一人です。社名の「Sakana(魚)」も、群れをなす魚が個々は単純でも群れとして賢く振る舞う、という集合知の発想から来ています。Fuguはその思想をそのまま製品にした格好で、名前の付け方まで一貫しているのは個人的に好きなところです。なお正式な提供開始は2026年6月22日です。
Devin Fusionと並べてみる
ここで本題の「流れ」の話です。Devin Fusionと並べると、共通点と違いがくっきりします。
共通しているのは、複数エージェントの複雑さを「1つの窓口」の裏に隠す発想です。使う側は普通にモデルを1回叩いているつもりなのに、裏では賢いモデルと安いモデルが分担して動いている。素朴なモデルルーティング(プロンプトを見て1モデルに振り分けるだけ)への不満から出発している点も似ています。
違いは立ち位置です。整理するとこうなります。
| Devin Fusion | Sakana Fugu | |
|---|---|---|
| 何として売るか | SWEエージェント製品の中身 | 単体の「モデル」(API) |
| 構成 | メイン+サイドキックの2体固定 | プールから動的にチーム編成 |
| 呼び出し方 | Devinを使う中で自動起動 | OpenAI互換エンドポイントを直接叩く |
| 中身の開示 | 役割と設計を公式が説明 | ルーティングは非公開(proprietary) |
Fusionは「Devinというコーディングエージェントを、より安く賢く動かすための内部エンジン」です。一方Fuguは「あなたのアプリから直接叩ける汎用モデル」で、コーディングに限りません。同じ発想を、片方は製品の内側に、片方はモデルという商品の形にした、という違いです。
素朴なルーティングから始まって、相談パターンを経て、今は「マルチエージェントを丸ごと1つの製品/モデルとして畳み込む」ところに来ている。FusionとFuguは、その最前線に別ルートからたどり着いた2例だと私は見ています。
料金の見せ方が、けっこう対照的
同じ流れの中にいても、料金の考え方には各社の性格が出ます。
Fuguで感心したのは、エージェントが増えても料金を積み上げない設計です。公式には「複数のエージェントが動いても、モデル費用を積み上げることはしない。関わった最上位モデルの単価で、一律に課金する」とあります。裏で5体動こうが10体動こうが、いちばん高いモデル1本分の料金で済む。マルチエージェントの「気づいたら請求が倍々になっていた」という怖さに、正面から手を打っています。
具体的な料金は、サブスクリプションと従量課金の2本立てです。
| プラン | 料金 | 備考 |
|---|---|---|
| Standard | $20/月 | 日常使い向け |
| Pro | $100/月 | Standardの約10倍の利用枠 |
| Max | $200/月 | 約20倍の利用枠 |
従量課金だと、Fugu Ultraが100万トークンあたり入力$5・出力$30(272Kを超える文脈では$10・$45)。セキュリティ特化のFugu Cyberは入力$6・出力$36です。
Fusionが「ベンチマークでコスト41%減」という削減率で語ったのに対し、Fuguは「積み上げない」という課金構造で語る。どちらもコストが主戦場なのは同じで、見せ方のアプローチが違うのが面白いところです。
性能はどうなのか
Sakana自身のベンチマークでは、上位版のFugu Ultraがフロンティアモデル(Opus 4.8、Gemini 3.1 Pro、GPT-5.5)と比べても遜色ない、あるいは一部で上回る数字を出しています。
| ベンチマーク | Fugu Ultra | 測るもの |
|---|---|---|
| SWE Bench Pro | 73.7% | 実際のソフトウェア課題の解決 |
| LiveCodeBench Pro | 90.8% | コーディング能力 |
| GPQA-D | 95.5% | 大学院レベルの難問 |
セキュリティ特化のFugu Cyberは、CyberGymで86.9%、CTI-REALMで72.1%という数字も出しています。ちょうど前回のDevin Security Swarmの記事を書いたばかりなので、セキュリティ特化のモデル階層をわざわざ用意してくる動きは、業界全体の関心の在りかを映している気がします。
ただし、ここは冷静に見る必要があります。これらはSakana自身のベンチマーク値で、第三者による再現はこれからです。数字は具体的で好感が持てますが、割り引いて読む余地はあります。この注意点は、前回のFusionやSecurity Swarmの記事とまったく同じです。自社ベンチは自社ベンチとして受け取る、という姿勢が無難です。
触る前に知っておきたいこと
導入を検討するなら、いくつか先に押さえておくと安心です。
| 項目 | 状況 |
|---|---|
| 提供地域 | 日本国外からも使えるが、EU/EEAは未提供(GDPR対応中) |
| 呼び出し | console.sakana.ai、OpenRouter、Vercelなど経由で利用可 |
| ルーティングの中身 | どのモデルをどう組み合わせているかは非公開 |
いちばん引っかかる人がいそうなのは、ルーティングの中身が非公開な点です。「どのモデルが使われたか」が見えないのは、Fusionが役割設計を公式に説明していたのと対照的です。裏を全部Sakanaに預ける代わりに、こちらは1つのAPIを叩くだけでいい。この委ね方をどう感じるかは、用途と好みによると思います。
もうひとつ、速度も正直に見ておきましょう。上位版のFugu Ultraは、1つのリクエストを複数モデルに投げて検証まで回すぶん、単体モデルを1回叩くより時間がかかります。第三者の検証では、コーディング系のタスクで数分から、場合によっては30分近くかかったという報告も出ています(Ethan Mollick氏らによる観測)。これは設定ミスではなく、マルチエージェント構造そのものに由来するトレードオフです。Sakana自身も、日常使いのデフォルトは通常版のFugu、Ultraは「難しくて間違いのコストが高い問題」向け、と位置づけています。軽いタスクは通常版のFuguに、ここぞという難問だけUltraに、という使い分けが現実的です。
おわりに
Fuguを調べていていちばん腹落ちしたのは、「マルチエージェントは、機能ではなく商品の単位になりつつある」ということでした。これまでマルチエージェントは、自分で組み立てる"作り方"の話でした。それがFusionでは製品の中身になり、Fuguではモデルという商品そのものになった。使う側は、もう中の複雑さを気にしなくてよくなってきています。
Devin Fusion、そしてSakana Fugu。出どころもアプローチも違う2つが、「複数エージェントを1窓口の裏に畳み込む」という同じ地点に着いたのは、偶然ではないはずです。この流れは当分続くと思うので、自分の環境でFuguを叩いてみて、実際の使い勝手やコスト感を測ったら続編を書くつもりです。そのときはFusionのときの数字とも突き合わせてみます。
参考リンク
- Sakana Fugu — Multi-agent System as a Model(Sakana AI公式)(一次情報。仕様・料金・ベンチマーク)
- Devin Fusion | Cognition公式ブログ(比較対象の一次情報)
- 過去記事: Devin Fusionの解説(メイン+サイドキックの2体構成でコスト41%減)
- ※ 発表日(2026年6月22日)・創業者・TRINITY/Conductorのパラメータ規模・レイテンシの実測報告は、Sakana AIの技術報告および複数の第三者レビューを参照した

