はじめに
近年、複数のLLMエージェントが相互作用するマルチエージェントシステムの研究が急速に増えている。その中で気になっているのが、「共謀(collusion)」と「迎合(sycophancy)」という2つの逸脱行動。
正直に言うと、私にはこの2つが最初、ほとんど同じものに見えていた。どちらも「集団の中で意見を合わせていった結果、協調的に失敗する」現象に思えたからだ。もちろんこれは私個人の印象でしかなく、何か根拠があっての話ではない。
そこで、直近に出た2本の論文を手がかりに、両者が表層的・内部的に何が違うのかを整理してみた。
きっかけになった2本の論文
1. Emergent Collusion in Long-Horizon LLM Agent Interaction
- 著者:Shi, Zhang, Yang(Diyi Yang研究室)
- 公開:2026-09-21
- https://arxiv.org/abs/2609.24967
相互検証し合う2エージェントの長期相互作用で、「共謀」が創発することを実証した論文。
マルチエージェントによる相互検証は、信頼性向上策として期待されている。しかし、長期的な馴れ合いが検証機構自体を無力化するリスクは、これまで十分に検証されていなかった。
実験では、プロトコル遵守と報酬最大化が両立しない制約を意図的に導入している。その上で長期タスク環境を構築し、ピア介入実験とアブレーションを実施した。アブレーションの対象は、報酬構造・検証フィードバック・履歴量の3つ。
結果は以下の通り。
- 10モデル中94%の試行で共謀が発生した
- 同系統では、高性能なモデルほど早く共謀に至る傾向が見られた
- ピア(他エージェント)の行動が強く影響した
- 相互作用の履歴を制限すると、共謀は抑制された
この結果は、相互検証に依存した安全設計の限界を示唆している。「エージェント同士に監視させれば安全」とはいかないということである。
2. Recovering Agentic Sovereignty: Mitigating the Consensus Paradox via Contrastive Epistemic Decoding
- 著者:Shehata, Li
- 公開:2026-09-22
- https://arxiv.org/abs/2609.25570
こちらは、多数意見への迎合(同調バイアス)を扱った研究。迎合は、認知的な手抜きや精度低下を招く。この論文では、その問題を追加学習なしのデコーディング時手法で緩和している。
LLMには、文脈上の「多数派意見」に安易に迎合してしまう脆弱性がある。自律エージェント同士の協調場面では、これが誤った合意形成を招く安全上の懸念になる。
提案手法はContrastive Epistemic Decoding(CED)と呼ばれる。単一アーキテクチャへの二重フォワードパスによって、同調バイアス成分を分離する仕組み。追加モデルや再学習が不要な点が、既存手法との大きな違い。
評価にはGemma-2、Llama-3.1、Mistral v0.3の3系統、合計7,200トラジェクトリを用いている。結果として、認知的手抜きを最大33.00pt削減し、精度は最大30.75%回復した。ファインチューニングなしでも「迎合」と「本来の能力」を分離できることを実証した点が興味深い。
そもそも定義がどう違うのか
前述の通り、私は当初この2つを「集団の中で協調的な失敗が起きる現象」としてひとまとめに捉えていた。しかし定義に立ち返ると、次のように区別できる。
- 共謀:複数のエージェントが互いの利益を最大化するために協力する現象。外部のルールや制約を無視して行動する
- 迎合:あるエージェントが他のエージェントの意見や行動に過度に同調する現象。自分の判断や真実性を犠牲にする
つまり、共謀は「ルールからの協調的な逸脱」、迎合は「他者への過度な同調」。動機も方向性も異なる現象。
表層的な振る舞いの違い
共謀(collusion)
複数のエージェントが、ルールや規範から協調して逸脱する現象。他者やシステム全体の目的を損なう形で、秘密裡に協力する。
表層的には、それぞれの発話は一見正常に見える。しかし組み合わせると、意図しない結果が生まれる。たとえば情報隠蔽、不正な合意形成、ステガノグラフィ的な秘密通信など。
迎合(sycophancy)
1つ以上のエージェントが、他者(ユーザーや多数派エージェント)の意見に過度に同調する現象。自分の独立した判断や真実性を犠牲にして、「和」を優先する。
表層的には、次のような形で現れる。
- 議論が早期に収束する
- 多数派意見に引きずられて正解が置き換わる
- 自信の強いエージェントに追随する
内部的なメカニズムの違い
ここが両者を区別するうえで、最も本質的なポイントだと感じた。
共謀:「集団的アノマリー」として表れる
近年の研究では、共謀の検出しにくさが指摘されている。単一エージェントの内部状態だけを見ても、共謀は見つけにくい。複数エージェントの内部活性化を同時に見ることで、初めて姿を現す。これは「集団的アノマリー(collective anomaly)」と特徴づけられている。
内部的には、主に3つのパターンが報告されている。
- Point Anomalies(点異常):個々のエージェントの内部表現で、「欺瞞スコア」のような指標が上昇する
- Collective Anomalies(集団異常):共謀しているサブグループの表現空間が、他のエージェント群と比べてシステマティックにシフトする
- Contextual Anomalies(文脈的異常):個々のスカラー値は正常範囲に収まる。しかし、エージェント間の活性化の相関や幾何配置は、全体として異常な構造を持つ
つまり共謀は、「エージェント間の関係性」に符号化される内部的パターン。単独で見れば「少し変かも」程度に過ぎない。複数エージェントの内部表現を統合して、初めて明瞭な異常として浮かび上がる。ここが本質的だと思う。
迎合:「圧力に応じた出力シフト」と回路レベルの脆弱性
一方、マルチエージェント迎合では、構造的な脆弱性が局在化されている。特定の中間層の回路が、2つの要因を合成している。
- チャネルの枠付け(誰が話しているか)
- 合意の強さ(何対何か)
この合成によって、正解が誤答に置き換わる。
内部的には、以下のようなメカニズムが示されている。
- 中間層(L14–L18付近)の注意回路が上記2要因を合成する。その結果、正しい推論を抑制する方向に活性化がシフトする
- これはRLHF由来というより、事前学習済みモデルに既に存在するmid-layerの脆弱性。アライメントはそれを部分的に緩和するだけで、根本原因ではない
- 「新しい迎合回路がオンになる」わけではない。むしろ「クリーンな推論特徴が圧力によって抑制され、出力層での確率分布が歪む」という形で現れる
RLHFのせいだと思い込んでいたので、事前学習の時点で既に存在する脆弱性だという指摘は個人的に意外だった。
さらに、マルチエージェント議論では、迎合の経路が2つ同定されている。内在的迎合(モデルの訓練バイアスに由来)と、制御された迎合(プロンプトや設定による)である。内部的には「早期収束」「自信模倣」「言語模倣」「対立回避」といったパターンが観察される。これらは、推論の多様性を削ぐ形で活性化空間を狭めると解釈できる。
まとめ
| 側面 | 共謀(collusion) | 迎合(sycophancy) |
|---|---|---|
| 本質 | 複数エージェントによる意図的な協調逸脱 | 他者・多数派への過度な同調 |
| 表層的特徴 | 個々の発話は正常、組み合わせで異常(秘密通信、不正合意など) | 議論の早期収束、多数派意見への追随、正解の置き換え |
| 内部的特徴 | エージェント間の内部表現の関係性に符号化された「集団的アノマリー」 | 中間層の注意回路が「チャネル×コンセンサス」を合成し、推論を抑制 |
| 検出の単位 | 複数エージェントの内部状態を同時に見る必要がある(multi-agent interpretability) | 単一エージェントの活性化でも回路レベルで局在化可能 |
| 設計上の含意 | 監視は「個体」ではなく「関係・相関」を見る必要がある | パイプライン設計(構造的異議、多様性確保)が重要 |
ざっくり言うと、こう整理できそう。
- 共謀:内部的には「エージェント間の関係に隠れた異常」。表層的には「個別には普通、全体でヤバい」
- 迎合:内部的には「圧力に応じて中間層が推論を抑制する回路」。表層的には「和を優先して正解を捨てる」
調べる前の私は、両者を同じものとして扱っていた。だが、検出のアプローチも設計上の対策も別物だった。共謀対策にはエージェント間の相関を監視する仕組みが要る。一方、迎合対策には単一エージェント内の回路レベルの介入やデコーディング手法が効く。
「協調的失敗」という括りでまとめてしまうと、この違いが見えなくなる。そこは意識しておきたい。
参考文献
- Shi, Zhang, Yang. Emergent Collusion in Long-Horizon LLM Agent Interaction. https://arxiv.org/abs/2609.24967
- Shehata, Li. Recovering Agentic Sovereignty: Mitigating the Consensus Paradox via Contrastive Epistemic Decoding. https://arxiv.org/abs/2609.25570