0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

【012】再帰Transformerの「常識」は間違いだった — d=1は再帰ではなかった

0
Last updated at Posted at 2026-09-18

この記事の要約

重み共有再帰Transformerでは、全ての再帰ステップが「同じ処理の繰り返し」だと暗黙に仮定されてきた。
d=1は収束解析でも「ノイズ」として除外するのが定石だった。
しかし d=1(初回ステップ)は再帰ではない。プレリュードからの「注入」である。
この区別を無視した結果、7.0Bモデルの学習で制御系が完全に非稼働状態に陥り、連鎖的な崩壊が発生した。
d=1に対する制御方針を変更することで問題は解消された。
「d=1は除外せよ」ではなく「d=1こそ最初に制御せよ」— 再帰Transformerの前提が反転した。


1. 再帰Transformerの「自明な前提」

Universal Transformer(Dehghani et al., 2019)以来、重み共有再帰Transformerでは同一ブロックをd回適用する。この系譜は近年急速に発展し、Geiping et al.(2025)は潜在空間再帰によるテスト時計算量スケーリングを実証、Ouro(Zhu et al., 2025)はループモデルが非ループモデルと同等の性能を示すことを報告、Bae et al.(2025)はMixture-of-Recursionsによるトークン単位の適応深度を提案している。

Gate Decay(深度依存の減衰機構)も、全深度に対して統一的な減衰制御を行うのが標準的な設計だった。

深度が増えるほどdecayが強くなり、深い再帰ほど更新が抑制される。合理的な設計に見える。

この設計には致命的な見落としがあった。


2. d=1は「再帰」ではない

BathysRDTのアーキテクチャを見ると、再帰ループに入る前にプレリュード(4層の独立Transformer encoder)が存在する。

埋め込み → プレリュード(4層) → [再帰ブロック × d回] → コーダ(4層) → 出力

再帰ループの各ステップを整理すると:

ステップ 入力のソース 性質
d=1 プレリュード出力 異なるソースからの初回注入
d=2 d=1の再帰出力 再帰的洗練
d=3 d=2の再帰出力 再帰的洗練
d=4 d=3の再帰出力 再帰的洗練

d=1だけが質的に異なる。 d≥2は「前のステップの出力を同じブロックに再入力する」再帰的洗練だが、d=1は「プレリュードという別のモジュールから来た情報を初めて再帰ブロックに注入する」ステップだ。

にもかかわらず、Gate Decayは全深度に同一の制御パラメータを適用していた。


3. 浅い深度でdecayが効かない問題

Gate Decayの減衰強度は深度依存であり、浅い深度ほど減衰が弱い。これはexp関数の性質上、数学的に必然である。

問題は、d=1ではこの減衰が事実上ゼロになることだ。具体的な数値は特許(ALTH-001〜006)の保護範囲のため省略するが、定性的に言えば:

  • d=1: ゲートをほぼ素通し — Gate Decayの効果がほぼゼロ
  • d=4以降: 有意な抑制 — 設計意図通りの動作
  • d=8以降: 強い抑制 — 深い再帰での安定化に寄与

d=1が「再帰的洗練」ではなく「初回注入」であるにもかかわらず、decayがほぼ効いていない。 これが全ての問題の起点だった。


4. 7.0Bモデルで起きたこと — 制御系が死んだ

4.1 実験条件

BathysRDT 7.0Bパラメータモデル(ユニーク約3.3B、重み共有で7.0B相当)を、RTX 3090単一GPUで学習した。

d=1に対する制御の有無を検証するため、d=1のCE(クロスエントロピー)と深層のCEの差(gap)を定期的に計測する仕組みを導入した。

4.2 分離制御なし — 失敗

最初の実験では、d=1用の減衰制御をグローバル設定と同一にした(分離なし)。結果:

  • gap ≈ 0 — d=1のCEと深層のCEがほぼ同じ
  • 制御器が有意なgapを検出できず、事実上の非稼働状態

さらに、この状態で連鎖的な障害が発生した:

  1. 適応的なτ制御の過渡応答でグローバルτが急落
  2. 深度制御器が崩壊判定 → 浅い深度に退避
  3. 深度拡張がロックされ、低い有効深度に閉じ込め
  4. 10Mトークン時点でCE=10.937(同時期の正常条件はCE=10.571)

4.3 分離制御あり — 成功

d=1に専用の減衰パラメータを導入し、深層のd=4程度と同等の減衰強度をd=1に与える設計とした。具体的なパラメータ値と適応制御の詳細はALTH-012(特願2026-201413)に記載されている。

結果は劇的に変わった。


5. 実験結果 — d=1制御の効果(200Mトークン完走)

5.1 学習初期の d=1 CE 比較

分離制御なし(v3.5)と分離制御あり(v3.6)の学習初期における d=1 CE を比較する。

eval 時点 v3.5 d1 CE v3.6 d1 CE v3.5 d3 CE v3.6 d3 CE
1回目(d≤4) 23.85 10.82 11.49 10.24
2回目(d≤4〜5) 13.09 10.70 11.05 10.71
3回目(d≤5〜6) 42.76 10.66 10.34 10.66
4回目(d≤6〜7) 20.67 10.29 10.06 9.59

v3.5 の d=1 CE は 13〜43 の範囲で激しく変動し、d3 CE(10〜11)の 2〜4 倍に達している。v3.6 の d=1 CE は 10.3〜10.8 で安定しており、d3 CE と同等水準を維持している。この差は学習の最初期から一貫しており、d=1 分離制御が即座に効果を発揮していることを示す。

5.2 200Mトークン完走時の比較

指標 v3.5(分離制御なし) v3.6(分離制御あり)
200M d1 CE 21.868 10.256
200M d3 CE 10.333 10.176
R_entry(d3/d1 比) 0.473 0.992
d1 CE 改善幅 — -11.612(53%改善)
200M 有効深度 d≤15 d≤16
実質有効深度 d2〜d15(14段) d1〜d16(16段、+2段)
200M CE(best depth) 9.374(d8) 9.886(d6)

v3.5 では d=1 の CE が 21.868 — d2 以降(9.4〜11.1)の約 2 倍であり、d=1 が有効な計算ステップとして機能していない。R_entry=0.473 は、d=1 が深層の半分以下の予測性能しか持たないことを意味する。

v3.6 では d=1 の CE が 10.256 — d2〜d17 の CE 範囲(9.886〜10.679)の中央付近に位置し、d=1 が深層と同等の予測性能を達成している。R_entry=0.992 であり、d=1 と d≥2 の性能差は実質的に消失した。

5.3 実質有効深度の拡大

v3.5 では D-CTRL の有効深度上限は d≤15 だが、d=1 が実質無効であるため、有効な再帰計算は d=2〜d=15 の 14 段 にとどまる。v3.6 では d=1 が有効化され、かつ D-CTRL 上限が d≤16 に 1 段拡大したことで、実質有効深度は d=1〜d=16 の 16 段(+2段) に拡大した。

同一パラメータ数でより深い再帰計算を利用可能にすることは、重み共有再帰アーキテクチャのパラメータ効率を直接改善する。変えたのはd=1の減衰パラメータだけだ。


6. なぜこれが「常識を覆す」のか

6.1 先行研究の定石 — 「d=1は除外せよ」

再帰Transformerの研究において、d=1は分析対象から意図的に除外されるのが定石だった。理由は明快で、d=1は再帰ブロックに入力が通過した最初の1回であり、重み共有による再帰的洗練がまだ始まっていない。そのため、収束解析や深度効率の議論では「d=1はノイズであり、d≥2からが本質的な再帰である」という暗黙の合意が、本研究が調査した範囲では存在していた。

具体的に見てみよう:

  • Universal Transformer(Dehghani et al., 2019, ICLR)— ACT(Adaptive Computation Time)の停止判定は全深度を均質に扱い、d=1を特別なステップとして認識しない
  • PonderNet(Banino et al., 2021, arXiv:2107.05407)— learned halting probabilityによって計算ステップ数を適応させるが、d=1を「初回注入ステップ」として独立した制御対象にする設計ではない
  • CALM(Schuster et al., 2022, NeurIPS)— confidence-basedのEarly Exitで層ごとの予測を利用し、学習時には層別lossの重み付けも行う。ただし、d=1を初回注入として分離制御する設計ではない
  • Ouro(Zhu et al., 2025, arXiv:2510.25741)— entropy-regularised exitゲートは学習パラメータだが、初回ステップを区別する構造はない
  • Mixture-of-Recursions(Bae et al., 2025, arXiv:2507.10524)— トークン単位で深度を適応させるが、d=1とd≥2の質的差異には言及していない
  • Universal Transformers Need Memory(Sapunov, 2026, arXiv:2604.21999)— 深度・メモリのトレードオフを確立したが、d=1の特殊性は分析対象外
  • Per-Token Fixed-Point Convergence(Logan, 2026, arXiv:2607.14427)— トークン単位の不動点収束を計測しているが、d=1を「初回注入ステップ」として独立した制御対象にはしていない

さらに、再帰Transformerではないが関連する研究として:

  • GRT: Gated Recurrent Transformer(arXiv:2608.15062, 2026)— prelude→shared recurrent core→codaの構造を持ち、adaptive update gateにより各再帰ステップの更新量を変調する。ただし、d=1を独立した制御対象として分離する設計ではない
  • CART: Cross-Attention Recurrent Transformer(arXiv:2606.01495, 2026)— LTI安定性をsigmoidゲートで実現するが、d=1の分離制御は行わない。なお、同論文の§10 ConclusionでBathysRDTの前身(OpenMythos)がconcurrent workとして言及されている

いずれの研究も、d=1に専用の制御パラメータを設ける設計を採用していない。

BathysRDTの実験結果は、この定石が危険であることを示す。

d=1を「除外してよいノイズ」と見なすのは、d=1への制御が不要であることを暗に前提としている。しかし実際には、d=1に適切なdecayが効いていない状態は、制御系の非稼働→連鎖崩壊という致命的な障害の原因になった。

d=1は除外すべき対象ではなく、最初に制御すべき対象だった。

6.2 暗黙の仮定の崩壊

再帰Transformerの研究では、Universal Transformer以来、以下の前提が暗黙に共有されてきた:

「重み共有再帰のすべてのステップは、同一パラメータによる同一処理の繰り返しである」

この前提の上に、上述のACT、PonderNet、CALM、Mixture-of-Recursionsなどの適応計算機構が構築されている。これらの研究で問題にされているのは「どこまで計算するか」であり、「d=1は再帰開始前の注入ステップとして別種の状態遷移なのか」という問いではない。

本研究の結果は、この前提が不完全であることを示す。d=1は物理的に異なるステップであり、異なる制御を必要とする。

6.3 先行研究との比較

研究 年 適応・深度制御 d=1独立制御
Universal Transformer 2019 ACTによる動的halting なし
PonderNet 2021 learned halting probability なし
CALM 2022 confidence / layer-wise prediction なし
Ouro 2025 learned depth allocation なし
Mixture-of-Recursions 2025 token-level recursive depth なし
Fixed-Point Convergence 2026 収束解析(d≥2が前提) なし
GRT 2026 adaptive update gate なし
CART 2026 sigmoid gate なし
収束解析の慣例 — d=1を除外して分析 なし
BathysRDT (本研究) 2026 d=1を初回注入として分離 あり

既存研究にも適応的な深度制御やゲート機構は存在する。しかし、d=1という構造的に異なる初回注入ステップを独立した制御対象として切り出した研究は、筆者の知る限り存在しない。 d=1は除外するのが標準的な実践だった。本研究は「除外すべき」を「最初に制御すべき」に反転させた。


7. 技術的補足

7.1 n1 norm(d=1隠れ状態のL2ノルム)

d=1の隠れ状態の大きさは学習に伴い漸減している:

時点 n1 norm
0.1M 1535.9
2M 1536.4
10M 1523.0
14M 1496.8
200M 1536.0

200Mトークン完走時も1536付近で安定しており、d=1の隠れ状態に崩壊の兆候はない。

7.2 d2/d1 ratio(安定性指標)

d=2がサンプリングされた際のnorm比(d=2のnorm / d=1のnorm):

時点 d2/d1 ratio
0.1M 1.0001
3.2M 0.9983
5.8M 0.9938
9.9M 0.9949

全て0.99以上で安定。d=1→d=2間に崩壊の兆候はない。

7.3 特許との関係

d=1分離制御は、多制御器協調学習フレームワーク(ALTH-012、特願2026-201413)の範囲内の設計である。Gate Decay機構の具体的な関数形(ALTH-001〜006)、制御アルゴリズムの閾値・適応調整パラメータの詳細(ALTH-008〜012)は特許明細書に記載されている。本記事では設計思想と実験結果を報告し、具体的な制御パラメータは省略している。


8. 現在の状況と今後

  • 200Mトークン学習は完走済み(2026年9月20日)
  • 200M完走データ: d=1 CE が 21.868(v3.5)→ 10.256(v3.6)に改善、R_entry が 0.473 → 0.992 に向上
  • 実質有効深度が 14段 → 16段 に +2段拡大
  • 学術論文(Jxiv第2稿 v8)にも知見4として掲載済み
  • 現在、400Mトークンまでの継続学習(Cycle 1)が進行中

  • 400M トークンまでの継続学習(Cycle 1)は完走しました(2026/9/23)。現在は、400M トークンの続きから学習を再開しています(2026/10/2)。
  • 同じアーキテクチャの 722M パラメータ版を公開しました(2026/10/2)。研究者が実行して評価できる最低限の形です。学習コードと学習時の制御方法は含みません。

9. まとめ

  1. d=1は再帰ではない — プレリュードからの初回注入であり、d≥2の再帰的洗練とは質的に異なる
  2. 全深度一律の制御ではd=1に減衰が効かない — 浅い深度ではGate Decayが事実上無効
  3. 分離制御により d=1 の CE が 21.868 → 10.256 に改善 — R_entry が 0.473 → 0.992、d=1 が深層と同等の予測性能を達成
  4. 実質有効深度が +2段拡大 — 同一パラメータ数でより深い再帰計算が利用可能に
  5. 分離制御なしでは連鎖崩壊が発生 — 崩壊判定 → 退避 → ロックアウト → 性能劣化
  6. 「d=1は除外せよ」という定石が誤りだった — d=1は除外すべきノイズではなく、最初に制御すべき対象である

重み共有再帰Transformerにおいて、「初回ステップは再帰ではない」という認識は、
アーキテクチャ設計と制御設計の両方に影響を与える基礎的な知見である。


シリーズ記事: BathysRDT — 重み共有再帰Transformerの研究
著者: 中村忠行(Aletheon Research)
特許: ALTH-001〜006, ALTH-008〜012(特願2026-201413 他)

追記(2026/10/2)

論文: Jxiv 第2稿(2026年10月1日公開) https://doi.org/10.51094/jxiv.6476
モデル: BathysRDT-722M(GitHub / Hugging Face)
中村忠行「精度差分観測による重み共有再帰Transformerの学習ダイナミクス解明: Gate Decay振幅制御、FP32崩壊境界、および多制御器協調学習」Jxiv, 2026.
https://doi.org/10.51094/jxiv.6476


参考文献

  • Dehghani, M. et al. (2019). Universal Transformers. ICLR.
  • Banino, A. et al. (2021). PonderNet: Learning to Ponder. arXiv:2107.05407.
  • Schuster, T. et al. (2022). Confident Adaptive Language Modeling. NeurIPS.
  • Zhou, W. et al. (2020). PABEE: Pre-Trained Model Based Early Exiting. ACL.
  • Geiping, J. et al. (2025). Scaling Up Test-Time Compute with Latent Reasoning. arXiv:2502.05171.
  • Rui-Jie Zhu et al. (2025). Scaling Latent Reasoning via Looped Language Models. arXiv:2510.25741.
  • Bae, S. et al. (2025). Mixture-of-Recursions. arXiv:2507.10524.
  • Sapunov, G. (2026). Universal Transformers Need Memory: Depth-State Trade-offs in Adaptive Recursive Reasoning. arXiv:2604.21999.
  • Logan, J. (2026). Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers. arXiv:2607.14427.
  • Zhang, T., Hu, J., Peng, Y., Xie, T. (2026). When Does Recurrence Become an Algorithm? arXiv:2607.20594.
  • GRT (2026). Gated Recurrent Transformer. arXiv:2608.15062.
  • CART (2026). Cross-Attention Recurrent Transformer. arXiv:2606.01495.
  • 中村忠行 (2026). Transformerの隠れ状態における見かけの収束. Jxiv.
  • 中村忠行 (2026). 精度差分観測による重み共有再帰Transformerの学習ダイナミクス解明: Gate Decay振幅制御、FP32崩壊境界、および多制御器協調学習. Jxiv. https://doi.org/10.51094/jxiv.6476
0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?