0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

Transformerの深い層は"冗長"ではなく"決定を遅延"しているのか ── J-space × Early Exit × 層プルーニングの再検証

0
Last updated at Posted at 2026-09-15

要旨

Transformerの効率化研究では、深い層の「冗長性」が広く議論されています。しかし、8つのTransformerモデルの各層で「隠れ状態の収束度」と「出力方向の整合度」を同時に測定したところ、通常Transformer 7モデルのうち3モデルで、中間層の出力方向が最終出力とは反対を向いていることが観測されました。

この結果は、少なくとも一部の通常Transformerでは、層の計算を単純な「冗長性」として扱うことが難しいことを示唆しています。

本記事では、この観測結果を報告し、Early Exitや層プルーニングの前提に対する示唆を考察します。


問題提起:hidden stateが「収束」していれば、出力も確定しているか?

Early Exitやdepth pruningでは、hidden stateの類似度を層の停止・削除判断に利用する考え方があります。

では、hidden stateが最終状態に近いことは、出力も確定していることを意味するのでしょうか?

本記事が検証するのは、この前提の妥当性です。各層のhidden stateを2つの異なる角度から測定し、hidden stateの収束とoutput directionの収束が一致するかどうかを調べました。


J-space:hidden stateとoutput directionのずれを見る

本記事の測定の核心は、hidden state(隠れ状態)の収束とoutput direction(出力方向)の収束を別々に測定し、両者が一致するかどうかを調べることにあります。

hidden state → 最終状態に近づいている? ← h_cos で測定
                    ↓
               しかし
                    ↓
output direction → 最終出力と同じ方向を向いている? ← l_cos で測定
                    ↓
         この2つが同じ「収束」を意味するとは限らない

この2つの指標が作る空間を、本記事では J-space と呼んでいます。

h_cos(隠れ状態の収束度)

h_cos(d, D) = cosine_similarity(h_d, h_D)

第d層の隠れ状態 h_d と最終層の隠れ状態 h_D のcosine類似度。値が1に近いほど「隠れ表現は最終状態に近い」ことを意味します。

l_cos(出力方向の整合度)

l_cos(d, D) = cosine_similarity(output_head(h_d), output_head(h_D))

第d層の隠れ状態をそのまま出力ヘッドに通した場合のlogitベクトル z_d と、最終層のlogitベクトル z_D のcosine類似度。値が1に近いほど「この層の時点で、最終出力と同じ方向の予測が出ている」ことを意味します。

J-gap

J-gap(d) = l_cos(d, D) - h_cos(d, D)

l_cosとh_cosの相対的な差を表します。正であれば、その層では出力方向の方がhidden stateより最終状態への類似度が高く、負であればhidden stateの方が出力方向より高い類似度を持ちます。

ただし、J-gapの符号だけで「収束している/していない」を判断することはできません。実際の解釈には、h_cosとl_cosそれぞれの絶対値を併せて見る必要があります。

注意事項

l_cosの測定は、各層のLayerNorm後の隠れ状態を直接出力ヘッドに通す方法です。各層に専用のプローブを学習させた場合は「その層でどこまで情報を引き出せるか」を測る指標になりますが、本記事のl_cosは**「モデルがそのまま使った場合に何が出力されるか」**を測る指標です。Early Exitの安全性評価には後者が直接的に関わります。


対象モデル

Model パラメータ数 層数 種別
GPT-2 124M 12 通常Transformer
llm-jp-3 3.7B 28 通常Transformer
Transformer 3.3B 3.3B 12 通常Transformer(自作)
DeepSeek-6.7B 6.7B 32 通常Transformer
Llama-3-8B 8B 32 通常Transformer
llm-jp-4 8B 32 通常Transformer
Qwen2.5-32B 32B 64 通常Transformer
独自再帰Transformer 722M 12(再帰) 重み共有再帰Transformer

Transformer 3.3Bは、独自再帰Transformerとの比較実験のために同一の学習データ・蒸留パイプラインで学習した12層の通常Transformerです。400Mトークンで学習しています。独自再帰Transformerは重み共有型の再帰Transformerで、同一ブロックを12回反復適用する構造です。通常のTransformerとの対比のために含めています。


観測結果

8モデルのJ-space分布

Model 層数 l_cos(中間層) h_cos(中間層) J-space分類
GPT-2 12 0.94 0.04 Predictive
独自再帰Transformer 12 recur 1.00 0.13→1.00 Predictive
Llama-3-8B 32 0.45 0.29 Partial
Transformer 3.3B 12 1.00 1.00 Predictive
Qwen2.5-32B 64 0.04 0.07 Weak
DeepSeek-6.7B 32 -0.27 0.40 False
llm-jp-3 28 -0.05 0.30 False
llm-jp-4 32 -0.24 0.07 False

J-space AC分類の定義

分類 条件 意味
Predictive l_cos ≥ 0.9(中間層) 中間層時点で出力方向がほぼ確定
Partial 0 < l_cos < 0.9 出力方向が部分的に整合
Weak l_cos ≈ 0(低い正値) 中間層の出力方向が最終出力とほぼ無関係
False l_cos < 0 中間層の出力方向が最終出力と反対を向く

この分類は中間層付近のl_cos代表値に基づいています。「中間層」は各モデルの総層数の約50%の深さを目安としています。


最も注目すべき観測:l_cosが負のモデル

通常Transformer 7モデルのうち3モデル(DeepSeek-6.7B、llm-jp-3、llm-jp-4)で、中間層のl_cosが負の値を示しました。

これが意味すること: 中間層の隠れ状態を出力ヘッドに通して得られるlogitベクトルは、最終層のlogitベクトルと反対方向を向いている。

特にDeepSeek-6.7Bでは、h_cos = 0.40(隠れ表現がある程度最終状態に近づいている)であるにもかかわらず、l_cos = -0.27(出力方向が反対)です。

hidden stateは「収束」しつつあるのに、output directionはまだ最終出力と一致していない。J-spaceで言えば、hidden-spaceの収束とlogit-spaceの収束が分離している状態です。


4つのJ-spaceパターン

Predictive(GPT-2, Transformer 3.3B, 独自再帰Transformer)── 出力方向が先に安定

GPT-2(12層)では、l_cos = 0.94と高い値を示します。中間層の時点で既に最終出力とほぼ同じ方向のlogitが生成されています。一方でh_cos = 0.04と極めて低く、隠れ表現自体は最終状態とは異なります。

Transformer 3.3B(12層)では、全層でl_cos = 1.00、h_cos = 1.00を示しました。ただしこの結果は、12層という浅い構造と400Mトークンという限定的な学習量のもとでの観測であり、層の機能分化が十分に進んでいない可能性があります。同じ12層のGPT-2もPredictiveを示しており、浅いモデルはPredictiveになりやすい傾向が見られます。

観測事実: 出力方向は浅い段階で確定するが、隠れ表現はその後も大きく変化し続ける。J-gapは正の大きな値(l_cosが先行して高い)。

このタイプでは、l_cosを使ったEarly Exitの判定が有望である可能性があります。

Partial(Llama-3-8B)── 途中まで整合、その先は不安定

l_cos = 0.45、h_cos = 0.29。J-spaceの中間領域に位置します。

観測事実: ある深さまでは出力方向が改善されるが、全体としては整合が不十分。

Weak(Qwen2.5-32B)── 中間層は最終出力と無関係

l_cos = 0.04、h_cos = 0.07。J-spaceの原点付近に位置します。

観測事実: 64層中の中間層は、最終出力に向かって漸進的に貢献しているようには見えない。最終層付近で急激に出力が決定される構造が示唆されます。

False(DeepSeek-6.7B, llm-jp-3, llm-jp-4)── 出力方向が反対

l_cosが負。J-spaceのl_cos負領域に位置します。

観測事実: 中間層時点の出力方向が、最終出力方向と反対側を向いている。これは、最終出力方向とは異なる方向から、最終的な出力方向へ大きく変化している可能性を示しています。


考察:観測 → 直接言えること → 仮説 → 未検証

観測事実

通常Transformer 7モデルのうち3モデルで、中間層のl_cosが負だった。

直接言えること

hidden stateが最終状態に近づいていても(h_cos > 0)、output directionが最終出力方向に近いとは限らない(l_cos < 0)。

したがって、hidden stateの収束だけでは、出力方向の収束を保証できない。

仮説

一部の通常Transformerでは、深い層は単なる冗長な反復ではなく、最終出力の方向を変更する計算を担っている可能性がある。

未検証

  • それを「決定の遅延」と呼ぶべきか、「予測の修正」と呼ぶべきか、あるいは別のプロセスなのか
  • 層数の増加がFalse ACを引き起こすかどうか — 同じ32層でもLlama-3-8B(Partial)とDeepSeek-6.7B(False)で異なるパターンが観測されており、層数だけでは説明できない。アーキテクチャや学習条件も関係している可能性がある
  • False ACを示すモデルの深い層を削除した場合に、実際にどのタスクでどの程度性能が変化するか

Early Exitとdepth pruningへの示唆

h_cosだけでは停止・削除の安全性を判断できないケースがある

False ACパターンではh_cos = 0.40であるにもかかわらずl_cos = -0.27です。h_cosベースの停止判定を適用すると、出力方向が最終出力と反対を向いている層で計算を打ち切るリスクがあります。

l_cos指標の併用による区別

層の冗長性を評価する際、重みやhidden stateの類似度だけでなく、各層の出力方向の整合度(l_cos)も指標に加えることで、「h_cosもl_cosも高い層(冗長の候補)」と「h_cosは高いがl_cosが低い層(出力方向を変更している候補)」を区別できる可能性があります。

命名に関する注

本稿で用いる「J-space」という名称は、Anthropicが提案したJacobian lens(J-lens)および同研究で用いられるJ-spaceという用語と区別して扱う必要がある。AnthropicのJ-lensは、中間層のactivationをinput-output Jacobianによって最終層側の基底へ写像し、モデル自身のunembeddingで読み出す手法である。本稿では、これに関連する予測空間をJ-spaceと呼び、J-gapやh_cos、l_cosなどの独自指標によって層方向の予測変化を分析している。

参考:


Transformer 3.3BのPredictive結果について

Transformer 3.3B(自作モデル)は全層でh_cos = 1.00、l_cos = 1.00となり、Predictive分類となりました。しかしこの結果には以下の構造的制約があり、「通常TransformerでもPredictiveになりうる」という一般的結論を導くものではありません。

  1. 12層という浅さ — False ACが観測された3モデル(DeepSeek-6.7B、llm-jp-3、llm-jp-4)はいずれも28-32層。GPT-2(同じく12層)もPredictiveであり、浅いモデルはPredictiveになりやすい傾向が見られる
  2. 400Mトークンの学習量 — 他の比較モデルは数百B〜数Tトークンで学習済み。400Mトークンでは層の機能分化が不十分な可能性がある

このため、Transformer 3.3Bは独自再帰Transformerとの直接比較(同一データ・蒸留パイプライン)のためのベースラインとして位置づけており、通常Transformerの一般的なJ-space特性を代表するものではありません。

一方で、12層のTransformer 3.3BではFalse ACではなくL0からほぼ最終予測が成立しているという結果は、「層が深いほどFalse ACになる」という単純な図式ではなく、モデルによって、予測が層方向に形成されるダイナミクスそのものが異なることを示唆しています。

再帰Transformerとの対比

今回測定した独自再帰Transformer(重み共有再帰Transformer, 722Mパラメータ)では、J-gap(= l_cos - h_cos)が深さとともに単調に減少する挙動が観測されました。通常のTransformerでこのような単調収束が観測されたのはGPT-2(12層)のみでした。

なぜ重み共有型の再帰Transformerでは異なる収束パターンが現れるのかは、今後の検証課題です。一つの可能性として、通常Transformerでは各層が独自の重みで異なる「役割」を持ちうるのに対し、重み共有型では同一の変換が繰り返されるため出力方向の整合が段階的に進みやすい、という機構が考えられます。ただしこれは現時点では仮説です。

この対比の詳細は、プレプリント( https://doi.org/10.51094/jxiv.5809 )で報告しています。


限界と今後の検証

本測定の限界

  • 各モデルの学習データ・学習条件が異なるため、パターンの違いがモデル構造によるものか学習条件によるものかを厳密に切り分けられない

  • l_cosの測定は各層の隠れ状態を直接出力ヘッドに通す方法であり、層ごとの情報抽出能力の上限を測るものではない

  • 「中間層」の定義は各モデルの総層数の約50%としており、層数が大きく異なるモデル間での直接比較には限界がある

  • 測定は限定された評価サンプルに基づいており、入力依存のパターン変動は調査していない

  • Transformer 3.3B(自作モデル)は12層・400Mトークン学習という制約のもとでの結果であり、大規模な通常Transformerの特性を代表するものではない

今後の検証

  1. 同一アーキテクチャ・異なるスケール ── 例えばLlama-8B / 70B / 405Bでパターンが遷移するか
  2. 入力依存性 ── 同一モデルでも入力の「難易度」によってパターンが変わるか
  3. l_cosを組み込んだdepth pruning / Early Exit ── l_cos指標がpruning後の性能予測精度を改善するか
  4. 学習段階での変化 ── 学習初期と後期でパターンが遷移するか

まとめ

  1. 8つのTransformerの各層で「隠れ状態の収束度(h_cos)」と「出力方向の整合度(l_cos)」を同時に測定した
  2. 通常Transformer 7モデルのうち3モデルで、中間層の出力方向が最終出力と反対を向いていた(False AC)
  3. hidden stateの収束だけでは、出力方向の収束を保証できない
  4. Early Exitやdepth pruningでは、h_cosだけでなくl_cosも考慮することで、出力方向が未確定の層をより正確に識別できる可能性がある

これは本測定から導いた観測事実と、それに基づく解釈です。深い層の内部計算に対する直接的な因果証明ではありません。

しかし、少なくとも以下のことは観測されています。Transformerの深い層は、何もしていないのではない。まだ「答え」を決めていないだけかもしれません。


関連研究

  • Lad et al. — LLMの推論がdetokenization → feature engineering → prediction ensembling → residual sharpeningの4段階で進行することを報告。本記事のFalse ACは、この段階的構造が出力方向の一時的な逆転を伴いうることを示唆
  • LEAP (arXiv:2605.01058) — 蒸留モデルでEarly Exitの前提が崩れることを報告。本記事は、蒸留に限らず通常の事前学習済みモデルでも類似の現象が存在する可能性を指摘
  • WRP (arXiv:2609.09883) — 重み類似度による層プルーニング。本記事のl_cos指標は、重みが類似していても出力方向が異なりうる場合があることを示す
  • Csordás et al. — 異なるサイズのモデルで相対的な深さの層が対応し、モデル後半がdistribution matchingに不均衡に費やされていることを報告
  • CascadeFormer (arXiv:2606.26538) — 勾配fan-in非対称性によるdepth-tapered構造を提案

測定環境

  • GPU: NVIDIA RTX 3090(24GB VRAM)
  • フレームワーク: PyTorch 2.6 + CUDA 12.4
  • 測定コード: 全モデルに対して同一のスクリプトを使用
  • 評価データ: 日本語テキスト

本記事の測定手法および分析の詳細は、プレプリント( https://doi.org/10.51094/jxiv.5809 )でも報告しています。


共同研究・追加検証へのご関心がある方へ

本記事で報告した観測結果について、大規模モデル(70B以上)での追加検証や、理論的な解析に関心をお持ちの研究者の方は、お気軽にご連絡ください。

特に以下のテーマで共同検証を検討しています。

  • 同一アーキテクチャの異なるスケールでのパターン変化(7B → 70B → 405B)
  • 入力の「難易度」に応じたパターン遷移
  • l_cos指標を組み込んだdepth pruning / Early Exitの改善

ORCID: 0009-0009-1789-9941
連絡先: tada2503@yahoo.co.jp

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?