https://www.alphaxiv.org/abs/2608.11981 を読んだメモです。
書誌情報
- 問い:SLMで事前学習したモデルを使うのが効率的か、それとも、大きなLLMを圧縮して使うのが効率的か?
- 上記の問いを、公平性、堅牢性、プライバシー、倫理の面から評価できるベンチマークを提供する
- 評価では、倫理、プライバシー、堅牢性、公平性を評価できるTrustLLMフレームワーク(先行研究で提案されているもの)を利用して評価する
- 評価では、非構造化及び半構造化枝刈りではLLMの信頼性を著しく低下させた
- 2:4などの半構造化枝刈りは、非構造化枝刈りよりも信頼が悪化した
- 具体的には、Llama-3.1-8Bの非構造化枝刈りでロバストネススコアは10%近く低下した
- 量子化は、枝刈りより信頼性を維持する上で遥かに効果的であった
- 量子化は、GPTQとAWQを使った
- 4bit量子化でのスコアの劣化は2%未満であった
- 同じ重みメモリフットプリントで事前学習済みSLMと圧縮LLMを比較すると、事前学習済みSLMよりも、4bit圧縮(量子化)済みLLMの方がスコアが高かった
- 蒸留で信頼性を向上することができることが確認された
- したがって、実用では、枝刈りより量子化を優先すること、SLMで事前学習するのではなく大きなモデルを圧縮すること、蒸留が有効である