大規模言語モデル(LLM)を実用的に展開する際、モデルのサイズを削減するために、まずアーキテクチャのパラメータ数を削減する構造的圧縮を行い、その後、残った重みを4ビットに量子化するという手法が標準的となっています。
しかし、この「圧縮してから量子化する」プロセスを経ると、推論能力、数学的推論、コード生成といったモデルの重要な能力が系統的に低下するという課題があります。
そのため、実運用パイプラインでは、この性能低下を回復させるための「ヒーリング(修復)」ステップが追加されています。
本研究では、構造的圧縮だけでなく量子化を経たモデルの回復プロセスに焦点を当て、「量子化認識ヒーリング(QAH)」という新しい手法を導入しました。
このQAHを、GPT-OSS 120Bモデルを60Bパラメータに圧縮し、MXFP4に量子化したモデルに適用した結果、その4ビットモデルが、元の高精度(bfloat16)バージョンと比較して9つのベンチマークのうち7つで性能を上回るという結果が得られました。
これは、通常、4ビットモデルが元の高精度モデルよりも性能が劣るという一般的な関係性を逆転させるものです。
従来のヒーリング手法には、量子化認識学習(QAT)と量子化認識蒸留(QAD)があります。
QATは、偽量子化演算子を順伝播パスに挿入し、タスク損失を用いてモデルを再ファインチューニングする方法ですが、これは多段階のポストトレーニングプロセスを再実行する必要があり、コストが高く、訓練が長すぎると不安定になるという課題があります。
一方、QADは、固定された高精度な教師モデルから量子化された生徒モデルへ、出力ロジットに対するKLダイバージェンス損失を用いて知識を蒸留することで、この再実行の必要性を回避します。
本研究は、これらの手法の限界を指摘し、QAHという新しい実用的なレシピを提示しました。
この記事は元情報をAIで日本語に要約したものです。全文翻訳ではなく、人手による完全な検証を保証しません。詳しくは原文をご覧ください。
Hugging Face
Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
原文の記事を確認する ↗