モデル圧縮と量子化
蒸留が大模型の能力を小さな模型へどう移すか、低精度の量子化が何と引き換えに速度と省メモリを得るか、小規模言語模型の限界はどこかを整理します。
模型をスマホや入門 GPU に載せるには三つの手段があります。大模型の出力分布をまねる蒸留、重みを 4 ビットや 8 ビットに落とす量子化、寄与の小さい結合を削る剪定です。得られるのはメモリ・遅延・電力の削減で、代わりに精度が減ります。低下は一様ではなく、長文生成や数値推論から先に崩れがちです。本タグは各手法の使いどころと、圧縮後の検証手順を整理します。