Quantization / INT8 / INT4
量子化
量子化とは、AIモデルのパラメータや演算の数値精度をFP32・FP16からINT8・INT4などの低精度フォーマットに変換することでモデルサイズを削減し、推論速度を高める技術です。精度をわずかに犠牲にする代わりにGPUのVRAM使用量を大幅に削減でき、より少ないGPUリソースで大規模モデルを実行できるようになります。
GPTQ・AWQなどの量子化アルゴリズムやvLLMとの組み合わせで、LLMの推論コスト削減に広く活用されています。INT4量子化では元のFP16比で約4倍のメモリ効率改善が期待できます。




