用語集

Quantization / INT8 / INT4

量子化

量子化とは、AIモデルのパラメータや演算の数値精度をFP32・FP16からINT8・INT4などの低精度フォーマットに変換することでモデルサイズを削減し、推論速度を高める技術です。精度をわずかに犠牲にする代わりにGPUのVRAM使用量を大幅に削減でき、より少ないGPUリソースで大規模モデルを実行できるようになります。

GPTQ・AWQなどの量子化アルゴリズムやvLLMとの組み合わせで、LLMの推論コスト削減に広く活用されています。INT4量子化では元のFP16比で約4倍のメモリ効率改善が期待できます。

CONTACT

お問い合わせ

GPU導入・AI活用にお悩みの方は
お気軽にご相談ください。

課題に合わせた「最適な計算環境」と
「AI実装プラン」をご案内します。