用語集Inference推論推論とは、学習済みのAIモデルを使って実際の入力データに対して予測や出力を生成するプロセスです。LLMにおいてはユーザーの入力テキストを受け取り、次のトークンを逐次生成する処理が推論に該当します。学習と異なり勾配計算が不要なため、メモリ使用量は少なくなりますが、サービス提供においてはレイテンシとスループットの両立が求められます。量子化(INT8/INT4)やvLLMなどの最適化技術を活用することで、限られたGPUリソースでの推論効率を高めることができます。用語集一覧に戻る