用語集

Inference

推論

推論とは、学習済みのAIモデルを使って実際の入力データに対して予測や出力を生成するプロセスです。LLMにおいてはユーザーの入力テキストを受け取り、次のトークンを逐次生成する処理が推論に該当します。

学習と異なり勾配計算が不要なため、メモリ使用量は少なくなりますが、サービス提供においてはレイテンシとスループットの両立が求められます。量子化(INT8/INT4)やvLLMなどの最適化技術を活用することで、限られたGPUリソースでの推論効率を高めることができます。

CONTACT

お問い合わせ

GPU導入・AI活用にお悩みの方は
お気軽にご相談ください。

課題に合わせた「最適な計算環境」と
「AI実装プラン」をご案内します。