用語集

Distributed Training

分散学習

分散学習とは、1台のGPU・サーバーでは処理しきれない大規模なモデルの学習を、複数のGPUやノードに処理を分散して行う技術です。データ並列(データを分割して各GPUで同じモデルを学習)、モデル並列(モデルを分割して各GPUに配置)、パイプライン並列の3つの手法が主に用いられ、実際には組み合わせて使われます。

分散学習の効率はGPU間・ノード間通信帯域幅に大きく左右されるため、InfiniBandとNCCLの最適な組み合わせが重要です。大規模LLMの開発には数千GPU規模の分散学習環境が必要です。

CONTACT

お問い合わせ

GPU導入・AI活用にお悩みの方は
お気軽にご相談ください。

課題に合わせた「最適な計算環境」と
「AI実装プラン」をご案内します。