Distributed Training
分散学習
分散学習とは、1台のGPU・サーバーでは処理しきれない大規模なモデルの学習を、複数のGPUやノードに処理を分散して行う技術です。データ並列(データを分割して各GPUで同じモデルを学習)、モデル並列(モデルを分割して各GPUに配置)、パイプライン並列の3つの手法が主に用いられ、実際には組み合わせて使われます。
分散学習の効率はGPU間・ノード間通信帯域幅に大きく左右されるため、InfiniBandとNCCLの最適な組み合わせが重要です。大規模LLMの開発には数千GPU規模の分散学習環境が必要です。




