NVIDIA Collective Communications Library
NCCL
NCCLとは、NVIDIAが提供するGPU間の集合通信(AllReduce・AllGather・Broadcastなど)を効率化するライブラリです。分散学習においてモデルの勾配をノード内外の全GPUで同期する処理に使われ、InfiniBandやNVLinkの帯域幅を最大限に活用するよう最適化されています。
PyTorchやTensorFlowなどの主要AIフレームワークに統合されており、分散学習環境では事実上の標準ライブラリとして位置づけられています。NCCL通信の帯域幅不足が分散学習のボトルネックとなるケースが多いため、ネットワーク設計と合わせてチューニングが重要です。




