Tensor Parallelism
テンソル並列
テンソル並列とは、大規模LLMのモデル並列化手法のひとつで、モデルの重み行列(テンソル)を複数のGPUに分割して同時に計算する技術です。Transformerのアテンション層やFFN層の行列積演算を複数GPUで並列実行することでVRAMの制約を超えた大規模モデルの処理が可能になります。
NVIDIAのMegatron-LMが代表的な実装で、NVLinkによる高速GPU間通信と組み合わせることで通信オーバーヘッドを最小化します。GPT-3やLLaMAなどの超大規模モデルの学習に不可欠な技術です。




