引言
当模型规模超过单卡显存容量时,必须采用分布式并行训练。数据并行、张量并行、流水线并行各有优劣,3D 并行成为大模型训练的标准范式。
数据并行(Data Parallelism)
每张 GPU 持有完整模型副本,处理不同数据批次,通过 AllReduce 同步梯度。实现简单,但通信开销随 GPU 数量线性增长。
张量并行(Tensor Parallelism)
将单层计算切分到多 GPU,如矩阵乘法按列或按行切分。通信频繁但延迟敏感,适合机内 NVLink 高速互联场景。
流水线并行(Pipeline Parallelism)
将模型按层切分到不同 GPU,形成流水线。需处理气泡(Bubble)问题,1F1B 调度策略可有效减少气泡。
拓扑感知调度
根据集群物理拓扑(NVLink、PCIe、RDMA)合理分配并行策略,将通信密集的张量并行放在机内,数据并行放在跨机,最大化训练效率。
总结
3D 并行是大模型训练的核心技术,信珩星途课程系统讲解原理与工程实践。