分布式并行训练:3D 并行策略与拓扑感知调度

数据并行、张量并行、流水线并行的 3D 组合是大模型训练的标准范式。本文分析不同并行策略的适用场景与拓扑感知放置方法。

引言

当模型规模超过单卡显存容量时,必须采用分布式并行训练。数据并行、张量并行、流水线并行各有优劣,3D 并行成为大模型训练的标准范式。

数据并行(Data Parallelism)

每张 GPU 持有完整模型副本,处理不同数据批次,通过 AllReduce 同步梯度。实现简单,但通信开销随 GPU 数量线性增长。

张量并行(Tensor Parallelism)

将单层计算切分到多 GPU,如矩阵乘法按列或按行切分。通信频繁但延迟敏感,适合机内 NVLink 高速互联场景。

流水线并行(Pipeline Parallelism)

将模型按层切分到不同 GPU,形成流水线。需处理气泡(Bubble)问题,1F1B 调度策略可有效减少气泡。

拓扑感知调度

根据集群物理拓扑(NVLink、PCIe、RDMA)合理分配并行策略,将通信密集的张量并行放在机内,数据并行放在跨机,最大化训练效率。

总结

3D 并行是大模型训练的核心技术,信珩星途课程系统讲解原理与工程实践。

信
信珩星途XinHengStar

专注大模型 AI 基础设施、智算高速网络与高阶 IT 认证培训,致力于让底层硬核技术可学、可用、可落地。

联系方式

  • 电话:13681997023(皮老师)
  • 邮箱:xhxtlab@126.com
  • 地址:上海市

©2026 信珩星途 XinHengStar 版权所有|上海信珩星途信息技术有限公司|沪ICP备2026043883-1号