2026-09-11大模型训练集群网络架构演进趋势从单机 GPU 到万卡集群,大模型训练对网络架构提出了前所未有的要求。本文梳理了从 PCIe 到 NVLink、从 TCP/IP 到 RDMA 的网络演进路径。阅读全文 →
2026-09-09RDMA 与 RoCE 在智算中心的实践要点RDMA 技术是实现高性能智算网络的关键。本文深入分析 RoCEv2 在数据中心部署中的 PFC、ECN 配置要点与常见性能瓶颈排查方法。阅读全文 →
2026-09-07NCCL 集合通信原理解析与性能调优NCCL 是大模型分布式训练中最核心的通信库之一。本文详解 AllReduce、AllGather 等原语的实现原理及跨机通信的路由选择策略。阅读全文 →