高性能计算网络所服务的负载具有非常不同的通信模式。一个紧耦合仿真、一个分布式训练作业和一组相互独立的计算任务,可能使用相同数量的服务器,却需要不同的网络行为。起点是作业,而不是交换机代际。
明确通信需求
记录进程或 GPU 的放置位置、作业规模、消息行为、并发情况以及与存储的交互。确定哪些通信跨节点、哪些仍留在服务器内部。在决定计算、存储、外部服务和管理路径在哪里共享基础设施之前,先将它们区分开。
根据实际的服务器和适配器配置统计活跃的网络端点数量。确切的适配器型号和支持的模式很重要;产品系列名称并不等于通用的协议授权。R51
遵循合适的设计路径
| 项目问题 | 相关解决方案范围 |
|---|---|
| 选择整体计算网络 | AI 计算交换网络规划 |
| 构建或扩展 NDR 环境 | NDR 端点、拓扑和互连设计 |
| 规划向 XDR 过渡 | XDR 端口架构和迁移边界 |
| 在 AI 中使用以太网 RDMA | RoCE 架构及独立的调试投运流程 |
| 使集群可运维 | 管理、供电、恢复和备件基础设施 |
这些范围应作为完整系统来评估。以太网/RoCE 需要主机与拥塞行为协同配合;InfiniBand 需要其自身受支持的交换网络控制和管理安排。两者都不能简化为面板速率的比较。R08R52
明确界定规模和故障
计算面向端点的端口、交换机间端口和扩展预留。说明正常状态和降级状态下的容量假设。为一个大型作业设计的拓扑,在多个作业竞争共享链路时可能表现不同。
为明确规划的下一步预留增长空间,例如增加一个机架组。包括该步骤所消耗的互连和管理资源。未使用的物理笼座在每个运行模式下并不一定都是可用容量。
用实际软件栈进行验证
试点应包含真实的主机架构、驱动程序、固件、交换网络软件和具有代表性的布线。使用通信测试来诊断路径,然后测量应用的相关结果。NCCL Tests 可以支持 GPU 集合通信评估,但其结果需要结合配置和放置位置的背景来解读,并非通用的 HPC 基准测试。R11
不仅要保留成功的运行记录,也要保留失败和异常记录。它们能识别出采购规格应保留的运行边界。
在初始设计讨论中,请提供服务器清单、应用、作业规模、机架布局以及运维团队的约束条件。由此产生的交换网络方案应说明其设计目标、将如何验证这些目标,以及哪些假设会限制其未来扩展。
配套工程示意图
以下配图用于说明本篇设计思路,图中英文术语可结合文末释义阅读;不代表实测结果、认证配置或随货清单。
专业术语说明
- NDR 端点NDR endpoint
- NDR 是 InfiniBand 的一代速率等级,端点指接入交换网络的服务器或存储端口。本篇中用于界定构建或扩展 NDR 环境时的端口、拓扑与互连设计范围。
- XDR 端口架构XDR port architecture
- XDR 是 InfiniBand 的下一代速率等级,端口架构指端口速率、通道与交换芯片的配套设计。本篇中用于规划向 XDR 过渡时的迁移边界。
- RoCE 架构RoCE architecture
- RoCE 是基于融合以太网的远程直接内存访问,架构涵盖主机侧与网络侧的拥塞控制配合。本篇中强调其需要独立的调试投运流程,不能仅比较面板速率。
- 集合通信collective
- 集合通信指多个进程或 GPU 之间按组进行的通信操作,如广播、归约等。本篇中 NCCL Tests 可用于 GPU 集合通信评估,但结果需结合配置与放置位置解读。
- 物理笼座physical cage
- 物理笼座指交换机或服务器面板上用于插入光模块或线缆的机械插槽。本篇中提醒未使用的笼座在每个运行模式下并不一定都是可用容量。
延伸阅读
资料来源
资料核对:
参数、兼容性与操作步骤应结合文中引用资料、完整型号及实际软件版本核对。配图为工程示意。


