先看通信模式
GPU 训练常涉及节点间同步,网络规划需要结合训练框架、作业规模和通信模式。平均流量不能反映所有同步时刻的拥塞。
先记录每台服务器的网卡、端口数量、目标速率及连接拓扑,再确定接入与上联能力。
一起核对主机与交换
交换机带宽只是其中一项。网卡、光模块、线缆、PCIe 连接、固件和应用配置都会影响端到端表现。
采用 RoCE 时,需要结合设备实现核对拥塞控制与队列配置,不能只依赖某一项交换机功能。
留出可观测能力
测试应覆盖并发作业、队列积压、端口丢包和链路故障。记录测试模型、服务器数量与软件版本,才便于比较改造前后的结果。
按阶段扩展
把近期连接数量与后续扩容分开规划,检查机柜空间、供电、散热和布线。升级速率前先确认已有端口与光纤能否复用。
带宽与拥塞分开看
多个节点同时向少数目的端发送时,局部端口可能先拥塞,即使全网平均利用率并不高。应把作业流量与拓扑放在一起观察,检查路径分布、队列积压和网卡反馈,而不是只增加交换机标称带宽。
运维接口是选型条件
设备应能提供排障所需的端口、队列、错误和告警信息。采购前确认数据采集频率、管理接口和权限,再验证配置模板、批量变更及撤回。监控系统应在扩容前接入,才能得到可比较的基线。
采购前的试点
选择代表性的服务器、网卡、光互联和软件组合,测试实际训练或通信负载。把总成本分成设备、模块、线缆、授权和运维投入;吞吐、能耗或训练收益应来自同一测试条件下的结果。