本文目录确立服务器边界将工作负载映射到这些接口选择受支持的交换网络组合纳入安装与恢复层验证通信与有效工作配套工程示意图

“B300 组网”并不是一个完整的系统规格。B300 标识的是 GPU 代际,而服务器平台决定网络接口、适配器位置、散热和服务连接。NVIDIA DGX B300 配置应依据其自身的系统文档来解读;不应假定它描述了所有使用 B300 GPU 的第三方服务器。R40

确立服务器边界

记录确切的服务器型号与配置、计算适配器、服务接口、管理端口以及主机接口布局。明确哪些接口用于 GPU 通信,哪些用于存储、外部访问或管理。

不要将内部 GPU 互连容量等同于外部网络容量。它们是具有不同边界的通信路径。交换网络设计必须基于工作负载实际可用的外部接口。

将工作负载映射到这些接口

确定框架、传输方式以及预期的作业放置。统计每台服务器的活动交换网络端口数,并定义跨机架或跨轨道的预期映射。仅凭服务器数量估算而缺少适配器拓扑,可能同时误判交换机端口需求和互连物料清单。

输入 为何重要
确切的服务器配置 确定真实的主机和网络接口
应用与传输方式 决定需要验证的通信路径
作业规模与并发度 影响跨机架需求和共享路径压力
机架放置 决定拓扑和线缆路由
故障目标 定义故障期间必须维持的路径和可接受的作业中断

选择受支持的交换网络组合

对于以太网/RoCE 设计,需协调主机软件、适配器能力、交换机功能和拥塞策略。不要将一组看似兼容的任意组件描述为经过验证的平台解决方案。使用相关的部署基线并测试集成路径。R08

从两端选择互连。逻辑端口速率、物理笼座、通道布局和模块散热形式是各自独立的属性。高聚合模块容量并不等同于一条相同速率的单链路。R01

纳入安装与恢复层

考虑管理连接、控制台访问、电源馈送、散热、安装以及合格备件。这些需求来自完整的服务器和交换机配置,而非 GPU 名称。

保持计算交换网络的扩展独立于管理可达性。运维人员不应需要依赖健康的生产交换网络来诊断该交换网络为何发生故障。

验证通信与有效工作

使用具有实际服务器配置的代表性试点。运行主机和交换网络检查、适用时的集合通信测试以及预期应用。保留命令设置、放置、版本以及观察到的拥塞或错误行为。NCCL Tests 可以提供有用的通信证据,但其结果不应被呈现为每个 B300 工作负载的性能。R11

交付物是特定于服务器的网络设计,包含合格的物料清单和验收计划。为了进行有意义的询价,请提供完整的服务器配置和工作负载——而不仅仅是 B300 GPU 的数量。

配套工程示意图

以下配图用于说明本篇设计思路,图中英文术语可结合文末释义阅读;不代表实测结果、认证配置或随货清单。

工程示意图 1 — B300 GPU 系统组网:匹配确切的服务器平台与交换网络

工程示意图 2 — B300 GPU 系统组网:匹配确切的服务器平台与交换网络

专业术语说明

RoCE(基于融合以太网的远程直接内存访问)RDMA over Converged Ethernet
在以太网上承载 RDMA(远程直接内存访问)的协议。数据传输可由适配器卸载,减少处理器参与和内核数据复制;并非所有过程都完全绕过 CPU。部署时需核对端点、拥塞控制和整条路径。
物料清单(BOM)Bill of Materials
构建系统所需的组件与数量清单。本文强调互连 BOM 需基于适配器拓扑和端口映射,而非仅凭服务器数量估算。
集合通信测试(NCCL Tests)NCCL Tests
NVIDIA 集合通信库提供的测试工具,用于验证 GPU 间通信性能。本文指出其结果可作为通信证据,但不代表所有 B300 工作负载的性能。
物理笼座physical cage
交换机或服务器上用于插入光模块的物理插槽结构。本文强调逻辑端口速率、物理笼座、通道布局和模块散热形式是独立属性,不能混为一谈。

延伸阅读

资料来源

资料核对:

参数、兼容性与操作步骤应结合文中引用资料、完整型号及实际软件版本核对。配图为工程示意。