第07章-数据中心网络

26 阅读3分钟

一句话定位:跨服务器协作——割集下界、并行方式与通信放置、在网归约、并发三重约束、拥塞控制分工与背压;"有网卡不等于用上了网卡"。上一页:第06章-超节点,下一页:第08章-推理优化。

小白入门:为什么 1024 张卡不能当 1 张卡用?

生活类比:1024 个人一起做一道菜——光协调谁干什么、食材怎么传,就要花大量时间。人越多,协调成本越高,到某个点后加人反而更慢。

核心问题:超节点(机内)解决了 8-72 张卡的协作,但千亿参数模型训练需要上千张卡——必须跨服务器。跨服务器的网络比机内互联慢得多(NVLink 900GB/s vs 网卡 50GB/s),网络成为瓶颈。

"有网卡不等于用上了网卡,通信算法决定每张网卡分到多少字节。"


一、割集与下界

类比:一条公路的通行能力由最窄的那段决定——不管其他段多宽。

T_C = V_C/B_C——传输时间下界 = 数据量 / 割集带宽

"链路每秒传的字节数都不会超过它的带宽。"


二、算法决定量、放置决定路径

类比:搬家时——搬多少东西由你决定(算法),走哪条路、经过哪些路口由房子位置决定(放置)。

算法跨服务器传输量说明
连续环720 MiB环绕所有服务器
分层384 MiB先机内归约再跨服务器

"算法决定总发送量,参与者在服务器上的分布则决定其中多少需要跨服务器传输、经过哪些网卡。"

通信放置原则:把频繁的张量并行归约留在较快的互联内,把数据并行的梯度同步放到服务器之间。


三、在网归约(SHARP)

类比:传统归约像每个人把数字写在纸上交给汇总人——汇总人加一遍。在网归约像快递员边送包裹边帮你加数字——到了目的地已经加好了。

S 台服务器时:环发送 2(S-1)/S 分片,在网归约恒一次。


四、并发三重约束

类比:高速公路通行量受三个因素限制——车道数(链路带宽)、收费站窗口数(槽位)、车辆进入速率(发起速率)。

B_eff ≤ min(B_path, Nm/T, m/δ)


五、拥塞控制分工

类比:交通管制——红绿灯管局部路口(链路流控 PFC),导航软件管全局路线(端到端 ECN/DCQCN)。

层级机制响应时间作用
链路流控(PFC)一跳 0.33μs极快挡局部溢出
端到端(ECN/DCQCN)20μs 往返较慢降源头速率

背压:"请求槽位用满后,端点就暂停或放慢提交,防止未完成的工作无限增长。"


六、关键量化数据

项目数值
NVLink H100 双向 / NIC / PCIe900 / 50 / 32-64 GB/s
192 MiB 梯度归约连续环 7.6ms → 分层 1.3ms
超售 3:11024 卡每卡份额 50→17.2 GB/s
64B 远程读取PCIe 网卡 2222ns / UB Load 419ns
状态量(N=M=1024)逐对连接 512 MiB vs 端点+通道 108 KiB(差 4855 倍)
1024 卡扩展8→64 卡吞吐 +36%;128→256 卡仅 +1.3%
故障统计1024 卡作业平均 7.9 小时中断一次

"平均利用率只有 40%",但高峰重叠仍积压——"缓冲保存的是一段时间内的差额"。