第06章-超节点

20 阅读4分钟

一句话定位:多设备协作的完整方法论——六种并行方式、集合通信代价、scale-up 物理组织(NVLink/TPU/昇腾 UB)与内存池;"放大超节点得到的是容量和总吞吐,不是单个会话的速度"。上一页:第05章-算子与运行时,下一页:第07章-数据中心网络。

小白入门:为什么一张卡不够用?

生活类比:一个人搬不动一台冰箱——需要两个人抬。但两个人抬不是"一个人搬两倍快",而是"两个人一起搬一台"。同样,多张 GPU 卡协作不是"一张卡跑两倍快",而是"多张卡一起跑一个模型"。

核心问题:70B 模型权重 141GB,一张 H100 只有 80GB——连装都装不下。必须把模型拆开放到多张卡上。

"放大超节点得到的是容量和总吞吐,不是单个会话的速度。"


一、六种并行方式

类比:把一个蛋糕分给多人吃——可以按人数分(数据并行)、按层数分(流水线并行)、按每层的块分(张量并行)……

并行方式切分维度类比适用场景
DP(数据并行)样本 B每人分一块蛋糕每卡跑完整模型,处理不同请求
TP(张量并行)特征 H把蛋糕竖着切,每人拿一部分每卡跑模型的一部分,同一请求
SP(序列并行)序列位置 S把蛋糕横着切长序列按位置分到不同卡
CP(上下文并行)上下文块把蛋糕按层分超长上下文分块处理
PP(流水线并行)层 L流水线——每人负责一道工序模型按层切分,轮流处理
EP(专家并行)专家 E每人负责不同科室MoE 模型的专家分到不同卡

套娃组合结构:DP 复制完整 TP×PP×EP 实例——大并行里套小并行。


二、集合通信的代价

类比:多人协作需要沟通——沟通本身也要花时间。如果沟通时间比干活时间还长,多人协作就不划算。

关键判据:TP 卡数翻倍的条件——通信增量须小于本地时间节省。

"并行收益随规模递减:串行处理的耗时仍然存在。"

通信-计算竞争:"单独加快通信不一定能加快整体执行"——64 MiB 通信与矩阵乘并发仅省 2.7ms 而非全部 11ms。

大小消息的分界

"数据量小时看延迟,数据量大时看持续带宽。"


三、超节点的物理组织

类比:办公室布局——小团队面对面坐(直连),中等团队用共享白板(交换机),大公司分层管理(分层互联)。

方案类比代表特点
直连面对面坐早期 8 卡 NVLink每卡连每卡,端口数爆炸
交换共享白板NVSwitch集中交换,端口数可控
分层分层管理DGX → NVL72scale-up 内紧密,scale-out 走网络

三大平台对比

平台互联规模上限特色
NVIDIA NVL72NVSwitch + NVLink72 GPU缓存一致,端口分配决定割集带宽
TPU v4ICI 环面 + OCS4096 芯片光路交换毫秒级切换
华为 UB事务层+传输层分离384×910C256KiB 缓存容纳四千多台主机

华为 UB 的关键优势:连接状态按端点数相加而非按端点对相乘——逐对连接只容 8 台主机,UB 方案容 4000+ 台。


四、内存池

类比:同事的桌子空着,你把文件放他桌上——用的时候取回来。

  • 借用与访问边界:在途事务窗口 uq/L
  • 重复读取约 10 次时取回本地更省——超过这个阈值,不如搬回本地

五、关键量化数据

项目数值
HGX H100 基线8×H100,每卡每方向 NVLink 450GB/s
NVLink 单向延迟0.822μs vs IB 3.76μs
Qwen3-235B-A22B BF16 权重470.2GB(单卡 6 倍),8 卡 TP 每卡 61.5GB
V4.1 Flash 算例(256 H100)超节点 8→64 卡每卡吞吐 ×7.4;64→256 无收益
昇腾 950 UB 双向2016GB/s
64B 远程读取UB 0.42μs vs PCIe 网卡 2.2μs

"单个 token 调用的 MFU 不会超过 0.3%……各种并行方式,都是在这一约束下重新组织权重的读取与复用。"