一句话定位:多设备协作的完整方法论——六种并行方式、集合通信代价、scale-up 物理组织(NVLink/TPU/昇腾 UB)与内存池;"放大超节点得到的是容量和总吞吐,不是单个会话的速度"。上一页:第05章-算子与运行时,下一页:第07章-数据中心网络。
小白入门:为什么一张卡不够用?
生活类比:一个人搬不动一台冰箱——需要两个人抬。但两个人抬不是"一个人搬两倍快",而是"两个人一起搬一台"。同样,多张 GPU 卡协作不是"一张卡跑两倍快",而是"多张卡一起跑一个模型"。
核心问题:70B 模型权重 141GB,一张 H100 只有 80GB——连装都装不下。必须把模型拆开放到多张卡上。
"放大超节点得到的是容量和总吞吐,不是单个会话的速度。"
一、六种并行方式
类比:把一个蛋糕分给多人吃——可以按人数分(数据并行)、按层数分(流水线并行)、按每层的块分(张量并行)……
| 并行方式 | 切分维度 | 类比 | 适用场景 |
|---|---|---|---|
| DP(数据并行) | 样本 B | 每人分一块蛋糕 | 每卡跑完整模型,处理不同请求 |
| TP(张量并行) | 特征 H | 把蛋糕竖着切,每人拿一部分 | 每卡跑模型的一部分,同一请求 |
| SP(序列并行) | 序列位置 S | 把蛋糕横着切 | 长序列按位置分到不同卡 |
| CP(上下文并行) | 上下文块 | 把蛋糕按层分 | 超长上下文分块处理 |
| PP(流水线并行) | 层 L | 流水线——每人负责一道工序 | 模型按层切分,轮流处理 |
| EP(专家并行) | 专家 E | 每人负责不同科室 | MoE 模型的专家分到不同卡 |
套娃组合结构:DP 复制完整 TP×PP×EP 实例——大并行里套小并行。
二、集合通信的代价
类比:多人协作需要沟通——沟通本身也要花时间。如果沟通时间比干活时间还长,多人协作就不划算。
关键判据:TP 卡数翻倍的条件——通信增量须小于本地时间节省。
"并行收益随规模递减:串行处理的耗时仍然存在。"
通信-计算竞争:"单独加快通信不一定能加快整体执行"——64 MiB 通信与矩阵乘并发仅省 2.7ms 而非全部 11ms。
大小消息的分界
"数据量小时看延迟,数据量大时看持续带宽。"
三、超节点的物理组织
类比:办公室布局——小团队面对面坐(直连),中等团队用共享白板(交换机),大公司分层管理(分层互联)。
| 方案 | 类比 | 代表 | 特点 |
|---|---|---|---|
| 直连 | 面对面坐 | 早期 8 卡 NVLink | 每卡连每卡,端口数爆炸 |
| 交换 | 共享白板 | NVSwitch | 集中交换,端口数可控 |
| 分层 | 分层管理 | DGX → NVL72 | scale-up 内紧密,scale-out 走网络 |
三大平台对比
| 平台 | 互联 | 规模上限 | 特色 |
|---|---|---|---|
| NVIDIA NVL72 | NVSwitch + NVLink | 72 GPU | 缓存一致,端口分配决定割集带宽 |
| TPU v4 | ICI 环面 + OCS | 4096 芯片 | 光路交换毫秒级切换 |
| 华为 UB | 事务层+传输层分离 | 384×910C | 256KiB 缓存容纳四千多台主机 |
华为 UB 的关键优势:连接状态按端点数相加而非按端点对相乘——逐对连接只容 8 台主机,UB 方案容 4000+ 台。
四、内存池
类比:同事的桌子空着,你把文件放他桌上——用的时候取回来。
- 借用与访问边界:在途事务窗口 uq/L
- 重复读取约 10 次时取回本地更省——超过这个阈值,不如搬回本地
五、关键量化数据
| 项目 | 数值 |
|---|---|
| HGX H100 基线 | 8×H100,每卡每方向 NVLink 450GB/s |
| NVLink 单向延迟 | 0.822μs vs IB 3.76μs |
| Qwen3-235B-A22B BF16 权重 | 470.2GB(单卡 6 倍),8 卡 TP 每卡 61.5GB |
| V4.1 Flash 算例(256 H100) | 超节点 8→64 卡每卡吞吐 ×7.4;64→256 无收益 |
| 昇腾 950 UB 双向 | 2016GB/s |
| 64B 远程读取 | UB 0.42μs vs PCIe 网卡 2.2μs |
"单个 token 调用的 MFU 不会超过 0.3%……各种并行方式,都是在这一约束下重新组织权重的读取与复用。"