对“显存带宽仅~1TB/s,远低于SRAM的40TB/s聚合带宽”的理解

2 阅读3分钟

这句话精准地指出了当前高性能计算(尤其是AI芯片)中最核心的瓶颈之一—— “内存墙”(Memory Wall) 。为了让你完全理解,我们分三步拆解:

1. 三个核心术语解释

  • 带宽(Bandwidth) :在计算机里,带宽指单位时间内能传输的数据总量。可以把它想象成高速公路的宽度和限速——带宽越高,每秒能通过的车(数据)就越多。这里用的是TB/s(太字节/秒),1 TB/s相当于每秒传输1万亿字节的数据。
  • 显存(VRAM,即Video Random Access Memory) :这是显卡(GPU)上的主内存,相当于显卡的“仓库”。它容量很大(通常几十GB),用来存放整个模型参数、训练数据等。但它物理上位于GPU芯片外部距离 GPU 计算核心较远,数据必须通过电路板上的走线(总线)才能运进芯片。正因为距离远、走线窄,它的带宽相对受限。
  • SRAM(静态随机存取存储器) :这是一种位于GPU芯片内部的高速缓存(如 Cache 级缓存或专属 SRAM 块)。它紧挨着计算核心(就像仓库旁边的“工作台”),容量极小(通常只有几十到几百MB)、成本高、占芯片面积大,但速度极快、延迟极低。这里的“40TB/s聚合带宽”指的是芯片内部所有SRAM区块的总读写能力之和,因为它们是并行工作的。
SRAM 与 显存 的关键对比
维度SRAM(片内缓存)显存(片外主存)
物理位置芯片内部(On-chip)芯片外部/中介层(Off-chip)
带宽速度极高(~40 TB/s 聚合带宽)相对较低(~1 TB/s)
访问延迟极低(几个纳秒/时钟周期)较高(几十到上百纳秒)
容量大小很小(几十 MB ~ 几百 MB)很大(24 GB ~ 192 GB 等)

2. 这句话的字面意思

这句话是在做速度对比

  • GPU从外部显存(仓库)取数据,速度只有 1 TB/s
  • GPU从内部SRAM(工作台)取数据,速度高达 40 TB/s

两者相差了整整40倍。这意味着,数据放在SRAM里,GPU计算核心能瞬间吃饱;但数据放在显存里,计算核心就得“饿着肚子干等”,因为数据送过来的速度跟不上计算速度。


3. 这句话背后要表达的深层意思(AI计算的核心痛点)

它揭示了当前大模型训练/推理的最大瓶颈:

  1. 算力闲置:GPU的计算单元(比如Tensor Core)每秒能处理几百TFLOPS(万亿次浮点运算),但显存带宽只有1TB/s。如果每个计算都要频繁去显存取数据,计算单元大部分时间都在“等快递”,利用率会非常低。
  2. 为什么AI代码要“疯狂优化” :这就是为什么工程师要花大力气做算子融合(Kernel Fusion)内存重计算——把多个小计算合并成一个大计算,让中间结果尽量待在速度极快的SRAM(工作台)上,避免频繁往返于慢速的显存(仓库)
  3. 硬件设计的无奈:显存带宽提升很慢(受限于物理引脚和功耗),而SRAM虽然快,但造价极高且面积大,无法做大。所以这句话本质上是在感慨:芯片的计算能力涨得太快,但数据搬运的速度远远跟不上,数据“运输”已经取代计算,成了决定AI训练速度的“卡脖子”环节。

因为显存带宽(1TB/s)和 SRAM 聚合带宽(40TB/s)相差了 40 倍,GPU 很多时候并不是卡在“算得不够快”,而是卡在“从显存搬运数据太慢” 。这就是为什么在 AI 算法优化中,工程师们需要花大量精力做“算子融合(Kernel Fusion)”或数据复用,尽量让数据留 在片内 SRAM 中处理,减少去片外显存拿数据的次数。