英伟达 Blackwell GB200:机架即「一块巨型 GPU」,推理快 30 倍

黄仁勋口中的「生成式 AI 时代处理器」

2024 年 GTC 大会上,英伟达发布 Blackwell 架构与 GB200 NVL72 机架。黄仁勋称其为「为生成式 AI 时代打造的处理器」——不再是单芯片,而是一整个液冷机架当「一块巨型 GPU」来用。

一组让人咋舌的数字

  • GB200 NVL72:单机柜内 36 颗 Grace CPU + 72 颗 Blackwell GPU。
  • 推理算力约 1.4 exaflops(FP4),训练约 720 petaflops。
  • 第五代 NVLink:每颗 GPU 双向带宽 1.8 TB/s,单域可连 72 颗。
  • 相比 H100:实时万亿参数大模型推理快约 30 倍,训练快约 4 倍。
H100BlackwellGB200
实时推理 30x · 训练 4x(对比 H100)

为什么是「机架级」而不是「单卡」

大模型推理的瓶颈不在单卡算力,而在卡间互联与内存。GB200 用 NVLink 把 72 颗 GPU 连成一个统一内存域,模型不用切得七零八落,推理延迟大幅下降。配合液冷,单柜约 60 万零件、重约 3000 磅(约 1.36 吨)。

对行业的信号

算力采购逻辑从「比单卡峰值」转向「比整柜每瓦性能、互联与供电」。能效提升也直接压低了推理成本,间接利好开源与中小模型。黄仁勋把数据中心称为「AI 工厂」——目标就是产出智能。

值得记住:Blackwell 卖的不是芯片,是一整套机架级的 AI 工厂方案。