9999算力 算力生意,一手判断
首页/判断/服务器居间/型号与硬件

柜级全互联 vs 多台 8 卡堆叠:差 9 倍

规则服务器居间2026-09-27

同样是 B300 芯片,实测差 9 倍:

  • GB300 NVL72 整机柜 —— 单卡 token 吞吐 7700/s
  • 普通 8 卡 B300 服务器 —— 单卡只有 800/s

差在哪?不是芯片,是互联:

  • 柜内 72 卡在同一 NVLink 域,全互联
  • 跨服务器要走 IB 网络,延迟直接吃掉推理性能
  • 真正的瓶颈是 KV 缓存跨卡传输

结论:做长上下文、高并发的 token 工厂,柜级 NVLink 全互联远胜多台 8 卡堆叠。
如果只是小规模推理,8 卡机够用,别为了「柜」多花那个钱。