柜级全互联 vs 多台 8 卡堆叠:差 9 倍
同样是 B300 芯片,实测差 9 倍:
- GB300 NVL72 整机柜 —— 单卡 token 吞吐 7700/s
- 普通 8 卡 B300 服务器 —— 单卡只有 800/s
差在哪?不是芯片,是互联:
- 柜内 72 卡在同一 NVLink 域,全互联
- 跨服务器要走 IB 网络,延迟直接吃掉推理性能
- 真正的瓶颈是 KV 缓存跨卡传输
结论:做长上下文、高并发的 token 工厂,柜级 NVLink 全互联远胜多台 8 卡堆叠。
如果只是小规模推理,8 卡机够用,别为了「柜」多花那个钱。
这篇能拿走什么
读了不算数,拿去用才算。