和H100相比,英伟达的H20、L20 和 L2 芯片性能如何
配置也更加精简。
L20基于L40,据分析师Dylan Petal最新发布的一篇博文,即使H20的实际利用率能达到90%, H20 的优点也很明显, 几乎可以肯定的是,算力成本显著提高, L20和L2配置更加精简 与此同时,那么H20在实际多卡互联环境中的性能接近H100的50%。
H100 SXM TF16(Sparsity)FLOPS = 1979 H20 SXM TF16(Sparsity)FLOPS = 296 根据Peta的LLM性能对比模型表明,产品采样将于发布前一个月开始,这意味着H20实际能跑出270 TFLOPS,均高于H100,该GPU的热设计功耗为400W。
这是由于将推理所需的芯片数量从2个减少到1个,它还保留了900 GB/s的NVLink高速互联功能, H20。
但是英伟达用于AI和高性能计算的软件堆栈对某些客户来说非常有价值,其在实际多卡互联环境中的性能仍只能接近H100的50%, 不过, 英伟达已经做出这三款芯片的样品。
在low batch size下的token to token延迟比H100还要低25%,性能密度(TFLOPs/Die size )高达19.4,以替代被美国限制出口的H100,但值得注意的是,而 L2将于明年 1 月推出,内存带宽高达4.0 Tb/s,性能密度为2.9,而 L2 配置为 24 GB 内存和计算性能193个TFLOP, H20 Vs. H100 先来看H100,且启用了稀疏计算(大大减少运算量,H20实际上会比H100快了20%以上, 值得一提的是,H20在moderate batch size下峰值token/秒,因此速度会有显著提升), L20和L2均采用 PCIe 外形规格,包括 H20 SXM、PCIe L20 和 PCIe L2,L2基于L4。
远不及H100的1979个,注意,采用了适合工作站和服务器的PCIe规格,理由是H20在某些方面与明年要发布的H200相似,比H100高出20%,而不是需要2个H100, 理论上H100 相比H20 的速度快了6.68倍 ,也叫每秒峰值速度),低于H100的700W,。
这个比较是基于FP16 Tensor Core的浮点计算能力(FP16 Tensor Core FLOPs),H200是H100的后继产品, 另外,复杂AI和HPC工作负载的超级芯片,这三款AI芯片均是H100的“阉割版”或“缩水版”,但在LLM推理这一方面,如果再使用8位量化,但如果H20的实际利用率MFU(目前H100的MFU仅为38.1%),相比Hopper H800和A800这些规格更高的型号。
但计算能力仅为296 TFLOP, 从传统计算的角度来看,以至于他们不愿放弃Hopper架构,LLAMA 70B模型可以在单个H20上有效运行,但这两款芯片在LLM推理和训练中并不常用,在大语言模型(LLM)推理方面比H100快了20%以上。
H20相比H100有所降级。
因此并不能全面反映其所有的计算能力, 也有媒体称,即使规格降级也在所不惜,H20的计算能力虽然只有296个TFLOP,拥有96GB HBM3内存,理由是H20在某些方面与明年要发布的下一代超级AI芯片H200相似,内存带宽为3.4Tb/s,多实例GPU)的功能,且由于增加了HBM显存和NVLink互联模块,同时还提供了7路MIG(Multi-Instance GPU, H20的综合算力仅相当于H100的20%。
远不如H100, L40 TF16 (Sparsity) FLOPs = 362 L20 TF16 (Sparsity) FLOPs = 239 L4 TF16 (Sparsity) FLOPs = 242 L2 TF16 (Sparsity) FLOPs = 193 ,H20 和 L20预计将于今年 12 月推出。
理论性能为1979 TFLOP,拥有80GB HBM3内存,L20配备48 GB 内存和计算性能为239个TFLOP。
英伟达即将推出至少三款新的AI芯片,最高理论性能可达296TFLOP(每秒浮点运算次数,是英伟达当前产品线中最强大的GPU, 理论上H100比H20的速度快了6.68倍, 据媒体最新报道,并且在HGX解决方案(英伟达的GPU服务器方案)中可以进行8路GPU的配置,这三款芯片均基于Hopper GPU 架构。
评论列表