英伟达 H100 GPU性能,规格,供给分析

首页 > 科技

英伟达 H100 GPU性能,规格,供给分析

来源:减肥餐搭配 发布时间:2023-08-23 10:10

NVIDIA H100张量核心GPU提供前所未有的机能,可扩展性,以及各种工作负载的安全性。与NVIDIA®NVLink®开关系统,最多256H100 gpu可以连接加速百亿亿级工作负载,而专用Transformer Engine支持万亿参数语言模型。H100使用突破性立异的NVIDIA Hopper™架构提供业界-领先的会话AI,将大型语言模型的速度进步了30倍以前的一代。

NVIDIA H100 gpu具有第四代张量内核和Transformer引擎具有FP8精度,进一步扩展了NVIDIA在市场领先的AI领导地位练习速度进步4倍,推理速度进步30倍语言模型。对于高性能计算(HPC)应用,H100将FP64的每秒浮点运算次数(FLOPS)增加三倍,并将其添加动态规划(DPX)指令提供高达7倍的更高性能。采用第二代多实例GPU (MIG),内置NVIDIA秘要计算,和NVIDIA NVLink交换系统,H100安全地加速所有从企业级到百亿亿级的每个数据中心的工作负载。

作为 A100 的替换,H100 采用了当前最进步的台积电 4nm 工艺、单块芯片拥有 800 亿个晶体管,可以加快 AI、HPC、内存带宽、互连和通讯的发展,甚至能够实现每秒近 5 兆字节的外部连接,是第一个支持PCle Gen5和利用HBM3的GPU,使记忆体频宽达到3TB/s。

硬件层级上,A100有108个SM,而H100 SM晋升到了132个,H100 SM数目的晋升带来2倍机能增益。其中每个SM里有 128个FP32 CUDA Core,配备了第四代 Tensor Core,可以在同时脉的条件下,晋升2倍比拟于A100的稠密(Dense)或稀疏(Sparse)运算的原始机能。(注:在安培架构,是有复用 INT32 部门,H100的FP32 CUDA Core是独立的,在没复用的情况下把 FP32 CUDA Core数目翻倍。)

全新的张量数据处理格局FP8 。FP64/FP32 60TFlops(每秒60万亿次),FP16 2000TFlops(每秒2000万亿次),TF32 1000TFlops(每秒1000万亿次),都三倍于A100。H100的FP8 算力是4000TFlops(每秒4000万亿次),六倍于A100。(FP8比拟于FP16,拥有更少的内存占用,且向量化程度更高,吞吐即会有晋升)

新的 Transformer Engine 结合了软件和定制的 Hopper Tensor Core 技术,专门用于加速 Transformer 模型的练习和推理,其集合了新的 Tensor Core、FP8 和 FP16 精度计算,以及 Transformer 神经网络动态处理能力,可以将此类机器学习模型的练习时间从几周缩短到几天,与上一代 A100 比拟,在语言模型的练习和推理过程中,练习速度比上一代快了9倍,推理速度快了30倍。

新的线程块集群(Thread Block Cluster)架构。该架构以比单个 SM 上的单个线程块更大的粒度开放了对局部性的控制。通过向原有的编程层级结构添加另一个级别来扩展 CUDA 编程模型,现在包括thread、thread block、thread block cluster和grid。block集群使多个线程块在多个 SM 上同时运行,以同步和协作获取和交换数据。(注:一个SM可以包含多个SP。thread是一个线程,多个thread组成一个线程块block,多个block又组成一个线程网格grid。)

张量记忆加速器 (Tensor Memory Accelerator)。新的张量内存加速器 (TMA) 进步了数据获取效率,TMA 通过复制描述符启动,使用张量维度和块坐标指定数据传输,而不是按元素寻址,其指定大数据块并将其从全局内存加载到共享内存或从共享内存存储回全局内存。TMA 通过支持不同的张量布局(1D-5D 张量)、不同的内存访问模式、缩减和其他功能,明显降低了寻址开销并进步了效率。

支持第四代 NVLink 技术。将 NVLink 与新的外部 NVLink Switch 相结合,NVLink 作为扩展网络扩展到服务器,与使用 NVIDIA HDR Quantum InfiniBand 的上一代比拟,最多可以连接多达 256 个 H100 GPU,带宽也高出了 9 倍。

针对服务器实际应用,H100 可以虚拟化为 7 个用户共同使用,每个用户获得的算力相当于两块全功率的 T4 GPU。对于贸易用户来说,H100 实现了业界首个基于 GPU 的秘要计算。

Nvida 的 GPU H100、GH200、DGX GH200、HGX H100 和 DGX H100 之间的区别?

• H100 = 1x H100 GPU;

• HGX H100 = NVIDIA 服务器参照平台。OEM 厂商用于构建 4 GPU 或 8 GPU 服务器,由 Supermicro 等第三方 OEM 制造;

• DGX H100 = NVIDIA 官方 H100 服务器,配备 8x H100,NVIDIA 是其独一供应商;

• GH200 = 1x H100 GPU 加上 1x Grace CPU;

• DGX GH200 = 256x GH200,将于 2023 年底上市,可能仅由 NVIDIA 供给;

H100 供应侧分析

来自 TSMC 的瓶颈

H100 是基于 TSMC 4N 工艺出产的,4N 属于 5nm 系列中的增强型 5nm,而非真正的 4nm 工艺。除了 NVIDIA,Apple 也在使用这个技术,但他们已主要转向 N3,并保存了大部分 N3 容量。一般情况下,前端制程容量(Fab Capacity)会提前 12 个月以上就被规划好。有观点指出,TSMC 和其大客户会共同计划下一年的出产需求,因此当下 H100 的供应短缺一定程度上是因为 TSMC 和 NVIDIA 在前一年对今年 H100 需求的错误判断。

H100 内存

H100 SXM 上主要使用 HBM3 内存, H100 PCIe 上,主要使用 HBM2e。因为HBM 很难出产,供应也非常有限,对于 HBM3 内存,NVIDIA 可能全部或者主要使用 SK Hynix。目前并不确定 NVIDIA 的 H100 是否使用了三星的内存,但可以确定的是,NVIDIA 目前没有使用美光的内存。

总结

至少到 2023 年底,对于要部署数百或数千的 H100 的企业都会面临短缺问题,也许到 2023 年底,情况会更加明朗,但目前看来,GPU 的短缺可能会持续到 2024 年。

ICQQG提供英伟达H100,H800,A100,A800GPU产品的机能,规格供应分析,欢迎关注我们。

NVIDIA H100张量核心GPU提供前所未有的机能,可扩展性,以及各种工作负载的安全性。与NVIDIA®NVLink®开关系统,最多256H100 gpu可以连接加速百亿亿级工作负载,而专用Transformer Engine支持万亿参数语言模型。H100使用突破性立异的NVIDIA Hopper™架构提供业界-领先的会话AI,将大型语言模型的速度进步了30倍以前的一代。

上一篇:横掠算短语吗... 下一篇:拼多多如何处...
猜你喜欢
热门阅读
同类推荐