英伟达最强芯片性能公布,较H100提升17%
英伟达今天向MLPerf提交了其Grace Hopper CPU+GPU超级芯片和L4 GPU翻跟斗的首批基准测试结果。MLPerf是行业标准的AI基准测试,旨在为衡量不同工作负载下的人工智能性能提供公平的竞争环境。这次提交有两个值得关注的新亮点:新增了大型语言模型(LLM)GPT-J推理基准测试,
英伟达今天向MLPerf提交了其Grace Hopper CPU+GPU超级芯片和L4 GPU翻跟斗的首批基准测试结果。MLPerf是行业标准的AI基准测试,旨在为衡量不同工作负载下的人工智能性能提供公平的竞争环境。这次提交有两个值得关注的新亮点:新增了大型语言模型(LLM)GPT-J推理基准测试,以及改进后的推荐模型。根据英伟达的说法,在GPT-J基准测试中,Grace Hopper超级芯片的推理性能比其市场领先的H100 GPU高出17%,而L4 GPU的性能则达到英特尔至强CPU的6倍。
整个行业正以惊人的速度向更新的人工智能模型和更强算力迈进。同样,由MLCommons机构管理的MLPerf基准测试也在通过新的v3.1版本同步进化,以更好地反映AI领域不断变化的特征。
GPT-J 6B是一个自2021年起就在实际工作负载中使用的文本摘要模型,现在已成为MLPerf套件中衡量推理性能的基准。与1750亿参数的GPT-3这类更先进的模型相比,60亿参数的GPT-J LLM相对轻量,但非常适合作为推理基准。该模型能够总结文本块,并在对延迟敏感的在线模式和吞吐量密集的离线模式下运行。此外,MLPerf套件还引入了参数数量翻倍的更大DLRM-DCNv2推荐模型、更大的多热点数据集,以及能更好模拟真实环境的跨层算法。

有了这些背景,我们就能理解英伟达的性能声明了。不过要注意,这些基准测试是英伟达自己向MLCommons提交的,可能代表经过高度调优的最佳情况。
英伟达还喜欢强调一点:它是唯一一家为MLPerf套件中每个AI模型都提交基准测试的公司——这个说法是客观事实。有些公司完全缺席,比如AMD;另一些只提交了部分基准测试,比如英特尔的Habana和谷歌的TPU。各家公司不提交的原因不尽相同,但能看到更多竞争对手加入MLPerf阵营总是好的。
英伟达提交了首个GH200 Grace Hopper超级芯片的MLPerf结果,突出显示CPU+GPU组合的性能比单个H100 GPU高出17%。乍看之下令人惊讶,因为GH200使用的GPU核心与H100相同,但下面会解释原因。当然,配备8个H100的英伟达系统性能优于Grace Hopper超级芯片,在每一项推理测试中都处于领先。
简单回顾一下:Grace Hopper超级芯片在同一块板卡上集成了Hopper GPU和Grace CPU,两者之间通过吞吐量达900GB/s的C2C链路连接,这是典型PCIe带宽的7倍,从而提升了CPU到GPU的数据传输能力。它还通过包含96GB HBM3内存和4TB/s GPU内存带宽的一致性内存池,增强了GH200的可访问内存带宽。相比之下,测试中使用的H100(在HGX配置中)仅有80GB HBM3(下一代Grace Hopper型号将在2024年第二季度配备144GB HBM3e,速度提升1.7倍)。
英伟达还推出了一项名为“Automatic Power Steering”的动态功耗转移技术,该技术能在CPU和GPU之间动态分配功率预算,将多余的预算倾斜给负载更高的单元。这项技术在许多现代CPU+GPU组合中已有应用,并不算新,但它确实让Grace Hopper超级芯片上的GPU获得了比HGX更高的功耗预算——因为功率可以从Grace CPU那里转移过来,这在标准服务器中是做不到的。完整的CPU+GPU系统以1000W TDP运行。
目前大多数推理仍在CPU上执行,随着更大模型日益普及,这种情况未来可能改变。对英伟达来说,用L4这样低功耗的小型GPU取代用于这些工作负载的CPU至关重要,因为这将推动大规模销售。本轮MLPerf提交还包括英伟达L4 GPU的首批结果:这款推理优化卡在GPT-J推理基准测试中的性能是单个Xeon 9480的6倍,而功耗仅为72W,采用超薄外形设计,无需辅助电源连接。
英伟达还声称,通过测量8个L4 GPU与两个上一代Xeon 8380 CPU的表现,视频+AI解码-推理-编码工作负载的CPU性能提升了120倍——这种比较有些不平衡。这可能是为了直观展示单个机箱内所能容纳的计算能力。需要指出的是,虽然四路服务器并非此类工作的最优选择,但它仍可使用,而且更新的至强芯片在这次测试中可能会表现更好。测试配置写在幻灯片底部的小字里,务必留意这些细节。
最后,英伟达还提交了Jetson Orin机器人芯片的基准测试,显示推理吞吐量提升了84%,这主要得益于软件改进。

重要的是要记住,在现实世界中,每个人工智能模型都是作为较长模型序列的一部分运行的,这些模型在AI管道中协同完成特定任务。英伟达上面的插图很好地说明了这一点:一个查询在执行完毕前需要经过八个不同的AI模型——而此类AI管道扩展至15个网络来满足单个查询的情况并不罕见。这个背景很重要,因为上述面向吞吐量的基准测试往往侧重于以高利用率运行单个AI模型,而不是现实世界中的管道——后者需要更强的通用性,多个AI模型串行运行才能完成给定任务。
英伟达上周还宣布,其用于生成式AI工作负载的TensorRT-LLM软件可在推理工作负载中提供优化性能,在H100 GPU上使用时不增加成本,总体性能提升一倍以上。英伟达最近提供了该软件的详细信息,并指出在本次结果提交时,这个推理增强软件尚未准备就绪;MLCommons要求MLPerf提交需有30天的准备时间,而当时TensorRT-LLM还不可用。这意味着英伟达的首轮MLPerf基准测试应该在下一轮提交中会看到巨大改进。
Nvidia Grace Hopper CPU的设计详解
正如我们之前的报道中所指出的,英伟达的Grace CPU是该公司首款专为数据中心设计的纯CPU Arm芯片,一块主板上集成两个芯片,共144个核心;而Grace Hopper超级芯片则在主板上集成了Hopper GPU和Grace CPU。
根据英伟达之前透露,Grace CPU采用台积电4N工艺。台积电将“N4”4nm工艺归入其5nm节点家族,将其描述为5nm节点的增强版。英伟达使用了该节点的一个特殊变体,称为“4N”,专门针对其GPU和CPU进行了优化。
随着摩尔定律的放缓,这类专用节点变得越来越常见,因为每进入一个新节点,缩小晶体管都变得更加困难且昂贵。为了实现英伟达4N这样的定制工艺节点,芯片设计人员和代工厂需要携手合作,采用设计技术协同优化(DTCO)来为其特定产品调整定制功耗、性能和面积(PPA)特性。
英伟达此前曾透露,其Grace CPU使用现成的Arm Neoverse内核,但公司仍未说明具体使用哪个版本。不过,英伟达表示Grace采用Arm v9内核,支持SVE2。Neoverse N2平台是Arm第一个支持Arm v9和SVE2等扩展的IP。N2 Perseus平台采用5nm设计(请记住,N4属于台积电的5nm系列),支持PCIe Gen 5.0、DDR5、HBM3、CCIX 2.0和CXL 2.0。Perseus设计针对每瓦性能和每面积性能进行了优化。Arm表示,其下一代核心Poseidon要到2024年才会上市,考虑到Grace的发布日期为2023年初,这些核心的可能性较小。
英伟达的新可扩展一致性结构(SCF)是一种网状互连,看起来与Arm Neoverse核心配合使用的标准CMN-700一致性网状网络非常相似。
英伟达SCF在各种Grace芯片单元(如CPU核心、内存和I/O)之间提供3.2 TB/s的对分带宽,更不用说通过NVLink-C2C接口连接其他芯片——无论是另一个Grace CPU还是Hopper GPU。

该网格支持72个以上核心,每个CPU总L3缓存为117MB。英伟达表示,上面专辑中的第一个框图是“用于说明目的的可能拓扑”,其排列方式与第二个图并不完全一致。
该图显示了具有八个SCF缓存分区(SCC)的芯片,这些分区似乎就是L3缓存片(我们将在演示中了解更多细节),以及八个CPU单元(这些似乎是核心集群)。SCC和核心以两个为一组连接到缓存交换节点(CSN),然后CSN驻留在SCF网状结构上,以提供CPU核心和内存与芯片其余部分之间的接口。SCF还通过Coherent NVLink支持最多四个插槽的一致性。

英伟达还分享了这张图,显示每个Grace CPU支持最多68个PCIe通道和最多4个PCIe 5.0 x16连接。每个x16连接支持高达128 GB/s的双向吞吐量(x16链路可以分为两个x8链路)。我们还看到了16个双通道LPDDR5X内存控制器(MC)。
然而,此图与第一个图不同,它将L3缓存显示为连接到四核CPU集群的两个连续块,这比之前的图更有意义,并且芯片中总共有72个核心。但是,我们在第一个图中没有看到单独的SCF分区或CSN节点,这造成了一些混乱。我们将在演示期间解决这个问题,并根据需要进行更新。
英伟达告诉我们,可扩展一致性结构(SCF)是其专有设计,但Arm允许合作伙伴通过调整核心数量、缓存大小以及使用不同类型的内存(例如DDR5和HBM)来定制CMN-700网格,并选择各种接口,例如PCIe 5.0、CXL和CCIX。这意味着英伟达可能为片上结构使用了高度定制的CMN-700实现。
GPU对内存吞吐量非常敏感,因此英伟达自然而然地将目光投向提升内存吞吐量——不仅限于芯片内部,也包括CPU和GPU之间的内存吞吐量。Grace CPU具有16个双通道LPDDR5X内存控制器,最多可支持32个通道,支持高达512 GB的内存和546 GB/s的吞吐量。英伟达表示,由于容量和成本等多种因素,它选择了LPDDR5X而非HBM2e。同时,与标准DDR5内存相比,LPDDR5X的带宽增加了53%,每GB功耗降低了1/8,使其成为更好的整体选择。
英伟达还推出了扩展GPU内存(EGM),它允许NVLink网络上的任何Hopper GPU访问网络上任何Grace CPU的LPDDR5X内存,同时保持原生NVLink性能。
英伟达的目标是提供一个可以在CPU和GPU之间共享的统一内存池,从而提供更高的性能,同时简化编程模型。Grace Hopper CPU+GPU芯片支持具有共享页表的统一内存,这意味着芯片可以与CUDA应用程序共享地址空间和页表,并允许使用系统分配器来分配GPU内存。它还支持CPU和GPU之间的原生原子操作。
CPU核心是计算引擎,但互连才是定义计算未来的战场。移动数据比实际计算数据消耗更多的电量,因此更快、更有效地移动数据,甚至避免数据传输,是一个关键目标。
英伟达的Grace CPU在一块板上由两个CPU组成,而Grace Hopper超级芯片在同一块板上由一个Grace CPU和一个Hopper GPU组成,旨在通过专有的NVLink芯片间(C2C)互连最大限度地提高单元之间的数据传输,并提供内存一致性,以减少或消除数据传输。

英伟达分享了其NVLink-C2C互连的新细节。简单来说,这是一种芯片到芯片的互连,支持内存一致性,可提供高达900 GB/s的吞吐量(是PCIe 5.0 x16链路带宽的7倍)。该接口使用NVLink协议,英伟达使用其SERDES和LINK设计技术设计了该接口,重点关注能源和面积效率。物理C2C接口通过标准PCB运行,因此不使用专门的中介层。
NVLink-C2C还支持行业标准协议,例如CXL和Arm的AMBA一致集线器接口(CHI——Neoverse CMN-700网格的关键)。它还支持多种类型的连接,从基于PCB的互连到硅中介层和晶圆级实现。

能效是所有数据结构的关键指标。今天英伟达表示,传输的数据每比特(pJ/b)链路消耗1.3皮焦耳。这是PCIe 5.0接口效率的5倍,但它是未来将上市的UCIe互连功耗的两倍多(0.5至0.25 pJ/b)。封装类型各不相同,C2C链路为英伟达的特定用例提供了性能和效率的坚实结合,但正如上表所示,更高级的选项可提供更高水平的能效。
Nvidia 将H100 推理性能提高一倍的秘诀
英伟达表示,其新的TensorRT-LLM开源软件可以显著提高GPU上大型语言模型(LLM)的性能。据该公司称,TensorRT-LLM的功能使其H100计算GPU在60亿参数的GPT-J LLM中的性能提升了两倍。重要的是,该软件可以实现这种性能改进,而无需重新训练模型。
英伟达专门开发了TensorRT-LLM以提高LLM推理的性能,英伟达提供的性能图表确实显示,通过适当的软件优化,其H100的速度提升了两倍。TensorRT-LLM一个特别突出的功能是其创新的动态批处理技术。该方法解决了LLM动态且多样化的工作负载问题,这些工作负载的计算需求可能存在很大差异。
动态批处理优化了这些工作负载的调度,确保GPU资源得到最大程度的利用。因此,H100 Tensor Core GPU上的实际LLM请求吞吐量翻倍,从而实现更快、更高效的AI推理过程。

英伟达表示,其TensorRT-LLM将深度学习编译器与优化的内核、预处理和后处理步骤以及多GPU/多节点通信原语集成在一起,确保它们在GPU上更高效地运行。这种集成得到了模块化Python API的进一步补充,它提供了一个开发人员友好的界面,可以进一步增强软件和硬件的功能,而无需深入复杂的编程语言。例如,MosaicML在TensorRT-LLM之上无缝添加了所需的特定功能,并将它们集成到其推理服务中。
Databricks工程副总裁Na veen Rao表示:“TensorRT-LLM易于使用,功能齐全,包括令牌流、动态批处理、分页注意力、量化等,而且效率很高。它为使用NVIDIA GPU的LLM服务提供了最先进的性能,并使我们能够将节省的成本回馈给我们的客户。”

英伟达H100与TensorRT-LLM结合使用时的性能令人印象深刻。在英伟达的Hopper架构上,H100 GPU与TensorRT-LLM配合使用时,性能是A100 GPU的八倍。此外,在测试Meta开发的Llama 2模型时,TensorRT-LLM的推理性能比A100 GPU提高了4.6倍。这些数字凸显了该软件在人工智能和机器学习领域的变革潜力。
最后,H100 GPU与TensorRT-LLM结合使用时支持FP8格式。此功能可以减少内存消耗,而不会损失模型准确性,这对于预算和/或数据中心空间有限、无法安装足够数量服务器来调整其LLM的企业来说尤其有益。
你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:英伟达最强芯片性能公布,较H100提升17%要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
相关热点在COMPUTEX2026展会上,技嘉展示了AORUSGeForceRTX5080INFINITYWOOD显卡和AORUSX870EINFINITYNEXT主板。RTX5080显卡采用白色主题与木色元素装饰,设计独特;X870E主板则以蝴蝶翅膀为灵感,采用类蜂窝结构和金属3D打印
星际荣耀公司近日成功完成SQX-3运载火箭海上回收高精度导航系统的无人机挂飞试验。该试验在广东阳江海域进行,采用创新的半实物动态模拟方案,全面验证了导航系统在复杂海况下的性能。结果表明,系统各项指标均优于设计要求,能够稳定提供火箭与回收船之间的高精度相对导航信息。这标志着该核心系统已完成全部地面验证
PC内存厂商OriginCode近日分别针对英特尔和AMD平台推出专项优化内存。面向英特尔平台的CQDIMM内存,通过与技嘉合作验证了256GB8000MT s的高带宽套条,旨在为本地AI、视频渲染等重载任务提供强大数据吞吐能力,并计划在2026年台北电脑展展出。针对AMD平台,则推出多款支持E
东风本田公布5月销量达18563台,环比增长20%,其中CR-V销量增长显著。品牌同步推出6月限时购车权益,涵盖CR-V、英仕派、HR-V及思域等多款车型,权益价最低至9 79万元起,并可叠加国家以旧换新补贴及原厂配置加装优惠,为近期有购车计划的消费者提供了具体的价格参考与增值选择。
- 日榜
- 周榜
- 月榜
热点快看
