英伟达GB300 256块GPU跑DeepSeek-v3算力提升50%破世界纪录
英伟达GB300用256块GPU驱动深度求索3671B模型,单GPU吞吐量达一千六百四十八万亿次浮点运算,较去年提升百分之五十,为上一代GB200的三倍。通过模拟超二十五万种配置、实施三十八项优化及一百四十万小时测试,系统级工程实现算力跃升,显著降低AI训练成本。
7月22日,英伟达正式发布重磅消息:Blackwell GB300在MoE预训练任务中刷新了全球纪录。仅用256块GPU便成功运行DeepSeek-v3 671B模型,单GPU算力飙升至1648 TFLOPs——这一数字有何意义?对比去年11月的1088 TFLOPs,性能提升了整整50%;再往前追溯,上一代GB200仅为606 TFLOPs,GB300几乎是其3倍。


亮眼成绩的背后是扎实的工程投入。英伟达在过去6个多月里,模拟了超过25万种配置,从中提炼出38项关键优化方案,累计GPU测试时长高达140万小时。这并非简单的参数微调,而是系统级别的硬核工程突破。

简单科普一下:MoE(混合专家模型)将大模型拆分为多个专家子网络,每次推理或训练仅激活部分节点。其优势在于以更低的计算成本支撑更大的模型容量,如今已成为主流大语言模型的标准架构。

GB300 NVL72的核心亮点在于,用更少的GPU即可达成相同的训练性能。这意味着什么?AI训练成本将进一步降低,对于大模型厂商而言无疑是实质性利好。英伟达同时表示,通过持续的系统级优化,Blackwell架构仍有性能提升空间,而本轮优化成果将直接惠及所有使用GB300的AI训练集群。
对DeepSeek这类大模型厂商来说,GB300带来的算力跃升直接意味着更短的训练周期和更低的成本。单GPU 1648 TFLOPs的算力,足以支撑更大规模模型的快速迭代——这或许才是行业最值得期待的变化。
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
小米AI Cube工程版详解:三芯协同架构与150W本地大模型部署
小米发布AI Cube工程版迷你主机,采用玄戒O3、O100及D100三颗自研芯片协同架构。该设备持续性能释放达150W,支持120B参数大模型本地部署。文章解析其异构计算原理、散热设计及技术验证现状。
致态Ti600s 2TB SSD评测:Xtacking 4.0架构下的性能与寿命突破
本文深入评测致态Ti600s 2TB SSD,基于长江存储Xtacking 4 0架构,顺序读取达7400MB s,4K随机读写性能媲美带缓存TLC。其最大亮点在于写入寿命较上代提升50%,2TB型号高达900TBW,远超普通QLC竞品。
鲁大师怎么看轻薄本是否过热:三步判断法
轻薄本接电发热、掌托发烫时,如何判断是否真的过热?本文教你利用鲁大师进行三步排查:首先确认系统高温提示,其次对比温度与风扇转速,最后通过短压测试观察温度曲线。通过这三步,快速识别瞬时高温还是持续过热,并提供相应的解决建议。
WPS PDF查看缩略图:3步调出页面预览快速定位
在WPS Office中查看PDF文档缩略图非常简单。只需点击顶部菜单栏的“视图”,打开“导航窗格”,并在左侧边栏切换到“页面”视图即可。此方法可快速预览所有页面,并通过点击缩略图实现精准跳转,大幅提升长文档的阅读与查找效率。
Excel数据透视表选项卡不显示?3步找回分析与设计功能
在Excel中操作数据透视表时,若顶部未显示“数据透视表分析”和“设计”选项卡,通常是因为未正确选中透视表区域。只需点击透视表内的任意单元格,这两个专属选项卡便会自动出现在功能区。本文详细讲解如何快速找回并正确使用这两个核心功能入口。
- 热门数据榜
相关攻略
2026-08-28 14:39
2026-08-28 14:38
2026-08-27 18:47
2026-08-27 18:46
2026-08-27 18:46
2026-08-27 18:46
2026-08-27 18:46
2026-08-27 18:45
热门教程
- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程

