DeepSeek 开源周第二弹:DeepEP —— 首个 MoE 模型训练和推理的 EP 通信库
2025 年 2 月 25 日,deepseek 在开源周的第二天,正式发布了首个专为混合专家模型(moe)训练和推理设计的专家并行(ep)通信库 —— deepep。deepep 在 github 上开源仅 20 分钟,便获得了超过 1k 个 star。截止本文发布时间,deepep 的 github star 数已经达到 2.4k,并且还在持续飙升。
免费影视、动漫、音乐、游戏、小说资源长期稳定更新! 👉 点此立即查看 👈

采用 MoE(Mixture-of-Experts,混合专家)架构的大语言模型,能够在显著提升模型容量的同时避免计算量的线性增长。然而,这种架构也引入了新的挑战 —— 尤其是在 GPU 之间的通信方面。在 MoE 模型中,每个 Token 仅会激活一部分专家,因此如何在设备之间高效交换数据变得至关重要。传统的 all-to-all 通信方法往往会导致瓶颈,增加延迟并降低 GPU 资源的利用率。在对延迟敏感的场景(如实时推理)中,即使是微小的延迟也可能影响整体性能。此外,尽管低精度运算(如 FP8)有助于减少内存占用,但其实现需要精细优化以维持模型质量。这些问题凸显了针对专家并行(Expert Parallelism, EP)需求定制通信库的必要性。
DeepEP 是一个专为 MoE 模型和专家并行设计的通信库。DeepEP 解决了 Token 在 GPU 之间分发和聚合过程中的效率问题。该库提供了高吞吐量、低延迟的all-to-all 的 GPU 内核(通常称为 MoE 分发与聚合内核),在训练和推理过程中优化了数据交换流程。特别值得一提的是,DeepEP 支持低精度运算(包括 FP8),这与 DeepSeek-V3 论文中详细描述的技术完全一致。DeepEP 有效解决了节点内和节点间环境中扩展 MoE 架构的挑战。
DeepEP 的核心功能DeepEP 的核心功能包括:
高效的 all-to-all 通信:通过软硬件协同优化,DeepEP 实现了专家之间的高速数据传递,显著提升了训练和推理效率。支持 NVLink 和 RDMA:无论是节点内还是节点间通信,DeepEP 都能充分利用 NVLink 和 RDMA 的高带宽和低延迟特性。高吞吐量与低延迟内核:在训练和推理预填充阶段,DeepEP 提供了高吞吐率计算核;而在推理解码阶段,则提供了低延迟计算核,满足不同场景的需求。原生 FP8 支持:DeepEP 支持包括 FP8 在内的低精度运算,进一步优化了计算资源的利用。灵活的 GPU 资源控制:通过计算与通信的重叠处理,DeepEP 实现了资源的高效调度,提升了整体性能。DeepEP 的常规内核和低延迟内核DeepEP 提供了两种主要类型的内核,以满足不同的操作需求:
常规内核(Normal kernels):这些内核针对需要高吞吐量的场景进行了优化,例如在推理或训练的预填充阶段。它们利用 NVLink 和 RDMA 网络技术,在 GPU 之间高效地转发数据。测试显示,在 Hopper GPU 上,节点内通信的吞吐量约为 153 GB/s,而使用 CX7 InfiniBand(带宽约为 50 GB/s)的节点间通信性能稳定在 43–47 GB/s 之间。通过最大化可用带宽,这些内核减少了在 token 分发和结果合并过程中的通信开销。

DeepSeek 在 H800 GPU 上测试了常规内核(NVLink 最大带宽约为 160 GB/s),每块 GPU 连接一张 CX7 InfiniBand 400 Gb/s RDMA 网卡(最大带宽约为 50 GB/s)。此外,遵循 DeepSeek-V3/R1 的预训练设置,包括每批 4096 个 token、隐藏层维度 7168、Top-4 分组、Top-8 专家、FP8 分发以及 BF16 结果合并。性能测试的结果如下表所示:

DeepSeek 在 H800 GPU 上测试了低延迟内核,每块 GPU 连接一张 CX7 InfiniBand 400 Gb/s RDMA 网卡(最大带宽约为 50 GB/s)。此外,遵循典型的 DeepSeek-V3/R1 生产环境设置,包括每批 128 个 token、隐藏层维度 7168、Top-8 专家、FP8 分发以及 BF16 结果合并。性能测试的结果如下表所示:

DeepEP 的发布标志着 DeepSeek 在 MoE 训练和推理优化上的又一重要突破。该通信库针对专家并行设计,解决了 GPU 之间的数据交换瓶颈,极大地提高了通信效率。DeepSeek 下一个开源的项目会是什么呢?让我们拭目以待。
参考资料deepseek-ai/DeepEP:https://github.com/deepseek-ai/DeepEP
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
爱奇艺怎么切换账号登录_爱奇艺切换账号方法【图文详解】
可切换账号:一、app内快速切换已保存账号;二、完全退出后重新登录;三、网页端扫码绑定;四、tv版手动更换绑定账号。 当你使用爱奇艺时突然发现当前账号权限不够、会员状态不匹配,或是需要把设备共享给家人使用,这时候就需要快速切换账号了。别担心,下面这四种方法能帮你轻松搞定。 一、手机APP端直接切换已
笔趣阁app收藏的小说不见了咋办_笔趣阁app书架恢复方法【解答】
一、确认当前登录账号并触发云同步 说实话,第一次遇到书架清空的情况时,我也懵了——明明昨天还在追更的小说怎么全不见了?后来才发现,这多半是账号同步在作怪。要知道,笔趣阁的书架数据和你的微信 QQ账号是绑定的,就像你的私人图书馆钥匙,用错账号可就进不了门了。 我习惯先做这个简单的排查:打开APP后直奔
微信朋友圈怎么发纯文字 不带图片的文字动态发布技巧
微信朋友圈纯文字发布攻略:四种方法,总有一款适合你 有时候,就想在朋友圈发一段纯粹的文字,不配图,不挂链接,只是安静地说点心里话。但微信偏偏把发朋友圈的入口设计成那个相机图标,一点进去默认就是选照片,这让很多朋友犯了难:到底怎么才能发一条“干干净净”的纯文字动态呢? 别急,这事儿其实有好几种解法。我
哪里找QQ阅读网盘资源搜索入口-QQ阅读网盘资源搜索入口位置在哪
QQ阅读网盘资源搜索:探索数字书海的必备指南 在当今这个信息爆炸的时代,寻找特定的电子书资源常令人望而却步。“QQ阅读网盘资源搜索入口”作为一个高效的整合工具,为广大书迷和知识探索者提供了直达海量图书的解决方案。无论是经久不衰的世界文学名著、各大榜单上的热门畅销作品,还是专业领域的学术文献和技术教程
如何进行WPS文档格式优化- WPS文档格式优化的教程
WPS文档格式优化完整指南:告别杂乱,打造专业级文件 一份排版精致、格式规范的文档,不仅能显著提升阅读舒适度,更是彰显专业能力与严谨态度的直接体现。掌握WPS Office内置的格式优化工具,你完全可以轻松将任何文档打磨出高级感。本指南将为你提供一套从零开始的系统性方法,帮助你的内容以最清晰、专业的
- 日榜
- 周榜
- 月榜
相关攻略
2015-03-10 11:25
2015-03-10 11:05
2021-08-04 13:30
2015-03-10 11:22
2015-03-10 12:39
2022-05-16 18:57
2025-05-23 13:43
2025-05-23 14:01
热门教程
- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程

