华为昇腾全栈开源DeepSeek-V3.2推理方案,赋能开发者创新

9月29日消息,DeepSeek-V3.2-Exp模型于今日晚间正式发布并开源,创新性地采用了稀疏Attention架构。华为随即宣布昇腾AI已基于vLLM/SGLang等主流推理框架迅速完成适配部署,实现对该模型0day级别的全面支持,并向开发者开源了所有相关推理代码和算子实现。
据介绍,昇腾AI在DeepSeek-V3.2-Exp发布的第一时间就实现了该模型BF16格式的高效部署,并在CANN计算平台上完成了针对性优化。部署方案延续了DeepSeek的大EP并行策略,同时针对稀疏DSA架构特性,创新性地实现了CP并行策略,在128K超长序列场景下仍能保持TTFT低于2秒、TPOT低于30毫秒的优异推理性能。
NPU DeepSeek-V3.2-Exp推理优化实践:
https://gitcode.com/cann/cann-recipes-infer/blob/master/docs/models/deepseek-v3.2-exp/deepseek_v3.2_exp_inference_guide.md
针对模型中全新引入的Lightning Indexer(LI)和Sparse Flash Attention(SFA)两大核心算子,昇腾团队创新性地优化了算子Tiling设计、Cube与Vector核间流水线调度等关键技术环节,现已开源相关模型和融合Kernel代码。
NPU DeepSeek-V3.2-Exp Ascend C融合算子优化:
https://gitcode.com/cann/cann-recipes-infer/blob/master/docs/models/deepseek-v3.2-exp/deepseek_v3.2_exp_ascendc_operator_guide.md
为降低开发者使用门槛,CANN首次推出PyPTO大融合算子编程框架,采用PTO(Parallel Tensor/Tile Operation)创新编程范式,以Tensor为基本数据单元构建计算图。目前该框架已成功应用于DeepSeek-V3.2-Exp模型中两个核心算子的开发,仅需数百行代码即可完成动态Shape算子编程。
基于PyPTO的Lightning Indexer和DeepSeek Indexer Attention算子开发实践:
https://gitcode.com/cann/cann-recipes-infer/blob/master/docs/models/deepseek-v3.2-exp/deepseek_v3.2_exp_pypto_operator_guide.md
除提供完整模型参考实践外,昇腾AI还全面支持vLLM和SGLang等主流推理框架,开发者可直接获取社区代码体验模型性能。未来将持续优化大模型在异构计算架构下的推理效率,重点提升算子融合、稀疏访存等核心能力。
大模型推理框架vLLM及昇腾实现:
https://github.com/vllm-project/vllm-ascend/tree/v0.9.1-dev/examples/deepseek.md
大模型推理框架SGLang及昇腾实现:
https://github.com/sgl-project/sglang/issues/11060
此外,昇腾与Tile-AI社区深度合作,基于其TileLang领域专用语言完成了Sparse Flash Attention等关键算子的NPU适配。后续将进一步完善NPU算子生态,持续提升计算性能。
NPU DeepSeek-V3.2-Exp TileLang算子开发实践:
https://gitcode.com/cann/cann-recipes-infer/blob/master/docs/models/deepseek-v3.2-exp/deepseek_v3.2_exp_tilelang_operator_guide.md
TileLang-Ascend开源社区:
https://github.com/tile-ai/tilelang-ascend
免责声明
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
iQOO 15电竞技术发布会:PC级游戏体验解析
9月23日消息,“跨代领先”iQOO15电竞性能技术沟通会正式举办,2K三星珠峰屏、自研电竞芯片Q3和Monster超核引擎亮相,将
开源鸿蒙五年发展规划:陈海波详解操作系统智能化生态战略
在近日举办的“开源鸿蒙技术大会”上,开源鸿蒙项目群技术指导委员会主席、华为基础软件首席科学家陈海波深入探讨了智能终端操作系统与人工智能技术融合的发展路径。他指出,当前“AI外挂式”技术方案存在成本高
AI技术前沿:科研先锋如何推动革命性突破
华为首席执行官任正非近日提出,人工智能革命或将成为人类社会最后一场重大技术变革。他指出,这场变革将持续数十年甚至数百年,其发展进程可能与能源核聚变技术的突破形成共振。在这场技术浪潮中,科研人员为推动
马斯克xAI将推Grokipedia百科,开源且超越维基准确性
科技界近日迎来一则重磅消息:马斯克在社交平台X上透露,其旗下人工智能公司xAI正在开发一款名为Grokipedia的新型百科全书项目。据他介绍,这款产品将突破传统知识平台的局限,在准确性和中立性方面
国产GLM-4.6大模型性能大升级,摩尔线程联手寒武纪加速
国庆前夕,全球人工智能领域迎来新一轮技术竞赛,多家国内科技企业接连发布大模型升级成果,推动行业进入白热化阶段。智谱AI与DeepSeek两大国产大模型团队在假期前夕密集发力,分别推出GLM-4 6与
热门教程
更多- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程



















