WAIC直击:十大开源社区挤进沐曦GPU展台,凭什么?
沐曦在WAIC展台展示曦景S600超节点与曦索X300科学智能GPU,同时为十个开源社区留出核心展区。自研MXMACA软件栈实现近零迁移成本,已完整兼容PyTorch2 8全部GPU算子,vLLM生态多数模型开箱即用。通过upstreamfirst策略成为首家与vLLM签署合作协议的中国芯片企业,目标打造AI时代的Android,长期生态开发者规模瞄准500
**曦景S600超节点**首次公开亮相,单机柜可容纳64张GPU,并且能够扩展至万卡集群规模。
在AI4S方向,沐曦也拿出了新成果——**曦索X300系列科学智能GPU**,这是该系列的首发。
Agent体验区排起了长龙,数字员工和AI文创工作站几乎一刻未停。
按理说,这些内容已经足够支撑起一个GPU展台的门面。
但真正让我们驻足的,却是另一件事。
展台中央,整整一片区域,被留给了**十个开源社区**。
**龙蜥、vLLM、PyTorch基金会、SGLang……**十个logo依次排列。沐曦还专门设计了一条开源社区打卡路线。
一家GPU公司,为何把最显眼的位置之一留给了开源?
要回答这个问题,得从他们的软件栈**MXMACA**说起。
在算力行业待久了的人都清楚,NVIDIA能长期占据龙头地位,绝不仅仅靠单颗芯片的硬件性能。
制程、架构、显存这些硬件指标,都是参数清晰、可量化、可对比的,国产厂商咬牙研发,总有机会缩小差距。
真正难以追赶的,是NVIDIA隐藏在硬件之下的那道护城河——CUDA软件生态。
数百万开发者的项目代码、研发经验、自研模块,全都沉淀在CUDA上。换一张算力卡,意味着要把过去多年的技术积累大幅推倒重建,迁移成本足以让大多数团队望而却步。
因此,国产GPU真正要啃的硬骨头,是打造一个能让开发者心甘情愿迁移过来的国产算力开发环境。
沐曦自研的全栈计算软件**MXMACA**,正是针对这一难题给出的答案——一套完整的国产算力开发环境,目标是将迁移成本降到最低。
这套全栈软件从编译器、算子底层函数库,一直覆盖到各大主流AI推理训练框架,目标只有一个:让开发者原有的代码无需改动,就能直接运行在沐曦GPU上。
当然,“近零成本”这个说法,已经得到了实际验证。
沐曦搭建了一套自动化测试体系,纳入了GitHub上近5000个热门开源项目,每一轮MXMACA版本更新都会跑一遍全量测试。
结果是:92%的项目一行代码都不用修改,就能正常运行。
在框架层面,策略也类似。
针对PyTorch 2.8,MXMACA实现了全部2410个GPU算子的完整兼容。更关键的是速度,每次PyTorch发布新版本,行业同类方案通常需要数月才能完成适配,而沐曦一周内就能搞定。
vLLM生态方面的表现更具说服力。
生态中有两百多款大模型,沐曦只深度调试了五六十款主流型号,其余的直接交给普通本科生,让他们使用沐曦显卡逐一测试。最终只有十来款出现了适配障碍,绝大多数开箱即用。
连在校学生都能完成如此大规模的验证,说明MXMACA的通用兼容性确实扎实。
不过,在沐曦的整体布局中,让代码顺利跑起来只是第一步。
真正的挑战,是在AI爆发之后才凸显出来的。
如今,一个大模型从训练完成到上线服务,周期被压缩到极短。大模型厂商、云厂商都希望在模型升级后第一时间获得收益。
但行业技术更新几乎没有间歇,今天某模型厂商推出一项创新技术,明天就有团队拿出迭代方案。
在这种节奏下,如果只依靠一套封闭自研的软件栈闭门跟进,既跟不上行业速度,也无法快速响应客户的多样化需求。
> “对于我们这样一个追赶者来说,需要以开源的方式,来打破领先者闭源的垄断。”
谈及选择开源的初衷,沐曦团队这样解释道。
但实际上,拥抱开源并非行业倒逼下的临时对策。
早在自家GPU产品正式量产之前,沐曦就已经完成了1752款开源软件的适配。
也是从那时起,沐曦将开源共建纳入了公司的长期战略。
决定开源之后,沐曦的打法可以用一个词概括:**upstream first**。
区别在哪里呢?
以前的做法是“社区发布新版本,厂商拉下来自己适配”——拉源码、打补丁、编译、调试,一套流程走完才能用。
而upstream first是把代码直接贡献回上游社区,和社区一起迭代。
落到开发者手里,就是“在vLLM社区拉代码,pip安装,直接运行”。能做到这一点,是因为沐曦的支持代码本来就长在社区里,新模型发布时往往默认就已经支持。
截至目前,沐曦已经开源了53个软件仓库,占整个软件栈的15%到20%,并且还在持续扩大。
这个过程中有一个标志性事件——**沐曦成为中国第一家与vLLM官方签署合作协议的芯片企业**。
放到全球范围,也是除美国芯片公司之外的第一家。
合作涵盖软件适配、开源活动、商业协同三个层面,沐曦的硬件也因此进入了Red Hat+vLLM的官方硬件货架。
这已经不是“我去适配你”的关系,而是实打实的生态共建。
再回看展台上的那十个社区,就能理解它是沐曦开源协作的一张完整地图——
十个社区,恰好对应一个Token所经过的每一层。
最底层是操作系统与资源调度层,**龙蜥、Red Hat、CNCF、蜜瓜智能**守在这里,每个Token能稳定运行,都依赖它们的支撑。
沐曦与龙蜥社区曾共同解决了一个让所有芯片厂商头疼的问题:操作系统内核小版本频繁升级,GPU驱动必须随之重新打包,给终端用户带来大量额外负担。
双方联合通过技术机制,使驱动能够直接忽略小版本变化,开源版本直接编译即可使用。
而这类工作,只有扎根在同一个社区里深度共建才能完成。
往上一层是训练与推理框架,**vLLM、SGLang、PyTorch基金会、九源联合体**都在这里,每个Token能够高效生成,靠的就是这一层的持续迭代。
沐曦提到,过去两年,这一层的性能每年提升都在100%以上。
再往上到顶层,对应的是开源生态运营与合规治理。
**模力方舟**负责降低模型分发门槛,方便开发者获取和使用各类模型;**木兰开源社区**则专注于开源项目孵化与行业规范搭建。
沐曦曾联合木兰开源社区共同制定开源规范与大模型分级标准,因为开源不等于无规则开放,每个Token的输出能否安全合规,都离不开完善的社区运营与治理体系。
从芯片到操作系统,从推理引擎到治理规则,走完这条打卡路线,也就走完了一个Token完整的生命周期。
而沐曦的共建,并不止步于框架这一层。
以北大团队研发、对标OpenAI Triton的编译器TileLang为例,沐曦从2024年下半年就开始投入共建。
等到今年行业多款主流大模型上新时,不少核心算子就是靠这套编译器写出来的。
这背后的意义在于,从并行编译到算子优化,国内第一次有了端到端自主可控的技术路线,不再需要担心自研适配代码无法合入上游社区主干。
框架之外,沐曦也将重点放在人才培养上。
沐曦围绕TileLang开设了多期实战训练营,累计吸引了500多名开发者参与。
今年沐曦还将启动“揭榜挂帅”,吸引更多算子优化技术人才。
规划编写的6本配套教材已经出版了4本,8大基础课程进入了上交大、浙大等20多所高校。
企业还联合上海AI实验室的书生工具链开办了三期实战营,让学生从数据收集、模型训练一路做到评测和应用,相关课程与全部工程代码均对外开源。
挑战杯、CCF大赛、各大国家实验室技术竞赛中,也都能看到沐曦的身影……
为了持续发掘优质新生技术力量,沐曦也给出了激励:在社区中实操表现突出的在校学生,还能获得免试入职实习的机会。
说到底,生态不是单方面“建”出来的,而是将底座持续开放后,各方共建长出来的。
那么,软件栈一直开放、生态自己往上生长,沐曦最终想让MXMACA成为什么?
沐曦CTO杨建博士给出了一个非常明确的锚点——**AI时代的Android**。
具体来说,就是持续开放最核心的那套全栈软件,从操作系统、大数据处理,到大模型训练推理,再到私有化部署,把全链条打通。
让客户乃至其他芯片厂商,都能基于这套完整软件栈,搭建一个**通用、好用、易用**的底层算力生态。
所谓通用,就是让市面上绝大多数模型与应用都能顺畅适配。
至于好用、易用,杨建博士给出了一个接地气的说法:一个小白用户,一个下午就能完成一个新应用的全部适配。
这话并非画饼。早在2023年,沐曦就已经能做到让一个大二学生在一天之内完成一款开源软件的适配、验证和部署。
在他的判断中,未来全球700万GPU和AI开发从业者中,至少650万人接触沐曦工具链后,一天内即可快速上手。
Android当年靠激活设备数和开发者数量撑起整个生态,AI时代的算力生态也是同样的道理。
现在生态里的50万开发者只是当下的刻度,沐曦的长期目标是到2029、2030年,将专属于沐曦生态的开发者数量扩展到500万。
而Agent浪潮的爆发,又给这套体系提出了新的命题。
用沐曦自己的话说,当下的Agent正处于一个类寒武纪时代——各类智能体方案集中涌现,GitHub上AI相关的项目每年翻番,所有人都在用各种方式探索Agent。
但这种爆发带着蛮劲,大量Agent程序缺少底层性能优化,大量Token被消耗在无效调用上。
Token的消耗增速,已经远超底层基础设施的扩容速度。
好在两端都在加速优化,而且是用一种很有意思的方式——**透明卷**。
比如今天业内开源一项降低单Token算力消耗的新技术,明天可能就有高校团队放出演进版,所有优化都摊在开源世界里,你追我赶,全程公开。
推理侧的结果是,同一张GPU原来每秒产100个Token,现在能产200个、300个。
Agent侧也在通过Skill等方式压缩开销,原来需要1000块Token预算才能办成的事,优化后100块就搞定了。
开源世界里还在发生一些更值得注意的变化。沐曦分享了一段真实经历:
一家互联网公司的产品经理找上门来要做模型适配,中途外出用餐,一顿饭的功夫回来告诉沐曦,适配已经完成了。
用的是AI编程工具,配上自家模型权重,再加上沐曦的公开文档,饭还没吃完,脚本就跑通了。
这件事让沐曦也颇感意外。
但转念一想,这恰恰说明生态走到了一个新阶段——文档足够开放、软件栈足够兼容,连不写代码的人都能借助AI参与共建。
展区那句**「每个Token背后,都是一次开源协作」**,也有了全新的注解——现在连AI自身产出的Token,也在参与这场开源协作。
落在长远布局上,沐曦想扮演的角色自始至终没有变过:做中国开源算力生态的领军者,靠开源底座串联产学研用,让操作系统、框架、模型、应用的每一环都建立在开源共享之上。
毕竟,Token不会说谎。每一个流畅生成的Token,都是对背后整套开源协作链路的验证。
沐曦想做的,就是让每个Token的价值都被真正兑现。 你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:WAIC直击:十大开源社区挤进沐曦GPU展台,凭什么?要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
相关热点在COMPUTEX2026展会上,技嘉展示了AORUSGeForceRTX5080INFINITYWOOD显卡和AORUSX870EINFINITYNEXT主板。RTX5080显卡采用白色主题与木色元素装饰,设计独特;X870E主板则以蝴蝶翅膀为灵感,采用类蜂窝结构和金属3D打印
星际荣耀公司近日成功完成SQX-3运载火箭海上回收高精度导航系统的无人机挂飞试验。该试验在广东阳江海域进行,采用创新的半实物动态模拟方案,全面验证了导航系统在复杂海况下的性能。结果表明,系统各项指标均优于设计要求,能够稳定提供火箭与回收船之间的高精度相对导航信息。这标志着该核心系统已完成全部地面验证
PC内存厂商OriginCode近日分别针对英特尔和AMD平台推出专项优化内存。面向英特尔平台的CQDIMM内存,通过与技嘉合作验证了256GB8000MT s的高带宽套条,旨在为本地AI、视频渲染等重载任务提供强大数据吞吐能力,并计划在2026年台北电脑展展出。针对AMD平台,则推出多款支持E
东风本田公布5月销量达18563台,环比增长20%,其中CR-V销量增长显著。品牌同步推出6月限时购车权益,涵盖CR-V、英仕派、HR-V及思域等多款车型,权益价最低至9 79万元起,并可叠加国家以旧换新补贴及原厂配置加装优惠,为近期有购车计划的消费者提供了具体的价格参考与增值选择。
- 日榜
- 周榜
- 月榜
热点快看
