人大与蚂蚁合作推出原生MoE扩散语言模型,即将开源
今年9月12日,蚂蚁集团携手中国人民大学在外滩大会上重磅推出全球首个原生MoE架构的扩散语言模型LLaDA-MoE,引发业界广泛关注。
这款创新型模型采用非自回归的掩码扩散机制,开创性地在原生训练的MoE架构上实现了与Qwen2.5相媲美的语言智能水平,在上下文理解、指令执行、代码编写和数学推理等方面都有出色表现。
实验数据显示,LLaDA-MoE在代码生成、数学运算、智能体等任务上的表现均优于LLaDA1.0/1.5和Dream-7B等同类扩散语言模型,其性能甚至接近或超越了Qwen2.5-3B-Instruct这样的自回归模型。特别值得注意的是,该模型在仅激活1.4B参数的条件下,就能达到相当于3B参数稠密模型的性能。
蚂蚁集团通用人工智能研究中心主任、西湖大学特聘研究员蓝振忠表示:"LLaDA-MoE的成功验证了工业级大规模训练的可行性和稳定性,标志着我们在扩散语言模型的研究道路上又向前迈进了一大步。"
中国人民大学高瓴人工智能学院李崇轩副教授从理论层面进行了分析:"当前主流大模型普遍采用的自回归生成方式仅能实现单向建模,这种生成token的方式限制了模型对双向依赖关系的捕捉能力。"
蚂蚁集团透露,研究人员克服了诸多技术难关。团队耗时3个月重构训练代码,依托自研ATorch分布式框架的EP并行技术,基于Ling2.0基础模型的训练数据,在负载均衡、噪声采样等关键问题上取得突破,最终完成了包含7B总参数量(激活1.4B)的MoE架构的20T数据训练。
在蚂蚁的统一评估标准下,LLaDA-MoE在HumanEval等17项基准测试中平均提升8.4%,领先上一代产品13.2%,与Qwen2.5-3B-Instruct表现相当。这些数据有力证明了"MoE放大器效应"在扩散语言模型中的适用性,为未来10B至100B规模的稀疏模型研发指明方向。
蓝振忠同时宣布,蚂蚁计划近期向全球开源完整的模型权重和专为dLLM优化的推理框架,这将显著提升运行效率。所有技术文档和代码将在GitHub及Hugging Face平台同步发布。他强调:"自回归并非唯一出路,我们相信扩散模型同样能成为实现AGI的重要路径。"
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
蔡司6月2日发布新品镜头技术迎来重大突破
蔡司宣布将于6月2日发布一款新镜头,并称其为镜头技术的重大突破,标志着全新纪元的开启。官方仅公布了产品剪影,但措辞暗示其可能带来根本性的技术升级,例如全新光学结构、先进镀膜或对焦系统改进。具体细节需待发布日揭晓。
神舟二十三号飞船将携带九项科学实验进驻中国空间站
据中国科学院空间应用工程与技术中心最新消息,神舟二十三号载人飞船即将发射升空,计划携带总计9项前沿科学实验项目进驻中国空间站。此次上行实验的样品及配套装置总重约54公斤,实验材料种类丰富,涵盖了肝脏细胞、水稻与拟南芥种子、纳米酶、放线菌以及钙钛矿太阳能电池等关键领域,旨在利用空间站独特环境开展多学科
香港女警黎家盈任载荷专家 资讯科技专长助力航天任务
5月23日上午,酒泉卫星发射中心举行神舟二十三号载人飞行任务新闻发布会,正式宣布任务计划。根据安排,神舟二十三号载人飞船将于北京时间5月24日23时08分准时发射升空。 本次飞行乘组的组成备受瞩目。神舟二十三号任务乘组由指令长朱杨柱、航天员张志远以及来自中国香港的载荷专家黎家盈共同构成。这标志着中国
苹果Beats新款头戴耳机通过FCC认证即将上市
美国联邦通信委员会数据库出现一款型号为A3577的蓝牙头戴式耳机,并非已知的AirPodsMax2。目前公开信息极少,仅有一张普通耳机耳罩图片。推测其可能属于苹果旗下Beats品牌的新一代产品,如BeatsStudioPro的更新型号,但具体身份仍有待后续信息确认。
永辉超市转型裁员三万人 CEO涨薪引争议
永辉超市因大连御锦拖欠股权转让尾款36亿余元申请强制执行,担保人王健林承担连带责任。永辉近年推行“胖改”后关店裁员约三万人,CEO薪酬却大幅上涨。追债成功与否存疑,万达自身债务压力使款项回收难度极大。此事关乎永辉现金流,已成为生存攸关的紧迫问题。
- 日榜
- 周榜
- 月榜
1
2
3
4
5
6
7
8
9
10
相关攻略
2015-03-10 11:25
2015-03-10 11:05
2021-08-04 13:30
2015-03-10 11:22
2015-03-10 12:39
2022-05-16 18:57
2025-05-23 13:43
2025-05-23 14:01
热门教程
- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程
热门话题

