东方算芯首颗AI芯片不追制程不靠HBM不复制GPU新招数
东方算芯推出首颗AI芯片DF1000,采用软件定义近存计算与3D堆叠技术,实现520TBF16算力、6 4TB s显存带宽,基于全国产供应链流片,128卡集群稳定运行,同步构建全栈软件生态,探索提升能效比的新路径。
先说几个核心判断。AI算力仍在高速增长,但芯片的竞争维度已经明显分化。

过去几年,AI芯片的发展路径几乎是沿着单一方向演进:更先进的制程工艺、更大的GPU集群、更高的峰值算力。
然而,推理时代的到来,正在改写原有的游戏规则。模型不再只关注训练速度,推理成本、Token吞吐量、部署效率等指标也变得同等重要。与此同时,能源消耗、制造工艺和供应链的约束也在日益凸显。
当堆砌算力变得越来越困难,提升效率成为新的竞争焦点时,一个关键问题摆上台面:国产AI芯片,是否还有另一条发展路径?
东方算芯试图给出自己的答案。在7月举行的首届产品发布会上,他们正式推出了国内首款采用软件定义近存计算路线的3D AI芯片DF1000。
相比单颗芯片的参数,更值得关注的是它所完成的一系列工程验证:依托全国产供应链完成流片和制造,128卡集群在真实业务场景中稳定运行,全栈软件生态同步搭建完成。
一套从芯片到系统的国产AI算力解决方案,初步成型。
从“算得快”到“搬得快”,AI芯片的新范式
一边是持续膨胀的算力需求,另一边则是不断攀升的能源和资本投入。在香港工程院院士郑光廷看来,AI的发展正受到物理世界的约束。
国际能源署(IEA)的数据很能说明问题:AI专用数据中心的用电量在2025年增长了50%,远高于数据中心整体17%的增速。Gartner则预测,到2030年,面向AI负载优化的服务器预计将占所有数据中心电力消耗的近一半。
基于此,郑光廷指出,未来真正稀缺的资源未必是算力,而可能是能源。如何在有限的能源和资源约束下,释放更多有效算力,已成为整个AI产业共同面对的挑战。
解题的第一步,需要先厘清一件事:训练和推理真正消耗的到底是什么。
东方算芯副总裁郭炜从当前最火爆的应用——Agent出发,指出AI智能体时代需要更智能的模型和更低成本的应用,这意味着训练必须更高效、推理必须更便宜。
结合大模型训练流程,他分析道,占据训练计算量约70%的预训练,本质上属于计算密集型任务,因此芯片计算能力仍然是决定训练效率的核心指标。
但推理不一样。模型参数固定后,系统大部分时间都在读取权重和KV Cache,然后生成Token。此时,瓶颈从“算得快”变成了“搬得快”。
郭炜进一步解释,推理中的Decode阶段占据时间大头,其Token吞吐能力高度依赖访存带宽——也就是计算单元与存储单元之间的数据传输速度。
当AI需求同时走向增长与分化,问题进一步延伸:训练时代的“王者”GPU,是否还能适配这个更复杂的新周期?
对于国产GPU而言,供应链是必须直面的第一道坎。
从训练侧来看,计算能力的提升越来越依赖先进制程、更大的计算单元规模以及更高的晶体管密度。
郭炜坦言,目前国际领先芯片制造工艺已进入3纳米,而国内能够获取的先进工艺仍以14纳米级为主,工艺代差直接限制了国产AI芯片的提升空间。
推理侧的瓶颈则转向存储与互联。先进HBM决定了单卡存储带宽的上限,但其供应同样受限;与此同时,高速I/O接口的密度与性能也受到制造工艺的制约,进而影响卡间互联带宽。
但更本质的问题在于,传统GPU本身也未必是AI时代的最优解。
北京超弦存储器研究院执行副院长赵超指出,传统冯·诺依曼架构将处理器与存储器分离,在AI算力高速增长的当下,两者之间的数据交换效率已越来越难跟上计算效率。
重新思考计算、存储与系统之间的关系,成为必然选择。
也正因如此,东方算芯创始人、董事长兼CEO魏少军直言,当下国产芯片行业真正需要思考的已经不是简单复制既有GPU的发展路径,而是走出一条属于自己的道路——以架构自主、技术原创、生态自立和供应链安全可控,重新构建适合AI时代的芯片体系。
用软件定义硬件,重组计算、存储与封装
东方算芯给出了它的答案。
作为东方算芯首颗大算力AI芯片,DF1000同时面向训练与推理场景。在首次产品发布会上,东方算芯还基于DF1000芯片,推出了完整的产品矩阵,包含加速卡、超节点、服务器、智算集群以及软件栈。
其中,巅峯1000 AI加速卡单卡可实现520T BF16算力、6.4TB/s显存带宽,支持AFD分布式推理;拓域64超节点进一步扩大系统规模,可实现33P BF16算力,近900GB/s Scale up带宽;慧算集群则采用fullmesh多芯互联结构和全铜缆连接,面向更大规模算力部署;擎元100一体机则针对中小体量客户,提供预装模型、开箱即用的快速部署方案。
聚焦软件生态,东方算芯同步推出的CAAP软件栈覆盖编译器、算子库、集合通信库、分布式训练框架以及工具链,支持主流深度学习框架和开源模型生态。
支撑这一完整链条的,是东方算芯从成立之初就锚定的“软件定义芯片”路线。郭炜介绍,这一路径首先改变的是计算资源的组织方式。
在传统GPU中,大量计算资源的工作模式按照固定方式组织,资源浪费难以避免。而东方算芯选择采用粗粒度计算架构,通过数据流驱动不同计算单元协同工作,并结合任务空间并行和资源时分复用,让同一套硬件能够根据不同模型动态分配计算资源。在不增加芯片面积的情况下,整体资源利用率实现大幅提升。
面对存储墙,东方算芯选择近存计算路线,通过3D混合键合的技术手段将逻辑晶圆和存储晶圆直接堆叠,让计算单元和存储单元几乎“贴在一起”。
根据现场披露的数据,相比传统HBM方案,3D DRAM能够提供数十倍TSV连接数量,访存带宽达到同容量HBM的5倍以上;同时,还可以通过增加晶圆堆叠层数继续扩展显存容量。
这种3D堆叠带来的不仅是存储性能的提升,更释放了封装空间。省下的HBM封装面积和互联接口,被重新分配给计算单元与互联资源。
在郭炜看来,相比传统2.5D封装,在相同封装尺寸下,东方算芯选择的3.5D Plus方案能够同时获得更大的算力规模、更高的网络带宽和更强的互联能力,也为未来继续扩展芯片规模预留了空间。
基于这条路线,东方算芯已经明确“量产一代、研发一代、预研一代”的产品战略。郭炜透露,下一代DF2000预计在今年四季度发布,整体性能参数将在DF1000基础上实现翻倍提升;DF3000则计划于明年推出。
国产AI芯片的更多可能性将被持续验证,而东方算芯的第一笔,已经落下。
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
三星Galaxy S27系列再曝 多处组件放弃自供
三星盖乐世S27系列预计明年春季正式登场,其中标准版与S27+主摄像头可能采用索尼传感器,并且会引入第三方显示驱动芯片及京东方OLED显示面板。而S27Pro取消了笔槽设计,内部配备5000毫安时电池。此外,猎户座2700芯片将搭载于S27和S27+两款机型上。
小米神秘旗舰入网,玄戒芯片、澎湃OS、自研AI大模型
小米新旗舰(型号2608BPX34C)已入网,配备67瓦快充,支持UWB超宽带技术及N79频段,或为首款阔折叠机型。该机有望搭载自研三纳米制程玄戒O3芯片与澎湃OS4操作系统,并备案了小米大模型、文心一言等多个人工智能大模型。
Google确认Pixel系列涨价 存储芯片成本激增所致
谷歌确认其手机系列将全面涨价,因存储芯片等成本激增。新机与存量机型均受影响,旗舰款起售价上调一百美元,标准版取消入门容量配置,高端版可能缩减运行内存以平衡成本。此外,所有型号价格均有所调整。
特朗普因欧盟谷歌罚款暴怒,再次威胁加征巨额关税
特朗普再度释放强硬信号——这次将矛头对准欧盟,导火索是欧盟对谷歌开出一张高达10亿欧元的罚单。简单来说,新仇旧怨一并清算,关税大棒又一次挥向大西洋彼岸的盟友。 事件经过如下:欧盟委员会于本周三发布新闻稿,正式宣布对谷歌处以10亿欧元罚款,理由是谷歌涉嫌违反欧盟的《数字市场法》。这部法律的核心目标就是
升仕175V踏板摩托车上市169cc动力升级售11800元
7月25日,升仕175V龙骨踏板摩托车正式上市,官方定价为11800元,与先前推出的150V和150X车型保持一致。先来了解几个关键信息:这款车早在7月20日就已开启销售,目前官方渠道均可查询到。 最核心的升级在于动力系统。175V搭载了一台实际排量为168 7cc(最新宣传口径为169cc级别)的
- 热门数据榜
相关攻略
2026-07-25 22:30
2026-07-25 22:30
2026-07-25 22:25
2026-07-25 22:24
2026-07-25 22:24
2026-07-25 22:24
2026-07-25 22:24
2026-07-25 22:02
热门教程
- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程

