清华系团队发布国产Token优化工厂兼容10余种芯片日吞吐千亿
是石科技发布国产Token优化工厂拓元,兼容昇腾等10余种芯片及20余个主流模型,实现异构算力统一调度。系统通过KVCache压缩、免训练Token压缩等技术提升推理效率,每日Token吞吐量达千亿级别,助力释放算力价值。
△WAIC 2026是石科技创始人兼董事长闫博文新品发布现场
原因非常直接:中国的算力资源,目前正被大量闲置浪费。
全国已建成50多个智算中心,智能算力总规模超过1000 EFLOPS,但平均利用率远未达到理想状态。算力“用不起来”——运行速度慢、长上下文场景下响应能力断崖式下降,已成为普遍难题。
是石科技的解决方案,叫作**拓元(Vectron)**,一座**国产Token优化工厂**。
中国已建成50多个智算中心,智能算力总规模超过1000 EFLOPS。
然而,平均利用效率仍有巨大的提升空间。
“大量算力正在被浪费,算不快、长上下文多模态响应下降,是普遍现象。”闫博文直言不讳。
依托国家级计算中心工程的深厚积累,是石科技持续投入大规模集群研发,成功建设了万卡级的国产大集群,并实现了稳定持续的运营。他们在推理效率方面进行了大量优化,构筑了坚实的技术壁垒,率先打通了从底层芯片到上层应用的超智融合全链路——真正把国产大集群从“点亮”变成了“跑满”,让庞大的国产算力切实转化为产业可用的Token稳定生产力。
“因此我们正在重新思考,在算力基础设施建设提速的同时,如何进一步释放算力价值?”闫博文认为,“十五五”期间,中国算力产业总投资预计将达到7万亿元。
如果算力利用效率能够提升**十到二十个百分点**,就能释放出**万亿级**的算力价值空间。这意味着各行各业都能以更低的成本进入AI世界,激发更多应用需求。
这背后,是行业共识的一次重要转折:AI基础设施的竞争,正从“算力规模竞赛”转向“**算力效率竞赛**”。
未来AI基础设施的关键,不仅在于芯片数量,更在于能否**将芯片、互联、内存、散热、调度与软件栈整合为稳定可用的大规模系统**。
而**拓元**,正是是石科技为这场“效率竞赛”交出的系统性答卷。
当前AI基础设施面临的效率难题,主要集中在以下几个方面:异构算力难以统一调度、大模型推理缺乏深度优化、长上下文导致显存与成本压力骤增、国产芯片生态适配成本高昂。
针对这些痛点,拓元不仅仅是一个模型,也不仅仅是一个工具。是石科技希望打造的,是**一套完整的AI Infra优化体系**。
具体来说——
在任务自适应优化方面,系统会根据请求的“画像”自动匹配最优计算链路,让算力按需分配,大幅减少资源浪费。不同的推理任务自动匹配最合适的算力资源,而不是“一把抓”。
在算子库优化方面,硬件专属算子融合编译,充分释放芯片的极限算力。这意味着每颗国产芯片不再只是“能用”,而是被“榨”出了最优性能。
在模型与推理框架优化方面,兼容主流国产芯片与大模型,通过异构深度调优,提升业务并发量。
在异构集群调度方面,破除跨地域、多芯片的算力孤岛,统一纳管调度,盘活闲置算力。
闫博文介绍,拓元全面兼容**昇腾、昆仑芯、天数智芯、太初、瀚博半导体、摩尔线程、沐曦、燧原**等10余种国产算力芯片,适配**20余个**主流模型,实现了国产异构算力池的统一调度与推理加速,每日Token吞吐量达**千亿**级别。
对企业客户而言,这意味着不管底层运行的是什么国产芯片,拓元都能让你的算力资源池被统一管理、优化调度,最终产出更多可用的Token。
发布会上,闫博文重点介绍了拓元的多项核心技术突破,每一项都直指企业使用大模型过程中的真实痛点。
企业使用大模型时,一个现实问题日益突出:模型越来越强,运行成本也越来越高。
尤其当上下文变长时,显存压力急剧攀升。
传统方法更多依赖输入阶段来判断信息价值,但在真实业务中,模型需要关注的往往是动态变化的内容。
拓元的**结果感知驱动KV Cache压缩技术**,可以在不牺牲模型效果的前提下,显著压缩KV Cache、降低显存压力,让长文本、大规模AI应用真正能够经济地运行。
在大模型运行过程中,并非所有信息都具有同等价值。
**如何保留关键Token、减少无效计算**,是效率提升的核心命题。
拓元在全模态场景中提出了基于模态自适应的免训练Token压缩方法,针对文本、视频、语音等不同输入,实现更加精准的信息筛选。
这意味着未来AI可以用更少的计算完成更复杂的任务——在多模态时代,这个能力将变得越来越重要。
企业知识库、智能助手、复杂分析任务,越来越多场景要求模型具备超长记忆能力。
拓元通过混合位置索引合成的长上下文偏好训练方法,以及记忆引导的重读机制,在远小于同类方法的训练数据量下,实现了显著的效果提升。
传统的大模型部署后,往往需要大量人工反馈来持续优化输出质量——就像养了一个需要不断投喂、调教的系统。
拓元提出的“基于元奖励的可扩展奖励建模方法”突破了这一难题。
闫博文将其比喻为:从“养一个需要不断人工训练的AI”,变成“**部署一个能够持续自我优化的AI系统**”。
对企业来说,这意味着AI落地成本的大幅降低。系统能够理解企业标准,在复杂业务场景中持续输出稳定、可靠、符合要求的结果。
智能体在执行长程检索任务时,有时会无法判断缺失信息或未读到的内容,到底是已经被丢弃了,还是根本不存在,从而产生负面影响。
拓元明确了**以目标为导向的信息记忆策略**,突破了稀疏信息难监测、长程建模受限于资源、注意力机制二次复杂度开销大等难题。
闫博文表示,拓元可以帮助模型实现**更低训练成本、更高上下文理解能力、更强复杂推理能力**。
“我们希望AI不只是能够回答问题,而是能真正理解复杂世界。”
过去几年,是石科技快速成长,已服务**超过200家**重点客户,覆盖互联网大厂、头部大模型公司、航空航天、生物制药、新能源等行业,在并行优化、算力调度等业务上形成了深厚的技术护城河。
拓元的发布,意味着是石科技将领先的技术能力凝结成了一个商业化和标准化的产品,驶上了规模化发展的快车道。
闫博文在发布会上强调:“技术创新的最终目的,不是停留在实验室,而是创造产业价值。”
不仅如此,拓元也再次明确了是石科技独特的赛道占位。
国产芯片生态的成熟需要“中间件”,未来中国AI产业必然需要构建自主可控的技术体系。
像拓元这样能够统一管理异构资源、屏蔽底层差异的平台,是国产算力生态走向“好用”的关键拼图。
在算力效率这个命题上,当大多数人还在讨论该怎么做的时候,是石科技已经把产品摆到了WAIC的展台上,也打开了公司从算力服务到Token服务的商业化新空间。
闫博文在发布会结尾说:
“对于我们这些技术出身的人来讲,最希望听到的声音就是两种。第一,是每次交付给客户的大规模集群,满负荷跑起来时发出的万卡集群的轰鸣声;
第二,就是**我们每次帮用户优化完效果之后,客户给出的高度评价**。
这两种声音,我们认为也是未来中国的AI走得更强、走向世界的最强音。” 你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:清华系团队发布国产Token优化工厂兼容10余种芯片日吞吐千亿要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
相关热点在COMPUTEX2026展会上,技嘉展示了AORUSGeForceRTX5080INFINITYWOOD显卡和AORUSX870EINFINITYNEXT主板。RTX5080显卡采用白色主题与木色元素装饰,设计独特;X870E主板则以蝴蝶翅膀为灵感,采用类蜂窝结构和金属3D打印
星际荣耀公司近日成功完成SQX-3运载火箭海上回收高精度导航系统的无人机挂飞试验。该试验在广东阳江海域进行,采用创新的半实物动态模拟方案,全面验证了导航系统在复杂海况下的性能。结果表明,系统各项指标均优于设计要求,能够稳定提供火箭与回收船之间的高精度相对导航信息。这标志着该核心系统已完成全部地面验证
PC内存厂商OriginCode近日分别针对英特尔和AMD平台推出专项优化内存。面向英特尔平台的CQDIMM内存,通过与技嘉合作验证了256GB8000MT s的高带宽套条,旨在为本地AI、视频渲染等重载任务提供强大数据吞吐能力,并计划在2026年台北电脑展展出。针对AMD平台,则推出多款支持E
东风本田公布5月销量达18563台,环比增长20%,其中CR-V销量增长显著。品牌同步推出6月限时购车权益,涵盖CR-V、英仕派、HR-V及思域等多款车型,权益价最低至9 79万元起,并可叠加国家以旧换新补贴及原厂配置加装优惠,为近期有购车计划的消费者提供了具体的价格参考与增值选择。
- 日榜
- 周榜
- 月榜
热点快看
