阿里云Aegaeon发布:GPU共享技术如何革新AI推理效率


在韩国首尔举办的SOSP 2025操作系统原理研讨会上,阿里云近日发布了名为"Aegaeon"的计算池化解决方案。这项创新技术致力于破解人工智能模型服务中由来已久的GPU资源利用率瓶颈,尤其适用于处理具有突发性或不可预测请求特性的大语言模型应用场景。
传统部署模式下普遍采用单一模型独占GPU资源的分配方式,造成大量算力闲置。Aegaeon通过在Token生成层级实现GPU访问的虚拟化,成功突破了这一局限。通过这种创新架构,单个GPU可并行服务于多个不同模型,从而实现更精细粒度的资源分配与调度。
作为推理阶段的智能调度系统,Aegaeon能够在每个token生成完成后,动态判断是否切换当前执行模型,并将极细粒度的任务片段灵活调度至共享资源池中。通过组件复用、显存的精细化管理以及对KV缓存同步机制的深度优化,系统将模型切换带来的性能开销降低了97%,既保障了token级调度的实时响应,又能支持在亚秒级时间内完成模型切换。
在阿里云模型平台开展的为期三个多月的Beta测试中,Aegaeon成功支撑了数十个参数量达720亿的大型模型稳定运行。实测数据显示,所需NVIDIA H20 GPU数量从原先的1192块锐减至213块,降幅高达82%。这种显著的资源压缩能力,对于面临高昂硬件投入的大型模型服务提供商而言,意味着运维成本的大幅降低。
目前,Aegaeon的核心技术已全面集成至阿里云百炼平台,为更高效的模型推理服务提供底层技术支撑。
免责声明
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
忍者龙剑传4获媒体83分盛赞,革新战斗铸就系列新巅峰
由Team Ninja与白金工作室联合打造的忍者龙剑传4已于今日正式推出。随着游戏解禁,各大媒体评分陆续公布,M站综合得分为83分,IGN与GameSpot均给出8分评价。国际知名游戏媒体Games
寒武纪募资39.85亿加码AI芯片,大模型计算平台落地加速
中科寒武纪科技股份有限公司近日发布公告,宣布2025年度向特定对象发行股票已完成股份登记。本次发行股份数量为333 49万股,已于10月16日在中国证券登记结算有限责任公司上海分公司完成登记。发行价
小米汽车逆势增长:SU7热销背后的用户共建技术生态
在新能源汽车市场硝烟弥漫的当下,小米汽车正以黑马之姿打破行业格局。尽管网络舆论场中争议不断,但SU7车型上市即售罄的市场表现,以及YU7车型未发先火的预售态势,让这家跨界造车企业成为行业焦点。其 "技
真我GT8 Pro影像首测:四年打磨GR系统有何突破?
10月21日消息,真我宣布真我携手理光GR从光学、交互、算法、影调进行全链路深度定制,首发理光GR影像系统,为年轻人打造表达个性的街拍神器。这次真我GT8 Pro首发理光GR防眩光主摄,通过理光GR
《宇宙机器人》新作公开:150位PlayStation角色全集结
在最近的PlayStation发布会上,《宇宙机器人》的一款全新作品意外亮相,引发玩家关注。据消息显示,这款游戏将汇集多达150个来自PlayStation的知名角色,它们将以小巧可爱的机器人形象作
热门推荐
热门教程
更多- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程








