面包屑图标 当前位置: 首页
AI资讯
热点详情

清华系200亿独角兽攻克具身智能记忆难题并开源

AI热点日报
AI热点日报时间:2026-07-20
热点解读

真正具备记忆能力的机器人VLA模型,究竟是什么样的?不妨先看看几个看似简单却极具挑战性的演示。例如,先遮盖住不同颜色的方块,然后指令机械臂按照红、绿、蓝的顺序逐一揭开。再或者,测试它能否精准地按下不同次数的按钮?画面中的机械臂,全部成功完成了任务。千万不要低估这些能力,它们曾让众多机器人束手无策。真

真正具备记忆能力的机器人VLA模型,究竟是什么样的?

不妨先看看几个看似简单却极具挑战性的演示。

例如,先遮盖住不同颜色的方块,然后指令机械臂按照红、绿、蓝的顺序逐一揭开。



再或者,测试它能否精准地按下不同次数的按钮?



画面中的机械臂,全部成功完成了任务。

千万不要低估这些能力,它们曾让众多机器人束手无策。真正的难点,隐藏在一个看不见的环节——记忆。

原因很简单:许多机器人根本记不住自己按了几次按钮。

上述演示中所展现的“原生上下文记忆”能力,是目前主流的、基于单帧反应式的VLA模型无法实现的。

幸运的是,就在不久前,面壁智能成功补上了具身智能领域这一关键短板。

7月19日,在WAIC现场,面壁智能开源了首个具身智能系列模型成果——MiniCPM-Robot,包含两个核心模型:通用VLA模型MiniCPM-RobotManip,以及跟踪导航模型MiniCPM-RobotTrack。

其中,MiniCPM-RobotManip在专门考核机器人模型上下文记忆能力的RMBench榜单上,取得了53.5分的优异成绩,而国外知名的VLA模型pi0.5仅有10.4分——两者差距十分显著。

性能比肩行业顶尖水平

机器人为何难以完成“按5次按钮”这类任务?因为当前绝大多数VLA模型,只具备“单帧反应”的能力。

大部分团队的做法,是让机器人仅根据眼前这一帧画面来决定下一步动作。这就导致在执行“按5次按钮”的任务时,当机器人按完第1次,准备进行下一次推理时,它的大脑一片空白——完全不清楚刚才发生了什么。

那么,为什么不给机器人加上“上下文历史记忆”呢?

答案在于:算力根本无法支撑。

如果让模型记住历史画面,计算量会呈指数级爆炸增长。大多数团队无法对视觉Token进行高效压缩。强行加入记忆,机器人就会变得像“树懒”一样,动作出现明显卡顿。

而这,恰恰是面壁智能所擅长的领域。

在考验机器人模型上下文记忆能力的RMBench上,出现了戏剧性的一幕:专用明星模型π0.5遭遇滑铁卢,得分仅为10.4分;而MiniCPM-RoboManip却一举拿下53.5分,实现了碾压性优势。

在LIBERO等传统主流榜单上,MiniCPM-RobotManip同样跻身第一梯队,性能足以比肩行业顶尖模型。


面壁智能究竟做对了什么?答案是:对视觉Token进行了极致压缩。

这款1.5B参数规模的VLA模型,继承了面壁智能在今年5月发布的最新多模态大模型MiniCPM-V 4.6的核心技术优势。MiniCPM-V 4.6开源不到2个月,下载量就突破了200万,在多模态基础模型社区中十分火爆。


通过极致的视觉压缩技术,面壁将VLA模型从“算力饥饿”中解放出来,让机器人在真实物理世界中能够以更低的成本高效运行。

在机器人应用场景下,VLA模型每次推理需要处理三路相机画面(双腕部加主视角)以及文本指令,并输出相应动作。如果处理速度过慢,机器人就会出现肉眼可见的卡顿——而在物理世界中,这种延迟是致命的。

视觉Token压缩,本质上是在做精准的“减法”。未经处理的多路图像会生成海量Token,直接拖垮推理速度。高效压缩能用更少的Token承载同等的视觉信息,就像将高清图片转换成高质量的JPEG格式——画质不减,体积锐减。

数据最能说明问题:MiniCPM-RobotManip单步决策仅需120ms,而pi0.5需要234ms——后者几乎是前者的两倍。


在处理上下文记忆时,Token的极致压缩也让MiniCPM-RobotManip的计算成本大幅降低。

无历史帧输入的pi0.5,算力固定在5.0 TFLOPS,但代价是放弃了历史记忆——模型“忘记过去,只管当下”。

而MiniCPM-RobotManip(采用流式推理加子任务生成)的算力从0.1 TFLOPS起步,随历史帧增加仅缓慢爬升至1.3 TFLOPS(对应120帧)。即便在60秒、1fps的长期记忆场景下,算力也仅约3.3 TFLOPS,始终低于pi0.5的5.0 TFLOPS。


因此,它用超低的成本,实现了“带脑子、带记忆”的高级推理能力。

这就是为什么,它能让机器人连贯地完成“做三明治”这样的任务——不卡顿、不遗忘,像人类一样丝滑。

更妙的是,在处理“上下文记忆”时,它的计算成本几乎不增加。

MiniCPM-RobotManip通过视觉Token极致压缩,让“有记忆”的推理成本和“无记忆”的推理成本基本持平。

拔掉网卡,这只机器狗还能“死死咬住”你?

在WAIC期间,面壁智能还开源了一个追踪导航模型——MiniCPM-RobotTrack。

面壁的一个真机演示案例令人印象深刻:一只宇树Go2机器狗紧紧跟随一名指定人员。

接着,工作人员走进典型的无网环境——电梯。这几乎相当于直接拔掉了机器狗身上的网卡,没有Wi-Fi信号。

最后,机器狗和工作人员一起坐电梯,到达另一个弱网环境:地下车库。

这是业内首个提供真实本地纯无网部署的跟踪模型,而且开箱即用!并且原生适配宇树Go2 Edu机器狗。

它可以在开放环境下实现零样本指令跟随,抗各类人物穿梭干扰,同时能在无网或弱网环境(如电梯、停车场)下流畅跟随。

这个仅有0.9B参数规模的模型,基于MiniCPM4-0.5B训练完成,在同类开源模型中性能稳居第一。

在三大典型真实场景维度测试中,它达到了以下结果:

STT(单目标追踪):追踪率达到89.81。
DT(干扰追踪,即多目标交叉干扰):追踪率达到73.38。
AT(模糊追踪,指令意图模糊或目标信息不全):追踪率达到80.35。

它不仅全面碾压了开源的OpenTrackVLA,甚至在STT和AT任务上,领先了闭源的、动用了四路视觉且经过RL训练的TrackVLA++ four-view,分别高出7.11和16.55个百分点。


一个0.5B的轻量级单视角模型,凭什么能超越前辈大模型?

秘诀在于面壁智能构建的“自进化数据管线(DAgger)策略”。

他们系统化地清洗原始数据,剔除仿真器早期产生的异常轨迹、错误动作等脏数据,保障了训练数据的质量。

在此基础上,首次提出面向具身追踪的DAgger策略:模型先在大规模通用场景上预训练,再持续部署至仿真与真实环境中交互,主动暴露长尾薄弱场景。

系统自动识别短板,定向采集薄弱数据,经专家策略与规则纠偏后迭代训练。闭环迭代不断强化低频复杂场景,显著提升模型在动态环境中的追踪与泛化能力。

只需几分钟,一台刚开箱的宇树Go2 Edu机器狗,跑上一段面壁的一键部署脚本,就能瞬间获得纯视觉、纯本地的自然语言指令跟踪能力,能够在机器狗原生本地算力条件下稳定达到5+ FPS,端到端响应时延约180毫秒。

这是首次实现基于纯视觉方案的本地自主指令追踪。

目前,已验证适用于楼宇巡检、人员陪护、园区安防等结构化环境,证明了其可靠性与泛用性。

未来,凭借弱网或断网下的自主决策能力,它有望瞄准灾害救援(如地震、火灾)与特种作业(如对抗、侦察)等高风险场景。在这些场景中,180ms的低延迟是决定搜救效率与生存概率的核心能力。

从模型到推理框架的全栈布局

面壁这两个模型的推理效率,也得到了推理框架PhyAI的有力支持。

推理框架PhyAI是由明体科技(MemBodied)联合北京邮电大学、北京大学共同研发的端云一体、全栈优化的具身智能模型推理框架。

如果说模型是大脑,推理框架就是让大脑高效运转的操作系统。

PhyAI面向VLA模型与世界模型(WAM),充分榨干硬件潜力——

与模型最新仓库相比,PhyAI在NVIDIA GeForce RTX 5090上运行π0、π0.5和GR00T时,分别实现了约2.85倍、1.82倍和2.28倍加速;GR00T在NVIDIA Thor和RTX PRO 6000上也分别实现了约1.40倍和4.31倍加速。


通过简洁的API,PhyAI在发布首日即完成了对MiniCPM-Robot的适配支持,并使用CUDA Graph进行加速,推理帧率从10.20 Hz提升至33.2Hz。

同时,团队还采取了算子融合的方法,将其在NVIDIA H20上的推理帧率进一步提升至36.77Hz。

这次开源的不仅仅是模型权重,而是完整的技术栈:模型加推理框架加部署方案。

对于开发者来说,这意味着拿到手就能用,无需重新搭建复杂的感知、规划和控制系统。

对行业来说,这意味着具身智能的研发门槛被大幅拉低了。

下半场才刚刚开始,具身智能是通往AGI终局的必需品

面壁智能为什么布局具身智能?

这并非偶然。AI竞赛下半场的主题之一,就是让AI拥有身体,进入物理世界。

面壁智能、智谱等纷纷布局具身智能,是行业的必然趋势。

目前大模型公司都在追求语言层面的通用智能,但物理层面的通用智能才刚刚起步。只有语言层面与物理层面的通用智能同时实现,才能达成真正的AGI。

面壁是一家追求通用人工智能的大模型公司,并选择了一条区别于云侧的路线:端侧。终端包括手机、汽车、机器人等等。所以面壁智能布局具身智能,是情理之中的事。

在WAIC上,面壁智能还展示了与乐聚机器人、吉利汽车等伙伴的产业落地案例——展厅导览、园区巡检、仓储物流……端侧能力在这些场景里不是“加分项”,而是“入场券”。

展馆、园区、厂区的很多角落存在信号盲区。为了保证机器人在任何网络环境下都能稳定工作,恰恰要靠强大的端侧模型来兜底。

这是端侧AI的独特价值所在:隐私安全、低延迟、无网可用。

此外,得益于过去的基础模型训练经验与技术积累,面壁还拥有独特的优势:

追求通用智能,而非专用技能;
多模态技术积累深厚,技术底气十足。

面壁智能坚持以通用智能为起点,让机器人处理更普适、更流水线、更长程的任务。MiniCPM-RobotManip正是这一理念的产物:先打造通用大脑,再适配多元场景。这与多数具身团队从特定场景出发、由点及面地打磨专用技能的路径不同。

具身智能天然依赖视觉、语言等多模态信息的融合,而这正是面壁的强项。

自研多模态模型MiniCPM-V/O系列已迭代两年半,开源下载量突破2500万;MiniCPM-V 4.6开源不到2个月下载量突破200万,在国内外社区影响力广泛。

正是这份深厚的多模态家底,让面壁能够快速切入机器人赛道,用视觉Token极致压缩解决了机器人的“金鱼脑”记忆短板。

这家公司用自己的节奏,走出了一条独特的端侧AGI之路。

机器人真正“好用”的关键,往往藏在看不见的地方——比如,记得住自己按了几次按钮。

看着能优雅做出三明治的机械臂,我们有理由相信:属于中国机器人的AGI时代,已经开启。

热点追踪提示词
你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:清华系200亿独角兽攻克具身智能记忆难题并开源要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
来源:https://www.163.com/dy/article/L27AB1VS0511ABV6.html
具身智能

游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

相关热点
AI热点2026-07-21 09:10
技嘉发布RTX 5080木艺显卡与X870E蝶翼主板的独特设计

在COMPUTEX2026展会上,技嘉展示了AORUSGeForceRTX5080INFINITYWOOD显卡和AORUSX870EINFINITYNEXT主板。RTX5080显卡采用白色主题与木色元素装饰,设计独特;X870E主板则以蝴蝶翅膀为灵感,采用类蜂窝结构和金属3D打印

AI热点2026-07-21 09:10
星际荣耀火箭海上回收导航系统关键试验成功

星际荣耀公司近日成功完成SQX-3运载火箭海上回收高精度导航系统的无人机挂飞试验。该试验在广东阳江海域进行,采用创新的半实物动态模拟方案,全面验证了导航系统在复杂海况下的性能。结果表明,系统各项指标均优于设计要求,能够稳定提供火箭与回收船之间的高精度相对导航信息。这标志着该核心系统已完成全部地面验证

AI热点2026-07-21 09:10
Origin Code发布全新英特尔CQDIMM与AMD EXPO ULL内存新品带来AI与渲染性能的强劲提升

PC内存厂商OriginCode近日分别针对英特尔和AMD平台推出专项优化内存。面向英特尔平台的CQDIMM内存,通过与技嘉合作验证了256GB8000MT s的高带宽套条,旨在为本地AI、视频渲染等重载任务提供强大数据吞吐能力,并计划在2026年台北电脑展展出。针对AMD平台,则推出多款支持E

AI热点2026-07-21 09:10
东风本田5月销量环比增长20% CR-V等车型限时购车权益

东风本田公布5月销量达18563台,环比增长20%,其中CR-V销量增长显著。品牌同步推出6月限时购车权益,涵盖CR-V、英仕派、HR-V及思域等多款车型,权益价最低至9 79万元起,并可叠加国家以旧换新补贴及原厂配置加装优惠,为近期有购车计划的消费者提供了具体的价格参考与增值选择。

延伸阅读