当前位置: 首页
科技数码
机器人触觉觉醒:AI模型视觉与触觉感知材质

机器人触觉觉醒:AI模型视觉与触觉感知材质

热心网友 时间:2026-07-21
转载

梨花女子大学提出Splash框架,通过掩码隔离训练仅更新模型休眠参数,使小型多模态语言模型在保留原有视觉能力的同时学会触觉感知,并在触觉与视觉任务上均优于现有方法,推理效率与原始模型一致。

试着闭上双眼,用手触摸一块布料,你能轻松分辨出丝滑的缎面、粗糙的麻布、柔软的棉质或是坚硬的皮革。这种感知对人类而言再自然不过,却一直是机器人长期缺失的关键能力。工业机器人虽然可以“看”,但很难“感觉”。当它们需要抓取易碎的鸡蛋,或是拧开紧密的瓶盖时,仅靠摄像头提供的视觉信息,很难准确判断该用多大的力、如何调整握持角度。触觉,正是让机器人从“看图猜测”升级为“真实感知”的核心拼图。

梨花女子大学的研究团队瞄准了这一难题,提出了一套名为Splash(Mask-isolated tactile alignment learning,即掩码隔离触觉对齐学习)的全新框架。该方案的核心目标在于:让一个原本只擅长处理图像和文字的紧凑型AI模型,在保留原有视觉理解能力的基础上,额外学会处理触觉信息。这就像在一张已经画满图案的画布上,找到空白角落,只在那里添加新内容,而不破坏任何已有的笔触。

一、触觉信息的载体:光学触觉传感器与AI模型的“感知鸿沟”

要理解这项研究,首先需要知道机器人如何“感受”触觉。现代机器人依赖一种名为光学触觉传感器的装置,例如DIGIT。其工作原理颇为巧妙——表面覆盖着一层柔软硅胶,当硅胶接触物体时,接触面的形变会被内置摄像头拍摄成图像,这就是“触觉接触图”。通俗来说,就像在你的指尖贴了一层透明果冻,果冻被按压后,变形的纹路被拍下来,照片里呈现出彩虹般的光泽,这就是机器人的“触感照片”。

研究团队面临的核心挑战是:现有的多模态大型语言模型,参数量动辄70亿,推理能力强,但体积太大,不适合需要实时运算、资源受限的边缘机器人。因此,他们将目标锁定在参数量不超过30亿的“小型多模态语言模型”上,例如Qwen2.5-VL-3B和InternVL2.5-1B。但这类小模型有一个致命弱点:参数预算本就捉襟见肘,当试图灌输触觉这种新感知模态时,它们很容易发生“灾难性遗忘”——学会触觉的同时,把之前辛苦学来的视觉理解能力忘得七七八八。论文中举了一个直观的例子:原本能准确描述“一个人手持金属罐”的Qwen2.5-VL-3B模型,在触觉训练后,开始臆造出“橡皮筋被压在罐子顶部”这种不存在的细节,视觉理解评分从9分跌到5分。这就像一位原本擅长绘画的学生,学了几节雕塑课后,突然连透视关系都画不准了——新技能的习得,是以旧技能的崩塌为代价的,这显然不可接受。

二、参数空间的“地权划分”:找出大脑里的“休眠区域”

Splash的核心思路,可以用城市规划来理解。一座城市土地资源有限,新建工厂不能随意占用已有的住宅区,而应该找那些尚未开发的空地来建。Splash对AI模型参数空间做的事,本质上就是一次“土地普查”——找出哪些参数是核心地标(比如市政厅、医院),哪些是尚未开发的荒地,然后把所有新建设都安排在荒地上,绝对不碰核心地标。

具体来说,团队受到一种叫Wanda的语言模型剪枝方法的启发,设计了一套“视觉相对重要性评分”机制。他们从一个视觉-语言校准数据集中随机抽取128个样本,对模型内部所有线性层中的每一个参数打分。这个分数怎么算?很简单,直接粗暴:将该参数的权重绝对值,乘以与之对应的输入激活值的L2范数。得分高的参数被标记为“关键参数”——它们是维持模型视觉语言能力的支柱,必须冻结保护。得分低的则被标记为“休眠参数”——它们在处理视觉语言任务时贡献微薄,可以被“唤醒”,重新用于学习触觉信息。

这种划分的程度,团队称之为“稀疏率”。当稀疏率设为60%,意味着60%的参数被判定为休眠参数,可以在触觉训练中更新,而剩下的40%关键参数则被完全冻结。值得一提的是,团队还额外保护了模型首尾两个Transformer层的所有参数——这两层分别负责原始输入的嵌入和最终语义的输出,对模型稳定性极为关键,不能随意改动。

三、掩码隔离训练:只在荒地上“施工”

有了参数空间的地图,Splash进入实际训练阶段。整个训练流程被设计成一个统一的单阶段过程,这与之前很多方法需要“先预对齐触觉编码器,再微调大模型”这种繁琐的两阶段流程,形成了鲜明对比。

在模型架构上,Splash保留了原有sMLLM中处理自然图像的视觉前端(包括视觉编码器和模态适配器),同时新增了一个轻量级的触觉前端。这个触觉前端采用了只有580万参数的ViT-Tiny模型,配合一个两层MLP投射器,将触觉接触图的特征映射到语言嵌入空间中。自然图像、触觉接触图和文字提示经过各自的编码器处理后,被拼接成一个统一的自回归序列送入大语言模型,让模型生成触觉属性描述。

训练时,团队构造了一个二值掩码矩阵M。每个被标记为休眠的参数对应掩码值为1,可以接受梯度更新;每个关键参数对应掩码值为0,梯度被清零,等于完全冻结。这个掩码通过Hadamard乘积作用于梯度上,从数学上确保了关键参数绝对不会被触觉训练污染。训练目标是最大化自回归生成触觉描述的对数似然,也就是让模型生成的触觉属性词汇(比如“粗糙的、有弹性的、坚硬的”)尽可能接近真实标注。

这种设计与常见的LoRA方法有本质区别。LoRA通过在原有权重矩阵旁边添加一对低秩矩阵来引入新能力,这种加法操作会在推理时引入额外计算量,并且原始权重空间并未被真正隔离,仍然存在干扰的可能。Splash则采用“原位替换”的思路——休眠参数直接在原地被更新,没有任何附加模块,推理阶段的计算量与原始模型完全一致,零额外开销。

四、实验验证:小身板胜大块头

研究团队在三个视觉-触觉-语言基准数据集上对Splash进行了全面评测。第一个是SSVTP数据集,包含4500个对齐的视觉-触觉图像对,聚焦服装纹理感知任务。第二个是TVL数据集,包含44000个样本,附带自然语言描述的触觉属性标注,是目前最大规模的VTL对齐训练集之一。第三个是TacQuad数据集中的DIGIT传感器子集,包含72000个触觉样本,通过手持交互方式采集,模拟真实世界中人类的接触动态。

评测方式分为两类。主要评测采用GPT-4o作为“文本裁判”,给模型生成的触觉描述与真实标注之间的语义相似度打分,满分10分。辅助评测则使用客观的关键词F1分数和Top-5准确率。对比的基线方法包括使用LLaMA-7B骨干的TVL-LLaMA和UniTouch,以及在相同Qwen2.5-VL-3B骨干上分别应用LoRA和(IA)?的变体。

结果相当令人瞩目。未经任何触觉训练的原始模型,平均得分仅在3.53到3.57之间,说明纯视觉模型对触觉属性推理几乎束手无策。使用7B参数LLaMA骨干的UniTouch,平均得分也仅为3.74——参数量更大,效果却并不突出,这说明单纯堆叠参数量并不是解决触觉感知的正确路径。

Splash-3B在相同的Qwen2.5-VL-3B骨干上,平均得分达到4.91,明显超过同骨干下使用LoRA方法的TVL基线(4.50)和(IA)?变体(4.42)。尤其在TacQuad这个“分布外”测试集上,Splash-3B得分4.86,远超(IA)?的3.84,说明Splash的泛化能力更强,能够应对真实世界中各种意想不到的触觉接触场景。体量更小的Splash-1B(仅10亿参数)平均得分甚至达到5.01,在SSVTP上高达5.69,超过了所有对比方法,包括参数量是其7倍的LLaMA-7B系方法。在客观指标上,Splash在平均F1分数和Top-5准确率上同样全面领先所有基线,充分表明其预测的触觉属性更加精准,词汇覆盖面更广。

五、不忘初心:视觉能力的完整保留

除了触觉任务的性能,研究团队还花费大量篇幅验证Splash不会损伤模型原有的视觉语言推理能力,这也是整项研究区别于以往工作的核心贡献之一。评测采用了四个权威的通用视觉语言基准:MMMU、MathVista、MME以及MMBench。

结果相当有说服力。UniTouch和TVL-LLaMA在这些通用视觉基准上几乎完全崩溃——UniTouch的MMMU得分仅26.6分,MathVista仅9.0分,MME更是只有可怜的27分,这意味着这些方法在引入触觉能力的同时,基本上摧毁了模型的通用视觉理解能力。

Splash-3B则呈现出截然不同的图景。其MMMU得分55.3,不仅远超TVL-Qwen基线(50.0),甚至超过了未经任何触觉训练的原始Qwen2.5-VL-3B零样本基线(53.1)。MathVista得分65.3,同样超过零样本基线的62.3。研究团队认为,这种“学了新技能反而比原来更强”的现象,可能源于稀疏性更新本身带来的一种类似剪枝的正则化效果,反而帮助稳定了原有的推理流形。

相比之下,(IA)?在MME、MMBench-EN和MMBench-CN三项上表现最佳,但这是以触觉学习能力不足为代价换来的——它的可塑性太低,只能通过在触觉任务上“划水”来保全视觉能力,并不是真正意义上的双赢。Splash则在保持视觉能力的同时实现了更充分的触觉学习,两者之间并不是此消彼长的零和游戏。

六、细节深挖:稀疏率、校准数据与触觉前端初始化

研究团队还进行了一系列精心设计的消融实验,逐一检验Splash各个设计决策的必要性。

关于稀疏率的选择,他们测试了从30%到100%的多个档位。当稀疏率过高(如100%,即全参数更新)时,视觉语言能力急剧崩塌,MMMU得分跌至22.0,MMBench-EN仅剩10.4,这印证了灾难性遗忘的破坏性。当稀疏率过低(如30%)时,触觉学习受到过度限制,VTL平均得分从4.91降至4.79。60%被确认为Splash-3B的最佳平衡点,在触觉与视觉两端同时取得最优表现。对于更小的Splash-1B,由于参数空间本就更紧张,模型对稀疏率更为敏感,但60%仍提供了合理的整体均衡。

关于校准数据的选择,研究结果令人颇感惊喜。无论是使用CC3M的图文对、TVL的触觉数据,还是用完全随机的噪声图像配上无意义文字提示作为校准输入,Splash的性能差异都极小(VTL平均得分在4.75到4.91之间微幅浮动)。这一发现暗示了一个深刻的结论:Splash所识别出的休眠参数,并非某个特定数据集激活模式的产物,而是模型架构中内在冗余结构的体现——这些“荒地”无论用什么地图来测绘,都大差不差地指向同一片区域。校准样本数量方面,64、128和256个样本表现相当,研究团队选择128个作为默认值。

关于触觉前端初始化,团队还控制变量,对比了使用TVL论文中触觉预训练编码器作为初始化的情况。即使在相同的触觉前端初始化条件下,Splash依然在VTL和VL两个维度上全面超越TVL-Qwen,证明性能提升的主要来源是掩码隔离训练策略本身,而非触觉编码器的质量差异。

七、走进模型内部:休眠参数被“唤醒”的证据

研究团队还深入分析了Splash训练前后,休眠子空间内参数的变化情况。他们从TVL数据集的一个子集出发,提取了Qwen2.5-VL-3B与Splash-3B之间,约1500万个休眠参数的权重变化情况,并将视觉相对重要性分数的变化分解为两个分量:权重幅值的变化和激活L2范数的变化。

结果显示,约48.8%的休眠权重幅值有所增加,而高达67.1%的对应激活值出现了显著的L2范数提升。换言之,休眠通道的“响应灵敏度”大幅上升——这些原本对视觉语言任务几乎没有反应的通道,在经过触觉训练后变得高度敏感,开始对触觉输入做出积极响应。综合来看,63.0%的休眠参数的整体重要性得分提升,进一步印证了“唤醒休眠”这一设计理念的有效性。

八、边界保护与推理效率的双重验证

有意思的是,团队还专门验证了冻结首尾Transformer层是否真的必要。若解冻这两层边界层,VTL平均得分下降0.18分,说明这两层对于维持模型的表示稳定性确实至关重要。

在推理效率方面,团队在单块NVIDIA RTX PRO 6000 Blackwell GPU上,测量了各方法的端对端推理延迟。基于LLaMA-7B骨干的TVL-LLaMA,P99延迟为202.37毫秒,控制频率约为每秒4.97次。而Splash-3B与合并LoRA权重后的TVL-Qwen基线延迟完全相同,均为134.55毫秒,控制频率7.50次每秒。由于Splash不引入任何附加模块,其推理负担与原始模型完全相同,这对于需要实时感知的机器人应用场景尤为关键。

九、真实案例与失败边界

从定性结果来看,Splash生成的触觉描述与真实标注的语义贴合度明显更高。当面对一块麻布时,Splash-3B能准确输出“lined, fabric”,而UniTouch给出的是“1. Textured 2. Rustic.”这类通用词汇,TVL-LLaMA则更是给出了“metallic, patterned, rigid”这种严重偏离实际的描述。

当然,Splash并非无懈可击。研究团队坦诚地分析了两类典型失败案例。第一类是“触觉感知混淆”——当一块织物在轻触时变形极小,其触觉接触图的几何结构与光滑硬质表面高度相似,导致模型误判材质属性,将软性布料描述为“metallic, smooth”。这是触觉感知本身的物理局限,而非模型设计缺陷。第二类是“微纹理误读与视觉主导”——当物体表面具有细微的凸起纹理,但整体外观视觉上较为光洁时,所有模型都倾向于被视觉外观所误导,生成“smooth, glossy”这类与触觉事实相悖的描述。这提示在视觉与触觉信号存在冲突时,模型的触觉感知融合机制仍有改进空间。

研究团队同时指出,Splash目前的休眠子空间是在训练开始前一次性离线确定的,之后固定不变。然而在实际机器人操作中,模型的激活模式会随着任务状态、接触条件和操作进度动态变化,静态的休眠子空间未必能完全捕捉这种时序变化。此外,当前实验仅基于DIGIT单一型号的触觉传感器,跨传感器泛化仍是未来值得探索的方向。不过由于Splash的设计本身与触觉前端无关,理论上可以直接替换不同类型的触觉编码器。

说到底,Splash做到的事情是:在一张已经画满图案的画布上,找到那些空白的角落,然后只在这些角落里添加新的内容,而不破坏任何已有的笔触。这听起来是个朴素的想法,但在AI模型这个领域,能够严格执行这种“只在荒地施工”的策略,并且在触觉任务和视觉任务两端同时取得优于现有方法的成绩,本身就是一件相当不容易的事情。

对于关注具身智能和机器人技术的研究者而言,这项工作提供了一个清晰的信号:赋予机器人新感知能力的道路,不一定要以更大的模型或更多的算力为前提,合理地利用已有模型的内在冗余,同样可以走出一条高效的路。而对于普通读者而言,下一次你感受到丝绸的顺滑或砂纸的粗粝时,或许可以想一想,让机器人也能获得这种感知,背后需要多少精妙的工程。对这个话题感兴趣的读者,可以通过arXiv编号2607.00302查阅完整论文,深入了解所有技术细节。

Q&A

Q1:Splash框架是如何避免AI模型学会触觉之后忘记视觉能力的?

A:Splash通过一个“地权划分”机制来解决这个问题。它先用一小批视觉语言数据,给模型内部所有参数打分,找出那些对视觉语言任务贡献微小的“休眠参数”。训练触觉能力时,只允许这些休眠参数更新,对视觉任务重要的“关键参数”则完全冻结,不接受任何梯度更新,从数学上保证了视觉能力不被触觉训练破坏。

Q2:Splash使用的触觉传感器是怎么工作的?

A:Splash实验中使用的是DIGIT光学触觉传感器。它的工作原理是:传感器表面覆盖一层柔软硅胶,当硅胶接触到物体时,接触面的形变会被内置摄像头拍摄成图像。这张图像呈现出彩虹状的光泽纹路,记录了物体表面的细微几何特征,就是所谓的“触觉接触图”,Splash通过专门的触觉编码器处理这类图像。

Q3:Splash的推理速度和现有方法相比如何?

A:Splash在推理阶段没有任何额外的计算开销,速度与基础模型完全一致。实测中,基于Qwen2.5-VL-3B的Splash与合并了LoRA权重的TVL-Qwen延迟相同,均为134.55毫秒,每秒可处理约7.5次推理。相比使用LLaMA-7B骨干的TVL-LLaMA(202.37毫秒,每秒4.97次)快了约35%,更适合实时机器人控制场景。

来源:https://www.163.com/dy/article/L2AKOSND0511DTVV.html

游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

同类文章
更多
罗福莉入选新一届35岁以下科技创新35人中国区名单

罗福莉入选新一届35岁以下科技创新35人中国区名单

2025年《麻省理工科技评论》“35岁以下科技创新35人”中国区名单在上海发布,罗福莉、姚顺宇等入选。罗福莉推动大模型从“能聊天”走向“能干活”,探索智能体演进;姚顺宇建立非厄米拓扑能带理论。本届AI+机器人领域入选者占四成。

时间:2026-07-25 21:58
美国科技巨头为AI投资年内裁员近14万人

美国科技巨头为AI投资年内裁员近14万人

美国科技巨头年内裁员近14万人,同时计划在AI基础设施上投入7250亿美元。裁员主要目的为AI投资腾出资金并纠正疫情期间过度招聘,市场对AI相关裁员反应负面,而AI初创公司正加速扩招,形成对比。

时间:2026-07-25 21:58
位AI Infra高管复盘WAIC:暴力美学触顶后求变?

位AI Infra高管复盘WAIC:暴力美学触顶后求变?

WAIC2026上,AIInfra行业关注点从算力规模转向推理效率与Token产出。Agent驱动Token消耗激增,AI工厂与Token工厂成为关键载体。效率竞争取代规模竞赛,玩家分层加速,具备全栈优化能力的头部厂商优势凸显。

时间:2026-07-25 21:58
显卡厂商封仓引发涨价 玩家面临高价购买

显卡厂商封仓引发涨价 玩家面临高价购买

显卡市场,恐怕又要迎来一波涨价潮了。过去两年,不少玩家咬咬牙买下的高价显卡,如今回头看,竟然成了抄底。但问题在于,硬件市场每一次涨价,最终买单的永远还是玩家。 业内消息显示,GDDR7显存价格出现了明显上涨,单颗2GB显存价格上涨接近20美元。按8GB显存规格计算,一张显卡的显存成本或将增加约542

时间:2026-07-25 21:58
OpenAI加入签署AI开源模型公开信,组织达35家

OpenAI加入签署AI开源模型公开信,组织达35家

7月25日,微软、英伟达等25家美国公司联署公开信支持开放权重AI模型,随后签署方增至35家,新增包括OpenAI等。开放权重模型可下载、修改、运行,能扩大创新、强化竞争并降低风险,避免AI收益集中于少数巨头。

时间:2026-07-25 21:28
热门专题
更多
刀塔传奇破解版无限钻石下载大全 刀塔传奇破解版无限钻石下载大全
洛克王国正式正版手游下载安装大全 洛克王国正式正版手游下载安装大全
思美人手游下载专区 思美人手游下载专区
好玩的阿拉德之怒游戏下载合集 好玩的阿拉德之怒游戏下载合集
不思议迷宫手游下载合集 不思议迷宫手游下载合集
百宝袋汉化组游戏最新合集 百宝袋汉化组游戏最新合集
jsk游戏合集30款游戏大全 jsk游戏合集30款游戏大全
宾果消消消原版下载大全 宾果消消消原版下载大全
  • 热门数据榜