新智具身联合复旦3万小时触觉数据统一具身智能手感
新智具身联合复旦大学发布N₀系列技术报告,构建3万小时视觉-触觉交互语料库,提出统一触觉表征模型NeoForce。N₀-VTLA通过预测未来触觉演变提升操作成功率,N₀-TWAM将触觉融入世界模型,使机器人精细操作成功率大幅提升。
先来看一段现场实景录制的视频:

视频里机器人能完成的活儿特别丰富:煮鸡蛋面、调柠檬水这些居家料理,还有收纳整理,它样样精通;就连工厂流水线装配、精密零件组装、线材缠绕梳理这些精细操作也全都游刃有余。这正是N₀系列模型所展现出的强大实操能力。
不知道大家有没有见过机器人实操翻车的名场面:插头边缘反复摩擦却难以插入、抓取塑料瓶时力道失控导致瓶身变形、叠好的毛巾在松手瞬间散落…… 在具身智能的落地进程中,这类“视觉系统判定无误,但物理交互瞬间翻车”的现象屡见不鲜。
这些失败指向了一个行业共识:决定机器人能否在真实物理世界中生存的关键,往往不只在于视觉感知的精度,而更在于接触瞬间的触觉反馈。摄像头能确认空间位置,却无法感知“是否接触”、“顶到边缘”、“夹力过载”或“发生滑移”等,缺失这层反馈,正是阻碍机器人跨越“最后一厘米”的核心痛点。
近日,上海新智具身智能科技有限公司(NeoteAI)联合复旦大学可信具身智能研究院,正式发布了N₀系列三份技术报告,把触觉从“辅助模态”跃升为“核心基建”。三份报告合起来看,恰好拼出一张蓝图——一套触觉数据底座,搭配两条不同侧重的技术路线。更具行业价值的是,项目的数据和模型会进行开源,可以直接查看项目的完整链接。
N₀-Foundation:统一触觉“方言”,构建3万小时交互语料库
触觉数据要想规模化落地,一直卡在哪儿呢?各类触觉设备输出的数据格式互不兼容,不同传感器输出的凝胶形变图、电容矩阵或六维力向量,犹如缺乏统一语法的方言,难以在同一模型中融合。
为此,NeoteAI搭建的NeoData数据集旨在打破这一壁垒:包含超3万小时视觉-触觉交互视频;约140万条操作片段,33亿个时间步;对应80亿帧RGB画面与100亿帧触觉图像;动用Franka、Piper、UR5e等6种机器人本体;覆盖450项真实长程任务(如叠衣、插拔接头、倒液体等),由90位操作员采集;已开源5千小时视觉-触觉交互视频。

另外,团队还提出了NeoForce统一表征模型。无论底层传感器硬件如何,都能学习到具备迁移能力、时序结构化的触觉表征,以供下游具身智能策略使用:哪里被按?按多大力?有没有横向拉扯?这种“触觉普通话”有效解决了跨设备数据融合难题。
为了更直观地理解,下面的视频完整介绍了N₀-Foundation的各项核心功能,包含硬件、数据样例、全面评测等。

N₀-VTLA:以“触觉预判”赋能轻量级VLA
数据底座夯实后,团队接下来思考的是如何将触觉真正融入到VLA技术路线之中。
在现有的多模态融合实践中,直接将触觉图像与RGB视觉信号进行简单拼接往往面临挑战:由于触觉信号仅在物理接触瞬间产生高频响应,大部分时间处于“静默”状态,极易被海量视觉Token淹没。更为关键的是,即便模型成功提取了当前触觉特征,其本质上仍是对已发生动作的滞后反馈——这种“后视镜”式的感知机制,使得在动态交互中始终慢半拍。

N₀-VTLA提出了一种全新的方案:不依赖滞后的当前触觉,而是预测未来50步内的触觉演变。该模型将当前触觉编码为紧凑的潜在Token,结合视觉上下文预判滑移、受力等趋势,从而指导动作模块提前调整。不同任务上显示:N₀-VTLA在插插头任务中成功率达85%,而同类视觉方案仅60%;在拔钥匙的任务成功率达99%,而视觉方案为35%。
此外,N₀-VTLA还突破了传统模仿学习仅依赖专家成功轨迹的局限,让机器人从失败数据中实现自主进化。模型结合触觉信息利用部署后数据以及human in the loop的数据训练了一个进度评估模型,使其能够识别任务执行阶段,甚至识别出“退步”与“救场”等复杂行为。通过结合离线强化学习,机器人在毛巾折叠、书包收纳、纸箱折叠等长程任务上的成功率,分别从50%、35%、20%大幅跃升至95%、80%、75%,真正实现了从失败经验中汲取教训的持续进化。

下面的视频直观展示了N₀-VTLA在精细化操作方面的强大能力。

N₀-TWAM:在世界模型中重构“触觉想象”
如果说N₀-VTLA是加装预判雷达,N₀-TWAM则是对机器人“认知中枢”的重构:它把触觉放进世界模型,让机器人在动手之前,先在自己的“想象”里完整推演一遍操作视角和手感。
现有世界模型大多局限于未来视觉图像的生成,在驱动真实机器人时面临严峻的物理对齐挑战:画面里杯子被抓住了,但手指夹没夹稳?画面里插头对齐了,但下一秒会不会卡住?这些触感信息完全缺失。
N₀-TWAM要做的是同时预测未来的视频、触觉和动作这三个相互耦合的序列。N₀-TWAM采用混合专家架构,内置视频、触觉、动作三个异步专家网络,视频专家从预训练模型热启动,触觉和动作专家用更窄的结构,最终总参数量72亿,仅相当于全宽方案的一半。

在仿真与真机测试中,N₀-TWAM展现出显著优势:仿真平均成功率达84.5%(而世界模型最强基线为36%);真机8项任务平均成功率46.3%(LingBot-VA为21.9%)。消融实验进一步证实,去除“未来触觉预测”或“当前触觉条件”均会导致性能显著下降,确立了触觉在世界模型中的不可或缺性。

以下视频展示了N₀-TWAM的模型实际操作能力。

触觉:具身智能的下一个Scaling Law?
纵观N₀系列三份报告,NeoteAI释放了明确的行业信号:N₀-Foundation验证了触觉模态具备类似视觉的Scaling潜力;N₀-VTLA证明了触觉可以自然地接入现有VLA架构;N₀-TWAM确立了触觉在世界模型顶层设计中的核心地位,使其与视觉模态真正平起平坐。
这意味着,机器人的认知范式正从单一的“视觉驱动”向“视触融合”演进。它们不再仅仅通过“看”来理解世界,而是开始像婴儿一样,通过主动的触觉探索来验证假设并规划下一步动作。“看得见杯子不等于拿得稳,认得出插座不等于插得进”——这一物理世界的常识,终于被写入了机器人的底层逻辑。
尽管距离“随手一摸即知轻重”的通用具身智能仍有长路要走,真实场景下的数据采集成本、跨本体泛化能力以及推理实时性仍是亟待攻克的工程难题,但NeoteAI的这组工作已实质性地推动触觉从“小众研究方向”跃升为“具身智能核心基建”。

具身智能的下一篇章,或许不再仅仅是“让机器人看懂世界”,而是真正“让机器人摸透世界”。
你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:新智具身联合复旦3万小时触觉数据统一具身智能手感要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
相关热点昆仑联通从沪市转战北交所,主营IT基础架构解决方案,年营收超21亿元,三年净利润约2 7亿元。客户涵盖蔚来、字节跳动等,核心技术产品贡献八成以上营收。但2024年一季度业绩下滑,拟募资4 58亿元用于业务拓展与智能运维升级。
NVIDIAEdify结合生成式AI与3D创作,可在数分钟内生成细节丰富的沙漠景观。通过文本提示快速创建3D资源,AI智能体自动规划布局并生成全景环境光照。技术采用Edify3D模型与16K分辨率HDRi,支持USD格式无缝导入创作工具,大幅提升场景构建效率。
GitHub推出GitHubModels服务,为超1亿用户提供AI模型选择与测试工具。核心功能ModelPlayground支持大语言、小语言及视觉模型,可调整参数并实时比较输出。目前处于限量公测阶段,免费使用。
摩尔线程与360集团签署战略合作协议,共同打造AI数字安全生态。双方将深度融合GPU算力与智脑大模型,推出360智脑大模型一体机,并已完成夸娥千卡集群适配,训练稳定性达100%,未来将扩展至万卡集群。
- 日榜
- 周榜
- 月榜
热点快看
