影眸科技获具身顶会RSS最佳论文提名 实现139.6倍加速与100%安全约束
影眸科技论文《cuNRTO》入围RSS2026最佳论文提名,将非线性鲁棒轨迹优化搬上GPU,在独轮车、四旋翼和机械臂任务中实现最高139 6倍加速,同时保持100%安全约束,使仿真训练策略具备对真实世界扰动的鲁棒性。
先给出几个关键判断。
在近期举办的具身智能顶级学术会议 RSS(Robotics: Science and Systems)2026 上,最高奖项 Outstanding Paper Award 的提名名单中,出现了一个略显“非传统机器人”的名字——影眸科技,一家专注于 3D 生成大模型领域的头部企业。
外界对影眸科技的认知,大多源于其在 3D 生成领域的核心技术实力:基于团队自主研发的原生 3D 大模型框架 CLAY(曾获 SIGGRAPH2024 最佳论文提名),影眸科技于 2024 年推出了全球首个原生 3D 大模型产品 Hyper3D。目前,该产品已深度嵌入今年英伟达 CES Keynote、OpenAI 首届黑客松冠军项目等多个全球技术标杆场景的 3D 资产生成流程中,其企业客户规模位居行业首位。
然而,影眸科技的研究与战略布局,远不止于生成领域。在具身智能方面,Hyper3D 的 Sim-Ready 功能能够一键为 3D 资产赋予重力、摩擦力等真实物理属性,并无缝导出至 Isaac Sim 等仿真环境,已成为众多具身智能团队训练「空间智能」的核心资产来源之一。今年 7 月,影眸科技在具身应用领域更进一步,联合地瓜机器人、谋先飞共同发布了“具身智能可训练仿真闭环联合解决方案”。其世界生成模型 Hyper3D WorldGen,基于自研原生 3D 大模型 Hyper3D Rodin 与 CAST 框架(SIGGRAPH2025 最佳论文),实现了仅凭单张照片即可还原出可交互的三维场景。场景内的所有 3D 物品均为原生 Sim-Ready 资产,具备完整物理属性,可直接用于仿真训练,从而打通了从真实影像到具身可训练场景的端到端链路。
在资产实现 Sim-Ready 之后,一个更为尖锐的问题随之浮现:如果仿真环境中训练出的策略,一旦迁移到真实世界,成功率便大幅下降,缺乏实际部署价值,那么仿真资产的价值究竟何在?
影眸团队通过这篇研究成果,给出了自己的答案。

影眸Hyper3D合伙人、物理 AI 事业部负责人 Joel Wang 作为共同第一作者、影眸科技作为署名单位参与完成的论文《cuNRTO: GPU-Accelerated Nonlinear Robust Trajectory Optimization》成功入围了 RSS 2026 的最高奖项 Outstanding Paper Award 提名。

在过去的十余年间,RSS 的最高论文奖项长期由全球顶尖高校与实验室所主导,来自中国大陆的机构及企业团队进入候选名单的案例寥寥无几。今年共有 8 篇论文获得提名,其中仅有两篇成果包含了由国内团队创立的商业公司的核心参与,分别是影眸科技和银河通用。
这篇论文所回答的,正是上述那道关于“从仿真到现实”的必答题:在充满误差与扰动的真实物理世界中,如何让具身智能体更快地计算出安全的动作。它将非线性鲁棒轨迹优化的核心计算迁移至 GPU 上,在独轮车、四旋翼飞行器和 Franka 机械臂等任务中实现了最高 139.6 倍的加速,同时保持了 100% 的安全约束满足率。
从生成 Sim-Ready 的 3D 资产,到让仿真环境中训练出的智能体逐步走向 Real-World Ready,这构成了影眸研究版图上关键且必然的一步。
仿真不必追求完美,策略需对不完美有所准备

具身智能体在仿真环境中学习的每一个动作,都建立在一个隐含的假设之上:世界会按照模型训练时的环境那样运转。然而,真实世界绝非如此。真实机器人所面对的,并非一个与仿真环境完全一致的物理世界,摩擦、控制误差和外部扰动始终存在。
行业内的传统直觉是不断提高仿真精度,让模拟器尽可能逼近现实。但这条路径面临一条残酷的渐近线——现实中的摩擦、接触、材料属性、执行误差等,不可能被完整复刻。Sim-to-Real Gap 是仿真训练真正走向落地所绕不开的核心问题。
cuNRTO 选择了另一条解决路径:要解决 Sim-to-Real 问题,不一定要等待一个完美的模拟器,也可以让策略本身对模拟器的不完美具备鲁棒性。
「仿真的天花板,不仅取决于它能多真实,也取决于策略能否承受它不真实的部分。」Joel Wang 表示。
这在技术上对应控制领域的一个经典方向——鲁棒轨迹优化(Robust Trajectory Optimization)。其核心思路其实很直接:既然扰动无法被精确预测,那么就把可以界定的模型误差与外部扰动,显式地表示成一个有界的结构化不确定性集合(uncertainty set)。然后,在规划阶段提出一个硬性要求:对于集合内的每一种可能扰动,所规划的轨迹都必须满足全部安全约束,包括避障、关节限位、力矩上限等,一个都不能违反。
换句话说,这是一种最坏情况保证(worst-case guarantee)。相比仅能给出概率性保证的随机方法,它在机械臂操作、飞行器避障等安全攸关的场景中显得更为根本。而且,求解的产物不仅是一条名义轨迹,还包括一组随时间变化的反馈增益——机器人在执行过程中一旦被扰动带偏,可以依据实时估计的扰动即时进行纠偏。
听起来很理想,但存在一个巨大的难题:这类问题,此前根本无法高效计算。
从 8 小时到 218 秒:算不动的鲁棒优化,如何被搬上 GPU
为什么算不动?从直觉层面看,“对所有扰动都成立”意味着存在无穷多条约束——不确定性是连续取值的,无法逐一枚举,因此问题在原始形式下是不可解的。
此前的 NRTO(Nonlinear Robust Trajectory Optimization)框架给出了一条可行的路径:外层对非线性动力学和约束进行逐次线性化(successive linearization),内层则通过鲁棒约束重构,将无穷多条约束转化为有限个二阶锥规划(SOCP)约束,再使用交替方向乘子法(ADMM)进行求解。这套框架在理论上足够优雅,能够处理非线性动力学和非线性约束。
但在工程实现上,它撞上了一堵墙:SOCP 子问题依赖内点法(Interior Point Method)求解。内点法精度高,却是一种以大规模矩阵分解为核心的串行算法,每次迭代都需要重新分解一个随问题规模膨胀的 KKT 系统。一旦系统维度升高、约束增多,计算量便会呈爆炸式增长。
论文中给出的基线数据非常直观:一个包含五个障碍物的独轮车(unicycle)任务,原始 NRTO 需要计算 30423 秒,超过 8 个小时;四旋翼任务也需要 13374 秒。这样的速度,使得鲁棒优化只能停留在论文层面,根本不具备任何实际部署价值。
与此同时,从刚体动力学梯度并行化,到实时非线性 MPC,将优化计算搬上 GPU 已是明确趋势。问题在于,NRTO 的原始结构,嵌套着双层循环加上串行内点法,天然不适合并行计算。
cuNRTO 的贡献,就在于通过两次算法层面的架构重构,将这套串行算法改写成 GPU 友好的形态。
第一步:NRTO-DR,用算子分裂替换内点法。

NRTO-DR 架构图
直观上,这一步所做的事情是将一个庞大且串行的求解器,拆解成大量小而独立的基本计算操作。
具体而言,团队使用经典的 Douglas-Rachford 分裂方法重写了内层计算成本最高的 SOCP 子问题,将其分解为两类操作。其一为稀疏线性求解,由于在内层迭代中 KKT 系统的系数矩阵保持不变,因此只需做一次 Cholesky 分解,后续每次迭代复用三角求解即可,这直接消除了内点法“每步重新分解”的高昂成本。其二为二阶锥投影,将一个点投影到二阶锥上只有三种几何情形,且每条约束的投影彼此完全独立,是典型的可大规模并行化问题。
在 GPU 实现上,稀疏分解与三角求解交由 cuDSS 处理,锥投影则由定制的 CUDA kernel 完成。每条约束映射到一个 warp,向量运算通过 cuBLAS 全程保留在设备端。
效果立竿见影:无障碍独轮车任务的计算时间从 30423 秒降至 1934 秒。
然而,团队在性能分析时发现了新的瓶颈:43.5% 的运行时间消耗在 CPU 与 GPU 之间的同步上,而真正的锥投影计算仅占 11%,GPU 平均利用率仅为 34.9%。算法虽然快了,但数据却在 GPU 与主机之间来回搬运,将省下的时间又消耗了回去。
第二步:NRTO-FullADMM,将整个内循环搬进 GPU。

NRTO-FullADMM 架构图
这是论文真正的核心创新点。它不再满足于替换子求解器,而是重构了内层 ADMM 本身的分块结构。通过引入新的松弛变量,将二阶锥投影直接“压”进 ADMM 的第一个更新块中——原本需要嵌套一层 DR 求解器才能完成的任务,现在变成了 ADMM 迭代中的一步原生投影,嵌套结构被彻底消除。
由此带来的关键工程红利是:整个内循环可以完整地运行在 GPU 上。每个外层线性化迭代只需向 GPU 上传一次约束数据与常量算子,后续的仿射求值、并行锥投影、QP 更新、反馈增益计算、对偶更新与残差检查,全部在设备端完成,直到收敛后才将结果传回。
GPU 到主机的通信瓶颈被彻底消除,GPU 平均利用率从 34.9% 飙升至 86.5%。
速度提升两个数量级,安全性能丝毫不减

使用 cuNRTO 规划 Franka 机械臂轨迹
论文在独轮车、四旋翼飞行器和 7 自由度 Franka 机械臂这三类系统上进行了系统性的评测,并对时间步长、不确定性水平和障碍物数量三个维度分别进行了实验。以下是几组关键数据:
- 独轮车五障碍物任务:30423 秒 → 218 秒,实现 139.6 倍加速
- 四旋翼飞行器五障碍物任务:13374 秒 → 200 秒,实现 66.9 倍加速
- Franka 机械臂(14 维状态、7 维力矩输入,包含关节限位、速度限制、力矩边界与避碰约束):3949 秒 → 152 秒,实现 25.9 倍加速
更为重要的是,所有加速成果均未以牺牲安全性能为代价。通过 1000 次随机扰动采样,加上 1000 次专门探测不确定性集合边界的极端用例,共计 2000 次 Monte Carlo rollout 验证表明:在考虑线性化误差的设定下,所有任务、所有扰动实现均保持了 100% 的约束满足率。三种求解器的最优目标值差异不到 0.5%,但速度提升了两个数量级,解的质量没有出现退化。
这项工作的核心,在于同时处理速度与鲁棒性,而不是用安全性换取速度。


值得关注的是,论文还在 Robotarium 平台上完成了真机验证。扰动集合直接从开环执行的残差中估计得出,NRTO 输出的反馈策略能够在线估计扰动并实时纠偏,最终使机器人稳定驶入目标区域。而仅执行名义控制序列的对照组,则出现了肉眼可见的漂移现象。
扰动不必被精确建模,只需被界定;世界不必完美,策略只需对不完美有所准备。这套方法论在真实硬件上成功跑通了完整的闭环验证。
据了解,团队正在与英伟达进一步推进 GPU 侧的优化工作,目标是将相关计算时间继续压缩至毫秒级别。一旦达成,鲁棒优化将不再仅仅是一种离线规划工具,而是具备在线控制能力的实时组件。
一家 3D 生成公司,为何能入围具身顶会最佳论文?


回到最初的问题:一家 3D 生成公司,为何要涉足机器人控制领域?
将影眸Hyper3D近几年的研究工作梳理在一起,答案便会自然浮现:
- CLAY(SIGGRAPH2024 最佳论文提名):原生 3D 生成基础模型,解决三维物体如何生成的问题;
- DressCode(SIGGRAPH2024 最佳论文提名):自回归 3D 生成架构的探索;
- BANG (SIGGRAPH2025 Top 10 技术论文速览):通过生成式方法理解物体内部结构、实现 3D 资产递归分件,解决物体结构如何理解和拆解的问题;
- CAST(SIGGRAPH 2025 最佳论文):从单张图片重建包含物体关系与物理约束的完整 3D 场景,解决完整场景及其物理关系如何重建的问题;
- cuNRTO(RSS 2026 最佳论文提名):解决智能体如何在存在不确定性的环境中安全行动的问题。
生成物体 → 理解结构 → 构建场景 → 在物理场景中行动。这并非四篇孤立的论文,而是同一张研究版图上环环相扣的四块拼图。它对应着影眸正在构建的业务闭环:Hyper3D 的 Sim-Ready 功能为具身智能持续生产可用于仿真的 3D 资产,而 cuNRTO 则在探索让基于这些资产训练出的智能体真正走向 Real-World Ready。影眸的定位也因此变得清晰:它正在成为连接生成世界、仿真世界与真实世界的 3D 智能基础设施。
支撑这张版图的,是一个在创业公司中相当罕见的全球顶级科研团队。影眸Hyper3D是业内唯一一家连续多年获得 SIGGRAPH 最佳论文及提名的商业公司,其算法团队中每 2 人就有 1 人曾获得或被提名过顶会最佳论文,约 70% 的科研成果已实现产品化转化。
这种研究密度在今年仍在加码:在 SIGGRAPH 2026 上,影眸共有 6 篇论文被接收——对于一家仅有 60 人的创业公司而言,这已是足以对标全球顶级实验室的产出水平。

团队在大会现场设立了展位,演示 Hyper3D 的实时生成能力,参观人流几乎从未间断,其中相当一部分是 Hyper3D 的老用户,他们围上来当面提出需求、反馈意见。

在同一个会场里,论文在讲台上被宣读,产品在展台前被用户簇拥,这无疑是“研究即产品”这条路线最具象的画面。

在影眸Hyper3D,研究者拥有真正的问题定义权,可以探索那些不直接服务于短期产品版本的长期问题。研究与产品并非两套割裂的体系:CLAY、BANG、CAST 最终都进入了产品与产业场景,多位核心研究者本身就是公司合伙人和核心决策者。身兼创业者与一线研究者身份的 Joel Wang,正是其中之一。
「这次提名当然是对论文的认可,但对我们而言更重要的是,它再次证明了影眸有能力支持非常前沿、甚至不直接服务于短期产品版本的研究。我们希望影眸最终能成为一支真正理解三维世界、并且能够持续定义前沿问题的 Research Lab。」Joel Wang 表示。
从 SIGGRAPH 到 RSS,从图形学到机器人学,一个判断正变得愈发清晰:影眸正在从一家 3D 生成模型公司,成长为一个覆盖 3D 表示、生成、理解、场景构建与智能体控制的研究团队,这些工作共同指向未来三维物理世界的建模、理解与交互。
当具身智能的叙事焦点集中于本体与大模型时,不容忽视的是,具身智能能否真正走进充满干扰、摩擦与误差的现实世界。而在具身智能走向现实世界的关键一步上,像影眸这样连接生成、仿真与现实世界的 3D 智能基础设施,将是不可或缺的。
你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:影眸科技获具身顶会RSS最佳论文提名 实现139.6倍加速与100%安全约束要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
相关热点近期科技圈动态频频,几个关键趋势值得关注:继百度、谷歌之后,微软也开始动真格,计划为其搜索引擎Bing带来一次“智能升级”——引入AI摘要功能。简单来说,就是让搜索结果不再只是抛出一堆链接供用户自行翻找,而是直接呈现一个“精编版”的答案。 目前这项名为“Bing生成搜索”的功能仍处于预览阶段。它将A
在得克萨斯州奥斯汀的一处秘密芯片实验室里,亚马逊正悄然测试一款全新的服务器设计方案,该方案集成了他们自主研发的AI芯片。其核心目标非常明确:与英伟达展开正面竞争,抢占市场份额。这一消息由AWS旗下安纳普尔纳实验室的工程总监拉米·辛诺在实验室参观期间对外披露。 辛诺指出,亚马逊之所以大力投入自研芯片,
生活场景大考:最强模型仅三成成功率,VitaBench首次揭示智能体真实能力边界 今天,美团LongCat团队正式发布了一项重磅成果——VitaBench(Versatile Interactive Tasks Benchmark)。这个名称听起来学术味十足,但它的目标非常直接:将大模型智能体从
机器视觉在工业领域的应用已极为广泛,几乎渗透到日常生产制造的每一个环节。从制造业中对子组件进行最终检验,到检测零件是否存在制造缺陷,都能看到其身影。在自动化领域,机器视觉更是充当着机器人“眼睛”的角色,引导它们完成精密操作。此外,验证数据矩阵码、检查食品包装、读取条形码等任务,也离不开这项技术。简而
- 日榜
- 周榜
- 月榜
热点快看
