从MoSA到FG-CLIP2 360上半年六篇顶会论文拼出精准可控AI路线
360人工智能研究院2026年上半年6篇顶会论文聚焦多模态理解与生成,旨在实现AI精准可控。MoSA利用无标注视频运动信息学习物体概念,FG-CLIP2和AML增强细粒度图文对齐与目标定位,RevealLayer实现图层分解,RefTON和NAMI提升虚拟试衣与生成效率。
2026年上半年,360人工智能研究院共有6篇论文被ICLR、CVPR、ICML和ECCV录用,研究方向涵盖多模态理解与多模态生成两大主线。若仅看单篇论文标题,这些成果分别聚焦于图文检索、指代分割、无监督视觉学习、图层分解、虚拟试衣和生成加速——但整体审视,技术目标高度一致:并非让AI显得更聪明,而是让AI在真实场景中“看得更准、改得更准、出得更准”。
最新入选ECCV 2026的MoSA,在海外AI技术社区引发了广泛讨论,它也是理解这一研究路线的一个绝佳切入点。

一、MoSA:AI能否通过观察运动学会“什么是物体”
这一赛道的代表性模型是Meta的SAM,它证明了通用图像分割模型的能力。用户只需提供一个点或一个框,模型就能分割出图像中的目标对象。但问题在于,SAM的训练依赖大规模人工分割标注——相比普通分类标签,分割标注需要沿物体边缘逐像素勾勒,遇到遮挡、细小结构和复杂背景时,数据成本会进一步飙升。
MoSA提出了一个更根本的问题:AI能否不依赖人工逐个标注,而是像人类一样,通过观察视频中的运动,自主学习“什么是物体”?
MoSA的全称是Motion-Grounded Segment Anything,核心思路是利用无标注视频中的运动信息构建监督信号,再将这种运动监督转化为可迁移到静态图像的物体概念。

论文将整个过程分为三个阶段。第一阶段是生成运动伪标签:从视频中提取双向光流,通过刚性物体分割和运动前景分割两个模块,分别捕捉独立运动部件和完整动态主体,再对候选Mask进行质量筛选与去重。第二阶段是学习物体性:训练感知分组模型,通过对比学习让同一物体内部的图像区域在特征空间中更接近,不同物体区域彼此分离——这样,模型逐渐从“哪些区域一起运动”抽象出“哪些区域属于同一个物体”。第三阶段再将这种物体先验迁移到高分辨率、可提示的图像分割模型中。
研究团队从约1万小时视频中生成了约2100万个高质量运动伪标签,视频覆盖人类活动、动物行为和道路驾驶等多种场景。在COCO、LVIS、ADE20K等7个数据集上的零样本评测中,MoSA明显优于已有无监督分割方法,并在不使用人工分割标注训练的条件下,取得了接近监督式SAM的表现。
这项工作的价值,并非宣称MoSA要取代SAM,而是验证了另一条可行的路线:大规模无标注视频中的运动信息,可以成为训练视觉基础模型的一种可扩展监督来源。

二、六篇论文,共同指向“让AI精准可控”
MoSA并非一项孤立的研究。从360人工智能研究院2026年上半年的论文布局来看,6篇顶会论文可以被归纳为“看得准、改得准、出得准”三个层次。
“看得准”对应多模态理解,包括FG-CLIP 2、AML和MoSA。FG-CLIP 2解决图像与文本之间的细粒度对齐问题;AML解决自然语言描述与具体视觉区域之间的精确定位;MoSA则进一步探索模型如何从无标注视频中自主学习物体概念。这条路线从图文细节匹配,逐步延伸到目标定位和开放世界物体认知。
“改得准”对应RevealLayer。它关注的不是再生成一张完整图片,而是把图像中的具体对象拆分为可独立编辑的RGBA图层,并恢复对象背后的背景内容,使AI生成图能够继续进入设计和内容生产流程。
“出得准”对应RefTON和NAMI。RefTON解决虚拟试衣中的服装细节、材质和多条件控制问题;NAMI则关注高质量图像生成的推理效率,在现有资料中披露了64%的推理加速。
这6篇论文任务不同,但解决的是同一个问题:AI如何减少“大概正确”,增加可定位、可控制、可落地的确定性。

三、看得准:从图文细节到精确视觉定位
FG-CLIP 2关注的是细粒度图文对齐。传统CLIP类模型擅长判断一张图片与一句话在整体语义上是否相关,但面对颜色、数量、位置、属性和对象关系这些细节时,往往还不够精确。举个例子,“一辆汽车停在路边”和“一辆黄色汽车停在瀑布旁”都包含汽车,但在真实检索中,颜色、环境和位置关系可能才是用户真正需要的条件。

从360 AI Research平台展示的方法来看,FG-CLIP 2采用两阶段训练:第一阶段通过全局对比学习建立图像与长短文本之间的基础对齐;第二阶段进一步加入区域级描述、难负样本和细粒度学习,使模型能够捕捉局部区域与文本细节之间的关系。

FG-CLIP 2还增加了中文数据、动态分辨率机制和新的损失设计,支持长文本检索、短文本检索、文搜图、图搜文、文搜文和图搜图等多种能力。它解决的不是“能否搜到相关图片”,而是“能否按用户描述的细节,找到真正匹配的内容”。
AML则进一步把图文对齐推进到了像素级目标定位。它的正式任务是指代表达图像分割——输入一张图像和一句自然语言描述,模型需要从多个相似对象中找到唯一目标,并输出其像素级Mask。AML的核心思想很直接:不是所有图像区域都值得参与训练。

论文首先通过PatchMax Matching Evaluation计算视觉Patch与文本Token之间的相似度,再利用Alignment-Aware Filtering Mask过滤低对齐区域,使模型集中学习更可靠的视觉—语言关系。AML采用两次前向传播:第一次生成相似度图和过滤Mask,第二次使用过滤后的图像训练模型。推理阶段则不需要这套过滤过程,因此不会增加额外推理结构和开销。
在RefCOCO、RefCOCO+和RefCOCOg的8个数据划分上,AMLRIS取得了新的最佳结果;在遮挡、低光、雾化和颜色扰动等条件下,也表现出更好的鲁棒性。虽然这篇论文并不是专门针对GUI Agent设计的,但它强化的能力与Agent视觉Grounding高度相关——用户对Agent说“点击右侧蓝色按钮”时,模型不仅要理解语言,还要在复杂界面中找到唯一目标。一旦定位错误,后续操作就可能全部出错。
因此,FG-CLIP 2、AML和MoSA形成了一条很清晰的能力递进:FG-CLIP 2看懂图文细节,AML找准语言所指目标,MoSA进一步学习物体概念本身。
四、改得准、出得准:从图层分解到高保真虚拟试衣
生成式AI可以快速生成一张完整图片,但在真实设计工作流中,一张扁平图像往往还不够。用户可能需要单独移动人物、替换商品、修改背景,或者删除某个对象后恢复被遮挡区域。传统生成模型输出的通常只是RGB图像,主体、背景和不同对象已经混合在一起,难以继续精细编辑。
RevealLayer解决的正是这个问题。

用户通过Bounding Box指定目标对象后,系统可以把对象提取为独立RGBA图层。RGBA相比RGB多了Alpha透明通道,结果不是普通矩形裁剪,而是可以继续移动、组合和编辑的透明对象层。同时,模型还会恢复目标对象背后的背景内容。这意味着RevealLayer同时完成了三件事:目标对象分离、透明边界估计、被遮挡背景恢复。
它与传统语义分割或普通抠图的区别在于,最终输出的是可继续编辑的数字资产,而不仅仅是一张Mask。RevealLayer目前已经上线360 AI Research平台,用户可以直接上传图片并体验图层拆分能力。

RefTON则把“可控生成”放进了虚拟试衣场景。虚拟试衣并不只是把一件衣服覆盖到人物身上,模型还要保持人物身份、姿态、身体比例和背景,同时还原服装的版型、纹理、Logo、透明度、蕾丝和镂空结构。传统方法通常依赖人体解析、姿态估计、服装Mask和Warp Mask等多个外部模块,RefTON尝试简化这一过程,并引入了一个很符合真实购物习惯的输入:模特上身参考图。

平铺服装图往往难以完整表现服装的透明度、材质和穿着效果,而模特上身图可以提供更直观的视觉参考。论文中的案例显示,加入参考图后,模型对透明材质和蕾丝领口等细节的还原更加准确。RefTON采用两阶段训练:第一阶段使用带Mask和姿态等条件的试衣模型生成训练数据;第二阶段训练Person-to-Person模型,使模型可以直接使用人物图、服装图和可选参考图完成虚拟试衣。论文还通过随机输入Mask版本或完整人物图,使同一个模型兼容有Mask和无Mask两种使用方式,并对Flux-Kontext的多条件位置编码进行了适配。

RevealLayer和RefTON分别代表了两种可控能力:RevealLayer让生成后的对象可以被精确拆分和编辑;RefTON让生成过程受到人物、服装和参考图的共同约束。NAMI则补上效率这一环——现有资料显示,NAMI面向高质量图像生成效率,实现了64%的推理加速。由于当前没有更完整的论文材料,这里不进一步展开其架构细节。三项工作可以概括为:RevealLayer解决怎么精确编辑,RefTON解决怎么按条件生成,NAMI解决怎么更高效地出图。
五、从顶会论文到产品,安全公司更关心AI是否可靠
论文指标能够证明模型能力,但对开发者和产业用户来说,更重要的问题是:这些能力能不能进入真实产品?而安全行业长期面对复杂环境,对精准判断和可靠结果有天然需求。“差不多对”在这里行不通,所以360具备探索AI精准可控的天然能力。
从现有平台看,FG-CLIP 2和RevealLayer已经完成了产品化。FG-CLIP 2被封装为图文跨模态检索能力,支持不同形式的图文检索与向量化接口;RevealLayer则提供网页交互体验,用户可以上传图片、指定目标对象并查看图层分解结果。这说明360人工智能研究院的部分研究,已经形成了“研究问题—模型能力—平台服务—业务场景”的闭环。
从FG-CLIP 2的细粒度图文对齐,到AML的目标定位,再到MoSA的自主物体学习;从RevealLayer的图层分解,到RefTON的参考图约束生成,再到NAMI的效率优化——360人工智能研究院2026年上半年的6篇顶会论文,其实在回答同一个问题:当AI真正进入Agent和产业工作流,如何减少“大概如此”,增加可定位、可约束、可复用的确定性。
MoSA是最新的一个切口。更值得关注的,是它背后逐渐清晰的一条研究路线:让AI看得更细、找得更准、改得更稳,并最终进入真实产品。

游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
CAD零基础入门教程:坐标输入、图层管理与基础绘图命令
本文面向CAD零基础学习者,系统讲解坐标输入、图层管理与基础绘图命令的核心用法。通过分步实操与常见问题排查,帮助新手建立精确绘图习惯,掌握规范出图的基础能力。
CAD从入门到项目交付:绘图、标注、图块与实战工作流
掌握CAD的核心在于建立“画得准、标得清、复用快、交付稳”的工作流。本文提供从环境设置、高频命令组合、标注规范、图块标准化到项目分阶段交付的完整路径,帮助初学者避免常见返工陷阱,独立完成可检查、可复用、可打印的工程图纸。
Claude Code 登录指南:个人、Teams 与企业账号区分与授权步骤
本文详细解析 Claude Code 登录前的账号类型区分方法,涵盖个人订阅、Teams 席位与企业 Enterprise 席位的授权路径差异。提供终端登录命令、环境变量排查及常见异常处理步骤,帮助用户快速完成正确授权并避免登录路径混淆。
Claude Code 文件修改前的权限模式配置与命令审批指南
本文详细介绍Claude Code在修改文件前的权限模式配置方法,包括defaultMode可选值、permissions allow与deny规则设置、多层级配置文件管理以及 status验证技巧,帮助开发者安全高效地使用AI编程助手。
Claude Code接入VS Code后先测扩展和终端命令
在VS Code中接入Claude Code后,建议优先验证扩展面板与集成终端两条入口。本文提供标准检查顺序、关键命令与常见故障排查路径,帮助你快速确认环境就绪,避免后续开发受阻。
- 热门数据榜
1
2
3
4
5
6
7
8
9
10
相关攻略
2026-09-01 16:53
2026-09-01 16:52
2026-09-01 14:27
2026-09-01 14:12
2026-09-01 14:10
2026-09-01 14:07
2026-09-01 13:55
2026-09-01 13:47
热门教程
- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程

