当前位置: 首页
AI教程
扩散模型自引导新范式SSG:直接交换Token提升生成能力

扩散模型自引导新范式SSG:直接交换Token提升生成能力

时间:2026-08-15
转载

本文入选 CVPR 2026 OralCVPR(IEEE Conference on Computer Vision and Pattern Recognition)是 IEEE 旗下最具影响力的国际计算机视觉与模式识别会议之一,长期聚焦计算机视觉、图像生成与模式识别等核心研究方向。就 CVPR 2

本文入选 CVPR 2026 Oral

CVPR(IEEE Conference on Computer Vision and Pattern Recognition)是 IEEE 旗下最具影响力的国际计算机视觉与模式识别会议之一,长期聚焦计算机视觉、图像生成与模式识别等核心研究方向。就 CVPR 2026 而言,投稿量约为160920篇,接收率约为25.42%。

论文主页:Guiding a Diffusion Model by Swapping Its Tokens

扩散模型这次又有了新的优化思路。

一直以来,提升扩散模型生成质量的重要手段之一,就是在推理阶段加入引导(guidance)。但这类方法的短板也很突出:要么依赖文本条件(如 CFG),这通常需要专门的训练策略,而且没有文本条件时就无法使用;要么依靠显式加噪来干预模型推理,但整体提升往往有限。

现在,一种全新的方法出现了:

不依赖文本条件,不注入额外噪声,也不修改模型结构,只是在模型内部交换 token。

来自上海交大和 vivo 的研究者提出了一种非常简洁但效果显著的方法——自交换引导(Self-Swap Guidance, SSG)。该成果已被 CVPR 2026 国际会议接收为 Oral。

一句话概括:

通过在空间维度和通道维度交换 token 特征,先人为构造一条“变差”的预测路径,再利用这条退化路径反过来指导原始生成过程。

思路听起来直接,但实验效果非常出色。

一、现有方法有什么问题?

当前主流的引导方法是 CFG(Classifier-Free Guidance)。简单来说,它通过“有条件输出”和“无条件输出”之间的差值,得到一个从“语义匹配较弱”到“语义匹配更强”的方向,再沿着这个方向修正模型预测,从而让最终生成结果更符合文本语义。

但它存在几个明显局限:

  • 必须依赖文本(prompt)的存在,没有文本就无法进行引导
  • 需要专门的训练过程,例如随机丢弃文本条件输入
  • 在高 Guidance Scale 下容易出现过饱和、细节损坏、多样性下降等问题

近来也有研究尝试“无条件引导”(condition-free guidance),即不依赖文本也能提升扩散模型生成质量,例如:

  • SAG(向输入添加噪声)
  • PAG/SEG(向 attention 施加噪声扰动)
  • TSG(向 timestep 向量添加噪声)

但这些方法普遍面临同一个问题:扰动的控制粒度较粗——要么强度不够,几乎起不到有效引导作用;要么扰动过强,直接破坏图像质量。结果就是,小扰动提升有限,大扰动则容易让生成图像失真严重。

图1 现有的无条件引导方法在低引导系数下生成质量欠佳,在高引导系数下出现图像失真、过饱和、高噪声等现象。相比之下,自交换引导(SSG)的生成质量对引导系数更加鲁棒稳定

二、SSG 的核心想法:不加噪声,只做“结构性”扰动

SSG 的核心思想非常直观:与其对特征加噪,不如直接对部分特征进行“结构性重排”。具体来说,它会对模型内部的 token 特征在两个维度上执行随机交换:空间维度自交换(spatial self-swap)和通道维度自交换(channel self-swap)。

在实践中,研究者发现,只要随机选择部分 token 或 channel 对进行交换,就能产生比较明显的引导效果;而如果进一步选择“两两最不相似”的 token 或 channel 对进行交换,引导效果会更强,生成图像质量也更好。原因在于,这种方式能够在局部特征层面形成更充分的破坏,而不必依赖全局加噪。

具体实现上,方法采用两个前向推理分支。其中一个分支完全不做改动,直接让预训练模型输出原始噪声预测(ϵori)。另一个分支则会在模型特定层加入自交换扰动:先在空间维度交换若干最不相似的 token,再在通道维度交换若干最不相似的通道,最终得到扰动后的噪声预测(ϵpert)。

在推理的每一个时间步中,使用这两个分支的噪声预测做差,并据此对原始噪声预测进行修正,修正强度由引导系数 omega 控制。这个引导过程与 CFG 的形式非常相似:

这种引导会在每个时间步重复执行,直到所有扩散推理步骤结束,最终得到经过引导后质量更高的生成样本,整体方法就是如此简洁。

三、实验结果

研究者在无条件生成和有条件文本生图两种设置下,基于 COCO2014、COCO2017、ImageNet 等多个真实图像数据集验证了 SSG 的效果。实验结果表明,SSG 在多个评测指标上均优于现有的 SAG、SEG、PAG 等无条件引导方法。

表1 SD1.5模型无文本条件生图在ImageNet上的定量实验结果

表2 SDXL模型有文本条件生图在COCO 2017上的定量实验结果

从具体评估体系来看,定量指标涵盖了 FID(分布差异)、CLIP Score(文本一致性)、Inception Score(图像质量与多样性),以及 AES、PickScore、ImageReward 等主观视觉相关指标。对于无条件生成场景,研究者还进一步引入 Precision 和 Recall,用于更全面地衡量生成质量与多样性。在这一系列严格指标下,SSG 都展现出了很强的综合竞争力。

图2 SDXL模型的定性实验结果

从实际生成效果对比可以看出,SSG 能够更加稳定地生成高质量、更加自然的图像;而在有文本条件的生成任务中,它与文本描述之间的一致性也更好。

表3 Token交换策略的消融实验。随机交换的性能已经超过多个现有方法,而“最不相似”交换策略可以获得更优的生成质量。

研究者还系统比较了不同的 token 交换策略。结果显示,即便只是随机交换,也已经能够获得相当不错的引导效果,甚至优于多种已有方法;而交换最不相似的 token 特征,则在人类偏好评分等指标上表现更优,整体实现了更好的性能权衡。

表4 空间与通道交换策略的消融实验。通道交换效果整体优于空间交换,二者结合使用可以实现图像质量和美学感知分数的最佳权衡。

图3 通过可视化可以发现空间交换与通道交换的引导模式差异明显

通过对空间交换与通道交换的消融实验可以验证,这两种机制都能够有效引导扩散模型生成。其中,通道交换的整体效果优于空间交换,而二者结合使用时则能获得更好的综合表现。因此可以认为,这两类交换在一定程度上具有互补性;对应的可视化结果也进一步说明,它们的引导模式存在明显差异。

四、一些其他探讨

SSG 与同期工作 TPG 都在特征的空间维度上引入了扰动设计——SSG 选择部分 token 进行空间位置交换,而 TPG 则直接对所有 token 进行随机重排列。从指标表现来看,SSG 的“最不相似 token 交换”方案略优于 TPG 的 token 随机重排,但其计算开销也相对更高。与此同时,SSG 首次揭示了特征通道维度扰动对于扩散模型引导的显著价值,并进一步发现,通道维度扰动的引导效果明显优于空间维度。这一发现也为后续设计更高效的扩散模型引导机制提供了新的方向。

至于这项研究的局限性,首先在于目前仍缺少系统性的理论支撑;其次,该方法的性能对扰动添加的具体层位置较为敏感。这些问题也是扩散模型引导方向中较为常见的挑战。因此,如何从理论层面解释其有效性,并进一步设计更鲁棒的扰动机制,仍然是值得深入研究的重要课题。

另外,在模型内部多个层分别计算 token 相似度,会带来一定的额外计算开销。因此,如何进一步优化 SSG 的计算效率,也将是一个具有实际应用价值的后续研究方向。

游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

同类文章
更多
CAD零基础入门教程:坐标输入、图层管理与基础绘图命令

CAD零基础入门教程:坐标输入、图层管理与基础绘图命令

本文面向CAD零基础学习者,系统讲解坐标输入、图层管理与基础绘图命令的核心用法。通过分步实操与常见问题排查,帮助新手建立精确绘图习惯,掌握规范出图的基础能力。

时间:2026-09-01 16:53
CAD从入门到项目交付:绘图、标注、图块与实战工作流

CAD从入门到项目交付:绘图、标注、图块与实战工作流

掌握CAD的核心在于建立“画得准、标得清、复用快、交付稳”的工作流。本文提供从环境设置、高频命令组合、标注规范、图块标准化到项目分阶段交付的完整路径,帮助初学者避免常见返工陷阱,独立完成可检查、可复用、可打印的工程图纸。

时间:2026-09-01 16:52
Claude Code 登录指南:个人、Teams 与企业账号区分与授权步骤

Claude Code 登录指南:个人、Teams 与企业账号区分与授权步骤

本文详细解析 Claude Code 登录前的账号类型区分方法,涵盖个人订阅、Teams 席位与企业 Enterprise 席位的授权路径差异。提供终端登录命令、环境变量排查及常见异常处理步骤,帮助用户快速完成正确授权并避免登录路径混淆。

时间:2026-09-01 14:27
Claude Code 文件修改前的权限模式配置与命令审批指南

Claude Code 文件修改前的权限模式配置与命令审批指南

本文详细介绍Claude Code在修改文件前的权限模式配置方法,包括defaultMode可选值、permissions allow与deny规则设置、多层级配置文件管理以及 status验证技巧,帮助开发者安全高效地使用AI编程助手。

时间:2026-09-01 14:12
Claude Code接入VS Code后先测扩展和终端命令

Claude Code接入VS Code后先测扩展和终端命令

在VS Code中接入Claude Code后,建议优先验证扩展面板与集成终端两条入口。本文提供标准检查顺序、关键命令与常见故障排查路径,帮助你快速确认环境就绪,避免后续开发受阻。

时间:2026-09-01 14:10
热门专题
更多
刀塔传奇破解版无限钻石下载大全 刀塔传奇破解版无限钻石下载大全
洛克王国正式正版手游下载安装大全 洛克王国正式正版手游下载安装大全
思美人手游下载专区 思美人手游下载专区
好玩的阿拉德之怒游戏下载合集 好玩的阿拉德之怒游戏下载合集
不思议迷宫手游下载合集 不思议迷宫手游下载合集
百宝袋汉化组游戏最新合集 百宝袋汉化组游戏最新合集
jsk游戏合集30款游戏大全 jsk游戏合集30款游戏大全
宾果消消消原版下载大全 宾果消消消原版下载大全