当前位置: 首页
科技数码
韩国CLO公司研发出衣物薄层结构3D生成技术

韩国CLO公司研发出衣物薄层结构3D生成技术

时间:2026-07-31
转载

韩国CLOVirtualFashion公司提出可微分几何图像(DiffGI)方法,以截断有符号距离函数替代传统二元判定,结合可微分马奇方块算法,实现薄壳结构3D服装的高精度重建与生成,大幅降低计算量,在边界精确度和形状保真度上优于现有方法。

这项由韩国CLO Virtual Fashion公司研发团队完成的研究,以arXiv预印本形式发布于2026年7月15日,编号为arXiv:2607.13365。如果您希望深入了解技术细节,可通过该编号在arXiv平台查询完整论文。

现实中的一道难题

您是否曾疑惑:为什么网购的服装,试穿时总与商品图存在明显差异?部分原因在于,数字世界中真实还原一件衣物的立体形态,远比想象中复杂。

当前的3D建模技术,类似于用大量积木堆砌出一件衣服的轮廓——但布料本身是极薄的层状结构,而积木天然具有体积。用方块去模拟一张纸,结果要么使布料显得厚重笨拙,要么边缘出现明显锯齿,完全失去轻薄飘逸的质感。主流3D生成技术始终难以绕开这个根本矛盾:它们擅长生成“封闭的、有厚度的”物体,例如苹果、汽车,但面对衬衫衣领、裙摆荷叶边、夹克拉链这类薄而开放的边缘结构,便显得力不从心。

CLO Virtual Fashion的研究团队对这一难题进行了彻底革新,提出了一套名为“可微分几何图像”(DiffGI,Differentiable Geometry Image)的方法,专门为薄壳结构量身定制,使计算机首次能以接近人类裁缝理解布料的方式,生成并还原3D服装。

一、为什么现有技术面对衣服总是“碰壁”

回到积木的比喻。主流3D生成技术的核心思路,是将整个三维空间划分为无数个小格子,如同一个立体棋盘,然后判断每个格子内是否存在物体。这种方法对苹果、椅子、雕塑这类“实心”物体效果良好,因为物体本身具有体积,能够填充格子。

但衬衫并非苹果。衬衫是一张弯曲的、开放边界的薄面,厚度趋近于零。当用“立体棋盘”描述衬衫时,相当于用方格纸裁剪圆形——边缘永远呈现锯齿状,而非光滑曲线。分辨率越低,锯齿越明显。许多技术不得不将分辨率提至极高,例如GIMDiffusion方法需使用768×768的网格才能勉强压制锯齿,但计算量也随之骤增。

更根本的问题在于,这些技术的“边界判断”采用一刀切方式:一个格子要么是“有”,要么是“没有”,没有中间状态。这好比用黑白两色的马赛克拼一幅画,只有纯黑与纯白,却要表现灰色渐变的头发——无论怎样努力,结果都粗糙不堪。当系统需要将高分辨率的“黑白图”压缩为小图以加速训练时,灰色边界信息便彻底丢失。

还有一个更隐蔽的问题:即便技术能生成粗糙的3D形状,最终从数字信号“翻译”成真正的3D网格模型这一步,也是硬切且不可逆的,如同将手绘稿扫描进电脑后,电脑无法再修改铅笔线条。这导致整个学习过程“断链”——AI在学习时,无法根据3D结果的好坏反向调整自身判断。

二、新思路:用“距离感”代替“有或没有”

DiffGI的核心突破,是将边界描述方式从“是/否”替换为“距离”。

具体而言,研究团队不再用0或1的黑白格子标记衣服轮廓,而是为每个格子赋予一个数字,代表“距离最近轮廓线有多远”。在衣服内部,该数字为正,表示距离边界的像素数量;在衣服外部,数字为负;恰好在边界上,数字为0。这种表示方法在学术上称为“截断有符号距离函数”(TSDF,Truncated Signed Distance Function),但理解它的关键在于:连续的数字比硬切的黑白格子,能保留更多信息。

可以这样理解:用黑白格子描述边界,如同告诉你“这里有一扇门”,你只知道门的大致位置;用距离数字描述边界,则如同告诉你“门框左侧距离你3厘米”,精度达到厘米级甚至毫米级。

这种精度提升有多显著?研究团队做了对比实验:在不压缩的情况下,当分辨率低至64×64时,TSDF方式的重建误差(用豪斯多夫距离衡量)明显低于黑白格子方式;在128×128时,差距依然显著。只有当分辨率提高到256×256以上,两种方式才逐渐趋近。换言之,用距离数字描述边界,能以更低分辨率实现更高重建质量——这直接意味着更少的计算量和更快的速度。

对于服装这类边界复杂的物体,TSDF的优势更为突出。衣服拥有密集的褶皱、弯曲的下摆、不规则的开口,这些区域边界极度密集。黑白格子遇到复杂边界会产生大量锯齿;而距离数字在相邻格子之间平滑过渡,天然适合描述这种弯曲绵延的轮廓。

三、让3D重建也能“学习”:可微分的马奇方块算法

解决了“如何描述形状”的问题后,DiffGI面临的下一个挑战是:如何让AI从描述中搭建出真正的3D网格,同时使搭建过程能够被“指导”和“纠错”?

传统方法——无论是从3D格子中提取面片的Marching Cubes,还是类似的2D版本——都采用“查表”方式工作。给定几个格子的值,查一张预设规则表,决定在哪里放置一条线或一个面。这种查表操作本质上是跳跃式、不连续的,如同走楼梯而非走坡道:你无法在楼梯上找到“半步”,自然也无法将“楼梯走得好坏”的评价反馈回去,告诉腿该如何迈步。

DiffGI引入了“可微分马奇方块”(DMS,Differentiable Marching Squares)算法,将这一过程改为“坡道”。

具体原理如下:当两个相邻格子中,一个距离值为正,另一个为负,说明边界位于两者之间。边界精确位置可通过两个格子的数值按比例插值计算。例如,左边格子距离为+3,右边为-1,则边界位于距左边格子75%、距右边格子25%的位置。这是一个连续、平滑的数学运算,没有任何跳跃,如同走坡道。

为防止两个格子数值非常接近时(分母趋近于零)计算出现不稳定,研究团队加入了一个极小的稳定常数(约百万分之一)来保护计算精度,同时确保该常数不影响反向传播时的梯度流动。

有了这个连续坡道,AI在训练时便可实现:先从2D距离图生成3D网格,然后将该3D网格的质量(如表面法线是否准确、形状是否忠实)换算为“评分”,再通过数学链条一路追溯回去,告诉2D图上每个数字该往哪个方向调整。这如同一位厨师不仅能品尝菜肴是否美味,还能精确知道少了多少盐、火候差了几分钟,从而不断改进。

研究团队还考虑了一个特殊情况:在马奇方块算法的16种拓扑形态中,有两种(对角格子的值一正一负的情形)在数学上存在歧义——两种连线方式都说得通。团队统一规定将这两块视为互不相连的独立区域处理,虽然选择本身固定,但选择后边界顶点的坐标依然是连续计算的,因此梯度仍能正常流动。

从计算效率来看,该方法工作在2D网格上,计算量随格子数量的平方增长;而传统3D体积方法计算量随立方增长。在相同精度要求下,DMS比DMTet等3D方法快得多,内存占用也显著更少。

四、把复杂3D服装压缩进一张名片大小的“密码”

有了连续距离图和可微分重建算法,研究团队开始搭建整个生成系统的核心——DiffGI-VAE。

VAE(变分自编码器)是一种特殊神经网络,可将复杂信息压缩成一段简短的“密码”,也能从密码重新展开还原信息。这个思路类似于将一部长篇小说压缩成几百字的内容简介,再从简介反推故事细节——当然,这种还原不可能完美,但如果“密码”设计得足够巧妙,关键信息能够保留下来。

DiffGI的输入是一个256×256×4的图像张量(三个通道存储3D坐标,一个通道存储距离值),目标是将其压缩为32×32×4的潜在表示——即将信息压缩到原来的八分之一分辨率。这是极为激进的压缩,相当于将一张高清照片缩成缩略图,然后要求从缩略图还原高清细节。

为了让这个高度压缩的“密码”仍保留3D形状的精华,研究团队设计了一个三管齐下的损失函数(可理解为“评分系统”)。第一管是位置图的像素级误差,确保每个像素的3D坐标大致正确;第二管是距离图的像素级误差,确保边界信息被正确还原;第三管是最关键也最具创新性的——“法线渲染损失”。

所谓法线,是3D表面上每个点“朝向哪里”的信息。如果把一件衬衫视为无数个微小平面的集合,每个小平面都有一个朝向,这就是法线。法线信息对视觉质量至关重要:同样形状的表面,法线正确则看起来光滑流畅,法线混乱则会出现奇怪噪点和折痕。

传统的像素级损失无法有效监督法线——即便每个像素的坐标都大致准确,相邻像素间的微小错位也可能导致局部法线严重扭曲,产生肉眼可见的噪点。法线渲染损失的做法是:将重建出的3D网格从四个固定角度渲染成法线图,再与真实网格的法线图比较差异,将差异换算为损失信号,通过可微分的马奇方块算法,一路追溯回去影响VAE的权重更新。这条路径的成立,完全依赖于DMS提供的连续可微分通道。

为加速训练,研究团队还采用了一个聪明的起跑策略:用已在海量自然图片上训练好的Stable Diffusion 1.5的VAE权重来初始化,同时将第一层卷积的通道数扩展以适应4通道输入,新增的权重用零初始化以防止已有知识被破坏。消融实验证明,该预训练初始化仅加速了收敛过程,最终重建质量与从头训练几乎没有区别——说明DiffGI的性能提升真正来自于表示方法和训练目标的设计,而非借力预训练。

五、在“密码空间”里学会创造新服装

有了将3D服装压缩成32×32×4密码的能力,研究团队的下一步是训练一个能在此密码空间中“创作”的生成模型——即从无到有,或根据一张图片、一个草图,生成全新的3D服装。

这类生成模型的主流架构之一称为扩散模型(Diffusion Model):它先向真实数据中逐步添加噪声,将“真实”变为“随机乱码”,然后反向学习从“乱码”恢复“真实”的过程。训练完成后,便可以从纯随机乱码出发,逐步去噪,最终生成新的“真实”密码,再解码还原为3D网格。

研究团队没有使用常见的U-Net架构,而是选择了Diffusion Transformer(DiT)作为核心骨架。这一选择背后有充分理由:服装的UV图(将3D表面展开成2D平铺图)不像自然图片那样具有明显的局部空间规律——相距很远的两块布料在展开图上可能紧挨着,而在展开图上相邻的两块区域在3D空间可能完全不相干。Transformer架构能让所有位置两两之间互相“对话”,非常适合捕捉这种全局拓扑关系。此外,扩散模型采用了流匹配(Flow Matching)调度方案,该方案能用更少的去噪步骤生成高质量结果,进一步加快推理速度。

研究团队基于这套框架搭建了三种不同的生成模式,分别服务于不同使用场景。

第一种是“类别条件生成”,给AI一个类别标签(例如“椅子”或“台灯”),它就能生成对应的3D模型。该模式使用DiT-B/2(中等规模)架构,在ABO家具数据集上训练,涵盖椅子、台灯、沙发、桌子四类。

第二种是“图片条件生成”,给AI一张衣服的正面照片(渲染的法线图),它能推断出看不见的背面,生成完整的3D服装。该模式使用更大的DiT-L/2架构,并通过一种名为DINOv2-Large的视觉特征提取器将图片信息注入到生成过程中。令人惊喜的是,尽管训练时使用渲染法线图,在测试时用真实衣服照片也能工作,表现出一定的泛化能力。

第三种是“占位条件生成”,给AI一张2D的缝纫版型轮廓图(相当于裁缝的裁剪样板),AI就能生成穿着在身上的3D褶皱效果。由于版型本身已高度约束形状,研究团队换用了更轻量的UNet-Tiny架构,计算量大幅降低。更有趣的是,如果仅修改版型上的袖子部分,生成的3D模型也只有袖子部分发生变化,其余形态保持一致,实现了精准的局部编辑效果。

为解决UV展开图布局固定导致的位置偏差问题,研究团队还设计了一套数据增强方法:将同一个3D网格重新排列成不同的2D布局,这样一件衣服就能变成多种不同的训练样本。在ABO数据集3800个样本基础上,通过此方式扩充到50万个训练样本,足以支撑更大规模模型的稳定训练。

六、实验数据说明了什么

研究团队在两个数据集上进行了系统评估:ABO数据集包含约7900个商业3D家具扫描模型(椅子、台灯、沙发、桌子等),GarmageSet数据集包含约14801个物理仿真级别的3D服装模型(具有大量非流形特征)。此外还使用了约300张真实服装照片的WARDROBE数据集做零样本泛化测试,但该数据集不参与定量评测。

定量评测使用了多个指标。倒角距离(CD)衡量生成形状与真实形状之间的整体差距;法线一致性(NC)衡量表面朝向的准确程度;F1分数衡量形状的精确率和召回率;边界倒角距离(BCD)专门衡量开放边界的精确程度(这是衡量薄壳结构最直接的指标);豪斯多夫距离(HD)衡量最坏情况下的局部偏差。

在VAE重建质量方面,DiffGI与两个基线方法进行比较:Omages直接在64×64×4的几何图像上操作,不经过VAE压缩;GarmageNet使用逐面板的几何图像(因此无法应用于家具数据集)。结果显示,DiffGI用32×32×4的压缩密码,在家具和服装两个数据集上的倒角距离和地球移动距离(EMD)等指标均优于Omages直接操作64×64×4不压缩的版本。换句话说,DiffGI将信息压缩得更小,表现却更好。唯一的例外是在ABO家具数据集上的法线一致性,DiffGI的NC略低于Omages,研究团队认为这是因为家具形状多为平面,Omages不压缩直接保留了更多法线细节;而在服装这类复杂曲面上,DiffGI的NC反而更高。

消融实验(逐步关闭各个设计组件,观察性能变化)清晰地展示了每个设计决策的贡献。单纯将占位图换成TSDF,不加法线损失,倒角距离就从1.503×10⁻²降至0.595×10⁻²,降幅超过六成,这是表示方法本身带来的收益。在此基础上加入法线损失,倒角距离进一步降至0.461×10⁻²,法线一致性从0.921升至0.961。有一个有趣的细节:仅用占位图+法线损失组合,法线一致性能达到0.947,超过了TSDF无法线损失的0.921——这说明法线损失足够强力,能在一定程度上弥补占位图的边界模糊问题;但在倒角距离、地球移动距离等整体形状指标上,TSDF无法线损失仍然领先于占位图+法线损失,证明表示方法是更基础性的因素。

在3D生成任务上,与TRELLIS、TRELLIS.2等大型基础模型的对比显示,DiffGI在服装生成的精确度上更胜一筹——倒角距离1.35×10⁻²对比TRELLIS的3.44×10⁻²,F1分数0.48对比TRELLIS的0.28,边界倒角距离2.91×10⁻²远低于TRELLIS.2的12.44×10⁻²,同时顶点数量只有约2.3万,而TRELLIS有10.9万、TRELLIS.2有38万。当然,TRELLIS是通用大模型,DiffGI是专为服装优化的专项模型,两者的定位不同;研究团队也明确表示这个对比的目的是展示薄壳结构专用方案的优势,而非声称全面超越。TRELLIS在服装生成上产生的常见问题是“双层壁”——前后两层布料被当成了封闭物体,中间生成了不合理的厚度;这是所有假设封闭表面的方法的根本缺陷。

计算效率方面的对比相当惊人。TRELLIS推理一次需要约16.28GB显存、4.52秒;Omages需要52秒。DiffGI的图片条件生成版本在RTX A6000上只需3.22GB显存、0.80秒,在消费级的RTX 4070显卡(12GB)上需要1.21秒,甚至在苹果M4芯片的MacBook上纯CPU运行也只需8.52秒。这意味着DiffGI已经可以在没有专业显卡的普通笔记本上运行。

七、这套方法还不完美的地方

DiffGI的局限性主要体现在三个方面,研究团队在论文中坦诚地进行了说明。

第一,TSDF的线性插值在极度尖锐的棱角处会产生轻微的圆角效果。对于衣服来说这几乎不是问题,因为布料本来就是柔软的曲面;但如果用于还原机械零件那种硬朗的直角,就可能有些失真。

第二,当前框架只生成几何形状,不生成颜色纹理或材质属性。一件3D服装只有光秃秃的灰色网格,没有花纹、颜色或布料材质,在实际应用中还需要单独的纹理生成步骤。

第三,不同UV分片之间的边界缝合问题。DiffGI将一件衣服分成多个UV图块分别处理,每个图块之间独立重建,没有强制约束相邻图块在3D空间里的接缝要完美对齐。这种“缝合不齐”的问题不影响几何评测指标,但在进行物理仿真时(例如模拟衣服在风中飘动),接缝处的不连续会造成破绽。

针对这些问题,研究团队也提出了未来的改进方向:引入能保持尖锐边缘的等值面提取算法(如对偶轮廓化)来处理棱角问题;扩展潜在空间以同时生成高分辨率纹理和材质图;设计两阶段流程,先生成2D版型布局,再从版型重建3D形状,以支持更精细的服装设计控制。

说到底,DiffGI做的事情,是将一个长期困扰数字服装领域的根本性问题——“如何让AI真正理解薄薄一层布料”——换了一套思路来解决。不是靠堆砌更大的模型、更高的分辨率、更强的算力,而是从“表示方法”这个最基础的层面做出改变:用连续的距离数字代替非此即彼的格子标记,用可微分的坡道代替不可逆的阶梯跳跃,让整个从2D信息到3D形状的过程变成一个可以双向传导、可以学习优化的闭合回路。

这项改变的影响,对普通人来说可能是:你在网上看到的虚拟试衣、游戏里的服装系统、影视特效里的布料飘动,都有机会变得更真实、更细腻,而支撑这些效果的计算机,也许只需要一台普通的笔记本就够了。当然,从研究室里的技术突破到大规模商业落地,还有相当长的路要走,但这一步的方向是清晰的。有兴趣深入了解技术细节的读者,可以通过arXiv:2607.13365查阅完整论文。

Q&A

Q1:DiffGI和普通3D建模软件有什么区别?

A:普通3D建模软件需要人手工逐步雕刻形状;DiffGI是一套AI自动生成系统,输入一张照片或轮廓草图,几秒钟内就能自动生成完整的3D服装网格。最大的不同在于DiffGI专门为薄壳结构(比如衣服)设计,能生成开放边界、不封闭的薄面结构,而传统3D生成AI往往只会生成有厚度的“密封体”,把衣服做成两层厚壳。

Q2:TSDF(截断有符号距离函数)为什么比黑白占位图更好用于服装建模?

A:黑白占位图对每个格子只有“有”或“没有”两种状态,边界只能落在格子边上,分辨率不够高时边界就像锯齿;TSDF给每个格子存储一个到最近边界的距离数值,边界位置可以在两个格子之间的任意位置精确插值,不受格子分辨率限制。对于服装这类边界密集、弯曲复杂的对象,TSDF能在低得多的分辨率下达到同样或更好的精度,大幅减少计算量。

Q3:DiffGI生成的服装3D模型能直接用于物理仿真或游戏引擎吗?

A:目前有一定限制。DiffGI生成的是标准三角网格,且因为采用多图块UV展开,不同图块之间的边界接缝在3D空间里可能存在微小不连续,会影响物理仿真的准确性。此外当前版本不生成颜色纹理,只有几何形状。研究团队已将跨图块边界一致性约束和纹理生成列为后续工作方向。作为快速原型参考或静态渲染,当前版本已经足够实用。

游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

同类文章
更多
2026中国航空产业大会10月底南昌启幕:首次与航博会同期举办,聚焦低空经济新路径

2026中国航空产业大会10月底南昌启幕:首次与航博会同期举办,聚焦低空经济新路径

2026中国航空产业大会与南昌航空产业博览会将于10月31日至11月4日在南昌国际博览城首次同期举办。大会聚焦低空经济,设置主旨报告、行业专家报告及低空产业洽谈会等主题活动,旨在探讨航空产业新路径,推动低空物流、城市巡检等新业态集聚,打造中部领先、全国知名的航空产业交流高地。

时间:2026-08-31 11:17
联想来酷Air 16酷睿5 315版开售:国补后3739元,16英寸轻薄本选购指南

联想来酷Air 16酷睿5 315版开售:国补后3739元,16英寸轻薄本选购指南

联想来酷Air 16酷睿5 315版于8月27日正式开售,搭载6核处理器与12GB内存,配备16英寸16:10屏幕。叠加国家补贴后预估到手价仅3739 15元,主打长续航与静音办公。本文详细解析其硬件配置、接口布局及购买建议,助您快速决策。

时间:2026-08-28 14:44
牛来AirPods保护套海外走红:萌趣硅胶设计引发关注

牛来AirPods保护套海外走红:萌趣硅胶设计引发关注

一款名为“牛来”的AirPods硅胶保护套在日本市场引发关注,售价约1726日元。其独特的搞怪萌趣造型、兼容多代机型的硅胶材质以及专属挂饰设计,使其在社交平台上迅速走红,成为近期备受瞩目的国产原创数码周边产品。

时间:2026-08-28 14:44
行李箱选购全攻略:材质、轮子与尺寸避坑指南

行李箱选购全攻略:材质、轮子与尺寸避坑指南

选购行李箱时,材质、轮子和尺寸是核心决策点。PP材质抗冲击且轻便,适合频繁托运;万向轮决定推行顺滑度;尺寸需匹配航空限重。本文拆解关键参数,结合具体产品案例,助您选出耐用且实用的行李箱。

时间:2026-08-28 14:44
《湮灭之潮》成都试玩会:技嘉RTX 5080风魔显卡实测体验

《湮灭之潮》成都试玩会:技嘉RTX 5080风魔显卡实测体验

2026年8月《湮灭之潮》成都试玩会圆满举行,千名玩家现场体验西方奇幻大作。文章重点解析技嘉RTX 5080风魔显卡在虚幻5引擎下的表现,涵盖Blackwell架构、DLSS 4 5技术及16GB GDDR7显存对高画质流畅运行的支撑作用。

时间:2026-08-28 14:43
热门专题
更多
刀塔传奇破解版无限钻石下载大全 刀塔传奇破解版无限钻石下载大全
洛克王国正式正版手游下载安装大全 洛克王国正式正版手游下载安装大全
思美人手游下载专区 思美人手游下载专区
好玩的阿拉德之怒游戏下载合集 好玩的阿拉德之怒游戏下载合集
不思议迷宫手游下载合集 不思议迷宫手游下载合集
百宝袋汉化组游戏最新合集 百宝袋汉化组游戏最新合集
jsk游戏合集30款游戏大全 jsk游戏合集30款游戏大全
宾果消消消原版下载大全 宾果消消消原版下载大全