面包屑图标 当前位置: 首页
AI资讯
热点详情

清华人大联合开源框架实现AI视频世界模型高效可控

AI热点日报
AI热点日报时间:2026-06-03
热点解读

由清华大学、中国人民大学等联合提出的minWM开源框架,将AI视频模型改造为支持实时交互和相机控制的视频世界模型,实现首帧延迟降低超223倍,并发布完整训练与推理工具链。

先说几个核心判断。AI视频生成技术在近两年确实发展迅猛,画面质感日益惊艳,但若要真正实现实时互动、即时响应操作,目前绝大多数模型仍有明显差距。最近,一项由清华大学、中国人民大学、香港科技大学及德克萨斯大学奥斯汀分校联合完成的研究,恰好致力于补上这块短板。他们提出了一个名为minWM的开源框架,核心目标是将那些只会“闭门造车”的视频生成模型,改造为能够边生成边展示、并且能根据用户指令实时调整的“视频世界模型”。该论文的编号是arXiv:2605.30263v1,发布时间为2026年5月28日,生数科技(ShengShu)团队提供了重要的产业支持。想深入了解细节的朋友,直接去arXiv搜索该编号即可获取全文。

清华、人大联手打造:让AI视频世界模型跑得既快又听话,这个开源框架做到了

一、一个让AI“导演”能实时控制镜头的梦想

你大概有过这种体验:在游戏里拨动摇杆,镜头就跟着向左推移,虚拟世界随之流畅展开。这种沉浸感背后,其实是两件事在起作用——镜头听从你的操控,而且画面几乎不卡顿。现在,假如把场景换成一个由AI实时生成的视频,你就能理解minWM想解决的核心问题了。

过去几年,AI视频生成模型进步显著,能产出画质精美、时间连贯的片段。但这类模型有一个致命的“职业病”:它们就像一位只拍长片的导演,非要等整段视频完整生成完毕才给你看,无法边拍边播放,更别说根据你的实时指令调整镜头了。换句话说,它们非常擅长“创作”,但对于“互动”这件事确实不擅长。

那么,一个自然而然的问题就出现了:能不能把这些高质量的AI视频模型,改造成能实时交互、实时响应镜头控制的“视频世界模型”?minWM这个开源框架,正是为了回答这一问题而生。

二、从“画卷”到“实时直播”——改造一个AI导演有多难

要理解minWM的解决方案,得先弄清现有AI视频模型的工作方式,以及改造起来到底难在哪里。

目前主流的AI视频生成模型,在技术范畴内被称为“双向扩散模型”。用一个形象的比喻:这类模型就像一位脑中必须先勾勒全局才落笔的画家,在动笔之前,脑海里已经想好了整幅画的每个角落。正因为它能“前后参照”整段视频的所有帧,所以画质极高。但代价也很明确——你必须等它把整幅画都画完才能看到。在一台A800显卡上,生成一段视频的首帧延迟高达771秒,差不多13分钟。对于需要实时互动的场景来说,这个速度显然无法接受。

要实现实时互动,模型就必须转变为“自回归”的工作方式——好比说话一样,一帧接一帧地向前生成,生成完一帧立刻输出,不需要等整段视频完成。如此一来,用户就能边看边操控。但转变之路并不平坦。一旦模型失去了“前后参照整段视频”的能力,生成质量往往大幅下滑,还会遇到所谓的“暴露偏差”问题:模型在训练时看到的都是真实视频帧,但实际推理时却要依赖自己刚刚生成的帧作为输入,两者之间的差异会随着时间累积,导致视频越往后质量越差,甚至出现画面漂移。

不仅如此,哪怕模型已经改成了自回归方式,如果每生成一帧还需要做几十步的去噪运算,延迟依然让人抓狂。因此,还需要进一步给模型“提速”,让它只需极少步骤(比如4步)就能生成一帧,这个过程叫作“少步蒸馏”。

把所有这些挑战加在一起:你需要的数据得精准标注相机参数,你得对模型进行可控性微调,你得做自回归训练,你得做少步蒸馏,你还得优化推理效率。这一整条流水线,在此之前还没有一个统一、开源、可复现的框架能把这些环节串起来。而minWM,填补的恰恰是这个空白。

三、一条完整的“改造流水线”——minWM的工作原理

minWM的设计思路,可以类比为一家汽车改装厂的完整工序。原始的双向视频扩散模型就像一辆性能出色但只适合赛道的赛车,外观漂亮、马力强劲,但完全不适合日常道路上的实时驾驶互动。改装厂的任务,就是把它变成一辆既好看、又能实时响应方向盘操控、还能高速行驶的智能汽车。

整个改造流程分两大阶段。第一阶段是给模型装上“镜头控制系统”;第二阶段是把模型的工作方式从“慢速全局计算”改为“快速实时生成”。

第一阶段的核心:PRoPE(射影相对位置编码)

相机控制的本质,是告诉模型“摄影机在哪里、朝哪里看、镜头焦距是多少”,然后让模型据此生成符合该视角的画面。PRoPE的做法,是把每一帧的相机参数——包括内参矩阵(决定镜头焦距和畸变)和外参矩阵(决定相机的空间位置和朝向)——编码成一种特殊的数学变换矩阵,然后把这个矩阵注入到模型的自注意力机制中。自注意力机制可以理解为模型在处理视频帧时“思考各帧之间关系”的核心模块。通过这种注入方式,模型在“思考”任意两帧之间的关系时,会自动考虑到这两帧对应的相机视角差异,从而学会根据相机轨迹来生成视频。这套方案的优雅之处在于:它不需要改变模型原有的注意力结构,只是在计算注意力时引入了相机信息,因此保留了原始模型的全部生成能力。

第二阶段:三个关键步骤

研究团队把第二阶段称为“因果强制”或“因果强制++”(Causal Forcing++),整个流程由三个步骤串联而成。

第一步:自回归扩散训练。从上一阶段得到的具有相机控制能力的双向模型出发,通过一种叫“teacher forcing”的训练方式,把它改造成一个自回归扩散模型。具体操作是把干净的视频帧和加了噪声的视频帧拼接在一起,并在训练时使用因果注意力掩码——也就是说,让模型在生成第N帧时只能看到第N帧之前的内容,不能偷看未来的帧。经过这一步,模型就具备了自回归生成能力,能够一帧接一帧地向前生成视频。不过,此时每帧仍需多步去噪,速度还不够快,而且由于自回归的暴露偏差,生成质量也比不上双向模型。

第二步:初始化少步模型。这里有两种方案可选。方案一叫“因果ODE初始化”:让上一步训练好的自回归扩散模型,对大量视频帧生成完整的去噪轨迹(即PF-ODE轨迹),然后在这些轨迹数据上训练一个少步模型,使其能够从加噪的中间帧直接“跳跃”到干净帧,跳过大量中间去噪步骤。方案二叫“因果一致性蒸馏(Causal CD)”:既然方案一需要大量预先生成ODE数据,既耗时又占存储,那么因果强制++就提出了一个理论上等价的替代方案——直接通过一致性条件进行在线训练,无需离线生成ODE轨迹。具体来说,就是让当前模型的预测结果与经过一步ODE推进后再用EMA(指数移动平均)版本模型预测的结果保持一致,同时配合时间步相关的权重函数和距离度量来约束训练。两种方案的最终效果是等价的,但后者在工程上更高效。

第三步:非对称分布匹配蒸馏(Asymmetric DMD)。经过前两步,模型已经能够少步自回归生成,但由于整个蒸馏过程中的“老师”是质量有限的自回归模型,学生自然也继承了老师的局限性,生成质量距离原始双向模型仍有不小差距。这一步的作用,就是让少步自回归模型向原始高质量双向模型“对齐”。具体机制是:让少步学生模型自主展开生成一段完整视频,然后把生成的视频加入噪声,分别用一个冻结的双向模型(代表“真实数据分布的评分”)和一个在线更新的判别模型(代表“当前生成分布的评分”)来估算两个分布之间的差异,并以此梯度指导学生模型的参数更新。这个过程的本质,就像让学徒不断临摹大师的风格,而不是只靠中等老师的指导——最终学徒的作品质量会向大师靠拢。

值得一提的是,整个蒸馏流程对相机控制是完全透明的。无论是第一步的自回归训练,还是第二步的ODE数据生成或一致性蒸馏,抑或第三步的分布对齐,所有阶段都在带有相机条件的数据上进行,所有参与的模型都具备相机条件能力,这就确保了相机控制能力在整个蒸馏过程中得以保留,不会流失。

四、两个实例——把理论变成真实可用的模型

研究团队选择了两个代表性的开源视频基础模型作为改造对象:Wan2.1-T2V-1.3B(文本到视频,13亿参数)和HY1.5-TI2V-8B(文本加图像到视频,80亿参数)。选择这两个模型有其深意:前者采用交叉注意力机制来注入条件信息,后者采用MMDiT架构(一种将文本和图像特征在同一Transformer中联合处理的结构),两种架构恰好代表了当前主流视频扩散模型的两大设计路线,也足以证明minWM框架的架构通用性。

在训练设置上,两个模型都被训练生成分辨率为480×832像素、共77帧的视频,自回归的“块大小”设为4个潜在帧(潜在帧是视频在编码器压缩后的紧凑表示)。少步蒸馏统一使用4步推理。HY1.5系列的训练使用批大小32、学习率1×10⁻⁴,双向模型训练8000步,随后依次进行4000步、1500步、500步的三阶段蒸馏。Wan2.1系列则使用批大小32、学习率2×10⁻⁴,双向模型训练5000步,随后进行4000步、2000步、200步的三阶段蒸馏。

改造完成后的性能提升,确实让人印象深刻。在单张A800显卡上测量首帧延迟(即从开始运行到生成出第一帧画面所需的时间,不含VAE解码时间),原始HY1.5双向模型需要771秒,改造成多步自回归模型后降至81秒,而最终的少步自回归模型仅需3.446秒——相比原始双向模型,实现了223.75倍的加速。Wan2.1的情况同样出色:原始双向模型需要269秒,多步自回归版本降至28.6秒,最终少步自回归版本仅需1.137秒,加速比达到了236.64倍。

这里需要解释一个关键点:双向模型之所以首帧延迟那么高,是因为它必须先生成整段视频才能给你第一帧。而自回归模型则是生成完第一帧就立刻输出,后续帧在你观看第一帧的同时继续生成。所以,在实际应用中,自回归模型的用户体验改善远不止数字所体现的倍数——它让“边生成边观看”真正变成了可能。

五、数据是成败的关键——三种路线的对比实验

模型能否学会根据相机指令生成正确视角的画面,数据的质量起着决定性作用。研究团队在训练数据的选择上做了大量实验,总结出了三条路线,每条路线的结果都大相径庭。

第一条路线:使用SpatialVid数据集。这个数据集包含大量带有相机参数标注的视频,但这些相机参数是通过计算机视觉算法从视频中“感知估算”出来的,并非真实测量值。实验结果令团队颇为失望:无论是HY1.5还是Wan2.1,在这份数据上训练出来的模型都无法可靠地执行相机控制指令,即便进行了额外的数据过滤,问题依然存在。这大概是因为感知估算出的相机姿态本身就含有噪声,而且可能存在轨迹不一致的问题,让模型很难从中找到清晰的对应关系。需要特别说明的是,这个结论仅针对他们当前的训练设置,并不意味着SpatialVid数据集本身没有价值——更精细的过滤和姿态优化或许能改善这一状况,团队也把这个方向留作了后续工作。

第二条路线:从DL3DV数据集出发,通过三维重建和重新渲染获得视频数据。DL3DV是一个大规模的真实场景数据集,研究团队先通过三维重建技术从中重建出三维场景,然后沿着预设的相机轨迹渲染视频。这条路线的好处是显而易见的:渲染出来的视频和对应的相机参数是完全精确对应的“地面真值”,没有任何估算误差。实验证明,在这份数据上训练的模型能够成功学会相机可控生成,效果相当不错。

第三条路线:为开源版本专门设计的方案。从OpenVid等图像数据集中采样图像,然后利用WorldPlay(一个已有的视频世界模型)根据指定的相机轨迹生成视频。由于WorldPlay本身就是一个具有几何一致性的视频生成系统,它输出的视频也具有可信赖的地面真值相机轨迹。实验表明,这条路线同样能让模型学会相机可控生成,而且更适合开源场景——毕竟它不需要复杂的三维重建流程。

六、训练步数与批大小——两个影响成功的关键细节

除了数据质量,研究团队还做了两组非常实用的消融实验,给出了训练步数和最小批大小的具体建议。对于想要复现或迁移这项工作的研究者来说,这些细节具有直接的参考价值。

关于训练步数。以HY1.5为例,研究团队观察到,相机可控性是逐步涌现的。在仅训练一两千步时,模型几乎完全不响应相机控制指令,生成的画面与相机轨迹毫无关联。到五千步左右,模型开始能够响应相机信号,但表现仍然不稳定,时好时坏。而当训练推进到八千步时,模型达到了强可控性,能够可靠、稳定地根据相机轨迹生成正确视角的视频。这说明,相机可控性的学习不是一蹴而就的,需要足够多的训练轮次让模型真正内化这一能力。

关于批大小。以Wan2.1为例,研究团队发现这是一个不能随意缩减的超参数。当批大小小于4时,模型很难学会相机可控性,几乎必然失败。当批大小提升到8时,可控性有了大幅改善,但仍然不够稳定。只有当批大小达到16时,完整的训练流程才能顺利完成,并获得高质量的相机可控性。这个结果对于计算资源有限的研究者来说,是一个非常实用的下限指标:至少需要16的批大小,才能保证成功。

七、不只是一个新模型,而是一套可复用的工具箱

minWM的定位,与一般论文有所不同。大多数视频生成论文的核心是展示单一最优模型的生成结果,而minWM的目标,是提供一套可复用、可扩展的完整工具链。这一点体现在多个具体方面。

研究团队发布了每个训练阶段的中间检查点,而不只是最终的模型。这意味着其他研究者可以从任意一个中间阶段接力,无需重新从头训练整条流水线,这在很大程度上降低了计算成本。同时,推理代码、训练脚本和使用文档也一并开源,确保论文中的结果可以被独立复现。

框架还支持对已有的视频世界模型进行适配,而不仅仅是从零开始转换。以HY-WorldPlay为例,minWM支持把这类现成的视频世界模型迁移到新的数据分布、调整训练配方,或者进一步压缩到更低的推理延迟。也就是说,即便某个研究团队已经训练好了一个视频世界模型,也可以借助minWM的蒸馏流程把它改造得更快、更灵活,而无需重复上游的大量工作。

在推理端,minWM也做了相应的工程优化,包括针对流式场景的DiT去噪和VAE解码的流水线设计。VAE(变分自编码器)是把潜在空间的视频表示解码为可见像素画面的模块,在流式推理中,需要与扩散去噪步骤并行或交织进行,才能实现视频边生成边播放的效果。

归根结底,这项研究最大的贡献,不是某一个更强的视频模型,而是把过去散落在各处的技术拼图——数据构建、相机控制、自回归训练、少步蒸馏、流式推理——第一次系统地组装成一条完整且开源的生产线。这样一来,更多研究者可以站在这条生产线的基础上继续往前走,而不是每次都从零开始重建。

当然,这项工作也有明确的局限性和未尽之处。目前支持的控制条件只有相机运动,未来团队计划引入更多控制维度,比如人体姿态控制。同时,基于感知估算相机姿态的数据(如SpatialVid)在当前设置下效果欠佳的问题,也留待后续研究通过更精细的数据处理来解决。这些开放问题本身,也构成了这篇论文留给社区的研究空间。

可以确定的是,对于那些希望探索交互式视频生成、视频世界模型或具身智能应用的研究者来说,minWM提供了一个难得的开放起点。有兴趣深入了解技术细节的读者,可以通过arXiv编号2605.30263查阅完整论文,或访问研究团队在GitHub上发布的代码仓库。


Q&A

Q1:minWM框架和普通AI视频生成模型有什么区别?

A:普通AI视频生成模型需要把整段视频全部算完才能输出,速度极慢,也无法实时互动。minWM框架的目标是把这类模型改造成能够一帧接一帧实时生成、同时响应相机控制指令的“互动式世界模型”,最终在单张A800显卡上,首帧延迟可以从十多分钟压缩到几秒钟。

Q2:训练minWM框架里的模型,对数据有什么特殊要求?

A:相机参数的精准度非常关键。研究发现,使用感知算法估算的相机参数(如SpatialVid数据)训练效果很差,模型学不会相机控制。需要使用“地面真值”相机轨迹——比如通过三维重建后重新渲染视频,或者用WorldPlay等已有世界模型生成的视频——才能让模型可靠地学会相机可控生成。

Q3:minWM蒸馏流程的三个阶段分别解决什么问题?

A:第一阶段把双向模型改成自回归模型,解决“边生成边输出”的问题;第二阶段做少步初始化,把每帧需要多步去噪压缩到极少步数,解决速度问题;第三阶段用原始高质量双向模型做分布对齐,弥补前两步导致的质量损失,让最终少步自回归模型的画质尽量接近原始模型。

热点追踪提示词
你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:清华人大联合开源框架实现AI视频世界模型高效可控要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
来源:https://www.techwalker.com/2026/0603/3189210.shtml
AI视频

游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

相关热点
AI热点2026-07-21 09:10
技嘉发布RTX 5080木艺显卡与X870E蝶翼主板的独特设计

在COMPUTEX2026展会上,技嘉展示了AORUSGeForceRTX5080INFINITYWOOD显卡和AORUSX870EINFINITYNEXT主板。RTX5080显卡采用白色主题与木色元素装饰,设计独特;X870E主板则以蝴蝶翅膀为灵感,采用类蜂窝结构和金属3D打印

AI热点2026-07-21 09:10
星际荣耀火箭海上回收导航系统关键试验成功

星际荣耀公司近日成功完成SQX-3运载火箭海上回收高精度导航系统的无人机挂飞试验。该试验在广东阳江海域进行,采用创新的半实物动态模拟方案,全面验证了导航系统在复杂海况下的性能。结果表明,系统各项指标均优于设计要求,能够稳定提供火箭与回收船之间的高精度相对导航信息。这标志着该核心系统已完成全部地面验证

AI热点2026-07-21 09:10
Origin Code发布全新英特尔CQDIMM与AMD EXPO ULL内存新品带来AI与渲染性能的强劲提升

PC内存厂商OriginCode近日分别针对英特尔和AMD平台推出专项优化内存。面向英特尔平台的CQDIMM内存,通过与技嘉合作验证了256GB8000MT s的高带宽套条,旨在为本地AI、视频渲染等重载任务提供强大数据吞吐能力,并计划在2026年台北电脑展展出。针对AMD平台,则推出多款支持E

AI热点2026-07-21 09:10
东风本田5月销量环比增长20% CR-V等车型限时购车权益

东风本田公布5月销量达18563台,环比增长20%,其中CR-V销量增长显著。品牌同步推出6月限时购车权益,涵盖CR-V、英仕派、HR-V及思域等多款车型,权益价最低至9 79万元起,并可叠加国家以旧换新补贴及原厂配置加装优惠,为近期有购车计划的消费者提供了具体的价格参考与增值选择。

延伸阅读