FLUX 3多模态AI模型发布 支持单次生成20秒多样化视频
FLUX3多模态基础模型于7月24日以EarlyAccess方式上线,采用统一架构实现图像、视频和音频的联合训练与生成。单次可输出最长20秒视频并自带原生音频,在文生视频、图生视频等任务中表现突出。人工评测中,10秒720p视频胜率优于GrokImagineVideo、Seedance2 0和GeminiOmniFlash。此外,该模型正与MimicRobo
7月24日,Black Forest Labs 通过 Early Access 模式正式发布了 Flux 3 多模态基础模型。此次发布的最大亮点在于采用统一架构,将图像、视频与音频的学习任务深度融合——这意味着模型无需再针对不同模态单独训练,而是能够同步处理多种信息类型。
在训练方面,官方博客指出,Flux 3 基于 Self-Flow 学习框架进行了扩展,在 FLUX.1 和 FLUX.2 系列的基础上,成功实现了视频、图像和音频的联合训练,并进一步延伸至多模态生成与理解任务。其背后的技术逻辑十分明确:既然人类感知世界的方式天然是多模态的,那么模型也理应朝着这一方向演进。


最令人惊艳的是,FLUX 3 能够单次生成最长 20 秒的视频,并自带原生音频。这意味着用户无需先生成视频再单独添加配音——模型一次性完成所有任务。官方列出的能力清单包括:文生视频、图生视频、视频生视频、输入视频与音频续写、关键帧转视频、多语言对话,以及多镜头串联。覆盖场景极为广泛,从创意短片到专业视频编辑,都能找到适用之处。

在性能评测方面,针对带声音的 10 秒 720p 视频的人工评估中,FLUX 3 的表现颇具说服力:对比 Grok Imagine Video 的胜率为 69%,对比 Seedance 2.0 的胜率为 52%,对比 Gemini Omni Flash 的胜率同样为 52%。尽管对 Seedance 和 Gemini 的优势并非压倒性,但考虑到多模态统一架构的复杂性,这一成绩已相当稳健。

一个值得关注的方向是,Black Forest Labs 正在与 Mimic Robotics 合作,探索将 FLUX 3 应用于机器人行为预测模型。这实际上是大模型落地的一个典型路径——多模态理解能力越强,机器人在真实环境中的感知与决策就越可靠。
在图像能力方面,FLUX 3 同样支持图像生成与编辑,涵盖多种风格、宽高比和分辨率。换言之,它不仅是一个视频模型,更是一个真正的多模态基础模型,能够处理文本、图像、视频和音频等多种内容类型。

你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:FLUX 3多模态AI模型发布 支持单次生成20秒多样化视频要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
相关热点OpenAI携手博通等公司自研AI服务器芯片,旨在缓解算力短缺困境,效仿苹果实现软硬件一体化。已挖角谷歌TPU团队加速研发,面临技术、资金等挑战,CEO提出庞大投资计划改造全球半导体产业。
NotebookLM可处理百万字级知识库,解决大文本失真问题。支持300个文件上传,基于向量数据库深度消化。提供音频播客、思维导图等六大生成功能。在创作流程中担任资料整理角色,处理海量信息不失真并标注出处。需自行解决网络与账号问题。
2025年7月,微软、英伟达、OpenAI等14家科技巨头联合成立安全人工智能联盟,旨在为全球AI从业者提供一套完整的开源安全指南与工具,应对生成式AI发展中的安全挑战,推动AI系统安全可靠地设计、构建与应用。
OpenAI发布GPT-4omini,一款高性价比的小型AI模型。作为GPT-4o的精简版,当前支持文本交互,未来将集成图像、视频、音频处理能力。定价亲民,面向个人开发者、小型团队及教育机构,推动人工智能普及。
- 日榜
- 周榜
- 月榜
热点快看
