美团LongCat-Image开源:编辑能力登顶SOTA的图像生成模型
尽管近年来AIGC关键技术在不断突破,但图像生成领域始终面临一个难以逾越的挑战:闭源模型性能虽强却难以私有化部署;开源方案则往往在轻量化与高性能之间难以取舍,且缺少面向商用的专项能力。
针对这一行业痛点,美团LongCat团队近日宣布,开源其最新研发的LongCat-Image模型。该模型通过高效的模型架构设计、系统性的训练策略与数据工程,仅以6B的紧凑参数规模,在文生图与图像编辑核心能力上逼近了更大尺寸的头部模型,为开发者与产业界提供了一个“高性能、低门槛、全开放”的全新选择。
▲模型架构
据介绍,LongCat-Image的核心优势在于其架构设计与训练策略。
具体来看,模型采用文生图与图像编辑同源的架构,结合渐进式学习策略,成功在6B参数下实现了指令遵循精准度、生图质量与文字渲染能力的高效协同。
在图像编辑方面,LongCat-Image的“可控性”表现突出,而性能突破的关键在于一套紧密协同的训练范式和数据策略。
为了有效继承文生图模型的知识和美感,同时避免文生图后训练阶段收敛的状态空间对编辑指令多样性的限制,团队一方面基于文生图Mid-training阶段模型进行初始化,并采用指令编辑与文生图多任务联合学习机制,深化对复杂多样化指令的理解;另一方面,通过预训练阶段的多源数据及指令改写策略,以及结合SFT阶段引入的人工精标数据,最终实现了指令遵循精准度、泛化性和编辑前后视觉一致性的共同提升。
在GEdit-Bench和ImgEdit-Bench等权威基准测试中,LongCat-Image均达到开源SOTA(当前最佳)水平,可精准响应用户的多样化修改需求。
在中文文本渲染这一长期困扰业界的难题上,LongCat-Image也取得了很大进展,通过课程学习策略提升字符覆盖度和渲染精准度:预训练阶段基于千万量级合成数据学习字形,覆盖通用规范汉字表的8105个汉字;SFT阶段引入真实世界文本图像数据,提升在字体、排版布局上的泛化能力;在RL(强化学习)阶段,引入OCR与美学双奖励模型,进一步提升文本准确性与背景融合自然度。
该模型在ChineseWord评测中以90.7的得分领先同类产品。无论是商业海报中的复杂笔划,还是古诗词插图中的生僻字,LongCat-Image均能实现精准、自然的渲染,进一步拓展AI在设计领域的应用边界。
为了提升生成图像的审美与真实感,LongCat团队还构建了系统性的数据筛选与对抗训练框架。团队在预训练阶段严格过滤低质量AIGC数据,并在RL阶段创新性引入AIGC内容检测器作为奖励模型,利用其对抗信号逆向引导模型学习真实世界的物理纹理、光影和质感,从而显著改善了AI绘图常见的“塑料感”纹理。
▲客观基准测试性能对比
全面的客观与主观评测数据均验证了LongCat-Image的能力:在客观基准测试中,其图像编辑得分与中文渲染能力均领跑参评模型;在文生图任务上,GenEval与DPG-Bench的优异表现证明了其相比头部开源与闭源模型依然具备强竞争力。
▲人类主观评分对比& 并列对比评估胜率
在更贴近用户体验的主观评测(文生图方面采用大规模的人工主观评分与图像编辑方面采用严格的并列对比评估)中,LongCat-Image在真实度方面相比主流开闭源模型表现出色,同时在文本-图像对齐与合理度上达到开源SOTA水平;至于综合编辑质量和视觉一致性方面,虽然与Nano Banana等商业闭源模型仍有一定差距,但在开源领域已形成领先优势。
值得一提的是,为了构建一个更透明、开放、协作的开源生态系统,美团 LongCat团队此次全面开源了从Mid-training到Post-training的文生图多阶段模型及图像编辑模型,旨在支持从前沿研究到商业应用的全流程。相关资源已在Hugging Face和GitHub上线,用户也可在官网longcat.ai上体验。
与此同时,面向终端用户的“LongCat APP”也迎来重大升级,全新上线的图生图功能与24个零门槛玩法模板,让普通用户也能一键生成海报、精修人像,实现“专业AI创作零门槛”。
美团LongCat团队还表示:“我们坚信,真正的技术进步源于社区的集体智慧。现诚邀广大开发者体验模型、参与共建,与我们共同基于这个高效能模型,探索视觉生成的更多可能。”
相关链接:
·Hugging Face:https://huggingface.co/meituan-longcat/LongCat-Image
·GitHub:https://github.com/meituan-longcat/LongCat-Image
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
小米集团辟谣官微上线,定位官方辟谣平台
小米辟谣官微6月30日正式上线,作为集团官方辟谣阵地,用户可查询辟谣声明、反馈谣言线索。账号将主动澄清网络谣言,维护合法商誉,并致力于打造权威辟谣通道,保障公众知情权与合法权益。
小米官方辟谣账号上线持续维护合法商誉
6月30日,小米集团的一则动态引发热议:小米辟谣官方账号,正式上线了。简单来说,小米这次将澄清谣言的工作直接推到了前台——在中央网信办违法和不良信息举报中心的指导下,小米辟谣的全新阵地宣告成立。 目前,这个辟谣账号已在微博开通。用户可以通过它核实与查阅小米官方的辟谣声明,也可以反馈任何涉及小米的谣言
特斯拉Cybercab无驾舱量产车在奥斯汀启动L4级公开道路测试
特斯拉Cybercab量产车在奥斯汀启动L4级公开测试,彻底取消方向盘等物理控制装置。安全监督员仅观察不干预。车辆专为Robotaxi设计,搭载HW4 0与FSDV14 3 3系统,续航672公里,支持无线充电,实现全程独立驾驶。
鸿蒙智行回应问界M5车内异味系第三方配件所致
6月30日,针对近期网络热议的“问界M5车内异味”事件,鸿蒙智行官方小助手在社区帖子下方发布了正式回应。官方表示,已对刘先生的这辆车进行了全面检测排查。工作人员上门核查后发现,涉事车辆内部加装了大量第三方配件,包括非原厂皮质、塑胶收纳摆件、脚托、抱枕、车衣等。在拆除所有加装配件后,工作人员严格依照国
闫闯直言20万买电车选400V太愚蠢
2026年6月30日,微博上一则关于电动汽车高压平台技术路线的争论迅速引爆热搜。坐拥超过475万粉丝的汽车领域博主闫闯,在归还体验了4天的理想i6时,专门花费6分多钟把电量充至满格,并掷地有声地留下一句:“一点不比加油慢。”随后他补充道:“还是那句话,都这时代了,20万+电车还买400V的绝对愚蠢。
- 日榜
- 周榜
- 月榜
1
2
3
4
5
6
7
8
9
10
1
2
3
4
5
6
7
8
9
10
1
2
3
4
5
6
7
8
9
10
相关攻略
2026-07-02 11:22
2026-07-02 11:22
2026-07-02 11:22
2026-07-02 11:22
2026-07-02 11:22
2026-07-02 11:21
2026-07-02 11:21
2026-07-02 11:21
热门教程
- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程
热门话题

