当前位置: 首页
AI
苹果全能视觉AI模型UniGen 1.5发布,看图修图绘图三合一

苹果全能视觉AI模型UniGen 1.5发布,看图修图绘图三合一

热心网友 时间:2025-12-19
转载

12月19日消息,据科技媒体9to5Mac昨日(12月18日)发布的博文报道,苹果研究团队近期发布了多模态AI模型UniGen 1.5,成功在单一系统中集成了图像理解、生成与编辑三大核心功能。

不同于主要依赖不同模型分别处理任务的传统方案,UniGen 1.5最大的突破在于构建了一个统一的框架,仅凭一个模型即可同时完成图像理解、图像生成以及图像编辑任务。研究人员认为,这种统一架构能让模型利用强大的图像理解能力反哺生成效果,从而实现更精准的视觉输出。

在图像编辑领域,模型往往难以精准捕捉用户微妙或复杂的修改指令。为解决这一难题,苹果团队首创引入了名为“编辑指令对齐”的后训练阶段。

该技术并不直接让模型修改图片,而是要求模型先根据原图和指令,预测出目标图像的详细文本描述。这种“先想后画”的中间步骤,迫使模型在生成最终图像前,必须深度内化用户的编辑意图,从而大幅提升了修改的准确度。

苹果全能视觉 AI 模型 UniGen 1.5 亮相,看图、修图、绘图三合一

苹果全能视觉 AI 模型 UniGen 1.5 亮相,看图、修图、绘图三合一

这一中间步骤有助于模型在生成最终图像之前更好地理解预期的编辑内容。

除了指令对齐,UniGen 1.5的另一大贡献在于强化学习层面的创新。研究团队成功设计了一套统一的奖励系统,能够同时应用于图像生成和图像编辑的训练过程。

此前,由于编辑任务涉及从微调到重构的巨大跨度,统一奖励机制极难实现,而这一突破让模型在处理不同类型的视觉任务时,能够遵循一致的质量标准,显著增强了系统的“抗干扰”性。

苹果全能视觉 AI 模型 UniGen 1.5 亮相,看图、修图、绘图三合一

UniGen-1.5 的文本转图像生成和图像编辑功能的一些示例

苹果全能视觉 AI 模型 UniGen 1.5 亮相,看图、修图、绘图三合一

UniGen-1.5 的文本转图像生成和图像编辑功能的一些示例

在多项行业标准基准测试中,UniGen 1.5展现了强劲的竞争力。数据显示,该模型在GenEval和DPG-Bench测试中分别获得0.89和86.83的高分,显著优于BAGEL和BLIP3o等近期热门方法。

在图像编辑专项测试ImgEdit中,其4.31的综合得分不仅超越了OminiGen2等开源模型,更与GPT-Image-1等专有闭源模型表现持平。

尽管整体表现优异,UniGen 1.5目前仍存在一定局限性。研究人员在论文中坦诚,由于离散去标记器(discrete detokenizer)在控制细粒度结构方面存在不足,模型在生成图片内的文字时容易出错。

苹果全能视觉 AI 模型 UniGen 1.5 亮相,看图、修图、绘图三合一

图 A 展示了 UniGen-1.5 在文本转图像生成和图像编辑任务中的失败案例。以上图源:苹果论文

此外,在部分编辑场景下,模型偶尔会出现主体特征漂移的问题,例如猫的毛发纹理改变或鸟的羽毛颜色偏差,这些问题将是团队未来的优化重点。

附上参考地址

UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning

来源:https://www.ithome.com/0/906/155.htm

游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

同类文章
更多
Figma一键去除复杂背景AI插件使用教程

Figma一键去除复杂背景AI插件使用教程

在Figma中处理复杂背景图片时,可借助AI背景移除插件实现一键智能抠图。首先安装可靠插件,选中位图图层后通过插件启动AI处理,生成带透明背景的新图层。导出时需选择PNG格式并勾选包含Alpha通道。若效果不理想,可尝试调整高级设置或手动使用矢量蒙版进行局部修正。

时间:2026-05-19 10:41
CodeBuddy自动生成代码注释教程 提升代码可读性指南

CodeBuddy自动生成代码注释教程 提升代码可读性指南

代码注释自动化生成能提升代码可读性与维护效率。通过IDE插件可批量处理存量代码,自动插入规范注释且不改变原有逻辑。在编辑器中圈选代码片段可快速生成解释并转为注释。支持自定义指令以固化团队注释规范,确保风格统一。结合设计工具,还能从设计稿直接生成带注释的前端代码。

时间:2026-05-19 10:41
Canva长图设计技巧:有效提升用户阅读完成率的实用指南

Canva长图设计技巧:有效提升用户阅读完成率的实用指南

提高Canva长图阅读完成率需降低认知负担、强化节奏引导。应运用视觉动线划分内容区块,图文结合并留白以提升可读性。控制信息密度,确保一屏一观点,并插入轻量互动点。首屏需用强标题与相关配图快速吸引注意,结尾则应设置行动暗示或链接,避免戛然而止。

时间:2026-05-19 10:41
OpenClaw自动化工具推荐与使用指南

OpenClaw自动化工具推荐与使用指南

针对OpenClaw的替代或增强需求,实测显示四款AI智能体平台表现突出。OpenOcta轻量且审计友好,适合测试运维;DTClaw深度定制,强化金融政务合规;ClawLite为边缘低算力设备精简设计;ClawHub则通过认证插件集实现非侵入式能力扩展。它们分别满足不同场景下的本地执行、技能扩展与安全控制要求。

时间:2026-05-19 10:41
Figma表单无法编辑的解决方法 静态层转可编辑组件教程

Figma表单无法编辑的解决方法 静态层转可编辑组件教程

Figma中“MakeDesigns”生成的静态表单需解构为独立图层,并用原生工具重建为可编辑组件。步骤包括分离图层、创建输入框、批量替换文字、设置约束,以及为下拉菜单等添加交互变体,最终转换为可交互的现代化组件。

时间:2026-05-19 10:40
热门专题
更多
刀塔传奇破解版无限钻石下载大全 刀塔传奇破解版无限钻石下载大全
洛克王国正式正版手游下载安装大全 洛克王国正式正版手游下载安装大全
思美人手游下载专区 思美人手游下载专区
好玩的阿拉德之怒游戏下载合集 好玩的阿拉德之怒游戏下载合集
不思议迷宫手游下载合集 不思议迷宫手游下载合集
百宝袋汉化组游戏最新合集 百宝袋汉化组游戏最新合集
jsk游戏合集30款游戏大全 jsk游戏合集30款游戏大全
宾果消消消原版下载大全 宾果消消消原版下载大全
  • 日榜
  • 周榜
  • 月榜
热门教程
更多
  • 游戏攻略
  • 安卓教程
  • 苹果教程
  • 电脑教程