苹果推出视觉AI新引擎 UniGen 1.5:一个模型贯通“看图—理解—创作—修改”全链路

12.19 传统视觉AI系统通常将图像识别文本生成图像text-to-image以及图像编辑如局部替换风格迁移视为独立任务,需调用不同模型训练不同参数,不仅资源消耗大,而且任务间的语义断层限制了整体表现

12月18日,苹果研究团队正式对外披露其最新多模态人工智能模型 UniGen 1.5,标志着公司在视觉AI领域迈出关键一步。与当前主流方案普遍依赖多个专用模型分别处理图像理解、生成与编辑任务不同,UniGen 1.5首次在单一架构内完整集成这三大能力,实现“理解—生成—修改”的端到端协同。

 

统一架构:打破视觉任务边界

 

传统视觉AI系统通常将图像识别、文本生成图像(text-to-image)以及图像编辑(如局部替换、风格迁移)视为独立任务,需调用不同模型、训练不同参数,不仅资源消耗大,而且任务间的语义断层限制了整体表现。UniGen 1.5通过重构模型底层架构,打造了一个统一的多模态大型语言模型(MLLM),使图像理解能力直接反哺生成与编辑过程,从而提升输出的语义一致性与细节准确性。

 

两大核心技术突破

 

1. “编辑指令对齐”机制:先理解,再动手  

针对图像编辑任务中用户指令模糊、复杂等问题,苹果团队创新性地引入了“编辑指令对齐”(Edit Instruction Alignment)的后训练阶段。该机制并不要求模型立刻修改图像,而是先让其根据原始图像与文本指令,生成一份详尽的目标图像文本描述。这一“先想后画”的中间推理过程,迫使模型深度解析用户意图,显著提升编辑精准度。


2025-12-19_155028_815


2025-12-19_155045_084

这一中间步骤有助于模型在生成最终图像之前更好地理解预期的编辑内容

 

2. 统一强化学习奖励系统:生成与编辑共享评价标准  

图像生成追求创意与美感,而图像编辑更强调保真与细节控制,二者目标差异大,以往难以在一个奖励体系下协同训练。UniGen 1.5通过设计一套统一的强化学习奖励机制,使生成与编辑任务共享同一套质量评估标准,有效弥合任务鸿沟,增强模型在复杂干扰下的鲁棒性。


2025-12-19_155532_164

UniGen-1.5 的文本转图像生成和图像编辑功能的一些示例

 

性能表现:对标顶尖闭源模型

 

在多项权威基准测试中,UniGen 1.5表现亮眼:  

  • 在综合生成能力评测 GenEval 中得分 0.89;  

  • 在 DPG-Bench 上取得 86.83 分;  

  • 在图像编辑专项测试 ImgEdit 中获得4.31 分,不仅超越开源模型 OmniGen2,更与 OpenAI 的 GPT-Image-1 等闭源系统持平。

 

当前局限与未来方向

 

尽管成果显著,研究团队在论文中坦言,UniGen 1.5在处理图像内嵌文字时仍存在识别与生成错误,主因在于其离散去标记器(discrete detokenizer)对细粒度结构控制不足。此外,在部分编辑场景中偶现“主体特征漂移”现象,如动物毛发纹理或颜色偏差,这些将成为下一阶段优化重点。

 

行业意义:迈向真正的“视觉通用智能”

 

UniGen 1.5的发布,不仅是技术整合的胜利,更代表苹果在构建“通用视觉智能”道路上的重要尝试。通过将理解、创造与修改统一于一个智能体,模型更接近人类处理视觉信息的完整闭环——既能“看懂”,也能“想象”,还能“动手改”。随着该技术未来可能集成至 iOS 或 macOS 系统,普通用户或将迎来更自然、更精准的AI图像交互体验。

 

论文链接:https://arxiv.org/pdf/2511.14760