阿里通义开源发布 Qwen-Image-2512:图像生成迈向“以假乱真”新阶段

12.31 该模型聚焦**更真实的人物质感更细腻的自然纹理更复杂的文字渲染**三大核心能力升级,显著降低生成图像的AI感,推动AI图像生成向真实世界无限逼近

12月31日,阿里巴巴旗下通义实验室正式开源发布新一代图像生成大模型Qwen-Image-2512,标志着其在文生图(Text-to-Image)领域的重大技术突破。该模型聚焦“更真实的人物质感、更细腻的自然纹理、更复杂的文字渲染”三大核心能力升级,显著降低生成图像的“AI感”,推动AI图像生成向真实世界无限逼近。

 

三大能力跃升,突破视觉生成瓶颈

 

 1. 更真实的人物质感  

Qwen-Image-2512 在人像生成方面实现了质的飞跃。模型能够精准还原皮肤纹理、发丝走向、面部微表情等细节,有效告别传统AI生成图像中常见的“塑料脸”或五官模糊问题。此外,它还能理解如“微微前倾”等复杂语义描述,将抽象语言指令转化为具象、自然的人体姿态。

 

2. 更细腻的自然纹理  

从水流涟漪、植被苔藓,到金毛犬的柔软绒毛、盘羊的粗粝皮毛,Qwen-Image-2512 对自然界中各类复杂材质的微观结构具备更强的刻画能力。这一提升不仅增强了图像的真实感,也为生物、生态、科研等专业领域的可视化应用提供了新可能。

 

3. 更复杂的文字渲染  

文字生成历来是图像大模型的难点,Qwen-Image-2512 在此方面取得显著进展。模型不仅可准确排版时间轴、技术图表,还能生成包含多格漫画与对话框的健康科普海报,有效解决图文混合排版难题,为教育、宣传、UI设计等场景提供强大支持。


2025-12-31_220933_835

 

用户盲测表现优异,开源生态再拓展

 

据官方披露,Qwen-Image-2512 在国际知名评测平台 AI Arena 上完成了超过1万局的用户盲测。数据显示,该模型在所有开源模型中表现最优,并在与多款主流闭源模型(如DALL·E、Midjourney等)的对比中仍展现出显著竞争力。


2025-12-31_220727_172

 

值得一提的是,Qwen-Image-2512 是在2025年8月发布的初代 Qwen-Image 基础上的重大升级版本。此次全面开源,延续了通义实验室“开放共享、推动技术普惠”的理念,开发者可通过 GitHub 仓库(https://github.com/QwenLM/Qwen-Image  )获取模型权重、推理代码及使用示例。


2025-12-31_222027_539

 

文生图进入“精细化真实”时代

 

Qwen-Image-2512 的发布,不仅体现了阿里在多模态大模型领域的技术积累,更预示着AI图像生成正从“能生成”迈向“能逼真生成、能精准控制、能专业应用”的新阶段。随着开源生态的进一步完善,该模型有望在数字内容创作、虚拟人、广告设计、科普教育等多个行业加速落地。