12月31日,阿里巴巴旗下通义实验室正式开源发布新一代图像生成大模型Qwen-Image-2512,标志着其在文生图(Text-to-Image)领域的重大技术突破。该模型聚焦“更真实的人物质感、更细腻的自然纹理、更复杂的文字渲染”三大核心能力升级,显著降低生成图像的“AI感”,推动AI图像生成向真实世界无限逼近。
三大能力跃升,突破视觉生成瓶颈
1. 更真实的人物质感
Qwen-Image-2512 在人像生成方面实现了质的飞跃。模型能够精准还原皮肤纹理、发丝走向、面部微表情等细节,有效告别传统AI生成图像中常见的“塑料脸”或五官模糊问题。此外,它还能理解如“微微前倾”等复杂语义描述,将抽象语言指令转化为具象、自然的人体姿态。
2. 更细腻的自然纹理
从水流涟漪、植被苔藓,到金毛犬的柔软绒毛、盘羊的粗粝皮毛,Qwen-Image-2512 对自然界中各类复杂材质的微观结构具备更强的刻画能力。这一提升不仅增强了图像的真实感,也为生物、生态、科研等专业领域的可视化应用提供了新可能。
3. 更复杂的文字渲染
文字生成历来是图像大模型的难点,Qwen-Image-2512 在此方面取得显著进展。模型不仅可准确排版时间轴、技术图表,还能生成包含多格漫画与对话框的健康科普海报,有效解决图文混合排版难题,为教育、宣传、UI设计等场景提供强大支持。

用户盲测表现优异,开源生态再拓展
据官方披露,Qwen-Image-2512 在国际知名评测平台 AI Arena 上完成了超过1万局的用户盲测。数据显示,该模型在所有开源模型中表现最优,并在与多款主流闭源模型(如DALL·E、Midjourney等)的对比中仍展现出显著竞争力。

值得一提的是,Qwen-Image-2512 是在2025年8月发布的初代 Qwen-Image 基础上的重大升级版本。此次全面开源,延续了通义实验室“开放共享、推动技术普惠”的理念,开发者可通过 GitHub 仓库(https://github.com/QwenLM/Qwen-Image )获取模型权重、推理代码及使用示例。

文生图进入“精细化真实”时代
Qwen-Image-2512 的发布,不仅体现了阿里在多模态大模型领域的技术积累,更预示着AI图像生成正从“能生成”迈向“能逼真生成、能精准控制、能专业应用”的新阶段。随着开源生态的进一步完善,该模型有望在数字内容创作、虚拟人、广告设计、科普教育等多个行业加速落地。