11月27日,阿里巴巴通义实验室正式开源新一代文生图大模型Z-Image。仅6B的参数规模,却在官方盲测中拿下与20B级商业模型相当的画质,并以“8步采样、亚秒级出图、16GB显存可跑”刷新轻量化赛道纪录,被业内视为“消费级AI绘图时代”的里程碑。
技术突破:单流DiT+解耦蒸馏,8步生成大片
Z-Image采用单流Diffusion Transformer(S3-DiT)架构,将文本、视觉语义与图像VAE token拼接为统一序列,最大化参数效率。核心加速来自两项自研蒸馏技术:
1. Decoupled-DMD:把“无分类器引导(CFG)”与“分布匹配”解耦,分别优化,实现8步出图仍保留50步细节。
2. DMDR:在蒸馏后再用强化学习微调,基于指令跟随、文本正确、美学三维度奖励模型,Elo评分提升3%,开源模型中排名第一。
实测在RTX 4090上生成1024×1024图像仅需0.9秒,峰值显存13.7GB;512×512图像最低7.1GB即可运行,笔记本端也能“秒级”成片。

能力亮点:双语文字、复杂指令、编辑一致性全面领先
Z-Image提供三个版本:
Z-Image-Turbo:面向推理加速,8步生成,已上线Hugging Face与ModelScope。
Z-Image-Base:完整基座,方便社区二次微调。
Z-Image-Edit:专注图像到图像编辑,支持自然语言指令精确改图。
在1万次匿名人工评测中,Z-Image-Turbo在照片真实感、中英双语文字渲染、复杂排版等任务上优于SDXL、Flux.1等32B级模型,中文海报生成准确率居首。编辑场景下,模型可完成风格迁移、物体增删、人物姿态调整,并保证光影与纹理一致性。
开源即商用:Apache 2.0协议,电商、游戏、影视可无缝集成
Z-Image代码与权重采用Apache 2.0协议,已在GitHub、Hugging Face、ModelScope三平台同步开放,允许直接商用。官方同步放出ComfyUI插件与16GB显存推理脚本,开发者“pip+三行代码”即可本地部署。
行业观察人士指出,Z-Image的轻量化路径与黑森林实验室32B参数的Flux.2形成鲜明对比,验证了“数据去冗余+算法创新”的小模型路线同样可达SOTA效果,为电商海报、短视频特效、游戏原画等场景提供了低成本、可落地的AI绘图方案。
通义实验室透露,下一步将发布INT8量化版,目标在0.6秒内完成1024×1024生成;同时联合阿里云推出API服务,预计2026年推动AI绘图能力向移动端与边缘设备大规模下沉。
项目地址:
https://github.com/Tongyi-MAI/Z-Image
https://huggingface.co/Tongyi-MAI/Z-Image-Turbo
https://www.modelscope.cn/models/Tongyi-MAI/Z-Image-Turbo