千问App重磅升级:通义万相Wan2.5与Qwen-Image开启全民AI创作新时代

12.2 今日,阿里巴巴旗下的通义实验室宣布,其官方应用千问App已完成重大升级,正式向国内用户免费开放两款重量级多模态AI模型被誉为国内最强的视频生成模型通义万相Wan2.5,以及被称为全球最强开源模型的Qwen-Image的独家满血特供版

12月2日,杭州 —— 今日,阿里巴巴旗下的通义实验室宣布,其官方应用“千问App”已完成重大升级,正式向国内用户免费开放两款重量级多模态AI模型:被誉为“国内最强”的视频生成模型通义万相Wan2.5,以及被称为“全球最强开源模型”的Qwen-Image的独家满血特供版。此举标志着AI内容创作的门槛被进一步拉低,普通用户也能轻松享受到前沿AI技术带来的创作乐趣。


2025-12-02_115941_424

 

通义万相Wan2.5是阿里巴巴在多模态生成领域的一次重大突破,被官方定位为“国内最强”的视频生成模型。其核心优势在于原生多模态架构,该架构能够实现文本、图像、音频等跨模态信息的无缝融合与深度对齐,从而生成效果极为逼真的内容。

 

Wan2.5最引人注目的技术特点是其原生音画同步能力。它不仅能生成最高1080P、24帧/秒的10秒高清视频,更能为视频自动配上与画面内容、人物口型精准匹配的人声(支持多人、多语言)、环境音效(ASMR)以及背景音乐(BGM)。这意味着用户只需输入一段简单的文本提示,就能得到一部“有声有色”的微型电影,极大地简化了视频创作流程。

 

此外,Wan2.5系列还集成了强大的图像编辑功能。用户可以通过自然语言指令,基于单张或多张参考图,实现主体一致的图像编辑与多图融合,真正做到“所想即所得”。

 

与Wan2.5一同上线的,是Qwen-Image模型的独家满血特供版。Qwen-Image是通义千问团队于2025年8月开源的一款全能型图像生成与编辑基础模型,因其在复杂文本渲染方面的卓越表现,被誉为“全球最强开源图像模型”。

 

长期以来,AI生成图像中的文字常常出现乱码或语义错误,而Qwen-Image的核心突破正是解决了这一行业难题。它能够精准地在图像中渲染复杂的中英文混合文本,支持多行布局、段落级生成,并能保留原有字体风格[[11],[16]]。这一能力使其在海报设计、广告 banner、信息图等需要图文结合的应用场景中具有无可比拟的优势。

 

在技术架构上,Qwen-Image采用了“三位一体”的协同设计,结合了Qwen2.5-VL语言视觉模型、VAE编码器和多模态扩散变换器(MMDiT),不仅在文本渲染上表现出色,还具备精准的图像编辑能力,支持物体的增减、风格变换以及细粒度的文字修改。

 

随着通义万相Wan2.5和Qwen-Image在千问App的正式上线,阿里巴巴再次展现了其在AI大模型领域的深厚积累与创新实力。这两款模型一个聚焦于音画同步的视频生成,一个专精于图文并茂的图像创作,共同构成了一个强大的多模态内容生成矩阵,为广大用户和开发者提供了前所未有的创作工具。可以预见,这将极大地激发全民的AI创作热情,推动AIGC(人工智能生成内容)生态迈向新的繁荣。