阿里巴巴开源通义万相Wan2.2:全球首款电影美学控制视频生成模型震撼发布

7.28 阿里巴巴正式开源其最新视频生成模型通义万相Wan2.2,推出三款创新模型文生视频Wan2.2-T2V-A14B图生视频Wan2.2-I2V-A14B和统一视频生成Wan2.2-IT2V-5B

在全球人工智能竞赛持续升温的背景下,中国科技巨头阿里巴巴再次迈出关键一步。7月28日晚,阿里巴巴正式开源其最新视频生成模型「通义万相Wan2.2」,推出三款创新模型——文生视频(Wan2.2-T2V-A14B)、图生视频(Wan2.2-I2V-A14B)和统一视频生成(Wan2.2-IT2V-5B)。其中,文生视频和图生视频模型成为业界首个采用混合专家(MoE)架构的开源方案,总参数量达270亿,激活参数140亿,标志着生成式AI在视频领域的重大突破。


20250728222648


此次开源的Wan2.2最引人瞩目的创新是其全球首创的「电影美学控制系统」。该系统通过精细调节光影、色彩、构图甚至微表情等元素,使AI生成的视频达到专业电影水准。例如,用户输入「黄昏」「柔光」「暖色调」等关键词,模型可自动生成金色落日场景;而「冷色调」「硬光」「低角度」的组合则能输出科幻风格的画面。这一技术不仅降低了影视创作的门槛,也为广告、游戏和社交媒体内容生产提供了全新工具。


2025072805

2025072806

20250728215928

 

为满足不同开发需求,阿里巴巴同步开源了一款参数量仅50亿的统一视频生成模型(Wan2.2-IT2V-5B)。该模型采用高压缩率3D VAE架构,时空压缩比高达4×16×16,信息压缩率提升至64倍,仅需22GB显存即可在消费级显卡上生成5秒720P高清视频(24帧/秒),成为目前开源领域速度最快的轻量化方案。这一突破使得中小企业和个人开发者能够低成本部署高质量视频生成应用。

 

自2024年2月以来,通义万相系列模型已在GitHub、Hugging Face和魔搭社区累计下载超500万次,显示出全球开发者对AI视频技术的强烈需求。此次更新进一步巩固了中国在生成式AI开源领域的领先地位,与Meta的Emu、Stability AI的SVD等国际竞品形成差异化竞争——尤其在电影化控制和小模型效率方面,Wan2.2树立了新的行业标杆。  

 

目前,开发者可通过阿里云百炼平台调用API,普通用户也可在通义万相官网及App直接体验。分析人士认为,这一开源举措将加速AI视频工具在跨境电商、教育、虚拟制作等场景的落地,同时推动全球多模态大模型技术向影视工业化方向演进。

 

在OpenAI、Google等美国企业仍将视频生成模型闭源商业化之际,阿里巴巴持续加码开源,既是对开发者生态的长期投资,也折射出中国科技公司通过开放协作争夺AI标准制定权的战略。随着Wan2.2电影美学系统的推出,AI生成内容(AIGC)的「艺术性」首次被量化建模,这可能重新定义未来人机协同的创意生产方式。  

 

不过,行业也面临挑战:如何解决AI视频的版权争议?是否会冲击传统影视就业?这些问题需要全球产学研各界共同探索。无论如何,通义万相的开源已为这场跨越国界的AI创新浪潮注入了新的动能。


开源地址:

GitHub:
https://github.com/Wan-Video/Wan2.2 

HuggingFace:
https://huggingface.co/Wan-AI 

魔搭社区:
https://modelscope.cn/organization/Wan-AI