通义千问推出多模态大模型Qwen VLo:理解与生成能力全面升级

6.28 核心功能突破智能图像编辑支持背景替换元素添加风格迁移等操作多图理解生成可同时处理多张输入图像完成复杂任务开放指令响应通过自然语言指令实现艺术风格转换场景重构等创意需求动态分辨率支持适配任意尺寸和比例的图像生成需求

阿里云旗下通义千问团队近日发布全新多模态大模型Qwen VLo,该模型在视觉内容理解与生成领域实现重大突破,为用户带来更智能的视觉创作工具。


20250628142553
来源:Aiyxl/Jimeng AI


技术升级亮点:

渐进式生成技术:采用独特的"从左到右、从上到下"生成策略,通过实时优化预测内容确保图像质量,同时提供更可控的创作过程

语义一致性保障:在图像编辑任务中能精准保留原图关键特征,如车辆改色时准确维持车型结构


多语言交互支持:全面兼容中英文等多种语言指令,实现全球化用户体验

核心功能突破:
• 智能图像编辑:支持背景替换、元素添加、风格迁移等操作
• 多图理解生成:可同时处理多张输入图像完成复杂任务
• 开放指令响应:通过自然语言指令实现艺术风格转换、场景重构等创意需求
• 动态分辨率支持:适配任意尺寸和比例的图像生成需求


应用场景示例:

电商设计:快速生成产品展示图并进行多风格适配

内容创作:根据文字描述自动生成插画或海报

图像优化:对现有照片进行智能修饰和增强

目前该模型已在Qwen Chat平台开放体验,研发团队表示将持续优化模型性能,解决当前存在的细节一致性等问题。此次升级标志着通义千问在多模态AI领域又迈出重要一步,为行业提供了更强大的视觉内容生产工具。


试用:http://chat.qwen.ai 

通义千问推出多模态大模型Qwen VLo:理解与生成能力全面升级 | AIYXL