阿里云旗下通义千问团队近日发布全新多模态大模型Qwen VLo,该模型在视觉内容理解与生成领域实现重大突破,为用户带来更智能的视觉创作工具。

来源:Aiyxl/Jimeng AI
技术升级亮点:
渐进式生成技术:采用独特的"从左到右、从上到下"生成策略,通过实时优化预测内容确保图像质量,同时提供更可控的创作过程
语义一致性保障:在图像编辑任务中能精准保留原图关键特征,如车辆改色时准确维持车型结构
多语言交互支持:全面兼容中英文等多种语言指令,实现全球化用户体验
核心功能突破:
• 智能图像编辑:支持背景替换、元素添加、风格迁移等操作
• 多图理解生成:可同时处理多张输入图像完成复杂任务
• 开放指令响应:通过自然语言指令实现艺术风格转换、场景重构等创意需求
• 动态分辨率支持:适配任意尺寸和比例的图像生成需求
应用场景示例:
电商设计:快速生成产品展示图并进行多风格适配
内容创作:根据文字描述自动生成插画或海报
图像优化:对现有照片进行智能修饰和增强
目前该模型已在Qwen Chat平台开放体验,研发团队表示将持续优化模型性能,解决当前存在的细节一致性等问题。此次升级标志着通义千问在多模态AI领域又迈出重要一步,为行业提供了更强大的视觉内容生产工具。