9月23日,阿里云通义千问团队以“深夜炸场”的方式,正式发布并开源了全模态AI模型Qwen3-Omni、语音生成模型Qwen3-TTS以及图像编辑工具Qwen-Image-Edit-2509。这一系列产品的发布,标志着中国企业在多模态大模型领域取得了突破性进展。
其中最引人注目的是Qwen3-Omni被定位为业界首个原生端到端全模态模型,可同步处理文本、图像、音频、视频输入,并支持文本与语音流式输出。
而图像编辑工具Qwen-Image-Edit-2509则直接对标谷歌近期爆火的Nano Banana(现已正式命名为Gemini 2.5 Flash Image),意味着中美AI竞赛进入新的阶段。

技术突破:端到端全模态统一处理
Qwen3-Omni的最大创新在于其原生端到端的设计架构。与传统的多模态模型不同,它不再需要在不同能力之间进行权衡取舍。该模型基于MoE(专家混合)架构与“思考者-表达者”设计,通过多码本技术实现低延迟交互。
在性能表现上,Qwen3-Omni在36项音视频基准测试中22项达到全球最新水平,32项在开源模型中领先。其语音识别与对话能力已可对标Gemini 2.5 Pro。
输入端支持文本、图像、音频和视频,输出端则支持文本和自然语音生成。这一全模态能力使得Qwen3-Omni能够更好地理解和处理复杂多模态信息。
多语言支持方面,该模型支持119种文本语言、19种语音输入语言及10种语音输出语言,包括英语、中文、法语和德语等多种语言,使其能够更好地服务于全球用户。

图像编辑革命:多图像拼接与一致性保持
此次同步推出的Qwen-Image-Edit-2509图像编辑工具,带来了行业首创的多图像编辑功能。与传统单图编辑工具不同,新版本支持“人+人”、“人+产品”和“人+场景”的组合编辑模式。
在实际应用中,这一功能使得专业级广告大片制作变得简单。商家可以轻松生成模特在不同场景的穿搭照,或者制作产品与模特的创意广告,这些曾经需要专业团队耗时数天的任务,现在只需点击几下鼠标即可完成。
更值得关注的是,Qwen-Image-Edit-2509在编辑一致性方面取得显著提升。对于人物编辑,模型能够更好地保留面部特征,支持各种肖像风格和姿势变换;对于产品编辑,则能更好地保留产品身份,支持产品海报编辑。
该工具还引入了ControlNet中广泛应用的关键点地图功能,用户可以通过多图像输入来精确控制和调整人物姿势,实现更加个性化的编辑需求。

语音合成进展:低延迟与多方言支持
阿里云同时发布了Qwen3-TTS-Flash语音合成模型,在语音稳定性和音色相似度评估中超越SeedTTS、GPT-4o-Audio-Preview等主流产品。
该模型支持17种音色与10种语言,包括多种中国方言如闽南语、吴语、粤语、四川话等。这一方言支持特性使得AI语音技术能够更好地服务于地方用户和特定场景。

性能方面,Qwen3-TTS-Flash实现了单并发首包延迟最低97ms,满并发首包延迟为420ms,这意味着用户几乎可以实时听到生成的语音,为交互式应用提供了可能。
行业背景:谷歌Nano Banana的爆发与影响
阿里此次发布并非孤立事件,而是对谷歌近期AI突破的直接回应。八月中旬,一个匿名模型以“Nano Banana”的代号悄然登陆海外AI测评平台LMArena,在图像一致性和自然语言编辑方面展现出惊人能力。
这一模型随后被证实正是谷歌的Gemini 2.5 Flash Image图像模型。在短短两周内,用户围绕Nano Banana开发出了多种创意玩法,包括多元素拼接、OOTD(今日穿搭)生成、手办设计等。
谷歌实验室总裁Josh Woodward在X平台透露,该模型全面推出后已累计完成**超2亿次图像编辑**,为Gemini吸引了超过1000万新用户。
Nano Banana的技术突破主要体现在其多模态理解、图像一致性保持和秒级响应能力上。它打破了过去“翻译官式”的传统模型局限,原生实现文本与图像的无损语义对齐与自然语言修图。
商业应用:降低成本与提升效率
AI图像编辑技术的进步正在重塑相关行业生态。据统计,使用Qwen-Image-Edit-2509后,**商家内容创作成本平均降低60%**,广告素材生成效率提升3倍以上。
更重要的是,这些工具解决了行业两大痛点:一是避免因模特档期或场地限制导致的拍摄延误,二是杜绝因设计师水平参差不齐引发的品牌视觉不统一问题。
在电子商务和数字营销领域,AI图像生成技术正成为改变游戏规则的力量。商家可以快速生成产品宣传图,网红模特可以省去画全妆、找场地、摆pose等一系列繁琐工作,大幅降低内容创作门槛。
随着Qwen-Image-Edit-2509等多图像编辑工具的出现,**多图像拼接和一致性保持能力**将为创意产业带来更多可能性,从广告设计到个人娱乐,均能找到应用场景。
随着Qwen3系列模型的开源,全球开发者社区将能够基于这些技术构建更多应用。业界认为,阿里云此举不仅展示了中国企业在多模态大模型领域的突破性进展,也为全球开发者提供了更丰富的AI工具选择。
模型已在Hugging Face、魔搭等平台开源,开发者可以立即体验这些最新技术。AI竞赛正在加速,而这一次,中国公司没有缺席。
https://github.com/QwenLM/Qwen3-Omni
https://huggingface.co/collections/Qwen/qwen3-omni-68d100a86cd0906843ceccbe