12月9日,阿里巴巴通义千问(Qwen)团队正式发布其新一代原生全模态大模型——Qwen3-Omni-Flash-2025-12-01。这一里程碑式的产品在Qwen3-Omni的基础上实现了全面升级,标志着多模态人工智能技术向更自然、更流畅、更“拟人化”的交互体验迈出了关键一步。

全模态无缝输入,实时流式输出
Qwen3-Omni-Flash的核心突破在于其对文本、图像、音频和视频等多种模态信息的“无缝”处理能力。用户不再需要将不同形式的信息分别提交给不同的模型或接口,而是可以像与真人交流一样,在一次交互中混合使用说话、发送图片、播放视频片段等多种方式。模型不仅能即时理解这些复杂的混合输入,更能以实时流式(real-time streaming)的方式同步输出高质量的文本与自然语音,极大地缩短了响应延迟,提升了交互的连贯性和沉浸感。
拟人化交互与个性化体验
此次升级不仅关注技术指标,更聚焦于用户体验的“拟人化”。据官方文档显示,Qwen3-Omni-Flash的实时版模型(qwen3-omni-flash-realtime-2025-12-01)显著增强了指令跟随能力和交互的自然度。更引人注目的是,该模型的支持音色已增加至49种,从“甜妹”到“御姐”,用户可以根据场景和偏好选择最合适的AI声音,为虚拟助手、客服、教育陪练等应用场景提供了高度个性化的可能。
在原有报道基础上,现补充关于 Qwen3-Omni-Flash-2025-12-01 的客观性能指标信息如下:
客观性能指标全面跃升
据官方披露的基准测试数据,Qwen3-Omni-Flash-2025-12-01 在多项关键任务中均取得显著进步,展现出卓越的综合能力:
逻辑推理能力:在 ZebraLogic 基准测试中,得分较前代提升 5.6 分,表明其在复杂推理和结构化思维任务上具备更强的泛化能力。
代码生成能力:在 LiveCodeBench-v6 评测中,性能提升 9.3 分;同时在 MultiPL-E 多语言编程评测中也提升了 2.7 分,体现出其对多种编程语言的理解与生成能力进一步增强。
多模态理解与生成:模型在多学科视觉问答(VQA)任务中同样表现优异,虽具体数值未完全披露,但阿里强调其“在综合写作、跨模态对齐和上下文一致性方面取得突破性进展”。

此外,该模型支持 119 种文本语言交互、19 种语音识别语言和 10 种语音合成语言,大幅拓展了其在全球化场景下的适用性。配合其实时流式架构和自适应语速、停顿与韵律调节机制,不仅性能强大,交互体验也更接近真人水平。
商业化落地与普惠定价
在推动技术前沿的同时,阿里也加速了该模型的商业化进程。据公开信息,Qwen3-Omni-Flash的API服务已正式上架,定价低至1元起,旨在降低全模态AI技术的应用门槛,赋能广大开发者和企业快速构建下一代智能应用。
Qwen3-Omni-Flash-2025-12-01的发布,不仅是阿里在大模型领域技术实力的又一次集中展现,更预示着人机交互方式正从“命令-响应”模式向“自然对话”模式深刻变革。随着全模态能力的成熟与普及,一个更加智能、便捷、人性化的数字未来正加速到来。