阿里通义发布并开源 Qwen3-VL-Embedding 与 Qwen3-VL-Reranker 模型,开启多模态检索新范式

1.9 随着AI应用从单模态问答迈向多模态智能体,阿里通义正通过持续开源与技术创新,加速推动AI能力从实验室走向千行百业的真实场景

1月8日,阿里通义实验室正式发布并开源两款专为多模态信息检索设计的全新模型——Qwen3-VL-Embedding 与 Qwen3-VL-Reranker。这两款模型基于此前广受关注的 Qwen3-VL 多模态基座构建,旨在实现对文本、图像、视频等异构内容的统一语义理解与高效检索,标志着阿里在多模态 AI 基础设施领域的又一次重要突破。

 

面向真实场景的多模态检索能力

 

在当前 AI 应用日益依赖跨模态交互的背景下,如何高效、精准地从海量图文音视频数据中检索出相关内容,成为技术落地的关键瓶颈。Qwen3-VL-Embedding 作为一款多模态向量嵌入模型,能够将不同模态的内容映射到统一的高维语义空间中,从而支持“以图搜文”“以文搜视频”等复杂检索任务。而 Qwen3-VL-Reranker 则在此基础上进一步优化排序质量,通过细粒度语义匹配对初步检索结果进行重排序,显著提升最终输出的相关性与准确性。


2026-01-09_101923_374

 

卓越的技术性能与灵活的模型选型

 

在技术性能方面,Qwen3-VL 系列检索模型展现了强大的竞争力。其 Embedding 模型在 MMEB-v2 和 MMTEB 等权威多模态检索基准测试中取得了业界领先的成绩。特别是 Qwen3-VL-Embedding-8B版本,已达到当前开源模型中的顶尖水平(state-of-the-art),甚至超越了部分闭源商业服务的性能表现。


2026-01-09_101021_046
Qwen3-VL-Embedding 在 MMEB-v2 和 MMTEB 评测集上的性能对比

 

为满足不同应用场景的需求,阿里提供了灵活的模型尺寸选择。整个系列包含0.6B(轻量版)、4B(平衡版)和 8B(高性能版) 三种参数规模,开发者可根据算力预算和精度要求进行选择。此外,模型还支持表征维度自定义和指令适配优化,进一步提升了部署的灵活性和特定任务的性能。

 

在训练方法上,模型采用了三阶段架构,结合了对比学习与监督微调,有效提升了模型的泛化能力和检索效率。值得一提的是,虽然该系列模型专注于多模态任务,但其文本能力同样不俗,在 MTEB等纯文本基准上也表现出色,并且支持多达119 种语言,为全球化应用提供了坚实基础。

 

开源普惠,推动产业落地

 

延续阿里通义一贯的开源策略,Qwen3-VL-Embedding 与 Qwen3-VL-Reranker 均以免费、可商用的形式向全球开发者开放。用户可通过魔搭(ModelScope)社区及 Hugging Face 平台直接下载模型权重与配套工具链。此举不仅大幅降低了企业构建多模态搜索、智能客服、内容审核、电商推荐等系统的门槛,也为学术界提供了高质量的研究基座。

 

值得注意的是,这是业界首次在开源体系中同时提供成对的多模态 Embedding 与 Reranker 模型,形成端到端的检索解决方案,被业内称为“多模态检索双子星”。

 

技术生态持续完善

 

此次发布是 Qwen3-VL 系列生态的重要延伸。此前,阿里已陆续开源 Qwen3-VL 的 2B、4B、8B、32B 等密集型模型及 MoE 架构变体,并提供 Thinking 与 Instruct 版本,覆盖从边缘设备到云端超大规模推理的全场景需求。新增的 Embedding 与 Reranker 模型将进一步强化该系列在多模态理解、生成与检索三大核心能力上的闭环布局。

 

随着 AI 应用从“单模态问答”迈向“多模态智能体”,阿里通义正通过持续开源与技术创新,加速推动 AI 能力从实验室走向千行百业的真实场景。Qwen3-VL-Embedding 与 Reranker 的推出,不仅填补了开源多模态检索领域的关键空白,也为构建下一代智能搜索引擎、数字助理和内容平台奠定了坚实基础。


GitHub 仓库:
https://github.com/QwenLM/Qwen3-VL-Embedding 

魔搭 ModelScope:
https://modelscope.cn/collections/Qwen/Qwen3-VL-Embedding 

https://modelscope.cn/collections/Qwen/Qwen3-VL-Reranker