11月11日,百度正式开源其最新多模态大模型——ERNIE-4.5-VL-28B-A3B-Thinking,标志着其在视觉语言融合与智能推理领域迈入新阶段。该模型在继承ERNIE-4.5-VL-28B-A3B强大基础能力的同时,重点强化了“深度思考”与“图像理解”能力,尤其在文档解析、图表理解和跨模态推理方面表现突出。
尽管模型总参数量高达280亿(28B),但得益于混合专家(MoE)架构设计,其实际激活参数仅为30亿(3B),大幅降低推理成本的同时,仍保持优异性能表现,真正实现了“轻量高效”。这种架构不仅提升了计算资源的利用效率,也为实际部署和应用场景提供了更强的灵活性。在多项基准测试中评估了模型的性能,与Gemini-2.5-Pro和GPT-5-High这些顶级大模型进行了对比,结果表明该模型仅凭3B激活参数就能达到相当不错的水平。

此次发布的最大亮点在于“图像思考”(Image Thinking)创新能力的引入。不同于传统多模态模型仅能对图像进行识别或描述,ERNIE-4.5-VL-28B-A3B-Thinking能够像人类一样对图像进行“思考式”处理——例如自由放大或缩小图像区域以捕捉细节信息,并结合上下文进行深度推理。此外,模型还具备工具调用能力,可执行如图片搜索、区域聚焦等操作,显著拓展了多模态交互的边界。
据公开信息显示,该模型已在海量高质量视觉-语言数据上进行了充分训练,在多项多模态理解基准测试中展现出领先水平。其开源发布,不仅为学术界和产业界提供了高性能的多模态基础模型选项,也进一步推动了“具身智能”与“视觉推理”技术的发展。
随着ERNIE-4.5-VL-28B-A3B-Thinking的推出,百度文心大模型体系在多模态领域的布局日趋完善,为智能办公、教育、医疗、自动驾驶等多个场景提供了更强大的AI底座。
项目地址:
https://www.modelscope.cn/models/PaddlePaddle/ERNIE-4.5-VL-28B-A3B-Thinking