商汤开源多模态自主推理模型 SenseNova-MARS:Agentic VLM 新标杆,AI“执行能力”迎来突破

1.30 SenseNova-MARS能自动完成图像裁剪以聚焦细节进行图文搜索获取信息最后进行逻辑运算得出答案,展现了强大的端到端复杂任务处理能力

1月29日,人工智能领军企业商汤科技正式开源其最新一代多模态大模型——SenseNova-MARS(Multi-modal Agentic Reasoning and Search),提供8B与32B双版本。该模型被官方定义为首个支持动态视觉推理与图文搜索深度融合的 Agentic VLM(具身视觉语言模型),标志着AI从“被动回答”迈向“主动执行”的关键一步。

 

性能超越顶级闭源模型,树立开源新标杆

 

在多项权威多模态基准测试中,SenseNova-MARS 表现出色。其综合得分为69.74 分,不仅在开源模型中遥遥领先,更一举超越了 Google 的 Gemini-3-Pro(69.06 分)和 OpenAI 的GPT-5.2(67.64 分)等顶级闭源模型。

 

具体到细分任务,SenseNova-MARS-32B 在 HR-MMSearch 基准上取得了 54.43 分 的成绩,领先 Gemini-3-Pro 和 GPT-5.2 达 5.91 和 6.23 分;而其 8B 版本也在 MMSearch(67.84 分)和 HR-MMSearch(41.64 分)上超越了 Gemini-3-Flash 和 GPT-5 等模型。这一系列成绩确立了其在多模态搜索与推理领域的 SOTA(State-of-the-Art)地位。


2026013001

 

核心突破:赋予AI真正的“执行能力”

 

SenseNova-MARS 的核心创新在于其 Agentic(智能体)特性。与传统只能根据输入生成答案的模型不同,它能够:

 

  • 自主规划:面对复杂任务,模型能自行拆解问题,规划出最优的解决步骤。

  • 动态调用工具:在推理过程中,可灵活、精准地调用图像裁剪、图像搜索、文本搜索等多种工具。

  • 闭环完成任务:整个过程无需人工干预,实现从“看到”到“理解”再到“行动”并最终“解答”的完整闭环。

 

例如,在一个典型场景中,模型需要识别赛车服上的微小 Logo,查询该公司成立年份,匹配车手出生日期,并计算两者的时间差。SenseNova-MARS 能自动完成图像裁剪以聚焦细节、进行图文搜索获取信息、最后进行逻辑运算得出答案,展现了强大的端到端复杂任务处理能力。

 

技术原理与应用场景

 

作为 Agentic VLM,SenseNova-MARS 是模型的“眼睛”和“大脑”的结合体,不仅能描述图像内容,更能进行深度推理。其训练过程分为两个阶段:首先通过自动化数据合成引擎构建高难度案例库,让AI学习基本的多跳搜索逻辑;随后引入强化学习机制,进一步提升其在真实复杂场景中的实战能力。

 

该模型的应用前景极为广阔:

  • 行业分析:从产品发布会或行业峰会照片中,自动识别企业标志,并快速搜集相关的产品信息、公司背景及关键数据,辅助分析师洞察行业格局。

  • 赛事与媒体:从赛事图片中追溯人物、品牌背景,快速补充报道所需的细节信息。

  • 科研与验证:处理包含超长推理步骤的任务,自动裁剪分析图像细节、搜索研究数据,以快速验证科学假设。

 

开源意义与行业影响

 

在 Agentic AI 被广泛认为是 2026 年关键技术趋势的背景下,商汤选择开源 SenseNova-MARS 具有深远意义。此举不仅为学术界和产业界提供了一个强大的研究基线,也极大地推动了多模态智能体技术的普及与落地,有望加速解决当前 Agentic AI 在技术成本、组织协同等方面的落地困境。

 

综上所述,SenseNova-MARS 的发布不仅是商汤在多模态领域的重大技术突破,更是整个AI行业向具备真正“执行能力”的通用人工智能迈出的坚实一步。


Github 仓库:https://github.com/OpenSenseNova/SenseNova-MARS 

模型仓库:

32B:https://huggingface.co/sensenova/SenseNova-MARS-32B 

8B:https://huggingface.co/sensenova/SenseNova-MARS-8B