在通用人工智能能力飞速发展的今天,一个关键的短板始终限制着AI与物理世界的深度交互:空间理解与推理能力。11月10日,人工智能软件公司商汤科技正式发布并开源其SenseNova-SI系列空间智能大模型,旨在填补这一关键空白,并宣称其在多项权威评测中不仅大幅领先同类开源模型,甚至超越了GPT-5和Gemini 2.5 Pro等国际顶尖闭源模型。
当前,尽管以GPT-5和Gemini 2.5 Pro为代表的行业领先大模型在知识问答、文本创作、逻辑推理和编程等任务上展现出卓越能力,但它们在理解和推理三维空间结构方面仍存在明显不足。商汤科技指出,这种空间智能恰恰是未来具身智能体(如机器人)与现实世界进行有效交互所必需的核心基础能力。
为解决这一行业痛点,SenseNova-SI系列模型应运而生。该系列目前包含2B和8B两个参数规格的模型,并同步开源了名为“EASI”的空间智能测评平台及“英雄榜”,以推动该领域的技术标准化和生态发展。
官方评测数据揭示了SenseNova-SI,特别是其8B版本的显著优势。在VSI、MMSI、MindCube、ViewSpatial这四个专门用于评估空间智能的权威基准测试中,SenseNova-SI-8B取得了60.99的平均分。
这一成绩的含金量极高:
对开源模型:它大幅领先于Qwen3-VL-8B(40.16)、BAGEL-7B(35.01)等通用多模态模型,也超越了SpatialMLLM(35.05)、ViLaSR-7B(36.41)等专为空间任务设计的模型。
对闭源巨头:更为引人注目的是,它以相对轻量的8B参数规模,实现了对GPT-5(49.68)和Gemini-2.5-Pro(48.81)等顶级闭源模型的超越。

这些基准测试涵盖了从物体方位判断、移动方向预测到复杂三维空间关系推理等多种任务。例如,VSI-Bench评估模型在真实室内场景视频中对空间关系的感知、理解和记忆能力,而MindCube则通过一系列精心设计的问题,测试模型在有限视角下构建心理空间模型的能力。
商汤科技强调,SenseNova-SI所展现的并非简单的性能提升,而是在空间智能领域实现了“质的突破”。这一突破为未来AI在机器人导航、自动驾驶、AR/VR、工业设计等需要深度理解物理空间的领域铺平了道路,标志着AI向真正理解并与三维世界交互迈出了关键一步。