商汤发布并开源SenseNova-Vision:一个模型统一四大视觉任务,全面超越Vision Banana

7.13 不同于行业以往将检测分割深度预测等多个专家模型打包封装的拼凑式统一,SenseNova-Vision的核心变革是让视觉成为通用基础模型的原生能力,彻底融入大模型体系,所有经典视觉任务由此实现原生统一

商汤科技今日正式发布并全面开源日日新SenseNova-Vision理解生成统一视觉大模型。不同于行业以往将检测、分割、深度预测等多个专家模型打包封装的“拼凑式统一”,SenseNova-Vision的核心变革是让视觉成为通用基础模型的原生能力,彻底融入大模型体系,所有经典视觉任务由此实现原生统一。

61564417532

一、核心理念:从“拼凑式统一”到“原生统一”

传统视觉AI的路径是“一个任务对应一个模型”,目标检测、图像分割、深度预测由不同专家模型各自负责,彼此割裂。行业虽存在所谓“统一视觉”,实则仍是多个模型打包封装,推理时各自为战。

SenseNova-Vision首次将全部视觉任务统一表述为通用基础模型可理解的多模态生成问题——不需要为不同任务设计专属预测头,直接在同一个共享表征空间内对文本、像素、语义信息和几何特征进行统一建模。

这种“原生融入”带来双向增益:视觉领域几十年高质量数据直接提升大模型底座的视觉理解能力;大语言模型的推理能力反过来让视觉任务融会贯通,甚至能用语言直接定义新视觉任务。

二、单模型横扫四大视觉任务

在多项权威评测中,SenseNova-Vision以“单模型”在四大核心视觉领域大范围领跑,比肩甚至超越了各领域的专用“专家模型”:

1. 结构化视觉理解:在目标检测、指代检测(Referring)、OCR、关键点定位等任务上全面领先同类型通用模型,稠密小目标检测和长尾类别识别等复杂场景表现尤为突出。

2. 稠密几何预测:深度估计、表面法向(Surface Normal)估计精度达到几何专用模型水准,室内外多场景下均保持极高稳定性。

3. 分割能力:涵盖通用分割、推理分割(Reasoning Segmentation)、交互式分割等,在推理分割与对话式分割(GCG Segmentation)表现上尤为惊艳。

4. 多视角3D几何:仅凭单模型即可高质量完成多视角点云重建与相机位姿估计,性能在通用视觉路线中处于领先位置。

3001967668649

三、全面超越Vision Banana,代际优势明显

横向对比中,SenseNova-Vision展现出对语义导向模型(如Youtu-VL等)的全面领先,对生成导向模型Vision Banana则展现出全面的代际优势:

  • 核心指标超越:在各项权威评测中,绝大多数指标上实现对Vision Banana的超越与领跑。

  • 任务能力倍增:Vision Banana仅能应对四大核心板块中的“两类”问题,SenseNova-Vision却能同时覆盖结构化理解、稠密几何、全景分割、多视角3D等全任务。

以深度估计为例,SenseNova-Vision在NYUv2数据集上δ₁指标达98.1,远超Vision Banana的94.8;在表面法向估计上,NYUv2数据集平均误差低至14.4,优于对手的17.8。

四、复杂场景实测:看穿镜面反射,突破视觉错觉

SenseNova-Vision展现出惊人的泛化能力:

  • 零样本泛化:面对训练集从未出现的游戏画面,无需针对性重训即可同时处理表面法向、实例分割及关键点检测。

  • 超稠密物体分割:对高度重叠的鱼群、羊群或货架商品,能像外科手术般精准剥离每个独立个体。

  • 看穿镜面反射:在包含镜子、玻璃的复杂室内环境中,能自动过滤反射误导,准确估计物体真实空间方向与深度。

  • 突破视觉错觉:对借位摄影等视觉错觉图像,能准确抠出被遮挡物体的完整轮廓,输出正确的表面法向估计。


五、全面开源,推动多模态AI普惠

商汤同步开源了包含5000万条高质量样本的视觉指令语料库SenseNova-Vision Corpus-50M,大幅降低视觉AI应用门槛。模型已在GitHub、Hugging Face、魔搭社区等平台全面开源。

商汤在视觉AI领域已连续十年蝉联中国市场份额第一,2025年首次登顶视频分析赛道全球市场份额第一。SenseNova-Vision将这一领先视觉能力融入统一多模态大模型体系,实现从“执行工具”向“世界理解模型”的本质蜕变。

未来,SenseNova-Vision核心技术将全面融入日日新U系列大模型。

SenseNova-Vision的价值不在单项指标登顶,而在于证明了“一个模型统一所有视觉任务”是可行的。当大语言模型的推理能力与视觉任务的原生统一深度结合时,视觉AI从“执行工具”向“世界理解模型”的跨越正在成为现实。对于一个已连续十年领跑中国视觉AI市场的公司而言,这次开源的意义在于:它不再只是自己跑得快,而是为整个行业铺设了一条新路。

开源地址:
https://github.com/OpenSenseNova/SenseNova-Vision