商汤开源SenseNova-Vision:一套模型通吃检测、分割、深度、3D重建四大核心视觉任务

商汤开源SenseNova-Vision:一套模型通吃检测、分割、深度、3D重建四大核心视觉任务 「经典视觉任务正式并入通用大模型」目录01 现有视觉三大路线核心短板02 三大核心设计2.1 文本图像双统一输出范式2.2 SN-Vision Corpus 50M开源数据集2.3 混合任务联合微调策略03 行业横向对比04 模型核心涌现能力05 写在最后近日商汤联合多高校开源SenseNova-Vision核心突破是完全取消任务专属预测头依托通用多模态大模型原生文本、图像双生成通道将目标检测、OCR、关键点、分割、单目深度、法线、多视图重建、相机位姿等全品类视觉任务整合至同一主干。模型依靠自然语言指令切换任务输出分为结构化文本、稠密图像、图文混合三类形式对标SAM、DepthAnything、VGGT等专用SOTA综合性能持平同时开源5000万全视觉标注数据集SN-VC大幅降低通用视觉模型训练成本。这套工作核心价值是打破视觉模型碎片化开发模式为机器人、工业视觉、数字内容提供统一推理底座。01 现有视觉三大路线核心短板当下视觉方案各自存在无法兼顾的缺陷也是SenseNova-Vision的设计出发点1. 单任务专用模型SAM、DepthAnything等单任务精度顶尖但每套任务独立训练部署算力、维护成本翻倍任务间几何、物体先验无法复用新增感知需求需完整重训网络迭代周期漫长。图 | SAM2. 序列通用模型OFA、Florence-2将掩码、坐标全部转为文本序列稠密几何预测时丢失像素细节长掩码推理速度暴跌难以支撑多视图3D重建任务。图 | OFA3. 图像生成感知DICEPTION、GenCeption擅长深度、掩码类稠密输出但缺少结构化文本生成能力OCR、关键点、相机位姿这类符号化结果必须外挂专用分支语言交互拓展性弱。图 | DICEPTION三类方案均无法同时兼容文本、图像、混合三类输出SenseNova-Vision以“视觉统一为多模态生成”为核心思路补齐该缺口。图 | SenseNova-Vision整体架构总览02 三大核心设计主干基于Bagel-7B-MoT多模态模型微调不新增专属解码器仅优化数据流水线整体分为统一输出范式、SN-VC数据集、混合任务微调三部分。2.1 文本图像双统一输出范式图 | 四大任务对应图文输出形式所有视觉任务仅依托模型原生两类生成通道依靠指令区分任务无需定制损失1. 结构化文本输出检测/OCR/关键点用bboxpoint标记包裹归一化坐标以自回归文本输出损失仅采用标准交叉熵无定制约束。2. 稠密图像输出深度/单目标分割深度映射灰度图、法线分RGB三通道存储XYZ分量二进制掩码黑白输出复用模型原生VAE图像模块。3. 图文混合输出全景分割/多视图重建文本输出实例类别、色号、相机参数图像输出彩色掩码/3D点云文字承载符号信息图像保存空间像素细节。图 | 数据协议典型样例该设计天然支持语言自定义任务无需微调即可实现自定义掩码、深度约束等零样本需求。2.2 SN-Vision Corpus 50M开源数据集现有视觉数据集品类割裂团队整合70公开视觉数据源搭建统一指令式数据集SN-VC开源SN-VC-50M子集。图 | SN-VC数据规模统计图数据分为四大板块结构化2D感知323万样本、稠密几何226万、分割31万、多视图几何467万。配套定位、OCR四大自动化标注引擎针对稀疏LiDAR、多视图数据采用MoGe-2、LingBot-Depth生成稠密伪标签补齐标注缺陷。图 | 四大数据构建引擎流程图2.3 混合任务联合微调策略批次混合检测、分割、几何样本同时混入VQA、文生图数据防止微调破坏模型原生图文能力高分辨率采用SigLIP2编码器多视图随机采样10帧以内降低显存开销相机浮点数参数设计专属数值token保障预测精度。图 | 各任务训练收敛曲线训练仅两套基础损失文本交叉熵、图像整流流损失无任务专属优化项轻量化显卡即可完成微调与推理。03 行业横向对比通用视觉赛道四类方案核心差异对比1. 专用专家模型单任务精度最优但部署成本高、拓展难2. 序列统一模型轻量化但几何重建能力缺失3. 图像生成感知稠密预测强无结构化文本输出4. SenseNova-Vision唯一全覆盖文本/图像/混合输出兼顾2D感知、单目几何、多视图重建依靠多模态预训练拥有跨任务泛化能力。图 | 全品类任务定性效果汇总量化表现客观区分纸面数值与落地真实意义结构化感知COCO检测mAP与Ground DINO持平OCR、定位超越同类通用大模型稠密几何NYUv2深度指标优于Marigold仅弱于专用MoGe分割通用全景略低于SAM对话式推理分割表现领先多视图重建通用模型内第一梯队和DUSt3R专用模型存在小幅差距。指标局限测试均为规整标准数据集动态车流、极端天气、微观工业场景未纳入纸面SOTA不代表实场景效果。04 模型核心涌现能力实验重点展示跨任务泛化优势而非单纯刷榜数据1. 跨知识迁移仅训练基础分割模板依靠检测学到的坐标知识解析文本点指令完成实例分割可按语言要求为密集物体分配独立掩码。图 | 密集实例分割文本指令测试OOD2. 零样本感知训练仅日常物体对动物、陌生器械、文本描述目标均可输出精准深度与掩码证明模型掌握通用物体几何而非记忆训练纹理。图 | 文本分割定性效果图多视图3. 稳健重建室内、户外、小物体场景无需针对性适配稀疏视角下可补全缺失几何结构。图 | 多视图重建各类场景效果图实验客观短板多任务均衡带来5%~15%单任务精度损耗高密度遮挡场景易出现实例掩码合并无序图片输入重建完整性大幅下降。05 写在最后此前NLP依靠统一生成范式完成大一统视觉领域长期任务割裂SenseNova-Vision以统一多模态生成为底层逻辑不依赖任何任务专属网络一套主干通过语言指令完成数十类视觉感知任务同时开放大规模多任务数据集。对比GenCeption等单赛道通用方案该工作任务覆盖广度全面领先。该方案不会完全替代单任务SOTA但提供均衡低成本的通用视觉底座为具身智能、通用视觉基础模型开辟全新路线。参考论文Vision as Unified Multimodal Generation论文链接https://arxiv.org/pdf/2607.06560项目开源https://github.com/OpenSenseNova/SenseNova-Vision模型数据集https://huggingface.co/collections/sensenova/sensenova-vision