商汤开源SenseNova-Vision统一视觉大模型及5000万样本语料库

商汤科技发布并开源“日日新SenseNova-Vision”理解生成统一视觉大模型,作为日日新大模型体系的视觉能力升级。商汤称,该模型以单一模型覆盖结构化视觉理解、稠密几何预测、全景分割、多视角3D等核心任务,在目标检测、OCR、关键点定位、深度估计、表面法向估计、交互式分割等评测中表现领先,并可完成多视角点云重建和相机位姿估计。商汤同时开源包含5000万条样本的视觉指令语料库SenseNova-Vision Corpus-50M,后续将把相关技术融入日日新U系列大模型。

上一篇:

下一篇:

发表回复

登录后才能评论