商汤开源多任务视觉模型 SenseNova-Vision-7B-MoT

商汤科技宣布开源多任务视觉模型 SenseNova-Vision-7B-MoT,为视觉理解和 GUI 智能体开发提供基础能力。该模型参数规模为 7B,统一集成目标检测、OCR、深度估计、法线估计、图像分割和多视图处理等视觉任务,并支持通过自然语言定义新的任务变体。商汤同时开放模型权重、包含 5000 万个样本的 SenseNova-Vision 语料库子集及复现工具包。相关技术细节、代码仓库和演示已上线 Hugging Face 与 GitHub。

上一篇:

下一篇:

发表回复

登录后才能评论