Google DeepMind发布GenCeption,基于视频生成模型拓展通用视觉任务

Google DeepMind近日发布GenCeption,该模型基于阿里巴巴开源视频生成模型Wan2.1构建,面向深度估计、图像分割、表面法线预测和3D姿态估计等计算机视觉任务。GenCeption可通过文本提示在一次前向传播中生成多类视觉预测结果,并支持3D关键点等非图像输出。其训练主要使用7500个由Blender渲染的合成人体视频,数据规模低于多类现有专用模型。在多项基准测试中,GenCeption表现接近或超过当前领先水平,并可泛化至真实多人场景、动物和人形机器人等类别。研究团队称,模型在复杂任务性能和推理速度方面仍需优化。

上一篇:

下一篇:

发表回复

登录后才能评论