谷歌 DeepMind 近日推出视觉模型 GenCeption,尝试将视频生成模型改造为视觉分析引擎。该模型基于阿里巴巴开源的通义万相 Wan2.1 框架训练,可通过单一模型完成深度估计、图像分割、3D 姿态估计等五项视觉任务,并在一次前向传播中输出深度图、分割掩码和相机运动轨迹等结果。GenCeption 训练数据约为 7500 段 Blender 渲染的单人合成视频,测试显示其可处理真实多人视频,并迁移至动物、机器人等类别;小模型处理 81 帧视频约需 6 秒,140 亿参数版本约需 10 秒。