DeepMind发布GenCeption:视频生成模型跨界挑战计算机视觉经典任务
Google DeepMind近日推出名为GenCeption的新模型,首次证明预训练视频生成模型可直接用于深度估计、图像分割、3D姿态估计等传统计算机视觉任务,且在多项基准测试中达到或接近当前领先水平。更值得注意的是,该模型所需训练数据量远低于现有专用视觉模型。
当前计算机视觉领域仍由任务专用模型主导——Segment Anything负责分割,Depth Anything专攻深度估计,各任务架构相互独立。DeepMind团队认为,大型文生视频模型在训练过程中已习得场景空间结构、物体运动规律及语言-视觉关联,具备成为通用视觉基础模型的潜质。
GenCeption基于阿里巴巴开源的Wan2.1视频模型构建,通过精简架构实现单次前向传播完成视觉任务预测。模型可根据文本提示,从同一视频中同步生成深度图、表面法线、分割掩码及姿态估计结果,并借助可训练模块输出3D关键点等非图像数据。
训练数据方面,GenCeption仅使用约7500个合成视频——由800个人体模型搭配200组动作序列经Blender渲染而成。即便如此,该模型在深度估计、表面法线预测、3D姿态识别、语言引导分割等任务中表现优异,训练数据量仅为部分现有模型的1/7至1/500。
泛化能力是另一亮点。尽管训练数据仅限单人合成人体视频,GenCeption却能处理真实场景中的多人交互、动物、人形机器人等未见过类别,生成细节丰富的视觉预测。
团队也坦承局限:多任务联合训练对复杂任务性能存在负面影响,推理效率亦有待提升——目前处理81帧视频约需6至10秒。
GenCeption的问世标志着视频生成模型正从内容创作工具向视觉理解基础设施演进。如何让生成式模型建立更可靠的物理认知与现实反馈机制,仍是AI研究的核心挑战。