谷歌 DeepMind 推出 GenCeption:单一模型实现五项视觉任务
谷歌 DeepMind 团队近日发布全新 GenCeption 模型,将视频生成 AI 逆向改造为深度理解现实世界的视觉分析引擎。该模型打破以往分割与深度估计等任务各自独立的传统架构,仅凭单一模型即可同时完成深度估计、图像分割、3D 姿态估计等五项核心视觉任务。
GenCeption 基于阿里巴巴开源的通义万相 Wan2.1 框架训练,通过单次前向传播完成预测,显著提升处理效率。用户仅需输入简单文本提示,模型即可输出深度图、分割掩码及相机运动轨迹等多元信息。
7500 段合成数据训练,泛化能力惊艳
值得关注的是,GenCeption 的训练数据仅包含约 7500 段 Blender 渲染的单人合成视频。但该模型展现出极强的泛化能力,不仅能处理真实场景中的多人视频,还可迁移至动物与机器人类别。
在实测表现中,小模型处理 81 帧视频耗时约 6 秒,140 亿参数的大模型也仅需 10 秒左右。其细节还原度甚至超越训练用的合成原图,猫胡须、单根发丝等细微边缘均能清晰保留。