最新消息:关注人工智能 AI赋能新媒体运营

京东开源视频实时编辑模型:30帧秒级推理,支持"边看边改"

科技资讯 admin 浏览

京东开源实时流式视频编辑模型 JoyAI-Video-Edit,实现"边播边改"

京东近日宣布,将其自研实时流式视频编辑模型 JoyAI-Video-Edit 正式开源。该模型支持用户在视频播放过程中实时修改人物与场景,将传统"先准备素材再后期编辑"的工作流转变为可实时互动的创作模式。京东方面表示,在流式实时视频编辑领域,该模型核心指标全面领先于当前业内代表性方案,达到世界一流水平。

视频实时编辑的核心瓶颈在于处理速度。视频由连续画面帧构成,若模型推理速度跟不上播放速度,便会产生卡顿与延迟。JoyAI-Video-Edit 基于全自研的 JoyAI-Video 模型,在 720P 分辨率下实现了每秒 30 帧的推理速度,能够在保持较高画面清晰度的同时,匹配常见影视视频的播放节奏。

除速度外,视频长度也是流式编辑的关键挑战。此前同类模型通常只能处理数秒或分钟级片段,而 JoyAI-Video-Edit 支持任意时长的稳定流式编辑,可随视频持续播放进行持续处理。用户无需等待整段视频生成完毕,即可在播放过程中实时修改场景、替换物体、调整人物形象或改变画面风格,真正实现"边观看边创作"。

评测全面领先,四类编辑任务优势显著

为验证模型能力,研究团队将 JoyAI-Video-Edit 与 SANA Streaming、LiveEdit、Xmax-X2.0 等国际代表性流式视频编辑模型进行了对比。结果显示,在覆盖典型视频编辑场景的评测数据中,该模型整体效果全面领先。

在业界广泛认可的 OpenVE-Bench 通用评测基准中,JoyAI-Video-Edit 超越了现有全部流式编辑方法,尤其在全局风格迁移、局部替换、局部删除和字幕编辑四类任务中优势突出。具体应用场景包括:让人物连续更换服装、将直播画面中的普通街道实时转换为动画风格,以及在家装设计中快速尝试不同的家具、墙面和灯光方案等。

拓展至具身智能,助力机器人训练数据合成

值得注意的是,JoyAI-Video-Edit 的技术路径还可延伸至具身智能领域,用于大规模合成机器人训练数据。机器人训练依赖大量物体抓取、搬运与操作视频,但真机数据采集成本高昂,且危险或罕见场景难以重复获取。

凭借对场景、物体与画面内容的可控编辑能力,该模型可将人手操作视频转化为机械手或机械臂操作素材,在保留物体位置、空间关系与动作轨迹的前提下,替换场景、物体与机器人形态,从而由单一视频扩展出丰富的训练样本。从视频创作工具到机器人训练数据合成平台,JoyAI-Video-Edit 的开源或将为多个领域带来新的可能性。

JoyAI-Video-Edit 模型示意图