最新消息:关注人工智能 AI赋能新媒体运营

**Wan-Streamer v0.2发布:主打超低延迟AI实时对话**

科技资讯 admin 浏览

通义实验室发布 Wan-Streamer v0.2:550毫秒延迟实现AI"面对面"实时交流

通义实验室近日推出端到端全模态理解与生成模型 Wan-Streamer v0.2,将AI视频通话的响应延迟压缩至550毫秒,显著改善了传统实时交互中常见的卡顿、延迟和声画不同步问题。

该模型将"听、看、说、演"功能整合于单一Transformer架构,使AI能够同步处理语音、文本和视频输入,并实时生成反馈。与采用级联流水线的传统系统不同,Wan-Streamer引入流式单元设计,每160毫秒即可完成用户输入感知、状态更新及响应生成,避免了信息逐级传递造成的延迟累积。

Wan-Streamer v0.2 技术示意图

技术参数方面,Wan-Streamer v0.2的整体延迟控制在0.55秒(含网络传输),优于当前主流语音对话模型。输出画质从上一代的192×336提升至640×368,场景细节呈现更为清晰。交互形态上,AI角色从"悬浮头部"升级为具备视线、姿态、手势及环境背景的全身数字人,增强了"在场感"和交互真实度。

应用场景覆盖口语陪练、心理咨询、教育辅导、游戏NPC互动等需要实时临场感的领域。通义实验室表示,该技术通过原生流式架构与分布式推理的结合,推动AI交互向人类自然对话模式靠拢。