最新消息:关注人工智能 AI赋能新媒体运营

字节推出SeedRealtime:音视频全双工大模型上车豆包,实现边看边听边说实时交互

科技资讯 admin 浏览

字节Seed团队推出SeedRealtime:音视频全双工大模型已在豆包App全量上线

字节跳动Seed团队正式发布SeedRealtime,一款采用统一架构的原生多模态大模型,将音频、视频与文本处理能力融为一体,支持"边看、边听、边说"的实时自然交互。目前该技术已在豆包App完成全量上线,标志着音视频全双工技术首次实现规模化落地。

与业界常见的级联方案不同,SeedRealtime的核心突破在于架构层面的原生设计。传统级联系统通常采用"听—转写—想—说"的分段式流程,感知与表达分属不同模块,容易导致对话节奏失调;而SeedRealtime将音视频的感知与表达整合进同一个端到端模型,使模型能够同时接收画面与声音输入,并直接生成回应。据官方数据,这一设计让音视频对话中的说话节奏问题减少了一半,有效缓解了抢话、停顿突兀、答非所问等常见割裂现象。

在实时交互的"分寸感"方面,该模型表现出更接近人类对话的特征:既能主动提醒,也能自然停顿,留出恰当的对话间隙,而非机械式地一次性输出全部内容。这一特性为全模态智能助手的发展提供了新思路——不再依赖多个单模态模型的管道式拼接,而是让单一模型同时具备视觉、听觉与语言生成能力。