字节 Seed 团队发布音视频全双工大模型 SeedRealtime,采用统一端到端架构,原生融合音频、视频与文本能力,支持“边看、边听、边说”的实时自然交互。该模型已在豆包 App 全量上线。相比传统“听、转写、思考、表达”的级联方案,SeedRealtime 将音视频感知与表达整合至同一模型,可直接接收画面和声音并生成回应,降低对话中抢话、突兀停顿和答非所问等节奏问题。
字节 Seed 团队发布音视频全双工大模型 SeedRealtime,采用统一端到端架构,原生融合音频、视频与文本能力,支持“边看、边听、边说”的实时自然交互。该模型已在豆包 App 全量上线。相比传统“听、转写、思考、表达”的级联方案,SeedRealtime 将音视频感知与表达整合至同一模型,可直接接收画面和声音并生成回应,降低对话中抢话、突兀停顿和答非所问等节奏问题。