通义实验室发布 Wan-Streamer v0.2,AI 实时对话延迟降至 550 毫秒

通义实验室推出端到端全模态理解与生成模型 Wan-Streamer v0.2,面向实时 AI 视频交互场景。该模型将“听、看、说、演”整合在单一 Transformer 架构中,支持语音、文本和视频输入的实时理解与反馈,整体响应延迟约 550 毫秒,包含网络传输时间。新版本引入流式单元机制,可在每 160 毫秒内完成感知、状态更新和响应生成,并将输出分辨率由 192×336 提升至 640×368。Wan-Streamer v0.2 还支持全身数字人形象,可呈现视线、姿态、手势及环境信息,适用于口语陪练、教育辅导、心理咨询和游戏 NPC 互动等场景。

上一篇:

下一篇:

发表回复

登录后才能评论