美团龙猫大模型团队宣布开源商用级数字人视频生成模型LongCat-Video-Avatar1.5。该模型在唇形同步、长视频稳定性、多人交互及物理一致性等方面提升显著,并通过引入Whisper-large音频编码器、多阶段数据增强及GRPO对齐机制,优化复杂场景表现与手部细节。技术上采用分布匹配蒸馏,将生成步数由50步压缩至8步,结合共享模型与LoRA架构,推理效率提升约15倍,生成10秒视频约需1分钟。评测显示,其在用户偏好、稳定性及音视频一致性等指标上优于多款主流模型。
美团龙猫大模型团队宣布开源商用级数字人视频生成模型LongCat-Video-Avatar1.5。该模型在唇形同步、长视频稳定性、多人交互及物理一致性等方面提升显著,并通过引入Whisper-large音频编码器、多阶段数据增强及GRPO对齐机制,优化复杂场景表现与手部细节。技术上采用分布匹配蒸馏,将生成步数由50步压缩至8步,结合共享模型与LoRA架构,推理效率提升约15倍,生成10秒视频约需1分钟。评测显示,其在用户偏好、稳定性及音视频一致性等指标上优于多款主流模型。