京东开源 EchoWM 世界模型,支持 720P 可交互视听生成

9月9日,在京东全球科技探索者大会(JDD)上,京东探索研究院发布并开源可交互视听世界模型 EchoWM,同时推出超长音视频生成模型 JoyAI-Echo1.5。JoyAI-Echo1.5基于音视频 Memory Bank,可连续生成10分钟以上内容,在480P分辨率下平均每秒生成24帧,支持自然语言驱动的故事、分镜与成片制作。EchoWM原生联合生成720P视频、环境音、音乐和语音,支持第一人称导航、第三人称摄像机及主体协同控制和多轮探索。在WBench Navigation评测中,EchoWM及EchoWM-Flash位列前两名。京东还展示了JoyAI基础模型矩阵、EgoLive真实数据及仿真工具链,并发布覆盖零售、物流、医疗、工业和政务的行业模型。

上一篇:

下一篇:

发表回复

登录后才能评论