7月9日,蚂蚁灵波宣布开源 LingBot-Video,称其为全球首个基于 MoE 架构、面向具身智能的开源视频生成基础模型。该模型采用 DiT+MoE 设计,30B 总参数生成时约激活 3B 参数,推理效率较同等规模 Dense 架构提升约 3 倍。LingBot-Video 引入约 7 万小时具身数据,并通过强化学习对齐物理合理性和任务完成度。在 RBench 基准上,其总分达 0.620,超过 Wan2.6、Seedance1.5Pro 等模型,可用于机器人动作预测、仿真数据生成和世界模型研究。