7月16日,小米发布面向真实移动操作任务的具身智能基底模型 Xiaomi-Robotics-1。该模型在预训练阶段使用10万小时由 UMI 设备采集的真实世界轨迹数据,覆盖家庭、商业、工业等场景,并通过视觉语言模型完成自动标注;后训练阶段引入约1万小时跨本体数据,实现本体与指令对齐。模型提供2B、5B、10B三种版本,实验显示其动作预测精度和未见场景任务成功率随数据量和模型规模提升而增长,并在 RoboCasa365、RoboDojo 等公开仿真基准刷新 SOTA 纪录。
7月16日,小米发布面向真实移动操作任务的具身智能基底模型 Xiaomi-Robotics-1。该模型在预训练阶段使用10万小时由 UMI 设备采集的真实世界轨迹数据,覆盖家庭、商业、工业等场景,并通过视觉语言模型完成自动标注;后训练阶段引入约1万小时跨本体数据,实现本体与指令对齐。模型提供2B、5B、10B三种版本,实验显示其动作预测精度和未见场景任务成功率随数据量和模型规模提升而增长,并在 RoboCasa365、RoboDojo 等公开仿真基准刷新 SOTA 纪录。