9月17日,小米MiMo大模型团队负责人罗福莉在X平台公开MiMo-V2.6强化学习训练进展,并上线实时训练页面,展示训练进度、Token消耗和成本指标。MiMo-V2.6正进行大规模多任务Agent RL实验,单步约20亿Token,采用完全异步并行、混合多框架环境及组内信用分配评估机制。截至披露时,Pro版训练约1天19小时、成本89万美元,Flash版约1天14小时、成本39.7万美元;相关技术细节计划未来数周逐步开源。
9月17日,小米MiMo大模型团队负责人罗福莉在X平台公开MiMo-V2.6强化学习训练进展,并上线实时训练页面,展示训练进度、Token消耗和成本指标。MiMo-V2.6正进行大规模多任务Agent RL实验,单步约20亿Token,采用完全异步并行、混合多框架环境及组内信用分配评估机制。截至披露时,Pro版训练约1天19小时、成本89万美元,Flash版约1天14小时、成本39.7万美元;相关技术细节计划未来数周逐步开源。