蚂蚁ASystem联合AReno与百灵打通本地智能体强化学习闭环

蚂蚁ASystem团队联合本地化大模型后训练工具包AReno及百灵大模型,推出轻量级后训练实践路径,在单机环境中完成Agentic RL强化学习闭环验证。该方案以井字棋为最小验证任务,基于DGX Spark对Ling-3.0-tiny模型进行后训练,通过规则奖励反馈和GSPO算法训练400步后,模型奖励均值提升、输出长度收敛,工具调用与动作选择稳定性改善。Ling-3.0-tiny已开放BF16、FP8和INT4版本,可在Hugging Face和魔搭获取。

上一篇:

下一篇:

发表回复

登录后才能评论