昊梵体育网

Agentic RL 系列(中):SkillRL

大家好,我是居丽叶。
上一篇我们讲了 Agentic RL 的训练闭环:模型在环境里执行 Action,产生 Trajectory,Verifier 给出 Reward,训练算法再把反馈写回策略。