问题不只是“推理不够强”:训练数据怎么写、长轨迹占多少、教师与学生是否共享知识,都会改变最终能力。
中科院自动化所团队构建了一个可控的多轮规划环境,系统拆解长程规划从预训练到后训练的形成过程,得到几条很实用的规律:
🔷 先建世界模型再行动:显式预测状态转移,比直接模仿动作更能泛化到长任务;实验中,长程任务的 avg提高45.8个百分点。
🔷 原子技能不会自动组合:只学1—5步任务时,模型短程 pass达93.12%,中程仅0.83%,长程为0;加入少量长轨迹后,长程能力明显出现。
🔷 劣质轨迹会被长链条放大:局部错误不断累积,长程性能比短程下降得更快。
🔷 规划模式适合RL,陌生知识未必适合蒸馏:理想教师下,OPD 的逐Token监督比GRPO的终局奖励覆盖更困难的训练区域;但若师生掌握不同任务路径,强行蒸馏反而可能破坏学生原有世界模型。
🔷 多教师融合取决于模式是否兼容:存在共享结构时,MOPD能迁移和持续学习;完全冲突时则会产生灾难性遗忘。
它真正提供的不是一个更大的Agent模型,而是一张“训练方法适用边界图”:长程能力首先依赖高质量预训练和少量完整长轨迹,后训练更适合筛选已有模式,而不擅长凭空注入大量新知识。
推荐做Agent训练、轨迹合成和RL后训练的研究者阅读,已经上传到附件了~ 感兴趣的同学自取👇🏻




