【科学家发现,AI可能会“走捷径”】如今,大语言模型已经能完成复杂问答、数学推理等任务,但它的答案究竟来自真正的推理,还是对训练数据规律的巧妙匹配?这是AI可靠性研究中的重要问题。
近日,中国科学院合肥物质科学研究院等团队在大模型强化学习与推理可靠性方面取得进展。研究发现,在仅依据最终答案进行奖励的强化学习中,模型容易倾向于学习数据中的表面相关性,而不一定形成稳定的推理过程。
为解决这一问题,研究人员对比了结果奖励模型(ORM)和过程奖励模型(PRM)。其中,ORM只关注最终结果是否正确,而PRM会对模型推理过程中的每一步进行评价,通过更细致的反馈,引导模型形成更可靠的推理链条。
研究表明,单纯增加训练数据规模,并不能从根本上消除模型推理中的脆弱性,对推理过程进行结构化监督,是提升模型可靠性的重要方向。
此外,团队还提出了大模型强化学习评测基准体系——棱镜基准OPG-D3,用于测试模型在难度提升、数据分布变化和反事实情境下的泛化能力,帮助发现模型在陌生环境中的不足。
这项研究表明,大模型能力的提升不仅依赖更大的参数规模和更多的数据,也需要更合理的训练目标和更科学的评测方法,让AI不仅“答对”,还能具备更加可靠的推理能力。中国科普博览
