昊梵体育网

[LG]《Reflection or Re-Generation? Why LL

[LG]《Reflection or Re-Generation? Why LLM Revision Fails Where Human Revision Succeeds》Y Tao, G Friedland, M Chandrasekaran, L Kong [Amazon] (2026)

在大语言模型(LLM)优化领域,通过“自我反思(Reflection)”来纠正错误是一个被寄予厚望的范式。过去的方法受困于模型往往无法通过迭代提升准确率,甚至会出现性能退化,其本质原因是模型在缺乏外部反馈时,无法区分真伪认知,陷入了自我循环的逻辑陷阱。**

本文的核心洞见是:把 LLM 的反思过程重新看作一种“受限的重新生成(Conditioned Re-Generation)”而非真正的错误驱动型修正。由此,通过信息论分析发现,模型在客观任务中只是在进行无信息的随机重采样,而在主观任务中则会因趋向模型内部先验分布而导致预测质量的“分布扁平化”崩溃。**

这项工作真正留下的遗产是揭示了“反思”在没有外部信号输入时存在信息增益的结构性上限。它为后来者打开的新门是转向基于外部验证(如工具校验或跨智能体对齐)的修正架构,但尚未跨过的门槛是如何在不依赖昂贵外部反馈的情况下,让模型产生真正的元认知监控能力。**

arxiv.org/abs/2607.28908 机器学习 人工智能 论文 AI创造营