后来发现,这不是一个简单的“哪个模型更固执”的问题。2023 年 FlipFlop 实验测试 10 个 LLM、7 类任务,只加一句类似“Are you sure?”的追问,模型平均 46% 会改变答案,最终准确率平均下降 17%。2024 年 TACL 对 self-correction 的综述也发现,一般任务里,仅靠 prompted LLM 自己产生 feedback,并没有可靠证据证明能稳定纠错;有可靠 external feedback 时才明显更靠谱。
更反直觉的是,ACL 2026 甚至专门研究了 overthinking:reasoning token 越多,边际收益会下降,有些模型会继续想,然后放弃之前已经正确的答案。
但我也不想得出“第一反应最好”的结论。人类研究刚好发现 first-instinct fallacy:考试里多数修改其实是错改对。
所以问题慢慢变成了另一个东西。一个可靠的 AI,到底应该多坚持,还是多反思?好像都不是。它真正缺的是一套 revision rule:什么证据有资格让我改主意,什么时候只是另一种 preference,什么时候根本应该停止 review。
这也让我重新理解 harness。reviewer 越多未必越安全。如果每一轮都强迫它“找出问题”,最后 trade-off 也会被包装成 bug。
也许未来 agent 很重要的一项能力,不是无限 thinking,而是知道什么时候已经可以不想了。










