基于大语言模型的AI天生具有不确定性,这是一把双刃剑。没有随机性,AI就成了死板和固定的规则库,缺乏创造力,但不确定性又给很多问题带来了挑战。
对于有明确结果、可验证的问题,比如数学求解与证明,软件产品调试和解决bug,由于输出的正确性可以明确验证,AI用起来效率高、效果好。
但对于开放性问题,比如软件开发和评审中,在各种功能、成本、需求、复杂性之间做取舍,如何定义边界,这些本身就是很模糊的。
如果使用者不做好把控,AI经常会天马行空,没完没了地迭代。越高级的模型,越容易自作聪明。不仅没有解决问题,还消耗了大量token。
在用Claude和Codex的实战中,我有过多次因为agent给出的方案和实现过于复杂,不得不叫停返工。
这就要求使用者提前设定好边界,引导AI的方向,知道什么时候该叫停。
如何引导AI有效地解决问题,让它快速收敛,而不是无限发散,是一门大学问。还在摸索学习中······
