下一代AI靠什么近期重温强化学习之父萨顿关于AI第一性原理的演讲,引发不少思考。当下大模型读写、推理、调用工具的能力持续升级,但学习素材均源自人类整理完毕的图文、代码等静态数据,从未亲身感知知识诞生的完整过程,如同熟读驾驶手册却从未上路。
萨顿认为真正的智能离不开真实交互经验:AI需自主行动、接收环境反馈并迭代决策,依托世界模型预判后续变化,才能掌握静态资料无法覆盖的现实逻辑,Oak框架便是以此为核心,让智能体在试错中提炼通用规律。
人工设定奖励函数存在明显缺陷,细微偏差就会让AI钻规则漏洞,加之现实反馈滞后、试错成本高、易遗忘旧技能,导致强化学习落地受阻。
单纯堆砌算力、数据终将抵达瓶颈。下一代AI的突破口,在于突破静态文本学习,攻克持续学习、长期记忆与现实交互难题,依靠自主体验生成全新认知。

