南洋理工等:不需复杂流程实现skill自进化
Motivation
如何在不更新基础大模型权重的情况下,通过自动修改技能文档、提示词、工具说明和执行规则,让Agent在具体任务上持续变强。以往方法如SkillOpt会引入复杂机制,随着基础模型变强,这些复杂优化拓扑可能不是必要的,甚至会阻碍模型直接从执行日志中发现问题。
贡献:
提出SkillOpt-Lite,把每条Agent执行轨迹保存为独立文本文件,让优化器模型像代码助手一样用文件系统工具浏览日志、发现共性失败模式、直接编辑技能文件,再用独立验证集决定是否接受修改。其核心贡献是证明:Agent自进化的最小有效管线不是复杂反思树,而是“轨迹文件化 + 共性错误挖掘 + 独立验证门控”。
skill优化化为一种零阶优化:技能文件是待优化变量,Agent运行环境返回任务得分和执行日志,优化器不能对文本技能直接求梯度,只能根据运行反馈进行修改。作者进一步指出,技能优化与传统零阶优化的关键差异在于:传统零阶优化只能看到标量分数,而Agent rollout会产生可读的、语义丰富的执行轨迹,包括计划、失败步骤、环境状态和错误日志。因此,技能优化更像“程序编译与调试”,而不是盲目的黑盒搜索。
论文提出(1)不能过拟合单条失败轨迹,而要从多条轨迹中挖掘共性失败模式。(2)候选skill必须通过独立验证集筛选,不能在训练失败样本上自我确认。(3)随着基础模型变强,应减少人为设计的复杂拓扑,让模型直接查看原始日志和文件。
SkillOpt-Lite:每轮rollout后,将每条轨迹保存为单独文件;优化器用shell/list/read等工具浏览目录,选择高价值失败样本;它总结跨任务共性错误,并对技能文件做最小修改;最后在独立验证集上测试,提升则接受,否则拒绝。
论文还将这一思想扩展到HarnessOpt:优化目标不应局限于markdown技能,也可以修改Agent harness代码。
结论:
随着基础模型能力增强,Agent自进化不一定需要越来越复杂的反思拓扑。更有效的方向可能是把技能、轨迹、错误日志和harness都作为可读写文件,让模型以代码调试方式直接定位共性失败模式,并通过独立验证集约束过拟合。
LLM howto手搓skill skill 大模型 智能体开发 agent 智能体

