⏶33
SkillOpt-Lite:通过一行Vibe实现更好更快的智能体自我进化
发表
由
Yifei Shen 提交
作者: Yifei Shen, Bo Li, Xinjie Zhang
摘要
AI 生成总结
通过零阶优化形式化,提出了一种技能优化的最小可行管道,通过轨迹探索、共识挖掘和验证门控原则,在消除冗余的同时保持收敛性和泛化能力。尽管自主智能体的技能优化已受到关注,但现有方法依赖于复杂的流程。这留下了一个未解决的根本问题:什么构成了一个最小可行技能优化流程,其中每个组件都由理论或经验必要性所证明?我们通过零阶(ZO)优化来形式化技能优化,将经典对应物(中心差分、信任域)映射到最新文献。值得注意的是,与经典ZO中的盲目数值扰动不同,技能轨迹可作为可解释的调试反馈。基于Claude Code理念和PAC学习,我们建立了收敛和泛化的三个原则:基于文件系统的轨迹探索、共识属性挖掘和独立验证门控。我们消除了冗余,提出了SkillOpt-Lite。它加速了收敛并超越了完整的SkillOpt:在GPT-5.5上将LiveMath提高了+8.8分,在GPT-5.4-nano上提高了+25.4分,使nano模型能够超越经SkillOpt优化的标准GPT-5.4。最后,我们将我们的框架集成到VSCode Copilot等生产级编码智能体中,使开发人员能够通过一行“vibe”代码来演进智能体技能。由于我们的框架将所有智能体组件都视为标准可编辑代码,因此这种最小流程自然地推广到完整的线束优化(HarnessOpt)。在SpreadsheetBench上,HarnessOpt使GPT-5.4-nano实现了0.7758的准确率,超过了运行标准流程的更大模型GPT-5.5(0.7620)。代码可在https://github.com/EvolvingLMMs-Lab/SkillOpt-Lite获取。

通过一行“vibe”代码即可训练智能体的技能和驾驭能力——实现自动化、循环改进。还推导了技能和驾驭能力优化的收敛性和泛化界限。