⏶221
SkillOpt:自演化智能体技能的执行策略
发表
由
taesiri 提交
作者:
Yifan Yang,
Ziyang Gong, Weiquan Huang, Qihao Yang, Ziwei Zhou,
Zisu Huang, Yan Li, Xuemei Gao, Qi Dai, Bei Liu, Kai Qiu, Yuqing Yang, Dongdong Chen, Xue Yang, Chong Luo
摘要
AI 生成总结
SkillOpt 引入了一种系统性的智能体技能文本空间优化器,该优化器将技能作为外部智能体状态进行训练,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越的性能。现在的智能体技能主要是手工设计、单次生成的,或是通过松散控制的自我修正演化而来的,这些方式都不像深度学习优化器那样可以对技能进行优化,并且在反馈下都无法可靠地在其起点之上进行改进。我们认为,应该像对待让权重空间优化可复现的纪律一样,将技能作为冻结智能体的外部状态进行训练。据我们所知,SkillOpt 是首个系统性的可控文本空间智能体技能优化器:一个独立的优化器模型将带评分的轨迹展开转化为对单个技能文档进行受限的“添加/删除/替换”编辑,并且只有当编辑能严格提高留出验证集得分时才会被接受。文本学习率预算、拒绝编辑缓冲区以及逐周期的慢速/元更新使得技能训练非常稳定,同时在部署推理时无需增加任何额外的模型调用。在 6 个基准测试、7 个目标模型和 3 个执行套件(直接对话、Codex、Claude Code)中,SkillOpt 在所有 52 个评估的(模型,基准测试,套件)组合中均名列第一或并列第一,并击败了人类、单次 LLM、Trace2Skill、TextGrad、GEPA 和 EvoSkill 技能在每个组合中的所有竞争对手。在 GPT-5.5 上,它将直接对话中的无技能平均准确率提高了 23.5 个百分点,在 Codex 智能体循环中提高了 24.8 个百分点,在 Claude Code 中提高了 19.1 个百分点。迁移实验进一步表明,优化后的技能产物在跨越模型尺度、在 Codex 和 Claude Code 执行环境之间迁移,以及在不进行进一步优化的情况下迁移到相近的数学基准测试时,依然能保持其价值。
评论
论文作者
🚀 SkillOpt:像训练神经网络一样训练智能体(agent)技能——且无需修改模型权重。
如果智能体不是通过微调大语言模型(LLM)来提升,而是通过自我优化其自身的技能文档来实现提升,会怎样?🧠✨
SkillOpt 将自然语言技能视为智能体可训练的外部状态:
🧪 展开(rollout) → 🔍 反思 → ✍️ 编辑 → ✅ 验证 → 📈 提升
我们在 6 个基准测试和 7 个模型上对 SkillOpt 进行了评估,涵盖了直接模型调用以及使用 Codex + Claude Code 的真实智能体执行循环。SkillOpt 在 52/52 种设置中取得了最好或并列最好的结果。
其核心思想简单但强大:
随着人工智能从助手转变为工作者,瓶颈不再仅仅是知识,而是程序性能力(procedural capability):工具使用、中间状态检查、领域惯例以及从失败中恢复。🛠️🤖
我们相信,经过优化、可复用且可检查的技能,可能会成为未来智能体的一个全新适配层。
🌐 项目:https://aka.ms/skillopt
📄 论文:https://arxiv.org/pdf/2605.23904
https://cdn-uploads.huggingface.co/production/uploads/62d18eb81e36881a57f29bf4/Re-3-XEU4VDFweVgeZuR6.mp4