⏶162
AgentSPEX:一种智能体规范与执行语言
发表
由
Rui Pan 提交
作者: Pengcheng Wang,
Jerry Huang,
Jiarui Yao,
Rui Pan, Peizhi Niu,
Yaowenqi Liu, Ruida Wang, Renhao Lu, Yuwei Guo, Tong Zhang
摘要
AI 生成总结
AgentSPEX 是一种领域特定语言和框架,用于创建具有显式控制流和状态管理的结构化、模块化且可解释的大语言模型智能体工作流。语言模型智能体系统通常依赖于反应式提示(reactive prompting),即由单一指令引导模型完成开放式的推理和工具使用步骤,这使得控制流和中间状态处于隐式,导致智能体行为可能难以控制。LangGraph、DSPy 和 CrewAI 等编排框架通过显式的任务流定义引入了更强的结构,但将工作流逻辑与 Python 紧密耦合,使得智能体难以维护和修改。在本文中,我们推出了 AgentSPEX,这是一种用于指定具有显式控制流和模块化结构的 LLM 智能体工作流的“智能体规范与执行语言”(Agent SPecification and EXecution Language),并配有可定制的智能体控制平台(harness)。AgentSPEX 支持类型化步骤、分支与循环、并行执行、可重用子模块以及显式状态管理;这些工作流在提供工具访问、沙箱虚拟环境并支持检查点、验证和日志记录的控制平台中执行。此外,我们提供了一个带有同步图形和工作流视图的视觉编辑器,用于创作和检查。我们内置了用于深度研究和科学研究的即用型智能体,并在 7 个基准测试上对 AgentSPEX 进行了评估。最后,通过用户研究,我们证明了 AgentSPEX 比现有的流行智能体框架提供了更具可解释性且更易上手的辅助工作流创作范式。
目前,许多智能体(agent)的工作流分为两类:1)主要由 Python 代码构建——灵活,但日益难以阅读、修改和复现;2)严重依赖自然语言(例如基于 Markdown 的“技能”)——轻量级,但执行路径不够稳定且可控性较弱。
因此,我们构建了 AgentSPEX:这是一个将智能体工作流指定为声明式 YAML,并在隔离沙箱中执行的系统。
✅ AgentSPEX 的核心能力
1️⃣ 基于 YAML 的工作流
- 支持 task / for_each / while / if / parallel / call 等步骤。
- 与以代码为中心的工作流相比,它更容易快速理解整个流水线;
- 与纯自然语言工作流相比,控制流更加明确。
2️⃣ 沙箱执行 + 工具集成
- 浏览器访问、终端、代码执行和文件系统等能力均在隔离环境中运行。
- 这使其默认更加安全,且更适用于现实世界的任务。
3️⃣ 可恢复、可重放且可验证
- AgentSPEX 框架支持检查点(Checkpoint)/ 恢复(Resume)/ 轨迹重放(Trace Replay)。
- 如果任务中断,可以从中断处恢复;如果你想复现一个过程,可以直接重放。
- 我们还在将关键执行属性转化为 Lean4 命题,利用形式化验证为智能体提供正确性保证。
此外,我们还构建了一个可视化的 YAML 编辑器,工作流图表与 YAML 保持双向同步——这使得修改工作流变得更加直观。
AgentSPEX 网站已经包含几个开箱即用的智能体:
📚 深度研究(Deep Research):约 15 分钟,费用 <$1,可对任何主题进行深入研究
🧪 AI 科学家(AI Scientists):约 25 分钟,费用 <$3,可生成研究提案
📝 AI 顾问(AI Advisor):覆盖人类评审反馈的约 80%