【开源自荐】让 Agent 在真实业务场景中自进化

Gear

应用平台

macOS、Linux。

通过命令行使用,也可以接入 Codex、Claude Code、DSH 等支持 Skill 的 Agent 环境。

推荐类型

开发者自荐

是否收费

免费开源,采用 MIT 协议。模型调用和运行评测所需的计算资源费用由使用者自行承担。

一句简介

Gear 是一个开源 AI Agent 优化框架,通过任务评测迭代改进 Agent 的指令、工具和工作流程,让它更可靠地完成真实世界的任务。

应用简介

大家好,分享一下我们正在开发的开源项目 Gear: GitHub - rsi-gear/gear: Gear (General Evolution Architecture) is RSI infrastructure for AI agents. Use Gear to refine agent harnesses. · GitHub

在使用 AI Agent 处理实际任务时,模型有时会遗漏要求、用错工具,或者没有按照业务规则执行。修改提示词和增加 Skill 可以尝试解决这些问题,但改动是否有效、会不会影响原本能完成的任务,需要通过评测来判断。

Gear 把这个过程组织成一个可以重复运行的优化循环:

准备一组有明确验收标准的任务,让 Agent 执行;分析执行记录和失败原因,提出改进;再运行评测,比较修改前后的表现,决定保留哪个版本。

目前已支持的功能:

  1. 优化提示词和行为规则:根据任务中的具体失败,调整 Agent 的指令和执行策略。
  2. 优化工具、Skills 和工作流程:允许修改辅助脚本、工具实现和执行步骤,把改进落实到 Agent 的实际工作方式中。
  3. 接入自己的任务集:可以使用现有 benchmark,也可以构建贴近自己业务场景的评测任务。
  4. 分别配置两个 Agent:负责分析和提出改进的 Agent,与实际执行任务的 Agent,可以使用不同模型。
  5. 记录修改和评测结果:查看每个候选版本做了什么、哪些任务改善了、哪些出现退化,并复用最终保留的版本。
  6. 自定义优化方法:根据需求调整候选生成、任务采样、评分和筛选策略。

例如,在 AutomationBench 的 100 个公开 Marketing 任务上,我们使用 Luna + DSH 经过五轮优化,任务通过率从 27% 提升到 53%,目标完成率 88%,超越了 Astra + Codex,并且单任务成本下降了95%;具体改动和评测记录已在案例文档中公开。

Gear 目前主要面向正在开发 Agent、编写 Skills,或者搭建自动化工作流的开发者。使用时需要准备任务集和运行环境,欢迎拿自己的任务来试,也欢迎反馈失败案例。

开发中功能

  • 利用任务反馈进行模型训练,并完善训练与评测的迭代流程。
  • 根据失败案例自动生成有针对性的练习任务。

截图预览

AutomationBench 优化过程回放:

automationbench-evolution-replay-zh

官方网站

1 个赞

想知道当前 rsi 有什么场景?

当前主要还是优化现有的agentic benchmark为主,如果有好的场景欢迎合作啊~