Gear
应用平台
macOS、Linux。
通过命令行使用,也可以接入 Codex、Claude Code、DSH 等支持 Skill 的 Agent 环境。
推荐类型
开发者自荐
是否收费
免费开源,采用 MIT 协议。模型调用和运行评测所需的计算资源费用由使用者自行承担。
一句简介
Gear 是一个开源 AI Agent 优化框架,通过任务评测迭代改进 Agent 的指令、工具和工作流程,让它更可靠地完成真实世界的任务。
应用简介
大家好,分享一下我们正在开发的开源项目 Gear: GitHub - rsi-gear/gear: Gear (General Evolution Architecture) is RSI infrastructure for AI agents. Use Gear to refine agent harnesses. · GitHub。
在使用 AI Agent 处理实际任务时,模型有时会遗漏要求、用错工具,或者没有按照业务规则执行。修改提示词和增加 Skill 可以尝试解决这些问题,但改动是否有效、会不会影响原本能完成的任务,需要通过评测来判断。
Gear 把这个过程组织成一个可以重复运行的优化循环:
准备一组有明确验收标准的任务,让 Agent 执行;分析执行记录和失败原因,提出改进;再运行评测,比较修改前后的表现,决定保留哪个版本。
目前已支持的功能:
- 优化提示词和行为规则:根据任务中的具体失败,调整 Agent 的指令和执行策略。
- 优化工具、Skills 和工作流程:允许修改辅助脚本、工具实现和执行步骤,把改进落实到 Agent 的实际工作方式中。
- 接入自己的任务集:可以使用现有 benchmark,也可以构建贴近自己业务场景的评测任务。
- 分别配置两个 Agent:负责分析和提出改进的 Agent,与实际执行任务的 Agent,可以使用不同模型。
- 记录修改和评测结果:查看每个候选版本做了什么、哪些任务改善了、哪些出现退化,并复用最终保留的版本。
- 自定义优化方法:根据需求调整候选生成、任务采样、评分和筛选策略。
例如,在 AutomationBench 的 100 个公开 Marketing 任务上,我们使用 Luna + DSH 经过五轮优化,任务通过率从 27% 提升到 53%,目标完成率 88%,超越了 Astra + Codex,并且单任务成本下降了95%;具体改动和评测记录已在案例文档中公开。
Gear 目前主要面向正在开发 Agent、编写 Skills,或者搭建自动化工作流的开发者。使用时需要准备任务集和运行环境,欢迎拿自己的任务来试,也欢迎反馈失败案例。
开发中功能
- 利用任务反馈进行模型训练,并完善训练与评测的迭代流程。
- 根据失败案例自动生成有针对性的练习任务。
截图预览
AutomationBench 优化过程回放:

官方网站