做了一套开源 RSI Infra,让 Agent 根据任务自主优化

tangyehui 2026-09-22 14:41 1

Gear 优化过程演示


大家好,分享一下我们正在开发的开源项目 Gear: https://github.com/rsi-gear/gear 。


Gear 是一个开源 AI Agent 优化框架,通过任务评测迭代改进 Agent 的指令、工具和工作流程,让它更可靠地完成真实世界的任务。


在使用 AI Agent 处理实际任务时,模型有时会遗漏要求、用错工具,或者没有按照业务规则执行。修改提示词和增加 Skill 可以尝试解决这些问题,但改动是否有效、会不会影响原本能完成的任务,需要通过评测来判断。


Gear 把这个过程组织成一个可以重复运行的优化循环:


准备任务 → 执行评测 → 分析失败 → 提出修改 → 再次评测 → 保留合适的版本。


你需要先准备一组有明确验收标准的任务,可以使用现有 benchmark ,也可以构建贴近自己业务场景的任务集。Gear 会利用执行记录和评测结果,在你授权的范围内提出并验证改进。


目前支持:



  • 优化提示词和行为规则:根据任务中的具体失败,调整 Agent 的指令和执行策略。

  • 优化工具、Skills 和工作流程:修改辅助脚本、工具实现和执行步骤。

  • 接入自己的任务集:围绕实际业务需求定义任务和验收标准。

  • 分别配置两个 Agent:负责分析和提出改进的 Agent ,与实际执行任务的 Agent ,可以使用不同模型。

  • 记录修改和评测结果:查看候选版本的具体改动、改善和退化情况,复用最终保留的版本。

  • 自定义优化方法:调整候选生成、任务采样、评分和筛选策略。


例如,在 AutomationBench 的 100 个公开 Marketing 任务上,经过五轮优化,Luna + DSH 的任务通过率从 27% 提升到了 53%,目标完成率 88% 超越了 Astra+Codex 的组合


这批任务参与过优化,因此属于研究集上的实验结果。具体改动和评测记录已在案例文档中公开。


Gear 目前主要面向正在开发 Agent 、编写 Skills ,或者搭建自动化工作流的开发者。支持 macOS 、Linux ,通过命令行使用,也可以接入 Codex 、Claude Code 、DSH 等支持 Skill 的 Agent 环境。


项目免费开源,采用 MIT 协议。模型调用和运行评测所需的计算资源费用由使用者自行承担。


当前已支持 Agent 指令、工具和工作流程的优化;模型训练与自动生成练习任务的完整迭代流程仍在开发中。



  • GitHub 项目地址

  • 中文使用文档

  • 快速开始


欢迎拿自己的任务来试,也欢迎反馈使用体验和失败案例。


求大家 Star !提 issue !提 PR !

最新回复 (8)
  • skuuhui 09-22 16:10
    1
    我就知道会有这种项目
  • tangyehui 楼主 09-22 16:15
    2
    @skuuhui 从 SoL-Pi 的爆火和 no free lunch 的角度来讲,未来 harness+model 协同进化是需要根据场景调优的。现在大家都还刚开始,欢迎提提意见啊!也求个 star 哈哈。
  • nickyadance23 09-22 16:28
    3
    自优化的思路我个人浅显理解,始终跳不出 Skill 提示词不可靠的底层限制,没有一个类似损失函数的东西来评估 Skill 的准确性,不可靠的评估堆叠而出的结果还是不可靠
  • tangyehui 楼主 09-22 16:35
    4
    @nickyadance23 这里有两层问题,1. skill 本身如何做 a/b ,由于 skill 的路由本身是个概率系统,有可能相互影响不好评估。2. metric/reward 如何随着迭代同时进行进化,防止被 hacking 。

    至于可靠性的问题,主要还是由概率的方式来做,就是测试 x 次,99% 没有问题;概率系统很难像纯代码一样,可以靠 lean 这样的东西完全证明没问题,只能说几乎处处可靠。
  • coefu 09-22 23:33
    5
    你懂个 der 的 RSI 。
  • tangyehui 楼主 09-23 00:07
    6
    @coefu 请问错在哪里呢
  • nickyadance23 09-23 10:38
    7
    @tangyehui #4 所以我认为 Skill 只是用于 AI 过渡期的工具,因为工程只有 0 和 1 ,没有 99%。代码可以出 bug ,但修复方式是确定的,而 Skill 有问题只能糊一段提示词。
  • tangyehui 楼主 09-23 10:51
    8
    @nickyadance23 我觉得是高频重复性的东西都会变成 workflow/代码,随着业务发展需要不断自适应后端的代码;但是很多探索性的东西,比如学术,是需要平衡 exploration 和 exploitation 的,需要一些概率的系统在里面。
* 帖子来源V2EX
返回