ModularRSI是什么?
ModularRSI是面向AI Agent Harness递归自我改进的开源研究框架。它冻结基础模型权重,只让Agent根据独立任务中的成功与失败轨迹,持续修改模型外围的执行机制,并测试改进能否迁移到未见任务、不同领域和不同基础模型。

五个可演化模块
- Agent Loop:控制推理、行动与观测的循环。
- Observation Management:筛选、压缩和组织环境反馈。
- Tool Use:选择工具、构造参数并处理调用结果。
- Context Management:维护历史、约束、中间结果与状态。
- Task Completion Detection:判断任务是否真正完成,避免无证据退出。
它如何避免只记住Benchmark?
框架使用与最终评测基准隔离的2000条可执行任务池,分别抽取Terminal与软件工程任务用于演化。候选代码修改必须经过Program Check、Diff Review和Execution Validation,最终评测前Harness会被冻结。
安装与运行
- 从官方GitHub仓库克隆项目,并确认Python与uv/虚拟环境依赖。
- 建立虚拟环境后执行可编辑安装,复制.env.example为.env。
- 在环境文件配置模型API端点和密钥,不要提交密钥。
- 检查启动脚本顶部参数、数据目录、模型和预算。
- 使用scripts/evolve.sh运行演化,使用scripts/evaluate.sh执行评测。
- 在隔离容器中运行任务,限制网络、文件和命令权限,并保留每代代码差异与轨迹。
许可与使用提醒
仓库包含不同许可:ModularRSI原创研究部分以CC BY-NC 4.0提供,仅限非商业使用;Harbor衍生代码保持Apache 2.0,第三方组件和数据集遵循各自许可。商业集成前必须逐项核对文件与数据许可,不能只看仓库首页的许可证标识。

