冻结基础模型,只让Agent从成功与失败轨迹中修改循环、工具、观测、上下文和完成判断;真正关键的不是分数上涨,而是这些改进能否跨任务、跨领域、跨模型继续成立。
先说预测:未来Agent能力升级不会只等下一代大模型。大量进步会发生在模型外面:更好的循环、更少的无效工具调用、更稳的错误恢复、更准确的完成判断。ModularRSI真正值得关注的地方,是把这些“工程经验”变成一套可以自动发现、写回代码并验证的演化流程。
但先别急着把它称为“AI完成通用自我进化”。目前结果来自arXiv v1和有限基准实验。它证明了Harness存在可迁移的优化空间,不等于系统已经能够无限递归变强,更不等于脱离人类评测与安全边界。

01 / 模型被冻结,什么东西还在学习?
研究把Agent写成A=(M,H):M是基础模型,H是Harness。基础模型决定知识、推理和生成能力;Harness决定模型能看到什么、如何维护上下文、何时调用工具、失败后怎样恢复,以及什么时候可以宣布任务完成。


ModularRSI让M始终冻结,只让H随执行经验变化。每轮任务留下轨迹,系统从多条轨迹中寻找反复出现的缺陷,生成代码修改,再通过验证门保留有效候选。下一代Harness因此建立在上一代的执行经验上。

02 / 为什么排行榜上涨,仍可能只是更隐蔽的过拟合?
传统机器学习会记住训练数据;Agent Harness也可能记住Benchmark的任务结构、工具约定和常见失败模式。更危险的是,这种过拟合会伪装成“聪明的工程规则”:某个文件名、某条命令、某种固定目录或只对当前批次有效的启发式策略。

因此论文设定了更严格的判断:改进必须在产生它的经验之外仍然有效。研究使用2000个外部可执行任务组成独立演化池,其中1000个终端任务、1000个软件工程任务;主实验分别抽取120个Terminal相关任务和120个SWE相关任务进行演化,最终Benchmark数据不参与演化和模型选择。
03 / 先把Harness拆成五块,再分别找问题
直接让模型修改整套Agent代码,搜索空间太大,也很难判断一次失败到底来自哪里。ModularRSI把Harness拆成五个模块:
- Agent Loop:负责推理、行动、观测的循环。
- Observation Management:筛选与组织环境反馈。
- Tool Use:选择工具、构造参数、处理返回。
- Context Management:维护历史、约束、状态和中间结果。
- Task Completion Detection:判断是否真正完成,防止无证据退出。

每个模块从相同初始Harness独立演化,最后再进入跨模块整合。这个设计既缩小修改范围,也使收益和回归更容易归因。
04 / 同一个任务多跑几次,成功与失败的差异最值钱
ModularRSI不会看到一条失败轨迹就立刻改代码,而是对同一任务执行多次rollout:
- 全部成功:继续检查重复操作、多余调用和低效交互。
- 有成功也有失败:在任务和环境相同的情况下直接比较决策差异,这是信息价值最高的情况。
- 全部失败:查找历史代次是否曾成功;若没有,再定位死循环、工具错误、恢复薄弱或提前终止。
多条轨迹会被整理成结构化findings:哪个函数可能有问题、证据来自哪里、应该怎样修改。只有类似缺陷在多个任务中反复出现,修改优先级才会提高。这一步把“某次任务失败”抽象成“系统性机制缺陷”。
05 / 自动写回代码之前,先过三道门
- Program Check:检查语法、import和接口契约。
- Diff Review:寻找任务特定常量、单实例答案和只对当前批次有效的规则,发现特化倾向就回滚。
- Execution Validation:让修改后的Harness重新执行任务,新运行时错误无法保留。
独立模块演化完成后,还要经过Cross-Module Integration、Function Merge和Task-Aware Function Composition:合并重复函数、解决冲突,并按任务需要选择合适的能力组合。
06 / 结果:47.57升到52.43,但“全部一起改”反而跌到44.19
在Terminal-Bench 2.0上,DeepSeek-V4-Flash-Preview配合原始Harness的准确率为47.57%,ModularRSI演化后达到52.43%,提升4.86个百分点。

单模块中,Agent Loop约提升2.99个百分点;Observation Management让平均交互步数下降约35%。然而把所有模块直接放在一起联合演化,准确率反而降到44.19%。这说明局部改动会改变其他模块的工作条件,Harness并不是五个互不影响的插件槽。
07 / 真正关键的数据:跨领域和跨模型还能涨
Terminal相关任务演化出的Harness放到SWE-Bench Verified后,比原始Harness提高2.40个百分点;反过来,SWE相关演化用于Terminal-Bench 2.0,也提高1.83个百分点。

跨模型实验同样出现正向迁移:GLM-5.2从59.55%升到61.80%,MiniMax-2.5从41.57%升到44.94%,DeepSeek-V4-Flash从47.57%升到52.43%。

这比单一榜单上的上涨更有意义。减少无效循环、改善错误恢复和加强完成判断,本来就不应完全绑定某一个模型。不过,这些模型和任务仍处于相近的编码与终端执行范畴,不能据此推断任何领域都能获得同样收益。
08 / 最能教会Agent的,不是最难题,而是“半会不会”的题
研究比较了两种难度分布。中等难度为主的任务中,约一半实例成功率落在40%到60%,演化得分从58.4%升到65.0%,提高6.6个百分点;由极简单和极困难任务组成的数据只提高0.6个百分点。

原因很直观:任务太简单时缺少失败证据;太难时又没有成功轨迹可作参照。只有“同一任务有时成功、有时失败”,系统才能比较究竟哪项机制改变了结果。这意味着Harness RSI的数据课程设计,可能和模型训练数据同样重要。
09 / 从连续八次错误命令,长出一套通用恢复机制
论文给出一个具体案例:Agent连续八次执行同一无效命令,之后反复声称任务完成,却一直被Verifier拒绝,最终耗尽预算。
演化过程先加入guarded_completion,阻止没有证据的完成声明并检测重复命令;随后加入parse_error_recovery修复格式错误;接着识别长时间只运行ls、cat、grep却没有编辑、构建或测试的“假忙”状态;最后加入planning_checklist追踪已完成和待完成需求。

这就是Harness RSI与简单记忆的区别:它没有记住某道题的答案,而是从具体失败提炼出重复检测、错误恢复、停滞识别和规划管理。
10 / 好机制叠在一起,也可能互相打架
Agent Loop和Verification单独演化时都有收益,组合后却出现两个completion gate。Agent通过一层后又被另一层拦住,在“完成—验证—再次完成”之间循环直至超时。最终系统只保留Verification作为最终完成判断,并保留Loop里的错误恢复。
这给实际Agent团队一个很实用的提醒:增加更多检查器并不天然更安全。完成判断、权限确认、重试和验证如果没有唯一责任边界,系统可能陷入互相否决。
11 / 行为真的变好了吗?研究用第二把尺子做了检查
团队使用LLM judge,从任务有效性、交互质量、推理可靠性、上下文和状态管理、效率与鲁棒性等维度评估不同代次轨迹。随着Terminal-Bench准确率上升,行为评分也呈现大致一致的趋势。

LLM评委不能替代人工审计、跨任务实验和真实生产测试,但它提供了额外证据:分数变化至少伴随可观察的执行行为变化,而不只是某个评测脚本被偶然满足。
12 / ModularRSI本地复现教程
- 准备隔离环境:使用容器或专用虚拟机,不要在包含生产密钥和个人文件的主机直接执行自修改Harness。
- 克隆官方仓库:从GitHub获取代码,记录提交版本,阅读README、.env.example和两类许可证。
- 建立Python环境:创建venv并执行可编辑安装,避免污染系统Python。
- 配置模型端点:在.env中填写API密钥与端点,限制额度并确保文件不会被提交。
- 检查启动参数:确认模型、演化任务、rollout次数、并发、预算、验证环境和输出目录。
- 运行演化:通过scripts/evolve.sh生成候选Harness,并保留每一代diff、轨迹和验证结果。
- 冻结后评测:使用scripts/evaluate.sh在未参与演化的任务上测试,不根据最终评测结果继续调Harness。
- 做消融与回滚:单独启用各模块,检查收益、步数、失败类型和模块冲突;任何回归都能恢复上一代。
许可提醒:仓库原创研究部分标为CC BY-NC 4.0,仅限非商业使用;Harbor衍生部分为Apache 2.0,第三方数据与组件另有条款。商业团队不能因为仓库页面显示Apache许可证就默认全部代码和数据可商用。
我的观点:Agent的“能力”越来越像模型与软件系统的乘积
ModularRSI没有让模型获得新知识,而是减少了系统浪费已有能力的方式。一个更强模型如果被糟糕的上下文、工具协议和完成判断拖累,实际表现可能不如较弱模型配合成熟Harness。
这对产品团队比“自动递归进化”的宏大叙事更现实:先把失败轨迹保存下来,建立可复现任务,比较成功与失败路径,把系统性问题转成小范围代码修改,再用隔离评测验证。即使不运行完整ModularRSI,这套方法也能用于改进现有Coding Agent、浏览器Agent和内部自动化。
官方资料与站内延伸
ModularRSI站内导航:
https://www.zuoshipin.com/link/45586.html
官方GitHub仓库: 查看代码、安装与许可证
官方论文: 阅读arXiv论文与实验设计
站内解读:AI Agent Harness到底是什么:
https://www.zuoshipin.com/article/30587
站内盘点:RSI递归自我改进公司:
https://www.zuoshipin.com/article/24075
站内项目:HarnessEval-W开源评测:
https://www.zuoshipin.com/article/24131
DeepSeek Harness站内导航:
https://www.zuoshipin.com/link/23248.html
站内研究:iCoder-27B的Agent研发流程:
https://www.zuoshipin.com/article/30755






