### [模型一行没训练,Agent准确率却涨4.86个百分点:ModularRSI让Harness自己改代码](https://www.zuoshipin.com/article/45587) **Published:** 2026-09-25T02:08:32 **Author:** 天才交易员 **Excerpt:** ModularRSI将Agent Harness拆成五个可演化模块,在模型权重冻结时通过对比成功/失败轨迹、三… **冻结基础模型,只让Agent从成功与失败轨迹中修改循环、工具、观测、上下文和完成判断;真正关键的不是分数上涨,而是这些改进能否跨任务、跨领域、跨模型继续成立。** **先说预测:**未来Agent能力升级不会只等下一代大模型。大量进步会发生在模型外面:更好的循环、更少的无效工具调用、更稳的错误恢复、更准确的完成判断。ModularRSI真正值得关注的地方,是把这些“工程经验”变成一套可以自动发现、写回代码并验证的演化流程。 但先别急着把它称为“AI完成通用自我进化”。目前结果来自arXiv v1和有限基准实验。**它证明了Harness存在可迁移的优化空间,不等于系统已经能够无限递归变强,更不等于脱离人类评测与安全边界。** [![传统机器学习与Agent Harness演化都必须面对隐蔽的过拟合问题](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-cover.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-cover.webp) 传统机器学习与Agent Harness演化都必须面对隐蔽的过拟合问题。点击查看大图。 ## 01 / 模型被冻结,什么东西还在学习? 研究把Agent写成A=(M,H):M是基础模型,H是Harness。基础模型决定知识、推理和生成能力;Harness决定模型能看到什么、如何维护上下文、何时调用工具、失败后怎样恢复,以及什么时候可以宣布任务完成。 [![ModularRSI论文于2026年9月提交至arXiv](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img01.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img01.webp) ModularRSI论文于2026年9月提交至arXiv。点击查看大图。 [![基础模型M保持冻结,Harness从H0持续演化到后续版本](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img02.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img02.webp) 基础模型M保持冻结,Harness从H0持续演化到后续版本。点击查看大图。 ModularRSI让M始终冻结,只让H随执行经验变化。每轮任务留下轨迹,系统从多条轨迹中寻找反复出现的缺陷,生成代码修改,再通过验证门保留有效候选。下一代Harness因此建立在上一代的执行经验上。 [![不同演化代次下Terminal-Bench 2.0表现逐步变化](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img03.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img03.webp) 不同演化代次下Terminal-Bench 2.0表现逐步变化。点击查看大图。 ## 02 / 为什么排行榜上涨,仍可能只是更隐蔽的过拟合? 传统机器学习会记住训练数据;Agent Harness也可能记住Benchmark的任务结构、工具约定和常见失败模式。更危险的是,这种过拟合会伪装成“聪明的工程规则”:某个文件名、某条命令、某种固定目录或只对当前批次有效的启发式策略。 [![Agent Harness过拟合会以任务策略和工具规则的形式隐藏起来](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img04.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img04.webp) Agent Harness过拟合会以任务策略和工具规则的形式隐藏起来。点击查看大图。 因此论文设定了更严格的判断:改进必须在产生它的经验之外仍然有效。研究使用2000个外部可执行任务组成独立演化池,其中1000个终端任务、1000个软件工程任务;主实验分别抽取120个Terminal相关任务和120个SWE相关任务进行演化,最终Benchmark数据不参与演化和模型选择。 ## 03 / 先把Harness拆成五块,再分别找问题 直接让模型修改整套Agent代码,搜索空间太大,也很难判断一次失败到底来自哪里。ModularRSI把Harness拆成五个模块: - **Agent Loop:**负责推理、行动、观测的循环。 - **Observation Management:**筛选与组织环境反馈。 - **Tool Use:**选择工具、构造参数、处理返回。 - **Context Management:**维护历史、约束、状态和中间结果。 - **Task Completion Detection:**判断是否真正完成,防止无证据退出。 [![ModularRSI使用对比采样、模块演化与三道验证构成闭环](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img05.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img05.webp) ModularRSI使用对比采样、模块演化与三道验证构成闭环。点击查看大图。 每个模块从相同初始Harness独立演化,最后再进入跨模块整合。这个设计既缩小修改范围,也使收益和回归更容易归因。 ## 04 / 同一个任务多跑几次,成功与失败的差异最值钱 ModularRSI不会看到一条失败轨迹就立刻改代码,而是对同一任务执行多次rollout: 1. **全部成功:**继续检查重复操作、多余调用和低效交互。 2. **有成功也有失败:**在任务和环境相同的情况下直接比较决策差异,这是信息价值最高的情况。 3. **全部失败:**查找历史代次是否曾成功;若没有,再定位死循环、工具错误、恢复薄弱或提前终止。 多条轨迹会被整理成结构化findings:哪个函数可能有问题、证据来自哪里、应该怎样修改。只有类似缺陷在多个任务中反复出现,修改优先级才会提高。这一步把“某次任务失败”抽象成“系统性机制缺陷”。 ## 05 / 自动写回代码之前,先过三道门 - **Program Check:**检查语法、import和接口契约。 - **Diff Review:**寻找任务特定常量、单实例答案和只对当前批次有效的规则,发现特化倾向就回滚。 - **Execution Validation:**让修改后的Harness重新执行任务,新运行时错误无法保留。 独立模块演化完成后,还要经过Cross-Module Integration、Function Merge和Task-Aware Function Composition:合并重复函数、解决冲突,并按任务需要选择合适的能力组合。 ## 06 / 结果:47.57升到52.43,但“全部一起改”反而跌到44.19 在Terminal-Bench 2.0上,DeepSeek-V4-Flash-Preview配合原始Harness的准确率为47.57%,ModularRSI演化后达到52.43%,提升4.86个百分点。 [![不同模块独立演化与联合演化的准确率、Pass@1和交互步数对比](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img06.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img06.webp) 不同模块独立演化与联合演化的准确率、Pass@1和交互步数对比。点击查看大图。 单模块中,Agent Loop约提升2.99个百分点;Observation Management让平均交互步数下降约35%。然而把所有模块直接放在一起联合演化,准确率反而降到44.19%。这说明局部改动会改变其他模块的工作条件,Harness并不是五个互不影响的插件槽。 ## 07 / 真正关键的数据:跨领域和跨模型还能涨 Terminal相关任务演化出的Harness放到SWE-Bench Verified后,比原始Harness提高2.40个百分点;反过来,SWE相关演化用于Terminal-Bench 2.0,也提高1.83个百分点。 [![Terminal任务与SWE任务之间的跨领域迁移结果](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img07.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img07.webp) Terminal任务与SWE任务之间的跨领域迁移结果。点击查看大图。 跨模型实验同样出现正向迁移:GLM-5.2从59.55%升到61.80%,MiniMax-2.5从41.57%升到44.94%,DeepSeek-V4-Flash从47.57%升到52.43%。 [![同一演化Harness迁移到GLM、MiniMax和DeepSeek模型后的结果](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img08.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img08.webp) 同一演化Harness迁移到GLM、MiniMax和DeepSeek模型后的结果。点击查看大图。 这比单一榜单上的上涨更有意义。减少无效循环、改善错误恢复和加强完成判断,本来就不应完全绑定某一个模型。不过,这些模型和任务仍处于相近的编码与终端执行范畴,不能据此推断任何领域都能获得同样收益。 ## 08 / 最能教会Agent的,不是最难题,而是“半会不会”的题 研究比较了两种难度分布。中等难度为主的任务中,约一半实例成功率落在40%到60%,演化得分从58.4%升到65.0%,提高6.6个百分点;由极简单和极困难任务组成的数据只提高0.6个百分点。 [![中等难度任务比极难与极易任务提供更高的信息密度](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img09.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img09.webp) 中等难度任务比极难与极易任务提供更高的信息密度。点击查看大图。 原因很直观:任务太简单时缺少失败证据;太难时又没有成功轨迹可作参照。只有“同一任务有时成功、有时失败”,系统才能比较究竟哪项机制改变了结果。这意味着Harness RSI的数据课程设计,可能和模型训练数据同样重要。 ## 09 / 从连续八次错误命令,长出一套通用恢复机制 论文给出一个具体案例:Agent连续八次执行同一无效命令,之后反复声称任务完成,却一直被Verifier拒绝,最终耗尽预算。 演化过程先加入guarded\_completion,阻止没有证据的完成声明并检测重复命令;随后加入parse\_error\_recovery修复格式错误;接着识别长时间只运行ls、cat、grep却没有编辑、构建或测试的“假忙”状态;最后加入planning\_checklist追踪已完成和待完成需求。 [![多个完成判断与规划函数被合并为更协调的通用机制](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img10.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img10.webp) 多个完成判断与规划函数被合并为更协调的通用机制。点击查看大图。 这就是Harness RSI与简单记忆的区别:它没有记住某道题的答案,而是从具体失败提炼出重复检测、错误恢复、停滞识别和规划管理。 ## 10 / 好机制叠在一起,也可能互相打架 Agent Loop和Verification单独演化时都有收益,组合后却出现两个completion gate。Agent通过一层后又被另一层拦住,在“完成—验证—再次完成”之间循环直至超时。最终系统只保留Verification作为最终完成判断,并保留Loop里的错误恢复。 这给实际Agent团队一个很实用的提醒:增加更多检查器并不天然更安全。完成判断、权限确认、重试和验证如果没有唯一责任边界,系统可能陷入互相否决。 ## 11 / 行为真的变好了吗?研究用第二把尺子做了检查 团队使用LLM judge,从任务有效性、交互质量、推理可靠性、上下文和状态管理、效率与鲁棒性等维度评估不同代次轨迹。随着Terminal-Bench准确率上升,行为评分也呈现大致一致的趋势。 [![Benchmark表现和LLM行为评估随演化代次呈现相近趋势](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img11.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/09/modularrsi-img11.webp) Benchmark表现和LLM行为评估随演化代次呈现相近趋势。点击查看大图。 LLM评委不能替代人工审计、跨任务实验和真实生产测试,但它提供了额外证据:分数变化至少伴随可观察的执行行为变化,而不只是某个评测脚本被偶然满足。 ## 12 / ModularRSI本地复现教程 1. **准备隔离环境:**使用容器或专用虚拟机,不要在包含生产密钥和个人文件的主机直接执行自修改Harness。 2. **克隆官方仓库:**从GitHub获取代码,记录提交版本,阅读README、.env.example和两类许可证。 3. **建立Python环境:**创建venv并执行可编辑安装,避免污染系统Python。 4. **配置模型端点:**在.env中填写API密钥与端点,限制额度并确保文件不会被提交。 5. **检查启动参数:**确认模型、演化任务、rollout次数、并发、预算、验证环境和输出目录。 6. **运行演化:**通过scripts/evolve.sh生成候选Harness,并保留每一代diff、轨迹和验证结果。 7. **冻结后评测:**使用scripts/evaluate.sh在未参与演化的任务上测试,不根据最终评测结果继续调Harness。 8. **做消融与回滚:**单独启用各模块,检查收益、步数、失败类型和模块冲突;任何回归都能恢复上一代。 **许可提醒:**仓库原创研究部分标为CC BY-NC 4.0,仅限非商业使用;Harbor衍生部分为Apache 2.0,第三方数据与组件另有条款。商业团队不能因为仓库页面显示Apache许可证就默认全部代码和数据可商用。 ## 我的观点:Agent的“能力”越来越像模型与软件系统的乘积 ModularRSI没有让模型获得新知识,而是减少了系统浪费已有能力的方式。一个更强模型如果被糟糕的上下文、工具协议和完成判断拖累,实际表现可能不如较弱模型配合成熟Harness。 这对产品团队比“自动递归进化”的宏大叙事更现实:先把失败轨迹保存下来,建立可复现任务,比较成功与失败路径,把系统性问题转成小范围代码修改,再用隔离评测验证。即使不运行完整ModularRSI,这套方法也能用于改进现有Coding Agent、浏览器Agent和内部自动化。 ## 官方资料与站内延伸 **ModularRSI站内导航:** [https://www.zuoshipin.com/link/45586.html](https://www.zuoshipin.com/link/45586.html) **官方GitHub仓库:** [查看代码、安装与许可证](https://github.com/IQuestLab/ModularRSI) **官方论文:** [阅读arXiv论文与实验设计](https://arxiv.org/abs/2609.14857) **站内解读:AI Agent Harness到底是什么:** [https://www.zuoshipin.com/article/30587](https://www.zuoshipin.com/article/30587) **站内盘点:RSI递归自我改进公司:** [https://www.zuoshipin.com/article/24075](https://www.zuoshipin.com/article/24075) **站内项目:HarnessEval-W开源评测:** [https://www.zuoshipin.com/article/24131](https://www.zuoshipin.com/article/24131) **DeepSeek Harness站内导航:** [https://www.zuoshipin.com/link/23248.html](https://www.zuoshipin.com/link/23248.html) **站内研究:iCoder-27B的Agent研发流程:** [https://www.zuoshipin.com/article/30755](https://www.zuoshipin.com/article/30755) **更多AI资讯:** [https://www.zuoshipin.com/archive/75](https://www.zuoshipin.com/archive/75) **Tags:** Agent Harness, AI Agent, ModularRSI, SWE-Bench, 递归自我改进 **Categories:** AI资讯 ---