暂无菜单项

模型一行没训练,Agent准确率却涨4.86个百分点:ModularRSI让Harness自己改代码

发布于
13

冻结基础模型,只让Agent从成功与失败轨迹中修改循环、工具、观测、上下文和完成判断;真正关键的不是分数上涨,而是这些改进能否跨任务、跨领域、跨模型继续成立。

先说预测:未来Agent能力升级不会只等下一代大模型。大量进步会发生在模型外面:更好的循环、更少的无效工具调用、更稳的错误恢复、更准确的完成判断。ModularRSI真正值得关注的地方,是把这些“工程经验”变成一套可以自动发现、写回代码并验证的演化流程。

但先别急着把它称为“AI完成通用自我进化”。目前结果来自arXiv v1和有限基准实验。它证明了Harness存在可迁移的优化空间,不等于系统已经能够无限递归变强,更不等于脱离人类评测与安全边界。

传统机器学习与Agent Harness演化都必须面对隐蔽的过拟合问题
传统机器学习与Agent Harness演化都必须面对隐蔽的过拟合问题。点击查看大图。

01 / 模型被冻结,什么东西还在学习?

研究把Agent写成A=(M,H):M是基础模型,H是Harness。基础模型决定知识、推理和生成能力;Harness决定模型能看到什么、如何维护上下文、何时调用工具、失败后怎样恢复,以及什么时候可以宣布任务完成。

ModularRSI论文于2026年9月提交至arXiv
ModularRSI论文于2026年9月提交至arXiv。点击查看大图。
基础模型M保持冻结,Harness从H0持续演化到后续版本
基础模型M保持冻结,Harness从H0持续演化到后续版本。点击查看大图。

ModularRSI让M始终冻结,只让H随执行经验变化。每轮任务留下轨迹,系统从多条轨迹中寻找反复出现的缺陷,生成代码修改,再通过验证门保留有效候选。下一代Harness因此建立在上一代的执行经验上。

不同演化代次下Terminal-Bench 2.0表现逐步变化
不同演化代次下Terminal-Bench 2.0表现逐步变化。点击查看大图。

02 / 为什么排行榜上涨,仍可能只是更隐蔽的过拟合?

传统机器学习会记住训练数据;Agent Harness也可能记住Benchmark的任务结构、工具约定和常见失败模式。更危险的是,这种过拟合会伪装成“聪明的工程规则”:某个文件名、某条命令、某种固定目录或只对当前批次有效的启发式策略。

Agent Harness过拟合会以任务策略和工具规则的形式隐藏起来
Agent Harness过拟合会以任务策略和工具规则的形式隐藏起来。点击查看大图。

因此论文设定了更严格的判断:改进必须在产生它的经验之外仍然有效。研究使用2000个外部可执行任务组成独立演化池,其中1000个终端任务、1000个软件工程任务;主实验分别抽取120个Terminal相关任务和120个SWE相关任务进行演化,最终Benchmark数据不参与演化和模型选择。

03 / 先把Harness拆成五块,再分别找问题

直接让模型修改整套Agent代码,搜索空间太大,也很难判断一次失败到底来自哪里。ModularRSI把Harness拆成五个模块:

  • Agent Loop:负责推理、行动、观测的循环。
  • Observation Management:筛选与组织环境反馈。
  • Tool Use:选择工具、构造参数、处理返回。
  • Context Management:维护历史、约束、状态和中间结果。
  • Task Completion Detection:判断是否真正完成,防止无证据退出。
ModularRSI使用对比采样、模块演化与三道验证构成闭环
ModularRSI使用对比采样、模块演化与三道验证构成闭环。点击查看大图。

每个模块从相同初始Harness独立演化,最后再进入跨模块整合。这个设计既缩小修改范围,也使收益和回归更容易归因。

04 / 同一个任务多跑几次,成功与失败的差异最值钱

ModularRSI不会看到一条失败轨迹就立刻改代码,而是对同一任务执行多次rollout:

  1. 全部成功:继续检查重复操作、多余调用和低效交互。
  2. 有成功也有失败:在任务和环境相同的情况下直接比较决策差异,这是信息价值最高的情况。
  3. 全部失败:查找历史代次是否曾成功;若没有,再定位死循环、工具错误、恢复薄弱或提前终止。

多条轨迹会被整理成结构化findings:哪个函数可能有问题、证据来自哪里、应该怎样修改。只有类似缺陷在多个任务中反复出现,修改优先级才会提高。这一步把“某次任务失败”抽象成“系统性机制缺陷”。

05 / 自动写回代码之前,先过三道门

  • Program Check:检查语法、import和接口契约。
  • Diff Review:寻找任务特定常量、单实例答案和只对当前批次有效的规则,发现特化倾向就回滚。
  • Execution Validation:让修改后的Harness重新执行任务,新运行时错误无法保留。

独立模块演化完成后,还要经过Cross-Module Integration、Function Merge和Task-Aware Function Composition:合并重复函数、解决冲突,并按任务需要选择合适的能力组合。

06 / 结果:47.57升到52.43,但“全部一起改”反而跌到44.19

在Terminal-Bench 2.0上,DeepSeek-V4-Flash-Preview配合原始Harness的准确率为47.57%,ModularRSI演化后达到52.43%,提升4.86个百分点。

不同模块独立演化与联合演化的准确率、Pass@1和交互步数对比
不同模块独立演化与联合演化的准确率、Pass@1和交互步数对比。点击查看大图。

单模块中,Agent Loop约提升2.99个百分点;Observation Management让平均交互步数下降约35%。然而把所有模块直接放在一起联合演化,准确率反而降到44.19%。这说明局部改动会改变其他模块的工作条件,Harness并不是五个互不影响的插件槽。

07 / 真正关键的数据:跨领域和跨模型还能涨

Terminal相关任务演化出的Harness放到SWE-Bench Verified后,比原始Harness提高2.40个百分点;反过来,SWE相关演化用于Terminal-Bench 2.0,也提高1.83个百分点。

Terminal任务与SWE任务之间的跨领域迁移结果
Terminal任务与SWE任务之间的跨领域迁移结果。点击查看大图。

跨模型实验同样出现正向迁移:GLM-5.2从59.55%升到61.80%,MiniMax-2.5从41.57%升到44.94%,DeepSeek-V4-Flash从47.57%升到52.43%。

同一演化Harness迁移到GLM、MiniMax和DeepSeek模型后的结果
同一演化Harness迁移到GLM、MiniMax和DeepSeek模型后的结果。点击查看大图。

这比单一榜单上的上涨更有意义。减少无效循环、改善错误恢复和加强完成判断,本来就不应完全绑定某一个模型。不过,这些模型和任务仍处于相近的编码与终端执行范畴,不能据此推断任何领域都能获得同样收益。

08 / 最能教会Agent的,不是最难题,而是“半会不会”的题

研究比较了两种难度分布。中等难度为主的任务中,约一半实例成功率落在40%到60%,演化得分从58.4%升到65.0%,提高6.6个百分点;由极简单和极困难任务组成的数据只提高0.6个百分点。

中等难度任务比极难与极易任务提供更高的信息密度
中等难度任务比极难与极易任务提供更高的信息密度。点击查看大图。

原因很直观:任务太简单时缺少失败证据;太难时又没有成功轨迹可作参照。只有“同一任务有时成功、有时失败”,系统才能比较究竟哪项机制改变了结果。这意味着Harness RSI的数据课程设计,可能和模型训练数据同样重要。

09 / 从连续八次错误命令,长出一套通用恢复机制

论文给出一个具体案例:Agent连续八次执行同一无效命令,之后反复声称任务完成,却一直被Verifier拒绝,最终耗尽预算。

演化过程先加入guarded_completion,阻止没有证据的完成声明并检测重复命令;随后加入parse_error_recovery修复格式错误;接着识别长时间只运行ls、cat、grep却没有编辑、构建或测试的“假忙”状态;最后加入planning_checklist追踪已完成和待完成需求。

多个完成判断与规划函数被合并为更协调的通用机制
多个完成判断与规划函数被合并为更协调的通用机制。点击查看大图。

这就是Harness RSI与简单记忆的区别:它没有记住某道题的答案,而是从具体失败提炼出重复检测、错误恢复、停滞识别和规划管理。

10 / 好机制叠在一起,也可能互相打架

Agent Loop和Verification单独演化时都有收益,组合后却出现两个completion gate。Agent通过一层后又被另一层拦住,在“完成—验证—再次完成”之间循环直至超时。最终系统只保留Verification作为最终完成判断,并保留Loop里的错误恢复。

这给实际Agent团队一个很实用的提醒:增加更多检查器并不天然更安全。完成判断、权限确认、重试和验证如果没有唯一责任边界,系统可能陷入互相否决。

11 / 行为真的变好了吗?研究用第二把尺子做了检查

团队使用LLM judge,从任务有效性、交互质量、推理可靠性、上下文和状态管理、效率与鲁棒性等维度评估不同代次轨迹。随着Terminal-Bench准确率上升,行为评分也呈现大致一致的趋势。

Benchmark表现和LLM行为评估随演化代次呈现相近趋势
Benchmark表现和LLM行为评估随演化代次呈现相近趋势。点击查看大图。

LLM评委不能替代人工审计、跨任务实验和真实生产测试,但它提供了额外证据:分数变化至少伴随可观察的执行行为变化,而不只是某个评测脚本被偶然满足。

12 / ModularRSI本地复现教程

  1. 准备隔离环境:使用容器或专用虚拟机,不要在包含生产密钥和个人文件的主机直接执行自修改Harness。
  2. 克隆官方仓库:从GitHub获取代码,记录提交版本,阅读README、.env.example和两类许可证。
  3. 建立Python环境:创建venv并执行可编辑安装,避免污染系统Python。
  4. 配置模型端点:在.env中填写API密钥与端点,限制额度并确保文件不会被提交。
  5. 检查启动参数:确认模型、演化任务、rollout次数、并发、预算、验证环境和输出目录。
  6. 运行演化:通过scripts/evolve.sh生成候选Harness,并保留每一代diff、轨迹和验证结果。
  7. 冻结后评测:使用scripts/evaluate.sh在未参与演化的任务上测试,不根据最终评测结果继续调Harness。
  8. 做消融与回滚:单独启用各模块,检查收益、步数、失败类型和模块冲突;任何回归都能恢复上一代。

许可提醒:仓库原创研究部分标为CC BY-NC 4.0,仅限非商业使用;Harbor衍生部分为Apache 2.0,第三方数据与组件另有条款。商业团队不能因为仓库页面显示Apache许可证就默认全部代码和数据可商用。

我的观点:Agent的“能力”越来越像模型与软件系统的乘积

ModularRSI没有让模型获得新知识,而是减少了系统浪费已有能力的方式。一个更强模型如果被糟糕的上下文、工具协议和完成判断拖累,实际表现可能不如较弱模型配合成熟Harness。

这对产品团队比“自动递归进化”的宏大叙事更现实:先把失败轨迹保存下来,建立可复现任务,比较成功与失败路径,把系统性问题转成小范围代码修改,再用隔离评测验证。即使不运行完整ModularRSI,这套方法也能用于改进现有Coding Agent、浏览器Agent和内部自动化。

官方资料与站内延伸

ModularRSI站内导航:
https://www.zuoshipin.com/link/45586.html

官方GitHub仓库: 查看代码、安装与许可证

官方论文: 阅读arXiv论文与实验设计

站内解读:AI Agent Harness到底是什么:
https://www.zuoshipin.com/article/30587

站内盘点:RSI递归自我改进公司:
https://www.zuoshipin.com/article/24075

站内项目:HarnessEval-W开源评测:
https://www.zuoshipin.com/article/24131

DeepSeek Harness站内导航:
https://www.zuoshipin.com/link/23248.html

站内研究:iCoder-27B的Agent研发流程:
https://www.zuoshipin.com/article/30755

更多AI资讯:
https://www.zuoshipin.com/archive/75

常见问题(FAQ)

ModularRSI会更新基础模型权重吗?
不会。实验中基础模型始终冻结,系统只修改Agent Harness,包括循环、观测、工具、上下文和任务完成判断。
ModularRSI的Terminal-Bench提升有多少?
使用DeepSeek-V4-Flash-Preview时,Terminal-Bench 2.0准确率从47.57%提高到52.43%,增加4.86个百分点。该结果来自论文实验,不代表所有Agent和任务都会获得同样收益。
ModularRSI如何避免针对Benchmark作弊?
它使用与最终Benchmark隔离的演化任务池,聚合多任务证据,并通过Diff Review检查任务特定常量与单实例规则;最终评测前Harness被冻结。
为什么中等难度任务更适合Harness演化?
中等难度任务同时产生成功和失败轨迹,系统可以在相同任务与环境下对比关键决策;太简单缺少失败证据,太难又缺少成功参照。
ModularRSI代码可以直接商用吗?
不能一概而论。原创研究部分采用CC BY-NC 4.0,仅限非商业使用;Harbor衍生代码为Apache 2.0,第三方组件和数据集遵循各自许可。
0 点赞
0 收藏
分享
0 讨论
反馈
热门资讯
相关素材

暂无数据