RSI不是一句“AI会自我升级”的口号。真正值得比较的是:谁提出改法、谁执行实验、谁验证结果,以及改进能否被下一轮继承。
递归自我改进(Recursive Self-Improvement)正成为AI创业密集方向,但严格意义的RSI要求系统改进“制造下一代AI的方法”,并让下一代继承这种改进。目前公开项目更多处于自动调优、AI Scientist或自动化实验室阶段。本文按验证信号由硬到软,梳理七家公司。
一、先看懂RSI:四步闭环与三种验证强度
- 提出改进假设;
- 执行代码、训练或实验;
- 用独立信号验证是否真的变好;
- 把有效经验保留给下一轮。
硬件计时、可执行测试和隐藏Benchmark通常更硬;AI评审和内部叙述更软。系统越能高速实验,越要防止奖励作弊、公开测试集过拟合与自我打分。
二、INT21:硬件计时是最难“讨好”的评估器

INT21站内导航。INT21用多Agent探索推理引擎与GPU Kernel,候选必须编译、通过正确性测试并在真实硬件测速。优势是目标明确、反馈可执行;限制是算子级优化不能直接等同整个模型加速,且目前更接近自动调优而非严格RSI。
三、rekursiv.ai:AI Scientist开始选择假设

rekursiv.ai站内导航。研究者给出问题,系统组织多个AI Scientist提出假设、写代码、跑实验和维护排行榜。价值在于失败方向如何被解释和止损;风险是公开Benchmark反复实验可能过拟合,迁移到陌生任务才是关键。
四、Inherent:改进对象从模型扩大到整间实验室

Inherent站内导航。Inherent把人员协作、算力分配、实验流程和AI Scientist共同视为可改进系统。它强调人机集体智能,但AI评AI仍需更多独立审计、专家校准和跨领域复现。
五、Core Automation:先自动化自己的AI实验室

Core Automation站内导航。Core聚焦新学习算法和超越现有Transformer配方的架构,并把自动化自身研究作为起点。团队背景强,但公开产品、Benchmark和可复现证据仍有限,应把路线图与已验证成果分开。
六、Mirendil:专用研究模型与实验数据飞轮

Mirendil站内导航。其设想是让专用模型持续参与代码、训练、评估、调试、Kernel和算力管理,积累通用模型缺少的完整研究轨迹。当前数据飞轮仍需要公开模型、独立Benchmark和客户复现来证明。
七、Recursive:目标最激进,也开始公开闭环数据

Recursive站内导航。它强调多条长期研究分支、合并路线和奖励作弊检查。公开实验说明闭环可以跑通,但更重要的问题是:经验能否跨任务继承、多轮后能否用更少实验找到更好方案、外部团队能否复现。
八、Discovery Loop:把实验吞吐量做成系统工程

Discovery Loop站内导航。团队强调大规模并行实验与基础设施,先服务自身研究,再扩展到结果可测量的科学领域。挑战在于物理实验周期、安全约束和目标价值判断,不能简单复制ML中几小时返回Loss的节奏。
九、七家公司怎么比较?
| 项目 | 改进对象 | 主要验证信号 |
|---|---|---|
| INT21 | Kernel/推理引擎 | 硬件计时+正确性 |
| rekursiv.ai | ML算法 | Benchmark+实验记录 |
| Inherent | AI Scientist与实验室 | AI评审+专家校准 |
| Core Automation | 学习算法与实验室 | 内部研究证据 |
| Mirendil | 研究模型与平台 | 尚待公开验证 |
| Recursive | 研究代码与流程 | 可执行实验+指标 |
| Discovery Loop | 跨领域实验系统 | 实验结果与领域指标 |
十、FAQ
RSI已经实现了吗?
严格意义上尚无公开证据证明系统能持续改进制造下一代AI的方法并稳定继承。
AI Scientist和RSI一样吗?
不一样。AI Scientist自动做实验,但只有改进研究方法并可继承时才更接近RSI。
为什么验证信号最重要?
因为系统可能奖励作弊、过拟合或自我打高分;硬件计时和独立测试更难被操纵。
融资和团队背景能证明技术吗?
不能。它们说明资源与潜力,产品能力仍需公开实验和独立复现。
接下来观察什么?
关注跨任务迁移、失败披露、独立复现、长期继承和单位实验成本。






