大模型与AI Agent Benchmark、轨迹评估、SWE-Bench和Terminal-Bench研究。
ModularRSI冻结基础模型,使用独立任务轨迹演化Agent Loop、工具、观测、上下文和完成判断,并评…