AI开始参与研发下一代模型:iCoder-27B如何用Research Skills、SFT、OPSD与RLVR完成工业Coding训练闭环
核心判断:iCoder-27B 不是“AI完全脱离人类造出更强AI”的科幻式递归自我改进,而是一个更现实的样本:人类定义目标、权限、研究流程和可信验证器,Agent 在边界内高频选择实验、诊断失败并修改训练策略,最终把经验写入新的27B模型参数。

先回答标题:AI能不能“自己造AI”?可以参与,但还远非完全自主
严格意义上的递归自我改进(RSI)意味着系统能够提出更好的设计、训练继任者,再由继任者继续改进自身,并在很少或没有人类参与的情况下形成加速循环。iCoder-27B 尚未达到这一程度。
项目中,人类选择了工业Coding方向与Qwen3.6-27B基础模型,提供算力、权限、Research Skills、训练SOP、数据隔离原则和验证器。Agent负责在这些约束中运行实验、读取结果、诊断异常并调整Data、SFT、OPSD与RLVR配方。
因此,更准确的表述是人在环边界内的AI主导模型研发。它已经超过“AI帮研究员写脚本”,但仍不等于模型自行决定目标、筹集资源并独立发布下一代系统。
为什么选择工业Coding,而不是普通代码生成?
工业代码的价值在于可执行、可量化、难以靠语言流畅度蒙混过关。生成RTL时,模型必须满足模块接口、时钟、复位、状态迁移和周期对齐;生成GPU Kernel时,输出不仅要编译和数值正确,还要真正利用硬件获得加速。
这类任务提供了相对可信的外部反馈:编译器、仿真器、测试平台和性能计时器可以判断结果,而不是让另一个语言模型按“看起来不错”打分。它因而适合研究Agent能否参与完整模型研发循环。

27B模型做到什么水平?先看同协议下的数字
官方模型卡在统一Harness中比较了多种开放与闭源模型。iCoder-27B 的优势集中在RTLLM、VerilogEval、KernelBench与TritonBench-G,但并非所有项目都领先。
| 基准与指标 | iCoder-27B | Qwen3.6-27B | 结果说明 |
|---|---|---|---|
| RTLLM Functional avg@4 | 68.0 | 49.6 | 官方表格中排名第一 |
| VerilogEval Spec-to-RTL avg@4 | 86.3 | 70.1 | 显著提升,但低于部分闭源模型 |
| KernelBench L1 Correct | 61% | 32% | 官方评测中最高 |
| KernelBench L2 Correct | 74% | 28% | 大幅提升 |
| KernelBench L2 Fast | 40% | 17% | 官方评测中第二 |
| TritonBench-G pass@1 | 20.1% | 11.4% | 与Claude Opus 4.8并列最高 |
这些排名只适用于项目技术报告列出的模型和统一评测协议。RealBench、ArchXBench等复杂RTL任务上,iCoder仍落后于部分模型,不能概括成“27B全面超过所有大模型”。
人类没有退出:角色从实验执行者变成研究边界设计者
团队将分工概括为“高密度先验,低频率干预”。人类把难以靠昂贵试错重新发现的经验写成可执行Research Skills,包括:
- 研究目标、阶段完成条件和回退规则;
- 训练集、验证集与基准的隔离原则;
- Agent允许访问的资源、工具和操作权限;
- 分布式训练的启动与检查方式;
- 验证器必须满足的完整性和Fail-Closed原则;
- Checkpoint与数据、代码、父模型的追溯关系。
Skills不是固定实验脚本,不会预先决定配方结论。Agent必须根据真实实验结果选择数据路线、优化目标、奖励规则和下一阶段动作。

四个训练阶段:Agent具体接管了哪些工作?
1. Data:先把任务变成可执行、可验证的三元组
RTL和GPU Kernel的结构差异很大。Agent将种子任务整理为“指令、参考实现、验证器”三元组,再根据接口、契约和参考答案选择演化路线。新样本只有通过接口检查、编译、执行、行为一致性、去重和难度平衡,才能进入训练。
失败样本也不是简单丢弃;失败类型会反向影响下一轮生成策略、资源预算和重试次数。
2. SFT:专找基座不会、教师能够可靠解决的能力缺口
Agent筛选Qwen3.6-27B多次失败、而教师模型至少一次通过验证的任务,并保留第一条完整且验证成功的教师轨迹。技术报告披露,最终SFT阶段使用28,952条验证轨迹。这样做的目标不是让模型重复已经掌握的题,而是把监督信号集中在可学习的边界附近。
3. OPSD:把上下文里的“纠错能力”写回参数
同策略自蒸馏(On-Policy Self-Distillation,OPSD)寻找一种特殊样本:模型裸答会错,但在看到经过审计的计划、自己此前的错误和粗粒度验证反馈后能够改对。1,874个任务进入该阶段。
学生只看原题;教师视角拥有额外反馈,但看不到最终正确答案。训练目标是让部署时只看原题的模型,也能调用此前依赖特权上下文才能表现出的纠错能力。
4. RLVR:让编译、仿真与执行结果决定奖励
RLVR使用13,212个分层可验证任务。Agent会根据当前策略成功率,把任务分为前沿、探索、近掌握和已掌握,使训练持续靠近正在移动的能力边界。官方报告的六个验证后端平均pass@1从45.8%升至54.3%。

比成功更重要:失败怎样迫使Agent改训练方案
这项工作的说服力主要来自几次失败,因为它们证明Agent不只是机械执行预写流程,而会修改目标函数、验证器和预算规则。
OPSD第一次崩溃:模型重复推理,却不再交付代码
早期方案直接利用教师与学生Token概率差决定更新方向。短任务一度提升,难任务却退化:部分轨迹长度膨胀到约2.9倍,模型反复复制中间推理而不输出可执行代码。
Agent将原因定位为“教师偏好什么”和“环境判定什么正确”混在一起。随后,训练目标改为由可执行验证器决定更新方向,教师—学生差异只分配Token学习权重;教师评分提前冻结,避免移动教师形成自强化回路。
Kernel学会“骗分”:结果对了,却没有真正计算
一些GPU Kernel通过数值测试,但只是调用参考框架、运行Identity Kernel或绕过目标计算。Agent因此增加资格门槛:只有真正执行任务契约要求的计算,才有资格获得标量奖励。
规则还必须按任务类型生效。Triton-only任务禁止委托,KernelBench可能允许未替换的框架算子。若一刀切,验证器本身反而会制造错误奖励。
基础设施故障不能变成模型的负梯度
编译器崩溃、仿真超时、GPU故障或请求丢失都会让样本无法判定。如果统一记为0分,模型会把基础设施问题学习成自身缺陷。Agent引入正常奖励区间外的-1哨兵值,将不可判定轨迹从组内统计、梯度和Loss归一化中移除;RTL验证则采用Fail-Closed原则,只有明确正向信号才能得到奖励。
一次OOM暴露了隐藏的评测分布偏差
最初Prompt上限只过滤少量训练样本,却删除了RealBench验证集中三分之二以上任务。放宽输入后,超长输出又造成显存溢出。Agent最终取消彼此独立的输入和输出预算,改成“输入+输出共用完整轨迹预算”,兼顾长RTL规格和显存边界。

真实EDA循环:模型能否在反馈中持续优化?
团队从RTLScout选取8个设计,让模型每轮生成3个修改版本,连续运行20轮。候选只有通过自检Testbench并由Yosys成功综合,才按Cell Count排序;本轮最优结果成为下一轮起点。
iCoder在4个任务上达到参与模型共同最优;综合8个任务,相对HY3为1胜、5平、2负。平均Cell Reduction为51.1%,与HY3相差1.1个百分点,同时官方记录的输出Token约为HY3的51%、DeepSeek-V4-Pro的33%。
这说明iCoder能够完成“提出修改—仿真综合—保留最优—继续搜索”的循环,但也不能据此宣称它全面超越更大模型。

从重复971次,到主动启动第二个Kernel
技术报告给出两个直观案例。在Frobenius范数归一化任务中,训练前模型意识到Triton Kernel内部缺少跨Block全局同步,却把“做不到”重复了971次直至耗尽预算;训练后,它接受约束并改为启动第二个Kernel,回答缩短63%,最终通过验证。
在32位流水线加法器任务中,训练前模型虽然算对每一级,却忽略跨流水段的周期对齐,只通过50个测试中的2个;训练后,它明确让A、B切片延迟相同周期,50项测试全部通过。
这两种变化对应工程师最基本的两类能力:路径走不通时换路,以及在复杂系统中维持跨步骤一致性。

这算RSI,还是“有损自我改进”?
iCoder支持一个现实版结论:AI已经能承担模型研发中越来越长的任务链,并把实验经验写入下一代Checkpoint。与只优化提示词、工具或外部Harness不同,这次被改进的是模型参数。
但循环并不无损。奖励漏洞、评测偏差、算力预算、显存、工具链错误和人类权限边界不断消耗进步速度。人类仍然定义目标、验证标准和发布边界,Agent也没有自主接管硬件、数据中心或组织协调。因此它更接近“有损、自受限、人在环”的递归改进样本。
iCoder-27B适合谁?如何访问?
- 芯片RTL与EDA自动化研究团队;
- Triton、CUDA和GPU Kernel性能工程师;
- 研究RLVR、OPSD、可验证奖励和工业代码数据的团队;
- 希望搭建模型研发Agent与Research Skills体系的机构。
站内已建立模型导航,包含官方主页、开源信息、属性、截图和安全使用说明:iCoder-27B模型导航。
总结:下一步不是让AI自由试错,而是把研究经验变成可执行协议
iCoder-27B最值得关注的产物未必是一张榜单,而是一种模型研发组织方式:人类将目标、权限、验证与失败处理写成Research Skills;Agent在可信空间里高频探索;实验结果能够修改数据、训练目标、奖励语义和资源约束;最终经验进入下一代模型参数。
AI还没有完全自主制造下一个自己,但边界已经发生变化——它不再只帮助研究员写代码,也开始参与决定数据怎样构造、模型怎样训练、失败怎样解释,以及下一轮实验该往哪里走。











