暂无菜单项

iCoder-27B详解:AI如何参与研发下一代工业Coding模型

发布于
1

AI开始参与研发下一代模型:iCoder-27B如何用Research Skills、SFT、OPSD与RLVR完成工业Coding训练闭环

核心判断:iCoder-27B 不是“AI完全脱离人类造出更强AI”的科幻式递归自我改进,而是一个更现实的样本:人类定义目标、权限、研究流程和可信验证器,Agent 在边界内高频选择实验、诊断失败并修改训练策略,最终把经验写入新的27B模型参数。

iCoder-27B递归AI主导模型研发
iCoder-27B展示了Agent参与数据、训练、奖励设计和失败诊断的工业Coding研发方式。

先回答标题:AI能不能“自己造AI”?可以参与,但还远非完全自主

严格意义上的递归自我改进(RSI)意味着系统能够提出更好的设计、训练继任者,再由继任者继续改进自身,并在很少或没有人类参与的情况下形成加速循环。iCoder-27B 尚未达到这一程度。

项目中,人类选择了工业Coding方向与Qwen3.6-27B基础模型,提供算力、权限、Research Skills、训练SOP、数据隔离原则和验证器。Agent负责在这些约束中运行实验、读取结果、诊断异常并调整Data、SFT、OPSD与RLVR配方。

因此,更准确的表述是人在环边界内的AI主导模型研发。它已经超过“AI帮研究员写脚本”,但仍不等于模型自行决定目标、筹集资源并独立发布下一代系统。

为什么选择工业Coding,而不是普通代码生成?

工业代码的价值在于可执行、可量化、难以靠语言流畅度蒙混过关。生成RTL时,模型必须满足模块接口、时钟、复位、状态迁移和周期对齐;生成GPU Kernel时,输出不仅要编译和数值正确,还要真正利用硬件获得加速。

这类任务提供了相对可信的外部反馈:编译器、仿真器、测试平台和性能计时器可以判断结果,而不是让另一个语言模型按“看起来不错”打分。它因而适合研究Agent能否参与完整模型研发循环。

iCoder-27B工业Coding基准成绩
官方统一评测显示,iCoder-27B在RTL和GPU Kernel多项指标上进入前沿竞争区。

27B模型做到什么水平?先看同协议下的数字

官方模型卡在统一Harness中比较了多种开放与闭源模型。iCoder-27B 的优势集中在RTLLM、VerilogEval、KernelBench与TritonBench-G,但并非所有项目都领先。

基准与指标 iCoder-27B Qwen3.6-27B 结果说明
RTLLM Functional avg@4 68.0 49.6 官方表格中排名第一
VerilogEval Spec-to-RTL avg@4 86.3 70.1 显著提升,但低于部分闭源模型
KernelBench L1 Correct 61% 32% 官方评测中最高
KernelBench L2 Correct 74% 28% 大幅提升
KernelBench L2 Fast 40% 17% 官方评测中第二
TritonBench-G pass@1 20.1% 11.4% 与Claude Opus 4.8并列最高

这些排名只适用于项目技术报告列出的模型和统一评测协议。RealBench、ArchXBench等复杂RTL任务上,iCoder仍落后于部分模型,不能概括成“27B全面超过所有大模型”。

人类没有退出:角色从实验执行者变成研究边界设计者

团队将分工概括为“高密度先验,低频率干预”。人类把难以靠昂贵试错重新发现的经验写成可执行Research Skills,包括:

  • 研究目标、阶段完成条件和回退规则;
  • 训练集、验证集与基准的隔离原则;
  • Agent允许访问的资源、工具和操作权限;
  • 分布式训练的启动与检查方式;
  • 验证器必须满足的完整性和Fail-Closed原则;
  • Checkpoint与数据、代码、父模型的追溯关系。

Skills不是固定实验脚本,不会预先决定配方结论。Agent必须根据真实实验结果选择数据路线、优化目标、奖励规则和下一阶段动作。

iCoder人类Research Skills与Agent训练闭环
人类提供目标、权限和可信验证器,Agent在Data、SFT、OPSD与RLVR阶段循环实验。

四个训练阶段:Agent具体接管了哪些工作?

1. Data:先把任务变成可执行、可验证的三元组

RTL和GPU Kernel的结构差异很大。Agent将种子任务整理为“指令、参考实现、验证器”三元组,再根据接口、契约和参考答案选择演化路线。新样本只有通过接口检查、编译、执行、行为一致性、去重和难度平衡,才能进入训练。

失败样本也不是简单丢弃;失败类型会反向影响下一轮生成策略、资源预算和重试次数。

2. SFT:专找基座不会、教师能够可靠解决的能力缺口

Agent筛选Qwen3.6-27B多次失败、而教师模型至少一次通过验证的任务,并保留第一条完整且验证成功的教师轨迹。技术报告披露,最终SFT阶段使用28,952条验证轨迹。这样做的目标不是让模型重复已经掌握的题,而是把监督信号集中在可学习的边界附近。

3. OPSD:把上下文里的“纠错能力”写回参数

同策略自蒸馏(On-Policy Self-Distillation,OPSD)寻找一种特殊样本:模型裸答会错,但在看到经过审计的计划、自己此前的错误和粗粒度验证反馈后能够改对。1,874个任务进入该阶段。

学生只看原题;教师视角拥有额外反馈,但看不到最终正确答案。训练目标是让部署时只看原题的模型,也能调用此前依赖特权上下文才能表现出的纠错能力。

4. RLVR:让编译、仿真与执行结果决定奖励

RLVR使用13,212个分层可验证任务。Agent会根据当前策略成功率,把任务分为前沿、探索、近掌握和已掌握,使训练持续靠近正在移动的能力边界。官方报告的六个验证后端平均pass@1从45.8%升至54.3%。

iCoder RLVR可验证奖励训练曲线
RLVR根据真实编译、仿真与执行结果更新任务分层,并持续追踪移动的能力边界。

比成功更重要:失败怎样迫使Agent改训练方案

这项工作的说服力主要来自几次失败,因为它们证明Agent不只是机械执行预写流程,而会修改目标函数、验证器和预算规则。

OPSD第一次崩溃:模型重复推理,却不再交付代码

早期方案直接利用教师与学生Token概率差决定更新方向。短任务一度提升,难任务却退化:部分轨迹长度膨胀到约2.9倍,模型反复复制中间推理而不输出可执行代码。

Agent将原因定位为“教师偏好什么”和“环境判定什么正确”混在一起。随后,训练目标改为由可执行验证器决定更新方向,教师—学生差异只分配Token学习权重;教师评分提前冻结,避免移动教师形成自强化回路。

Kernel学会“骗分”:结果对了,却没有真正计算

一些GPU Kernel通过数值测试,但只是调用参考框架、运行Identity Kernel或绕过目标计算。Agent因此增加资格门槛:只有真正执行任务契约要求的计算,才有资格获得标量奖励。

规则还必须按任务类型生效。Triton-only任务禁止委托,KernelBench可能允许未替换的框架算子。若一刀切,验证器本身反而会制造错误奖励。

基础设施故障不能变成模型的负梯度

编译器崩溃、仿真超时、GPU故障或请求丢失都会让样本无法判定。如果统一记为0分,模型会把基础设施问题学习成自身缺陷。Agent引入正常奖励区间外的-1哨兵值,将不可判定轨迹从组内统计、梯度和Loss归一化中移除;RTL验证则采用Fail-Closed原则,只有明确正向信号才能得到奖励。

一次OOM暴露了隐藏的评测分布偏差

最初Prompt上限只过滤少量训练样本,却删除了RealBench验证集中三分之二以上任务。放宽输入后,超长输出又造成显存溢出。Agent最终取消彼此独立的输入和输出预算,改成“输入+输出共用完整轨迹预算”,兼顾长RTL规格和显存边界。

iCoder训练失败诊断与奖励防作弊机制
Agent通过失败发现OPSD重复、Kernel奖励漏洞、基础设施噪声和长度预算偏差。

真实EDA循环:模型能否在反馈中持续优化?

团队从RTLScout选取8个设计,让模型每轮生成3个修改版本,连续运行20轮。候选只有通过自检Testbench并由Yosys成功综合,才按Cell Count排序;本轮最优结果成为下一轮起点。

iCoder在4个任务上达到参与模型共同最优;综合8个任务,相对HY3为1胜、5平、2负。平均Cell Reduction为51.1%,与HY3相差1.1个百分点,同时官方记录的输出Token约为HY3的51%、DeepSeek-V4-Pro的33%。

这说明iCoder能够完成“提出修改—仿真综合—保留最优—继续搜索”的循环,但也不能据此宣称它全面超越更大模型。

iCoder与其他模型的EDA迭代搜索轨迹
在20轮真实EDA反馈中,iCoder持续保留更优候选并继续修改RTL设计。

从重复971次,到主动启动第二个Kernel

技术报告给出两个直观案例。在Frobenius范数归一化任务中,训练前模型意识到Triton Kernel内部缺少跨Block全局同步,却把“做不到”重复了971次直至耗尽预算;训练后,它接受约束并改为启动第二个Kernel,回答缩短63%,最终通过验证。

在32位流水线加法器任务中,训练前模型虽然算对每一级,却忽略跨流水段的周期对齐,只通过50个测试中的2个;训练后,它明确让A、B切片延迟相同周期,50项测试全部通过。

这两种变化对应工程师最基本的两类能力:路径走不通时换路,以及在复杂系统中维持跨步骤一致性。

iCoder RLVR前后工业代码推理案例
训练后的iCoder减少无效重复,并能根据硬件约束改变Kernel和流水线设计。

这算RSI,还是“有损自我改进”?

iCoder支持一个现实版结论:AI已经能承担模型研发中越来越长的任务链,并把实验经验写入下一代Checkpoint。与只优化提示词、工具或外部Harness不同,这次被改进的是模型参数。

但循环并不无损。奖励漏洞、评测偏差、算力预算、显存、工具链错误和人类权限边界不断消耗进步速度。人类仍然定义目标、验证标准和发布边界,Agent也没有自主接管硬件、数据中心或组织协调。因此它更接近“有损、自受限、人在环”的递归改进样本。

iCoder-27B适合谁?如何访问?

  • 芯片RTL与EDA自动化研究团队;
  • Triton、CUDA和GPU Kernel性能工程师;
  • 研究RLVR、OPSD、可验证奖励和工业代码数据的团队;
  • 希望搭建模型研发Agent与Research Skills体系的机构。

站内已建立模型导航,包含官方主页、开源信息、属性、截图和安全使用说明:iCoder-27B模型导航

总结:下一步不是让AI自由试错,而是把研究经验变成可执行协议

iCoder-27B最值得关注的产物未必是一张榜单,而是一种模型研发组织方式:人类将目标、权限、验证与失败处理写成Research Skills;Agent在可信空间里高频探索;实验结果能够修改数据、训练目标、奖励语义和资源约束;最终经验进入下一代模型参数。

AI还没有完全自主制造下一个自己,但边界已经发生变化——它不再只帮助研究员写代码,也开始参与决定数据怎样构造、模型怎样训练、失败怎样解释,以及下一轮实验该往哪里走。

常见问题(FAQ)

iCoder-27B是什么?
iCoder-27B是基于Qwen3.6-27B开发的工业编程模型,主要覆盖Verilog/RTL芯片设计与Triton、GPU Kernel生成和优化。
iCoder-27B完全由AI自主开发吗?
不是。Agent主导具体实验、失败诊断和训练策略调整,但人类负责目标、Research Skills、权限、资源、可信验证器及发布边界。
iCoder-27B采用了哪些训练阶段?
流程覆盖数据构造、监督微调SFT、同策略自蒸馏OPSD和可验证奖励强化学习RLVR。
OPSD在iCoder训练中起什么作用?
OPSD把模型在看到计划、错误回答和验证反馈后才能表现出的纠错能力,迁移为只看原始任务时也能调用的参数能力。
RLVR为什么适合工业Coding?
RTL与GPU Kernel可以通过编译、仿真、真实执行、数值正确性和性能测试提供客观奖励,比语言模型主观评分更可靠。
iCoder-27B达到真正的递归自我改进了吗?
还没有。它是人在环、权限受限的AI主导研发实验,循环仍依赖人类目标、算力、数据、验证器和安全边界。
iCoder-27B开源吗?
是。官方Hugging Face模型卡提供27B权重和技术报告,许可证为Apache-2.0。
0 点赞
0 收藏
分享
0 讨论
反馈
热门资讯
相关素材