暂无菜单项

Google WikiSkill深度解析:三层知识架构如何让AI Agent技能自己进化?

发布于
4

Google Research 的 WikiSkill 不靠重新训练模型,而是让 Agent 把成功与失败沉淀为持久知识,再从知识中持续生成、验证和改进技能。

AI Agent 为什么总在重复犯错?常见原因并不是模型完全没有能力,而是执行轨迹中已经出现过的经验没有被系统保存:一次失败分析完就丢,一次成功策略也难以稳定复用。新论文 WikiSkill 给出了一套更工程化的答案——在原始经验和可执行 Skill 之间,加入持续积累的 Wiki。

这套设计把“发生了什么”“我们学到了什么”“下一次该怎么做”拆成三个层次,并通过验证门控决定技能更新是否生效。它并不是一个面向普通用户的一键产品,而是一种值得 Agent 开发者参考的技能进化架构。

WikiSkill 框架概览
WikiSkill 让执行经验、结构化知识和可执行技能协同进化。

一、WikiSkill 是什么?一句话说清核心思路

WikiSkill 是由 Google Research 研究人员提出的 Agent 技能进化框架。它不改变底层模型参数,而是把 Agent 的指令、脚本和资源组织成文件化 Skill,再根据真实任务中的成功和失败轨迹持续修改这些 Skill。

与只分析一次轨迹、直接修改技能的方法相比,WikiSkill 最关键的变化是建立一个独立、持久的知识层。即使某次技能补丁在验证阶段被拒绝,对应的失败原因、修改差异和评估结果也会被保存,下一轮不必从零开始。

二、为什么不能只让Agent“复盘后改Prompt”?

单轮复盘很容易遇到三个问题:经验散落在长日志中、技能修改缺乏设计溯源,以及回滚时连同有价值的失败知识一起丢失。随着迭代增多,Agent 可能不断提出相似补丁,却不知道此前为什么失败。

WikiSkill 把知识当成独立资产:技能只是当前可执行版本,Wiki 才是长期积累的“研发记录”。这让 Agent 的改进过程更接近有日志、有评审、有回归测试的软件工程。

WikiSkill 三层知识架构
三层结构分别回答:发生了什么、学到了什么、应该怎么做。

三、Raw Layer:保存不可变的事实记录

Raw Layer 保存每轮训练任务的完整执行轨迹,包括观察、推理过程、工具调用、工具返回和最终答案。它被设计为不可变层,因为后续的根因分析和技能提案都需要回到原始证据,避免结构化摘要把关键细节过度压缩。

在实际工程中,可以把这一层理解为 Agent 的运行日志仓库。除了结果,还应保存模型版本、Skill 版本、工具权限、输入数据哈希和执行时间,才能真正复现实验。

四、Wiki Layer:把一次性经验编译成结构化知识

Wiki Layer 是整个框架的核心,主要包含三类内容:

  • patterns/:每个成功策略或失败模式独立成页,记录现象、根因、证据和可操作的修复方案。
  • logs.md:按迭代记录新发现、知识合并和技能变化。
  • skill-impact.md:保存每次技能提案、差异、验证分数以及接受或拒绝结果。

Wiki 不随技能回滚而清空。某个补丁被拒绝,只代表它暂时没有提升验证集成绩,并不代表这次尝试没有知识价值。

五、Skills Layer:SKILL.md负责执行,PURPOSE.md负责溯源

Skills Layer 保存当前生效的程序化知识。每个技能目录至少包含 SKILL.mdPURPOSE.md:前者告诉 Agent 如何执行任务,后者说明这项技能针对哪些 Wiki Pattern、为什么被创建或修改。

这种设计解决了“规则存在但没人知道原因”的维护难题。当未来准备删除、合并或改写技能时,开发者和 Agent 都能回溯当初的证据与目标。

六、四步进化循环:执行、整理、提案、门控

  1. Inference Agent:使用当前技能在训练任务上执行 rollout,并把轨迹写入 Raw Layer。
  2. Wiki Maintainer:分析成功与失败样本,提炼模式、根因和解决策略。
  3. Skill Proposer:读取 Wiki、历史影响记录和必要轨迹,提出一次技能创建或补丁。
  4. Gating & Rollback:在独立验证集上评估候选技能;成绩提高才接受,否则回滚技能,但保留 Wiki 记录。

论文特意限制 Inference Agent 在训练 rollout 中直接访问 Wiki,防止它靠查知识库完成任务,导致轨迹无法真实反映当前 Skill 的质量。

WikiSkill 实验结果
WikiSkill 在多个任务与模型上验证技能进化和模型规模之间的关系。

七、实验结果:9B模型加Skill,超过27B无技能模型

研究在五个基准、五个模型上测试,任务覆盖数学推理、网页搜索、电子表格、长文档问答和交互式具身任务。论文报告,在 Qwen 家族内,WikiSkill 为 4B、9B、27B 模型带来的平均增益分别为 12.3、17.5 和 23.9 个百分点,说明模型能力和技能进化并非替代关系,强模型也能从好技能中获益。

更醒目的对比是:Qwen-3.5-9B 配合 WikiSkill 平均达到 47.4%,超过 Qwen-3.6-27B 无技能时的 39.4%。但这不是“所有小模型都能普遍击败大模型”的结论,而是特定基准、工具和评估配置下的实验结果。

八、技能可以跨模型迁移,发现与执行是两种能力

在 ALFWorld 上,Qwen-3.5-9B 使用 Qwen-3.6-27B 进化出的技能达到 70.2%,高于使用自身进化技能时的 63.4%。这提示我们:更强模型可以承担“发现策略和编写技能”的工作,再由成本更低的小模型负责稳定执行。

对企业来说,这可能形成“强模型研发流程、小模型批量运行”的分层架构,但迁移前仍要检查工具协议、上下文格式和模型遵循指令的差异。

WikiSkill Wiki消融与技能演化分析
消融实验显示,持久知识是后续技能提案的重要基础。

九、Wiki到底有多重要?消融实验给出15个百分点差距

在 Gemini-3.5-Flash 的消融实验中,当 Inference Agent 不访问 Wiki 时,让 Skill Proposer 使用持久 Wiki,平均成绩从 48.7% 提升至 63.7%,增加 15 个百分点。这表明价值不只来自“多写一份文档”,而是来自跨迭代保存失败模式、拒绝记录和修复证据。

反过来,让 Inference Agent 在训练时直接读取 Wiki,最终平均成绩从 63.7% 降到 60.9%。论文推测,Agent 可能直接借助 Wiki 解题,使 rollout 不再充分暴露技能缺陷。

十、如何落地到真实Agent项目?

团队可以先从轻量版本开始:为每次任务保存结构化运行记录;失败后生成 Pattern 页面;每个 Skill 绑定用途说明;所有修改经过固定验证集;拒绝的补丁也进入影响日志。随后再加入自动聚类、相似 Pattern 合并和成本控制。

如果团队正在使用 Codex 或其他支持文件化 Skills 的 Agent,可以把 WikiSkill 的思想用于代码审查、内容发布、浏览器自动化和数据处理流程。关于 ChatGPT Work 中的 Skills、插件和长任务能力,可继续阅读 ChatGPT Work 与 Codex 同款能力解析

十一、生产环境必须补上的安全设计

  • 对日志进行脱敏,避免 Wiki 长期保存密钥、账号、客户数据或隐私内容。
  • 把训练集、验证集和测试集严格隔离,防止技能针对固定答案过拟合。
  • 高风险工具采用白名单和人工确认,技能更新不能自动扩大权限。
  • 记录模型、工具与依赖版本,避免环境变化被误判为技能提升。
  • 为 Wiki 设置合并、过期和裁剪机制,控制上下文与存储成本。

十二、当前局限:WikiSkill还不是“无限自我进化”

论文直接把当前技能注入提示词,以隔离技能检索和触发错误,因此没有回答技能库扩大后如何准确选中 Skill。严格门控也会拒绝短期无增益、但可能为后续改进铺路的中性修改。此外,Wiki 持续增长却缺少自动裁剪机制,实验也未覆盖连续数小时、数百次动作的超长任务。

所以,更准确的说法是:WikiSkill 展示了可审计、可验证的技能持续优化,而不是让 Agent 无限制地自行修改一切。

结语:真正能复利的不是一次答案,而是可积累的经验

WikiSkill 的价值在于把 Agent 改进从“凭感觉改 Prompt”升级为一套有事实记录、知识沉淀、技能溯源和验证门控的工程流程。未来的智能体竞争,除了模型本身的能力,也会越来越取决于谁能更系统地保存失败、提炼经验,并把知识转化为可靠的执行程序。

0 点赞
0 收藏
分享
0 讨论
反馈
热门资讯
相关素材