### [Google WikiSkill深度解析:三层知识架构如何让AI Agent技能自己进化?](https://www.zuoshipin.com/article/30545) **Published:** 2026-09-01T06:53:33 **Author:** 天才交易员 **Excerpt:** Google Research提出WikiSkill,用Raw、Wiki和Skills三层架构积累Agent经… Google Research 的 WikiSkill 不靠重新训练模型,而是让 Agent 把成功与失败沉淀为持久知识,再从知识中持续生成、验证和改进技能。 AI Agent 为什么总在重复犯错?常见原因并不是模型完全没有能力,而是执行轨迹中已经出现过的经验没有被系统保存:一次失败分析完就丢,一次成功策略也难以稳定复用。新论文 **WikiSkill** 给出了一套更工程化的答案——在原始经验和可执行 Skill 之间,加入持续积累的 Wiki。 这套设计把“发生了什么”“我们学到了什么”“下一次该怎么做”拆成三个层次,并通过验证门控决定技能更新是否生效。它并不是一个面向普通用户的一键产品,而是一种值得 Agent 开发者参考的技能进化架构。 ![WikiSkill 框架概览](https://admin.zuoshipin.com/wp-content/uploads/2026/09/a937527b-a5ac-11f1-9243-fa163e47d677.webp) WikiSkill 让执行经验、结构化知识和可执行技能协同进化。 ## 一、WikiSkill 是什么?一句话说清核心思路 [WikiSkill](https://www.zuoshipin.com/link/30544.html) 是由 Google Research 研究人员提出的 Agent 技能进化框架。它不改变底层模型参数,而是把 Agent 的指令、脚本和资源组织成文件化 Skill,再根据真实任务中的成功和失败轨迹持续修改这些 Skill。 与只分析一次轨迹、直接修改技能的方法相比,WikiSkill 最关键的变化是建立一个独立、持久的知识层。即使某次技能补丁在验证阶段被拒绝,对应的失败原因、修改差异和评估结果也会被保存,下一轮不必从零开始。 ## 二、为什么不能只让Agent“复盘后改Prompt”? 单轮复盘很容易遇到三个问题:经验散落在长日志中、技能修改缺乏设计溯源,以及回滚时连同有价值的失败知识一起丢失。随着迭代增多,Agent 可能不断提出相似补丁,却不知道此前为什么失败。 WikiSkill 把知识当成独立资产:技能只是当前可执行版本,Wiki 才是长期积累的“研发记录”。这让 Agent 的改进过程更接近有日志、有评审、有回归测试的软件工程。 ![WikiSkill 三层知识架构](https://admin.zuoshipin.com/wp-content/uploads/2026/09/a99aa6a7-a5ac-11f1-ae62-fa163e47d677.webp) 三层结构分别回答:发生了什么、学到了什么、应该怎么做。 ## 三、Raw Layer:保存不可变的事实记录 Raw Layer 保存每轮训练任务的完整执行轨迹,包括观察、推理过程、工具调用、工具返回和最终答案。它被设计为不可变层,因为后续的根因分析和技能提案都需要回到原始证据,避免结构化摘要把关键细节过度压缩。 在实际工程中,可以把这一层理解为 Agent 的运行日志仓库。除了结果,还应保存模型版本、Skill 版本、工具权限、输入数据哈希和执行时间,才能真正复现实验。 ## 四、Wiki Layer:把一次性经验编译成结构化知识 Wiki Layer 是整个框架的核心,主要包含三类内容: - **patterns/:**每个成功策略或失败模式独立成页,记录现象、根因、证据和可操作的修复方案。 - **logs.md:**按迭代记录新发现、知识合并和技能变化。 - **skill-impact.md:**保存每次技能提案、差异、验证分数以及接受或拒绝结果。 Wiki 不随技能回滚而清空。某个补丁被拒绝,只代表它暂时没有提升验证集成绩,并不代表这次尝试没有知识价值。 ## 五、Skills Layer:SKILL.md负责执行,PURPOSE.md负责溯源 Skills Layer 保存当前生效的程序化知识。每个技能目录至少包含 `SKILL.md` 和 `PURPOSE.md`:前者告诉 Agent 如何执行任务,后者说明这项技能针对哪些 Wiki Pattern、为什么被创建或修改。 这种设计解决了“规则存在但没人知道原因”的维护难题。当未来准备删除、合并或改写技能时,开发者和 Agent 都能回溯当初的证据与目标。 ## 六、四步进化循环:执行、整理、提案、门控 1. **Inference Agent:**使用当前技能在训练任务上执行 rollout,并把轨迹写入 Raw Layer。 2. **Wiki Maintainer:**分析成功与失败样本,提炼模式、根因和解决策略。 3. **Skill Proposer:**读取 Wiki、历史影响记录和必要轨迹,提出一次技能创建或补丁。 4. **Gating & Rollback:**在独立验证集上评估候选技能;成绩提高才接受,否则回滚技能,但保留 Wiki 记录。 论文特意限制 Inference Agent 在训练 rollout 中直接访问 Wiki,防止它靠查知识库完成任务,导致轨迹无法真实反映当前 Skill 的质量。 ![WikiSkill 实验结果](https://admin.zuoshipin.com/wp-content/uploads/2026/09/aa01afc7-a5ac-11f1-9db4-fa163e47d677.webp) WikiSkill 在多个任务与模型上验证技能进化和模型规模之间的关系。 ## 七、实验结果:9B模型加Skill,超过27B无技能模型 研究在五个基准、五个模型上测试,任务覆盖数学推理、网页搜索、电子表格、长文档问答和交互式具身任务。论文报告,在 Qwen 家族内,WikiSkill 为 4B、9B、27B 模型带来的平均增益分别为 **12.3、17.5 和 23.9 个百分点**,说明模型能力和技能进化并非替代关系,强模型也能从好技能中获益。 更醒目的对比是:Qwen-3.5-9B 配合 WikiSkill 平均达到 **47.4%**,超过 Qwen-3.6-27B 无技能时的 **39.4%**。但这不是“所有小模型都能普遍击败大模型”的结论,而是特定基准、工具和评估配置下的实验结果。 ## 八、技能可以跨模型迁移,发现与执行是两种能力 在 ALFWorld 上,Qwen-3.5-9B 使用 Qwen-3.6-27B 进化出的技能达到 **70.2%**,高于使用自身进化技能时的 **63.4%**。这提示我们:更强模型可以承担“发现策略和编写技能”的工作,再由成本更低的小模型负责稳定执行。 对企业来说,这可能形成“强模型研发流程、小模型批量运行”的分层架构,但迁移前仍要检查工具协议、上下文格式和模型遵循指令的差异。 ![WikiSkill Wiki消融与技能演化分析](https://admin.zuoshipin.com/wp-content/uploads/2026/09/aa6b70b4-a5ac-11f1-98ad-fa163e47d677.webp) 消融实验显示,持久知识是后续技能提案的重要基础。 ## 九、Wiki到底有多重要?消融实验给出15个百分点差距 在 Gemini-3.5-Flash 的消融实验中,当 Inference Agent 不访问 Wiki 时,让 Skill Proposer 使用持久 Wiki,平均成绩从 **48.7%** 提升至 **63.7%**,增加 15 个百分点。这表明价值不只来自“多写一份文档”,而是来自跨迭代保存失败模式、拒绝记录和修复证据。 反过来,让 Inference Agent 在训练时直接读取 Wiki,最终平均成绩从 63.7% 降到 60.9%。论文推测,Agent 可能直接借助 Wiki 解题,使 rollout 不再充分暴露技能缺陷。 ## 十、如何落地到真实Agent项目? 团队可以先从轻量版本开始:为每次任务保存结构化运行记录;失败后生成 Pattern 页面;每个 Skill 绑定用途说明;所有修改经过固定验证集;拒绝的补丁也进入影响日志。随后再加入自动聚类、相似 Pattern 合并和成本控制。 如果团队正在使用 [Codex](https://www.zuoshipin.com/link/1474.html) 或其他支持文件化 Skills 的 Agent,可以把 WikiSkill 的思想用于代码审查、内容发布、浏览器自动化和数据处理流程。关于 ChatGPT Work 中的 Skills、插件和长任务能力,可继续阅读 [ChatGPT Work 与 Codex 同款能力解析](https://www.zuoshipin.com/article/30538)。 ## 十一、生产环境必须补上的安全设计 - 对日志进行脱敏,避免 Wiki 长期保存密钥、账号、客户数据或隐私内容。 - 把训练集、验证集和测试集严格隔离,防止技能针对固定答案过拟合。 - 高风险工具采用白名单和人工确认,技能更新不能自动扩大权限。 - 记录模型、工具与依赖版本,避免环境变化被误判为技能提升。 - 为 Wiki 设置合并、过期和裁剪机制,控制上下文与存储成本。 ## 十二、当前局限:WikiSkill还不是“无限自我进化” 论文直接把当前技能注入提示词,以隔离技能检索和触发错误,因此没有回答技能库扩大后如何准确选中 Skill。严格门控也会拒绝短期无增益、但可能为后续改进铺路的中性修改。此外,Wiki 持续增长却缺少自动裁剪机制,实验也未覆盖连续数小时、数百次动作的超长任务。 所以,更准确的说法是:WikiSkill 展示了**可审计、可验证的技能持续优化**,而不是让 Agent 无限制地自行修改一切。 ## 结语:真正能复利的不是一次答案,而是可积累的经验 WikiSkill 的价值在于把 Agent 改进从“凭感觉改 Prompt”升级为一套有事实记录、知识沉淀、技能溯源和验证门控的工程流程。未来的智能体竞争,除了模型本身的能力,也会越来越取决于谁能更系统地保存失败、提炼经验,并把知识转化为可靠的执行程序。 **Tags:** Agent Skills, AI Agent, Google Research, SKILL.md, WikiSkill, 技能进化, 持久知识库, 智能体记忆 **Categories:** AI资讯 ---