### [AgentGarten让AI在实时世界里边玩边进化:4轮学会搭掩体,代码与扩散模型如何闭环?](https://www.zuoshipin.com/article/49452) **Published:** 2026-10-09T16:21:48 **Author:** 天才交易员 **Excerpt:** MirroS发布AgentGarten,把可编程代码世界、实时神经渲染与智能体经验手册连接成闭环。本文详解捉迷… **导读:**代码保存可执行的物理状态,神经渲染器生成连续画面,智能体再把每轮试错写成可继承的Playbook。AgentGarten的重点不是再造一个“会生成视频”的模型,而是给AI准备一个**能行动、能验证、能复盘的实时试炼场**。 推开挡板,通道就被封住;搬来坡道,高墙就能翻越。动作改变世界,改变后的世界又成为下一次决策的依据。MirroS团队发布的**AgentGarten**,正是把这种连续因果关系交给代码维护,再用神经渲染器生成智能体看到的画面。 [![AgentGarten捉迷藏代码世界的俯视演练画面](https://admin.zuoshipin.com/wp-content/uploads/2026/10/agentgarten-code-world-image01.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/agentgarten-code-world-image01.webp) AgentGarten捉迷藏代码世界的俯视演练画面。 ## 01 / 智能体真正缺的,不是更多视频,而是能反复练手的世界 只让AI观看大量视频,它可以学会视觉模式,却很难确认“自己的动作究竟改变了什么”。智能体要形成稳定的物理经验,必须亲自采取行动、观察后果、修正策略,并在下一轮继续验证。 传统游戏引擎擅长维护明确状态:箱子被推到哪里、通道是否被封、车辆有没有碰撞,都可以查询和重放。但要为大量场景制作高质量模型、材质和灯光,成本很高。 视频世界模型能生成逼真画面,却常把物理状态藏在模型内部。对象属性、任务规则、胜负裁判和精确干预不够透明,长时间交互还可能出现外观漂移或“幻觉物理”。 | 方案 | 强项 | 主要短板 | | --- | --- | --- | | 代码/游戏引擎 | 状态明确、规则可控、可复现 | 高质量资产制作成本高 | | 视频世界模型 | 视觉真实、场景生成灵活 | 状态隐式,难查询和精确裁判 | | AgentGarten | 代码管物理,模型管画面 | 仍依赖GPU,完整环境尚未全部开源 | ## 02 / 代码负责世界怎样变化,扩散模型负责它看起来怎样 在每一步交互里,智能体先提交动作。代码环境立即计算碰撞、对象位置、任务状态和规则结果,再从第一人称相机导出深度或表面法线等轻量几何条件。 神经渲染器读取这些几何条件、参考图、文本与此前的视觉历史,生成下一段观察画面。智能体看见结果后再决定下一步,形成“动作—状态更新—画面—新动作”的闭环。 [![Agent动作、代码世界状态、几何条件与神经渲染画面之间的交互闭环](https://admin.zuoshipin.com/wp-content/uploads/2026/10/agentgarten-code-world-image03.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/agentgarten-code-world-image03.webp) Agent动作、代码世界状态、几何条件与神经渲染画面之间的交互闭环。 **关键区别:**画面可以由模型生成,但世界状态没有交给模型猜。任务裁判、对象关系和物理变化仍由代码掌握,因此更容易检查、干预、重置和复现。 [![导航、物体操控、重新运镜和多智能体场景的几何条件与渲染结果对比](https://admin.zuoshipin.com/wp-content/uploads/2026/10/agentgarten-code-world-image04.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/agentgarten-code-world-image04.webp) 导航、物体操控、重新运镜和多智能体场景的几何条件与渲染结果对比。 ## 03 / 捉迷藏实验:不是一次生成答案,而是把失败写进下一轮 团队重访了OpenAI 2019年的捉迷藏实验。躲藏者先布置场景,搜寻者随后进入。智能体只接收第一人称渲染画面,没有对象坐标、隐藏状态、地图或对手私有视角,并通过短Python程序控制移动和抓取。 **官方项目说明显示,每轮由五局不同布局和随机种子的游戏组成**,并非部分二手稿件写的十局。每轮结束后,双方分别复盘行动程序和允许查看的视觉证据,把经验写入由短技能文件组成的Playbook。 [![躲藏者搭建掩体、搜寻者搬坡道和失败后调整重试的三种策略](https://admin.zuoshipin.com/wp-content/uploads/2026/10/agentgarten-code-world-image02.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/agentgarten-code-world-image02.webp) 躲藏者搭建掩体、搜寻者搬坡道和失败后调整重试的三种策略。 结果很直观:躲藏者在第4轮学会移动长挡板搭建掩体,搜寻者在第10轮学会把坡道搬到墙边;第一次跳跃失败后,它还会把坡道拉近再试一次。 [![传统自我博弈强化学习与AgentGarten视觉智能体的策略出现规模对比](https://admin.zuoshipin.com/wp-content/uploads/2026/10/agentgarten-code-world-image05.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/agentgarten-code-world-image05.webp) 传统自我博弈强化学习与AgentGarten视觉智能体的策略出现规模对比。 这不能简单理解为“4轮胜过2500万局”。2019年实验从零训练强化学习策略,输入和训练方式不同;AgentGarten使用的是具备推理能力的预训练智能体,并在轮次之间继承文字经验。两者更像不同学习范式的对照,而不是严格同口径跑分。 ## 04 / Playbook让经验可读、可传承,也更容易被检验 AgentGarten把一次演练拆成四步: 1. **Read:**读取任务、动作范围、时间限制和规则,但不提供标准答案。 2. **Play:**在有限步数内自主行动,只通过相机画面判断当前局面。 3. **Write:**记录尝试、观察、失败原因、仍不确定的问题和下一轮要验证的假设。 4. **Archive:**冻结并归档Playbook,让下一轮智能体从前面的经验继续探索。 [![智能体读取任务、进入世界、撰写Playbook并归档传承的四步演练循环](https://admin.zuoshipin.com/wp-content/uploads/2026/10/agentgarten-code-world-image06.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/agentgarten-code-world-image06.webp) 智能体读取任务、进入世界、撰写Playbook并归档传承的四步演练循环。 这种文字经验不会自动保证正确。错误判断也可能被传下去,所以真正重要的是可重置的代码世界:经验可以重新测试,跨多个世界仍有效的技巧才有机会沉淀成更通用的知识。 ## 05 / 换到四个世界,经验循环还能继续工作吗? 团队把同样的“读取—行动—复盘—传承”流程放进四种不同任务,并各运行四轮: - **陪伴小狗:**60秒内通过伸手、抚摸、玩球和后退维持互动,分数从13提高到19。 - **狭桥会车:**两辆车只看自己的驾驶视角,总通关时间从71秒缩短到41秒。 - **合作牧羊:**两只牧羊犬引导四只羊进入围栏,第1轮只完成三只,后续轮次能稳定全部入圈。 - **采石场装载机:**从只会推开石块,进步到完成推石、送料和停车,并在360秒限制前31秒结束。 [![陪伴小狗、狭桥会车、合作牧羊和采石场装载机的四轮表现变化](https://admin.zuoshipin.com/wp-content/uploads/2026/10/agentgarten-code-world-image07.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/agentgarten-code-world-image07.webp) 陪伴小狗、狭桥会车、合作牧羊和采石场装载机的四轮表现变化。 这些结果说明同一种经验传承流程可以跨任务工作,但样本规模仍小,任务也由研究团队设计。它证明了方向的可行性,还不能直接推导出开放世界中的长期通用能力。 ## 06 / Adversarial Forcing怎样让长时间画面不容易漂? 神经渲染器从预训练视频模型出发,先学习用几何条件控制画面,再用分块自回归方式逐段生成。每一小段完成后提交到有界KV缓存,下一段可以依赖刚生成的历史。 长时间生成的难点是误差会不断积累。团队提出的Adversarial Forcing主要解决三件事: - **分块生成:**不一次生成整段视频,动作后立即产出短块观察。 - **精确重放:**第二遍训练按相同的分块顺序和注意力内核重算,使后段损失能够更新模型怎样写入历史。 - **真实视频对抗信号:**让判别器同时约束画面真实性和几何条件一致性,减少棋盘格伪影与长期漂移。 官方还使用手写Triton内核、cuBLAS矩阵乘法和CUDA Graph降低服务延迟,并强调渲染器能够实时运行。具体速度会受到GPU、分辨率、采样步数和解码器配置影响,不应把演示中的速度当作所有设备都能达到的保证。 ## 07 / 开源了什么?普通用户能不能直接跑? AgentGarten官方仓库采用Apache-2.0许可证,目前已经开放神经渲染器的训练、流式推理和服务代码。基础环境要求为Python 3.11+、PyTorch 2.9+和CUDA主机,还要准备NVIDIA Cosmos3-Nano、Wan 2.2 VAE及项目渲染器权重。 ``` git clone https://github.com/MirroS-Lab/AgentGarten.git cd AgentGarten pip install -e '.[data,media,wandb,te]' cp .env.example .env ``` **当前边界:**代码世界、实时交互前端以及完整的“行动—复盘—Playbook”智能体演练循环仍在官方待发布清单中。现在可以研究和运行渲染器,但不能把仓库理解为所有演示世界都已一键开放。 ## 08 / 做视频网观点:它真正改变的是世界模型的分工 AgentGarten最有意思的地方,是没有要求单一神经网络同时记住物理、规则、裁判和视觉。它让代码保留确定性,把神经模型用在视觉分布最复杂、传统资产制作最昂贵的部分。 对CG、虚拟制作和具身智能从业者来说,这是一条值得关注的路线:低成本程序化场景负责交互骨架,生成模型负责外观,Agent负责探索与积累经验。下一步真正困难的,不只是生成更多世界,而是自动判断一个世界是否**可观察、可学习、值得训练**,以及怎样防止错误经验在Playbook里不断放大。 ## 相关站内内容 **AgentGarten站内导航:**[https://www.zuoshipin.com/link/49451.html](https://www.zuoshipin.com/link/49451.html) **HarnessEval-W世界模型评测导航:**[https://www.zuoshipin.com/link/24130.html](https://www.zuoshipin.com/link/24130.html) ## 官方资料 [AgentGarten官方项目主页](https://mirros-lab.github.io/agent-garten/) [AgentGarten官方GitHub仓库](https://github.com/MirroS-Lab/AgentGarten) [MirroS官方技术博客](https://mirros.ai/blog/worlds-for-evolving-agents) [AgentGarten技术报告](https://mirros.ai/report/agent-garten.pdf) **Tags:** AgentGarten, AI Agent, 世界模型, 具身智能, 开源AI **Categories:** AI资讯 ---