导读:代码保存可执行的物理状态,神经渲染器生成连续画面,智能体再把每轮试错写成可继承的Playbook。AgentGarten的重点不是再造一个“会生成视频”的模型,而是给AI准备一个能行动、能验证、能复盘的实时试炼场。
推开挡板,通道就被封住;搬来坡道,高墙就能翻越。动作改变世界,改变后的世界又成为下一次决策的依据。MirroS团队发布的AgentGarten,正是把这种连续因果关系交给代码维护,再用神经渲染器生成智能体看到的画面。

01 / 智能体真正缺的,不是更多视频,而是能反复练手的世界
只让AI观看大量视频,它可以学会视觉模式,却很难确认“自己的动作究竟改变了什么”。智能体要形成稳定的物理经验,必须亲自采取行动、观察后果、修正策略,并在下一轮继续验证。
传统游戏引擎擅长维护明确状态:箱子被推到哪里、通道是否被封、车辆有没有碰撞,都可以查询和重放。但要为大量场景制作高质量模型、材质和灯光,成本很高。
视频世界模型能生成逼真画面,却常把物理状态藏在模型内部。对象属性、任务规则、胜负裁判和精确干预不够透明,长时间交互还可能出现外观漂移或“幻觉物理”。
| 方案 | 强项 | 主要短板 |
|---|---|---|
| 代码/游戏引擎 | 状态明确、规则可控、可复现 | 高质量资产制作成本高 |
| 视频世界模型 | 视觉真实、场景生成灵活 | 状态隐式,难查询和精确裁判 |
| AgentGarten | 代码管物理,模型管画面 | 仍依赖GPU,完整环境尚未全部开源 |
02 / 代码负责世界怎样变化,扩散模型负责它看起来怎样
在每一步交互里,智能体先提交动作。代码环境立即计算碰撞、对象位置、任务状态和规则结果,再从第一人称相机导出深度或表面法线等轻量几何条件。
神经渲染器读取这些几何条件、参考图、文本与此前的视觉历史,生成下一段观察画面。智能体看见结果后再决定下一步,形成“动作—状态更新—画面—新动作”的闭环。

关键区别:画面可以由模型生成,但世界状态没有交给模型猜。任务裁判、对象关系和物理变化仍由代码掌握,因此更容易检查、干预、重置和复现。

03 / 捉迷藏实验:不是一次生成答案,而是把失败写进下一轮
团队重访了OpenAI 2019年的捉迷藏实验。躲藏者先布置场景,搜寻者随后进入。智能体只接收第一人称渲染画面,没有对象坐标、隐藏状态、地图或对手私有视角,并通过短Python程序控制移动和抓取。
官方项目说明显示,每轮由五局不同布局和随机种子的游戏组成,并非部分二手稿件写的十局。每轮结束后,双方分别复盘行动程序和允许查看的视觉证据,把经验写入由短技能文件组成的Playbook。

结果很直观:躲藏者在第4轮学会移动长挡板搭建掩体,搜寻者在第10轮学会把坡道搬到墙边;第一次跳跃失败后,它还会把坡道拉近再试一次。

这不能简单理解为“4轮胜过2500万局”。2019年实验从零训练强化学习策略,输入和训练方式不同;AgentGarten使用的是具备推理能力的预训练智能体,并在轮次之间继承文字经验。两者更像不同学习范式的对照,而不是严格同口径跑分。
04 / Playbook让经验可读、可传承,也更容易被检验
AgentGarten把一次演练拆成四步:
- Read:读取任务、动作范围、时间限制和规则,但不提供标准答案。
- Play:在有限步数内自主行动,只通过相机画面判断当前局面。
- Write:记录尝试、观察、失败原因、仍不确定的问题和下一轮要验证的假设。
- Archive:冻结并归档Playbook,让下一轮智能体从前面的经验继续探索。

这种文字经验不会自动保证正确。错误判断也可能被传下去,所以真正重要的是可重置的代码世界:经验可以重新测试,跨多个世界仍有效的技巧才有机会沉淀成更通用的知识。
05 / 换到四个世界,经验循环还能继续工作吗?
团队把同样的“读取—行动—复盘—传承”流程放进四种不同任务,并各运行四轮:
- 陪伴小狗:60秒内通过伸手、抚摸、玩球和后退维持互动,分数从13提高到19。
- 狭桥会车:两辆车只看自己的驾驶视角,总通关时间从71秒缩短到41秒。
- 合作牧羊:两只牧羊犬引导四只羊进入围栏,第1轮只完成三只,后续轮次能稳定全部入圈。
- 采石场装载机:从只会推开石块,进步到完成推石、送料和停车,并在360秒限制前31秒结束。

这些结果说明同一种经验传承流程可以跨任务工作,但样本规模仍小,任务也由研究团队设计。它证明了方向的可行性,还不能直接推导出开放世界中的长期通用能力。
06 / Adversarial Forcing怎样让长时间画面不容易漂?
神经渲染器从预训练视频模型出发,先学习用几何条件控制画面,再用分块自回归方式逐段生成。每一小段完成后提交到有界KV缓存,下一段可以依赖刚生成的历史。
长时间生成的难点是误差会不断积累。团队提出的Adversarial Forcing主要解决三件事:
- 分块生成:不一次生成整段视频,动作后立即产出短块观察。
- 精确重放:第二遍训练按相同的分块顺序和注意力内核重算,使后段损失能够更新模型怎样写入历史。
- 真实视频对抗信号:让判别器同时约束画面真实性和几何条件一致性,减少棋盘格伪影与长期漂移。
官方还使用手写Triton内核、cuBLAS矩阵乘法和CUDA Graph降低服务延迟,并强调渲染器能够实时运行。具体速度会受到GPU、分辨率、采样步数和解码器配置影响,不应把演示中的速度当作所有设备都能达到的保证。
07 / 开源了什么?普通用户能不能直接跑?
AgentGarten官方仓库采用Apache-2.0许可证,目前已经开放神经渲染器的训练、流式推理和服务代码。基础环境要求为Python 3.11+、PyTorch 2.9+和CUDA主机,还要准备NVIDIA Cosmos3-Nano、Wan 2.2 VAE及项目渲染器权重。
git clone https://github.com/MirroS-Lab/AgentGarten.git
cd AgentGarten
pip install -e '.[data,media,wandb,te]'
cp .env.example .env
当前边界:代码世界、实时交互前端以及完整的“行动—复盘—Playbook”智能体演练循环仍在官方待发布清单中。现在可以研究和运行渲染器,但不能把仓库理解为所有演示世界都已一键开放。
08 / 做视频网观点:它真正改变的是世界模型的分工
AgentGarten最有意思的地方,是没有要求单一神经网络同时记住物理、规则、裁判和视觉。它让代码保留确定性,把神经模型用在视觉分布最复杂、传统资产制作最昂贵的部分。
对CG、虚拟制作和具身智能从业者来说,这是一条值得关注的路线:低成本程序化场景负责交互骨架,生成模型负责外观,Agent负责探索与积累经验。下一步真正困难的,不只是生成更多世界,而是自动判断一个世界是否可观察、可学习、值得训练,以及怎样防止错误经验在Playbook里不断放大。
相关站内内容
AgentGarten站内导航:https://www.zuoshipin.com/link/49451.html
HarnessEval-W世界模型评测导航:https://www.zuoshipin.com/link/24130.html






