暂无菜单项

AgentGarten让AI在实时世界里边玩边进化:4轮学会搭掩体,代码与扩散模型如何闭环?

发布于
60

导读:代码保存可执行的物理状态,神经渲染器生成连续画面,智能体再把每轮试错写成可继承的Playbook。AgentGarten的重点不是再造一个“会生成视频”的模型,而是给AI准备一个能行动、能验证、能复盘的实时试炼场。

推开挡板,通道就被封住;搬来坡道,高墙就能翻越。动作改变世界,改变后的世界又成为下一次决策的依据。MirroS团队发布的AgentGarten,正是把这种连续因果关系交给代码维护,再用神经渲染器生成智能体看到的画面。

AgentGarten捉迷藏代码世界的俯视演练画面
AgentGarten捉迷藏代码世界的俯视演练画面。

01 / 智能体真正缺的,不是更多视频,而是能反复练手的世界

只让AI观看大量视频,它可以学会视觉模式,却很难确认“自己的动作究竟改变了什么”。智能体要形成稳定的物理经验,必须亲自采取行动、观察后果、修正策略,并在下一轮继续验证。

传统游戏引擎擅长维护明确状态:箱子被推到哪里、通道是否被封、车辆有没有碰撞,都可以查询和重放。但要为大量场景制作高质量模型、材质和灯光,成本很高。

视频世界模型能生成逼真画面,却常把物理状态藏在模型内部。对象属性、任务规则、胜负裁判和精确干预不够透明,长时间交互还可能出现外观漂移或“幻觉物理”。

方案 强项 主要短板
代码/游戏引擎 状态明确、规则可控、可复现 高质量资产制作成本高
视频世界模型 视觉真实、场景生成灵活 状态隐式,难查询和精确裁判
AgentGarten 代码管物理,模型管画面 仍依赖GPU,完整环境尚未全部开源

02 / 代码负责世界怎样变化,扩散模型负责它看起来怎样

在每一步交互里,智能体先提交动作。代码环境立即计算碰撞、对象位置、任务状态和规则结果,再从第一人称相机导出深度或表面法线等轻量几何条件。

神经渲染器读取这些几何条件、参考图、文本与此前的视觉历史,生成下一段观察画面。智能体看见结果后再决定下一步,形成“动作—状态更新—画面—新动作”的闭环。

Agent动作、代码世界状态、几何条件与神经渲染画面之间的交互闭环
Agent动作、代码世界状态、几何条件与神经渲染画面之间的交互闭环。

关键区别:画面可以由模型生成,但世界状态没有交给模型猜。任务裁判、对象关系和物理变化仍由代码掌握,因此更容易检查、干预、重置和复现。

导航、物体操控、重新运镜和多智能体场景的几何条件与渲染结果对比
导航、物体操控、重新运镜和多智能体场景的几何条件与渲染结果对比。

03 / 捉迷藏实验:不是一次生成答案,而是把失败写进下一轮

团队重访了OpenAI 2019年的捉迷藏实验。躲藏者先布置场景,搜寻者随后进入。智能体只接收第一人称渲染画面,没有对象坐标、隐藏状态、地图或对手私有视角,并通过短Python程序控制移动和抓取。

官方项目说明显示,每轮由五局不同布局和随机种子的游戏组成,并非部分二手稿件写的十局。每轮结束后,双方分别复盘行动程序和允许查看的视觉证据,把经验写入由短技能文件组成的Playbook。

躲藏者搭建掩体、搜寻者搬坡道和失败后调整重试的三种策略
躲藏者搭建掩体、搜寻者搬坡道和失败后调整重试的三种策略。

结果很直观:躲藏者在第4轮学会移动长挡板搭建掩体,搜寻者在第10轮学会把坡道搬到墙边;第一次跳跃失败后,它还会把坡道拉近再试一次。

传统自我博弈强化学习与AgentGarten视觉智能体的策略出现规模对比
传统自我博弈强化学习与AgentGarten视觉智能体的策略出现规模对比。

这不能简单理解为“4轮胜过2500万局”。2019年实验从零训练强化学习策略,输入和训练方式不同;AgentGarten使用的是具备推理能力的预训练智能体,并在轮次之间继承文字经验。两者更像不同学习范式的对照,而不是严格同口径跑分。

04 / Playbook让经验可读、可传承,也更容易被检验

AgentGarten把一次演练拆成四步:

  1. Read:读取任务、动作范围、时间限制和规则,但不提供标准答案。
  2. Play:在有限步数内自主行动,只通过相机画面判断当前局面。
  3. Write:记录尝试、观察、失败原因、仍不确定的问题和下一轮要验证的假设。
  4. Archive:冻结并归档Playbook,让下一轮智能体从前面的经验继续探索。
智能体读取任务、进入世界、撰写Playbook并归档传承的四步演练循环
智能体读取任务、进入世界、撰写Playbook并归档传承的四步演练循环。

这种文字经验不会自动保证正确。错误判断也可能被传下去,所以真正重要的是可重置的代码世界:经验可以重新测试,跨多个世界仍有效的技巧才有机会沉淀成更通用的知识。

05 / 换到四个世界,经验循环还能继续工作吗?

团队把同样的“读取—行动—复盘—传承”流程放进四种不同任务,并各运行四轮:

  • 陪伴小狗:60秒内通过伸手、抚摸、玩球和后退维持互动,分数从13提高到19。
  • 狭桥会车:两辆车只看自己的驾驶视角,总通关时间从71秒缩短到41秒。
  • 合作牧羊:两只牧羊犬引导四只羊进入围栏,第1轮只完成三只,后续轮次能稳定全部入圈。
  • 采石场装载机:从只会推开石块,进步到完成推石、送料和停车,并在360秒限制前31秒结束。
陪伴小狗、狭桥会车、合作牧羊和采石场装载机的四轮表现变化
陪伴小狗、狭桥会车、合作牧羊和采石场装载机的四轮表现变化。

这些结果说明同一种经验传承流程可以跨任务工作,但样本规模仍小,任务也由研究团队设计。它证明了方向的可行性,还不能直接推导出开放世界中的长期通用能力。

06 / Adversarial Forcing怎样让长时间画面不容易漂?

神经渲染器从预训练视频模型出发,先学习用几何条件控制画面,再用分块自回归方式逐段生成。每一小段完成后提交到有界KV缓存,下一段可以依赖刚生成的历史。

长时间生成的难点是误差会不断积累。团队提出的Adversarial Forcing主要解决三件事:

  • 分块生成:不一次生成整段视频,动作后立即产出短块观察。
  • 精确重放:第二遍训练按相同的分块顺序和注意力内核重算,使后段损失能够更新模型怎样写入历史。
  • 真实视频对抗信号:让判别器同时约束画面真实性和几何条件一致性,减少棋盘格伪影与长期漂移。

官方还使用手写Triton内核、cuBLAS矩阵乘法和CUDA Graph降低服务延迟,并强调渲染器能够实时运行。具体速度会受到GPU、分辨率、采样步数和解码器配置影响,不应把演示中的速度当作所有设备都能达到的保证。

07 / 开源了什么?普通用户能不能直接跑?

AgentGarten官方仓库采用Apache-2.0许可证,目前已经开放神经渲染器的训练、流式推理和服务代码。基础环境要求为Python 3.11+、PyTorch 2.9+和CUDA主机,还要准备NVIDIA Cosmos3-Nano、Wan 2.2 VAE及项目渲染器权重。

git clone https://github.com/MirroS-Lab/AgentGarten.git
cd AgentGarten
pip install -e '.[data,media,wandb,te]'
cp .env.example .env

当前边界:代码世界、实时交互前端以及完整的“行动—复盘—Playbook”智能体演练循环仍在官方待发布清单中。现在可以研究和运行渲染器,但不能把仓库理解为所有演示世界都已一键开放。

08 / 做视频网观点:它真正改变的是世界模型的分工

AgentGarten最有意思的地方,是没有要求单一神经网络同时记住物理、规则、裁判和视觉。它让代码保留确定性,把神经模型用在视觉分布最复杂、传统资产制作最昂贵的部分。

对CG、虚拟制作和具身智能从业者来说,这是一条值得关注的路线:低成本程序化场景负责交互骨架,生成模型负责外观,Agent负责探索与积累经验。下一步真正困难的,不只是生成更多世界,而是自动判断一个世界是否可观察、可学习、值得训练,以及怎样防止错误经验在Playbook里不断放大。

相关站内内容

AgentGarten站内导航:https://www.zuoshipin.com/link/49451.html

HarnessEval-W世界模型评测导航:https://www.zuoshipin.com/link/24130.html

官方资料

AgentGarten官方项目主页

AgentGarten官方GitHub仓库

MirroS官方技术博客

AgentGarten技术报告

常见问题(FAQ)

AgentGarten是什么?
它是MirroS推出的可执行代码世界与实时神经渲染项目,让智能体在明确规则中行动,通过视觉反馈、复盘和Playbook传承持续改进。
AgentGarten真的4轮就学会搭掩体吗?
在团队的一对一捉迷藏设置中,躲藏者在第4轮出现搭建掩体策略;搜寻者在第10轮学会用坡道翻墙。该结果不能与从零训练的强化学习局数直接等价比较。
AgentGarten每轮进行了多少局游戏?
官方项目说明为每轮五局,使用抽样布局和随机种子。部分二手内容写成十局,与官方说明不一致。
AgentGarten已经全部开源了吗?
没有。神经渲染器训练与流式推理代码已经开放,代码世界、实时前端和完整智能体演练循环仍在待发布清单中。
运行AgentGarten需要什么硬件?
官方要求CUDA主机,并使用Python 3.11+、PyTorch 2.9+、Cosmos3-Nano和Wan 2.2 VAE。实际显存和速度取决于模型、分辨率及运行配置。
0 点赞
0 收藏
分享
0 讨论
反馈
热门资讯
相关素材

暂无数据