暂无菜单项

Zing-0.5开源:Loopit实时互动世界模型如何让视频变成“可以玩的世界”?

发布于
6

副标题:键盘控制空间、自然语言改写事件——Loopit开源Zing-0.5,探索“可以玩的生成式视频”

实时视频世界模型正在从“生成一段视频”走向“持续生成一个可操作的场景”。Loopit背后的Seedleap团队发布并开源Zing-0.5,让用户用键盘控制移动和视角,同时用自然语言改变天气、角色动作或场景事件。

Loopit与Seedleap发布开源实时交互世界模型Zing-0.5
Loopit与Seedleap发布开源实时交互世界模型Zing-0.5

需要先修正一个会随榜单变化的结论:Zing-0.5发布时曾被报道为WBench第一,但最新官方项目说明显示,它目前是WBench综合第2、实时世界模型第1。排行榜会持续接收新模型,名次应以WBench实时页面为准。

模型代码、示例和权重入口可通过站内整理的 Zing-0.5项目导航 查看,链接为正确的公开前台地址。

一、Zing-0.5解决的不是“视频更长”,而是“世界能继续”

普通视频生成模型接收提示词后输出固定片段,用户只能观看结果。实时世界模型则要不断接收动作,在每个时刻根据既有画面和新输入生成后续。用户向前走、转向、改变视角,模型都必须让场景连续演化。

Zing-0.5进一步加入语义改写:空间动作决定“去哪里”,文本Prompt决定“发生什么”。两条控制链路同时进入同一个因果生成过程,新事件应当发生在当前世界中,而不是把旧视频切掉、另起一段。

持续飞行过程中输入喷火指令,巨龙动作与场景保持连续
持续飞行过程中输入喷火指令,巨龙动作与场景保持连续

二、联合控制:一边移动,一边改写正在发生的事件

第一个案例是在骑龙飞行数十秒后输入“龙嘴巴喷火”。理想结果不只是出现火焰,而是飞行方向、洞穴、瀑布和远处光源继续保持,喷火成为当前运动中的新事件。

第二个案例要求主控人物跪地祈祷,同时让多座雕像睁眼。这比单一对象变化更难,因为模型必须理解动作主体、影响范围和多对象同步关系,同时保留各对象原有位置。

人物祈祷的同时,多座雕像睁眼并保持原有空间关系
人物祈祷的同时,多座雕像睁眼并保持原有空间关系

三、多轮改写:第二条指令必须进入已经改变的世界

真正困难的不是响应一次Prompt,而是让多条指令形成连续后果。测试先加入暴风雪改变全局天气,随后再要求远方人像睁眼。第二条事件必须发生在已经经历暴风雪的环境中,而不是恢复到初始场景后重新生成。

Zing-0.5在训练阶段就会在自回归生成中途切换Prompt:保留视觉历史和操作历史,用新的文本条件预测后续。因此,中途改写不是推理阶段临时拼接,而是模型被专门训练过的能力。

暴风雪之后继续加入局部对象变化,测试多轮语义改写的一致性
暴风雪之后继续加入局部对象变化,测试多轮语义改写的一致性

四、长程一致性:角色、道路和世界结构不能越走越偏

连续生成会放大误差。模型后续看到的不是真实视频,而是自己刚生成的历史;角色比例、颜色、道路方向和空间结构的小偏差会逐帧累积。时间一长,人物可能变形,通道可能弯曲,世界看似连续却已经不是原来的世界。

Zing-0.5在训练中主动扰动部分历史帧,加入轻微噪声、模糊、颜色偏移和视角变化,再要求模型预测干净、稳定的未来。这样做相当于教模型从不完美历史中区分“真实状态”与“生成误差”。

持续前进测试观察角色外观、背包与通道结构是否保持稳定
持续前进测试观察角色外观、背包与通道结构是否保持稳定

五、响应Prompt还不够,模型也要知道什么不该改变

像素风场景中途要求“前方出现一朵蘑菇”,看似简单,实际同时考验两种能力:模型必须生成蘑菇,又不能顺手更换画风、角色、道路或远处建筑。

这揭示了交互世界模型的一个核心指标:局部可编辑、全局可保持。新增事件只应改变被指令触及的部分,未被提及的世界事实应继续存在。

像素世界中新增蘑菇,同时保持角色、道路和建筑风格
像素世界中新增蘑菇,同时保持角色、道路和建筑风格

六、技术路线:动作残差与Cross-Attention共同决定未来

Zing-0.5把语言和动作做成两条独立控制链路。移动、转向和视角等连续信号经过sin/cos编码与因果时序卷积,形成逐帧Action Residual,并与视频Token对齐;新的文本条件通过Cross-Attention写入当前生成。

动作链路负责让世界继续运动,文本链路负责改变语义事件。两者共同进入Causal DiT,所以角色可以边移动边执行新动作,场景也能在不中断空间连续性的前提下改变天气或对象状态。

语言与动作两条控制链路共同进入Causal DiT
语言与动作两条控制链路共同进入Causal DiT

七、为什么要用四步DMD与增量KV Cache?

互动体验对延迟极其敏感。如果每次按键都要等待数十秒,模型再逼真也无法“玩”。Zing-0.5通过DMD蒸馏把原本多步的视频扩散过程压缩到四步;推理时使用因果KV Cache复用视觉历史,只有Prompt变化时才更新文本条件。

官方开源说明将其定位为紧凑的单GPU管线,并提供不同滑动窗口配置。默认97/9配置建议H100或至少80GB显存;较低显存和在线推理可采用33/5配置。这说明“单GPU”不等于普通游戏显卡就能轻松运行,视频世界模型依然是高算力任务。

团队还披露过单张RTX 5090超过24 FPS和每分钟推理成本约0.06元的内部结果。这些数字与分辨率、硬件、量化方式和服务负载强相关,应视为特定配置下的工程数据,而非所有部署的通用保证。

八、WBench评测应该怎么看?

WBench由复旦大学和美团LongCat团队推出,包含289个案例、1058轮交互,覆盖导航、主体动作、事件编辑和视角切换,并使用22项指标评估画面质量、场景遵循、交互遵循、一致性和物理合理性。

这类榜单比单纯视频审美评测更适合世界模型,因为“画得漂亮”不等于“控制得住”。但榜单也会持续加入新模型和更新提交。Zing-0.5当前的官方定位是综合第2、实时世界模型第1,文章不再沿用发布报道中的“总榜第一”。

带扰动的历史、当前扩散块与干净目标用于提升长程稳定性
带扰动的历史、当前扩散块与干净目标用于提升长程稳定性

九、为什么Loopit说“实时视频还不是世界”?

视频模型可以让一座桥在画面中坍塌,却未必真正保存“桥已经不存在”这一事实。长期运行的世界必须维护实体、状态、规则、记忆、因果和多人一致性;这些内容如果全部隐含在像素历史里,时间越长、参与者越多,错误越容易累积。

Loopit提出的阶段性路线是Code维护世界状态,Pixel负责生成式渲染。AI Coding把用户意图转化为实体、关系、规则和事件,确定性系统负责执行下一状态;视频模型则把状态渲染为连续画面、声音、动作与光照。

Zing-0.5完成的是生成式渲染与实时控制这一半,因此命名为“0.5”。团队设想中的Zing-1.0会进一步结合AI Coding,让行动不仅改变下一帧,也改变可持续追踪的世界事实。

十、从应用长出模型:Loopit的“模应一体”逻辑

互动世界模型需要的数据不是普通视频,而是“用户想怎样改变世界—系统如何响应—用户是否满意—接下来又做了什么”的轨迹。这类数据很难从互联网直接获得,也难靠人工标注大规模构造。

因此,Loopit选择让模型进入真实互动产品:产品产生需求与失败案例,模型迭代改善体验,用户通过继续、退出、分享和Remix反馈什么内容真正有趣。模型与应用共同生长,才可能积累面向端到端互动世界的独有数据。

结语:从预测下一帧,走向执行下一状态

Zing-0.5最值得关注的,不只是实时生成或榜单名次,而是它把“空间探索”和“语义改写”放进同一个持续生成过程,并明确承认纯像素路线在长期状态与因果上仍有边界。

互动世界模型的竞争正在从画面质量转向四个更难的问题:能否实时响应、能否多轮改写、能否保持长期一致、能否维护真实世界状态。Zing-0.5已经让Pixel部分具备可玩性,而Code与Pixel如何进一步融合,将决定“可以玩的生成视频”能否真正变成长期运行的数字世界。

常见问题(FAQ)

Zing-0.5是什么模型?
Zing-0.5是Seedleap/Loopit团队开源的实时交互式视频世界模型,支持在持续生成中同时使用键盘动作和文本提示控制世界。
Zing-0.5在WBench排名第几?
根据官方项目最新说明,Zing-0.5目前位列WBench综合第2,并在实时世界模型中排名第1;榜单会持续更新。
Zing-0.5如何实现中途改写?
模型在训练阶段学习保留既有视觉与动作历史,并在生成中途切换文本条件,让新指令进入当前世界而非重新生成。
普通显卡可以运行Zing-0.5吗?
项目提供单GPU推理管线,但默认配置建议H100或至少80GB显存;较低显存可尝试33/5滑动窗口配置,仍需要CUDA NVIDIA GPU。
为什么Zing-0.5叫0.5?
团队认为当前版本主要完成生成式渲染和实时控制,长期状态、规则与因果仍需Code维护;未来目标是进一步融合AI Coding与视频生成。
Zing-0.5是否开源?
是。官方GitHub仓库提供推理代码、示例、模型权重入口和运行说明,并采用Apache License 2.0。
0 点赞
0 收藏
分享
0 讨论
反馈
近期热门