做视频AI导航网
做视频AI导航网
AI导航
  • 热门工具
  • Agent智能体
  • Skills技能
  • AI大模型
  • AI创作
  • AI工具集
视频Video
  • 素材下载
  • 创作灵感
Github神器
搜索
  • 导航
  • 资讯
  • 视频素材
  • 视频模版
  • 音乐音效
  • Luts调色预设
  • 整合包
首页/
打开 MD 链接

Zing-0.5 – 开源实时交互式视频世界模型

9
一边探索空间,一边用自然语言改写正在生成的世界
评分
模型类型:实时交互式视频世界模型控制方式:键盘动作 + 文本Prompt核心技术:Causal KV Cache / 4步DMD运行平台:Linux + NVIDIA CUDA GPU开源协议:Apache 2.0
Zing-0.5是开源实时交互式视频世界模型,支持键盘动作与文本提示联合控制、中途改写、因果KV Cache和…
AI视频

Zing-0.5 是Seedleap.ai(涌跃智能)与Loopit团队开发的开源实时交互式世界模型。它能够持续生成视觉世界,并在生成过程中接收键盘动作和文本指令,让用户一边探索空间,一边改变世界中发生的事件。

核心能力

  • 联合控制:W/A/S/D/I/J/K/L动作控制移动与视角,文本提示改变语义和未来演化。
  • 中途改写:新Prompt进入当前视觉历史,而不是重新开始一段视频。
  • 长程生成:使用因果KV Cache和滑动窗口降低持续生成成本。
  • 实时优化:四步DMD采样减少扩散迭代次数,面向单GPU交互管线。
  • 开放推理代码:项目提供JSONL交互时间线、示例任务、运行脚本和模型权重入口。

最新评测位置

官方项目说明显示,Zing-0.5在WBench榜单中位列综合第2,并在实时世界模型中排名第1。WBench榜单会持续更新,具体名次应以前台最新数据为准。

部署要求

官方运行环境为Linux、Python 3.11和支持CUDA的NVIDIA GPU。默认97/9滑动窗口推荐H100或至少80GB显存;低显存及在线实时推理可使用33/5配置。该模型虽强调单GPU管线,但仍属于高算力视频生成任务。

适用场景

适合互动视频、AI游戏原型、可探索空间、语义事件编辑和世界模型研究。当前版本侧重生成式渲染与交互控制,长期一致的多人状态、规则和因果仍需要外部系统维护。

常见问题(FAQ)

Zing-0.5是什么?
Zing-0.5是Seedleap/Loopit团队开源的实时交互式视频世界模型,可在持续生成过程中同时接收键盘动作和新的文本指令。
Zing-0.5如何控制世界?
它使用W/A/S/D/I/J/K/L等连续动作控制移动与视角,并通过分段文本提示改变世界语义和后续状态。
Zing-0.5可以实时运行吗?
项目采用因果KV Cache与四步DMD采样优化实时性;官方文档建议高显存NVIDIA GPU,并提供面向较低显存的滑动窗口配置。
Zing-0.5采用什么许可证?
官方GitHub仓库标注Zing-0.5采用Apache License 2.0,使用前应查看仓库中的完整许可证。
0 讨论
热门最新
总结
暂无总结
0 / 600
细中粗

相关网站

热门最新

MoWorld – 高帧率实时交互世界模型

面向 NPU 的高帧率实时交互世界模型,适合关注世界模型和视频生成的用户。

面向 NPU 的实时交互世界模型,强调高帧率、低成本和连续控制的视频世界生成能力。

0

FrameX Rise – 500ms实时交互的全域沉浸式视频模型

让摄像头中的自然动作直接进入并改变生成世界

Rise 是 FrameX 推出的全域沉浸式视频生成模型,把摄像头动作理解与视频生成统一建模,官方赛车演示端到…

0

Xmax AI – 想实时重绘现实和互动视频,这个 AI 视频模型平台很前沿

构建实时交互式 AI 视频模型,让现实画面可以被即时重绘、控制和互动

Xmax AI 是实时交互式 AI 视频模型平台,主打实时视频重绘、角色与风格变换、空间互动和动态视频控制,适…

0

LingBot-VA – 把视频理解、动作建模和机器人控制连到一起的具身智能大模型

面向通用机器人控制的因果视频-动作世界模型页面,聚焦具身智能、世界模型与机器人学习方向

聚焦具身智能、机器人控制与视频动作世界模型方向的前沿大模型页面。

0

SenseNova U1.5 – 开源4K图像生成、编辑与复杂排版模型

一个模型统一完成理解、生成、编辑与复杂视觉排版

SenseNova U1.5 是商汤开源的原生统一多模态模型,支持图像生成、编辑、视觉理解、复杂中英文排版、多…

0

OpenDM(DM0.5)- 面向开放世界机器人控制的开源VLA模型

开放DM0.5权重、训练、推理与评测流程,面向多机器人本体和长程任务

OpenDM 是 Dexmal 开源的机器人控制项目,提供 DM0.5 模型权重、训练与推理脚本、数据注册示例…

0

MAVIN – 按剧本生成多镜头音视频的叙事控制模型

让AI沿着叙事时间线安排镜头、对白、动作与角色身份

MAVIN是ECCV 2026 Oral多镜头音视频生成研究,通过边界感知注意力、身份感知传播和多智能体脚本流…

0

GLM-5.3-Flash – 智谱原生多模态开源大模型

以18B激活参数提供前沿级编程、Agent与视觉能力

推荐!GLM-5系列首个原生多模态模型,320B总参数、18B激活参数,支持视觉编码、Agent、专业办公与长…

0

Qwen3.8-27B – 24GB显存可尝试的开源多模态Agent模型

推荐!把前沿Coding与Agent能力压缩到27B尺寸,本地部署和强能力第一次真正靠近

Qwen3.8-27B是27B Dense开源多模态模型,强化Coding、工具调用与长程Agent,4bit…

0

Seedream 5.0 Pro – 字节跳动多模态AI图像生成与精准编辑模型

从整图生成走向区域级修改,让AI更接近真实设计工作流

推荐!面向设计生产的多模态AI图像模型,支持高密度信息图、圈选与箭头精准改图、图层分离、多图融合、真实摄影质感…

0
所有的成功,都源自一个勇敢的开始
不辜负每一个勇敢的开始
做视频AI导航网 © 2026闽ICP备16009488号-1