Rise 是 FrameX Era 系列的全域沉浸式视频生成基础模型。它把用户摄像头中的动作、表情、环境与生成画面放在同一时序上下文中联合建模,让用户无需键盘、手柄或复杂提示词,也能用自然动作实时控制生成世界。
Rise 的核心能力
- 理解与生成统一:摄像头帧和生成帧在一个模型中端到端处理,减少传统两阶段管线的串行等待。
- 低延迟交互:官方赛车演示宣称端到端响应低于 500ms。
- 自然动作控制:支持空手手势、手机、垫子等任意形状物体模拟方向盘。
- 多视角泛化:可以在第一人称与第三人称驾驶场景中响应用户动作。
- 实时生成世界:生成内容会根据动作和环境持续变化,而不是一次性执行固定 Prompt。
它和普通视频生成有什么不同?
普通视频模型通常接收文字或图片,离线生成一段固定视频;实时模型主要缩短生成等待。Rise 进一步把用户状态作为连续原生输入,使视频从“被观看的结果”变成“可以进入并影响的世界”。
当前体验与限制
官方公开展示主要集中在赛车交互。约 300 小时赛车视频用于后训练,因此其他场景的稳定性、物理一致性和泛化程度仍需分别验证。使用摄像头前还应确认隐私政策、浏览器权限、网络延迟与设备性能。







