打开摄像头,屏幕里的角色不再只是播放一段预先生成的视频:它会根据镜头、手势和触控实时变化。Xmax AI 发布的 X2.0,试图把 AI 视频从“生成后观看”推到“生成时就能玩”的阶段。

打开摄像头,现实就成了可编辑画布
X2.0 这次集中展示了三类能力:实时渲染、次元交互和触屏交互。它们的共同点,是把视频中的人物、服装、背景和物体都转化为可以持续计算的变量。
替换角色、服装和整体视觉风格,同时尽量保留原始动作、光影与镜头节奏。
以现实物体为锚点,让虚拟角色进入镜头并响应触摸、指向和空间位置。
直接拖拽静态主体,实时改变物体的运动方向和画面状态。

实时换人、换装和风格迁移
在 CharX、ClothX、VibeX 等模式中,模型可以分别处理人物身份、服装或整体风格。对创作者来说,真正有价值的并不是“变身”本身,而是它能否在连续运动中保持人物结构、动作关系和光影一致性。



如果这类能力进入直播、电商试穿或虚拟制片流程,创作者可以先用真人完成表演和机位,再实时映射角色外观,减少传统流程里反复离线渲染与预览的等待。
从“看角色”到“和角色互动”
次元交互更接近增强现实:模型会读取摄像头中的空间线索,以现实物品作为锚点,让虚拟角色与桌面、玩偶、手办或人物动作建立关系。角色不只是叠加在画面上,而是需要对位置变化和用户动作持续作出响应。



触屏交互:静态素材也能直接“动起来”
触屏模式允许用户在屏幕上拖拽主体,改变物体的运动路径。它让壁纸、照片或概念图拥有近似桌面宠物、互动海报和轻量游戏素材的表现方式,也给短视频互动模板带来了新的可能。


Free 模式:Prompt 内容仍是核心控制入口
除了封装好的模式,X2.0 也保留了自由 Prompt 控制。用户可以用自然语言描述喷火、镭射眼、空间扭曲等效果,再配合摄像头和触控输入实时调整。
“保持人物动作和镜头不变,将角色替换为银白短发的未来战士,周围出现蓝色能量粒子;当人物抬手时,从掌心释放光束,效果与现场光线保持一致。”


X2.0 的技术底牌:流式逐帧生成
传统视频模型通常需要先联合计算一段画面,再输出完整结果。X2.0 采用逐帧自回归的流式生成思路,让已完成的画面先显示,同时继续计算后续帧,从交互感觉上更接近实时视频流。
按照公开介绍,团队主要使用了以下优化:
- 多阶段、多目标融合蒸馏:压缩采样步骤,减少单帧计算量。
- 上下文持久化:在较长时间的连续生成中抑制画面漂移与质量衰减。
- 注意力稀疏化与 FP8 量化:降低显存占用和推理成本。
- 端侧专项优化:通过混合精度量化、结构化剪枝、算子融合和内存布局优化适配移动芯片。


产品方给出的目标表现包括:消费级单卡运行最高可达 960 分辨率、24fps;iPhone 本地演示则达到 384 分辨率、16fps。这些指标的意义在于,实时生成正在从云端演示下沉到普通设备。
对视频从业者真正有用的地方
站在后期和内容生产角度,我更关注 X2.0 是否能形成稳定的生产链路,而不是单个“换脸变身”Demo。它目前最值得观察的方向有四个:
- 虚拟制片与预演:现场快速查看角色、服装和环境风格,提前判断镜头是否成立。
- 直播包装:主播、观众动作与虚拟场景实时联动,形成千人千面的观看结果。
- 电商与零售:实时试穿、商品替换和互动陈列,减少用户只靠静态图想象的成本。
- IP 与虚拟陪伴:让已有角色对用户动作产生响应,提升“在场感”。


API 才是更大的想象空间
Xmax AI 同时强调 API 开放,希望开发者把实时交互能力接入直播、智能硬件、文旅、教育和办公协同等产品。摄像头只是入口,模型能否稳定理解视频流、手势和空间关系,才决定它能覆盖多少行业。


总结
X2.0 给 AI 视频带来的最大变化,不是再把画面做得更精致一点,而是让用户在生成过程中就能介入。视频开始从固定结果变成持续响应的界面。


对于创作者,现阶段最适合把它当作互动效果探索、直播视觉测试和虚拟制片预演工具。真正进入商业项目之前,仍应针对长时间稳定性、版权合规、角色一致性、延迟和成本进行完整测试。
注:功能与性能数据依据产品公开展示整理,实际效果以当前版本和设备环境为准。






