H-JEPA是什么?
H-JEPA是一套面向长时序视觉规划的分层动作条件世界模型。它不是直接生成视频像素,而是在多个潜空间层级中预测未来:高层看得更远、负责粗粒度子目标,低层处理短时间尺度的具体动作。
项目状态:研究团队已开放论文、训练与评估代码、配置以及预训练权重。项目适合世界模型、机器人规划和具身智能研究,目前不是面向普通用户的一键式应用。

核心机制
- 多时间尺度:每一层在自己的潜空间中预测不同跨度的未来。
- 自上而下规划:高层预测会变成下一层的子目标,让长路径被拆成可执行的短步骤。
- 动作条件预测:模型同时编码状态和动作,在潜空间评估候选动作序列。
- SIGReg正则:训练时约束表示分布,降低潜空间坍塌风险。
- 离线规划:论文在多个视觉控制环境和DROID离线机器人数据上进行验证。

论文结果应该怎样理解?
论文中最显眼的数字来自Visual AntMaze:三层H-JEPA取得73.3%的任务成功率,而平坦LeWorldModel基线为18.0%。这说明分层子目标对长路径视觉规划很有帮助,但该数字只对应论文的特定环境、数据和评估设置。

层级也并非越多越好。论文在Push-T实验中观察到两层结构更合适,继续增加层数反而可能受限于轨迹长度和数据量。复现时应把层数视为需要验证的超参数。
安装与复现
项目当前建议使用Python 3.11.13,并通过Conda创建独立环境。基础安装流程如下:
git clone https://github.com/kevinghst/H-JEPA.git
cd H-JEPA
conda create -n hjepa python=3.11.13
conda activate hjepa
pip install -e ".[train,env]" --extra-index-url https://download.pytorch.org/whl/cu128
随后设置数据目录环境变量,按照仓库中的环境说明准备数据集与评估依赖。预训练模型可从项目公开的Hugging Face仓库获取。
export HJEPA_HOME=/path/to/data
适合谁使用?
- 研究长时序世界模型、潜空间规划和JEPA架构的开发者。
- 希望比较平坦模型与分层规划模型的机器人研究团队。
- 研究视觉导航、操作任务或离线机器人数据的高校与实验室。
- 关注虚拟制作、智能摄影机和交互式预演长期技术路线的CG技术人员。
许可与风险
仓库使用MIT许可证。代码和权重开放不代表已经达到生产级稳定性;不同GPU、CUDA版本、数据预处理和随机种子都可能影响复现结果。部署前应核对仓库README、配置文件和许可证原文。
