导读:高层规划远期目标、低层执行具体动作;代码与预训练权重已经开放,但73.3%来自特定Visual AntMaze基准,并不等于通用机器人能力。真正值得注意的并不是一个孤立的跑分,而是世界模型开始把“想得远”和“做得细”拆给不同层级。
Yann LeCun参与的一项新研究把JEPA世界模型做成了分层结构。由AMI Labs、纽约大学、INRIA Paris与布朗大学研究者共同完成的H-JEPA,已经开放论文、代码、配置和预训练权重。

01 / H-JEPA交出了什么:不是概念图,而是一套可复现的分层规划模型
H-JEPA全称可以理解为分层联合嵌入预测架构。它延续JEPA“不必逐像素生成未来”的思路,在潜空间里预测环境状态,并进一步加入多个时间尺度:越高的层看得越远,越低的层越接近当前动作。
这次公开内容包括训练与评估代码、不同环境配置、预训练检查点以及论文实验。对于研究者来说,这比只放一段演示视频更有价值,因为模型的结构、训练方式和失败边界都能被复核。

02 / 为什么要分层:从纽约去巴黎,没人会一次规划完每一步
长时序任务的困难在于,模型既要看见很远的目标,又要处理眼前细节。如果只在单一时间尺度上规划,搜索空间会迅速膨胀,而且远期预测容易被局部噪声拖累。

可以把它想成从纽约前往巴黎:高层只需要决定“先去机场、飞到巴黎”,中层决定“搭哪班交通工具”,低层才处理转弯、避障和每一步动作。高层不必关心快速变化的细节,低层也不必独自承担整段跨洲路线。

03 / H-JEPA如何工作:高层预测变成低层的子目标
模型的每一层都拥有状态编码器、动作编码器和预测器。高层在自己的潜空间中预测较远未来,并把结果作为下一层的目标;低层再围绕这个子目标搜索更具体的动作序列。

这种自上而下的规划把一条很长的决策链拆成多个更短的问题。论文的关键判断是:当环境确实存在快慢不同的变化尺度时,高层可以主动丢弃快速、难预测且对长期目标不重要的细节。
04 / 训练重点:逐层学习,还要避免潜空间坍塌
H-JEPA采用逐层构建与训练的方式,并使用SIGReg正则约束潜表示。潜空间模型如果学成“所有输入都映射到相近表示”,看似损失很低,实际上已经失去区分状态和预测未来的能力;正则化的目的就是降低这种表示坍塌。

这条路线与此前的LeJEPA和动作条件LeWorldModel研究衔接:前者讨论如何让JEPA式表征学习更稳定,后者把动作放进世界模型,H-JEPA则继续把时间尺度与规划层级组织起来。


05 / 73.3%到底意味着什么:优势明显,但不能把基准结果写成通用能力
在论文的Visual AntMaze设置中,三层H-JEPA取得73.3%的任务成功率,平坦LeWorldModel基线为18.0%。分层结构还减少了长距离规划时的计算负担,说明高层子目标确实能缩小低层搜索空间。

研究同时覆盖FourRoom Distractors、Visual AntMaze、OGBench Cube、Push-T,以及DROID数据上的离线机器人规划。整体趋势支持分层建模,但并非每项任务都随着层数增加而单调提升。

| 实验 | H-JEPA解决的问题 | 阅读时要注意 |
|---|---|---|
| Visual AntMaze | 长路径视觉导航与子目标规划 | 73.3%只对应论文特定设置 |
| FourRoom / Cube | 干扰环境与操作任务中的长时规划 | 仍是受控基准,不等同现实部署 |
| Push-T | 视觉操作与轨迹预测 | 两层更合适,继续加层可能下降 |
| DROID离线数据 | 真实机器人数据上的计划一致性 | 离线规划不等于实时机器人成功率 |
06 / 复现教程:先跑通官方环境,再谈换数据和加层
项目当前建议使用Python 3.11.13。基础安装流程如下:
git clone https://github.com/kevinghst/H-JEPA.git
cd H-JEPA
conda create -n hjepa python=3.11.13
conda activate hjepa
pip install -e ".[train,env]" --extra-index-url https://download.pytorch.org/whl/cu128
然后为数据和实验文件设置本地目录:
export HJEPA_HOME=/path/to/data
建议按下面顺序复现:
- 确认GPU驱动、CUDA和PyTorch版本与官方安装要求匹配。
- 先下载公开权重并跑通一个官方评估配置,不要一开始就训练完整模型。
- 记录数据预处理、随机种子、层数、规划步数和候选动作数量。
- 分别测试一层、两层和三层,验证层级增加是否真的适合当前任务。
- 最后再替换自有数据;出现下降时先检查时间尺度是否存在,而不是盲目扩大模型。
公开权重可从官方Hugging Face页面获取。下载前建议核对模型卡、文件大小与对应实验配置,避免把不匹配的检查点用于其他层级。
07 / 和普通世界模型相比,H-JEPA赢在哪里?
| 路线 | 预测对象 | 长时规划 | 主要代价 |
|---|---|---|---|
| 像素生成式世界模型 | 未来画面或观测 | 可直观看结果,但远期生成成本高 | 要为大量视觉细节付费 |
| 平坦潜空间世界模型 | 单一尺度的未来表示 | 实现直接,长路径搜索容易变大 | 远近信息挤在同一表示里 |
| H-JEPA | 多个时间尺度的潜表示 | 高层给子目标,低层执行 | 训练、调参与层级设计更复杂 |
08 / 对CG和影视从业者有什么关系?短期不是生产工具,长期影响很大
H-JEPA不会直接替代Blender、Unreal Engine或视频生成软件。它当前更像研究底座,而不是点一下就能出片的工具。
但它代表的能力与虚拟制作高度相关:智能摄影机需要在场景里长期导航,数字角色需要理解动作后果,预演系统需要把导演目标拆成镜头与路径,现场机器人则要在动态环境里持续规划。分层世界模型如果成熟,可能成为这些系统的“规划层”。
做视频网观点:对创作者而言,H-JEPA今天最值得跟进的是方法而不是下载量。视频生成解决“画面像什么”,世界模型试图解决“环境如何变化、下一步该做什么”;真正可交互的空间内容最终需要两者会合。
09 / LeCun的路线正在从论文框架变成可运行代码
LeCun长期主张,仅靠语言预测不足以让机器获得对物理世界的理解,视觉表征、世界模型、记忆、规划和动作需要组成完整架构。H-JEPA并没有证明这条路线已经完成,但它把“多层规划”从架构草图推进到可复现实验。


这也不等于否定大语言模型作为工具的价值。更准确的表述是:语言模型擅长处理符号和知识任务,但要构建能够长期感知、预测并作用于现实环境的智能体,还需要视觉世界模型与规划机制。

AMI Labs把研究重点放在高级机器智能与世界模型。资本规模、团队背景和论文指标都只能说明投入与方向,不能替代真实场景里的持续验证。

10 / 最后判断:这是值得复现的研究节点,不是已经完成的通用智能
H-JEPA最扎实的贡献,是让高层远期预测与低层动作规划在同一套JEPA框架中协同,并通过公开代码和权重让外部研究者能够检验结果。
它的限制同样清楚:成绩依赖任务、层数和数据;部分实验仍是受控环境;离线机器人计划不能直接等同现实执行。把这些边界写清楚,73.3%才是有价值的研究进展,而不是一个被放大的营销数字。
相关站内内容
H-JEPA站内导航:https://www.zuoshipin.com/link/51279.html
World Labs Atlas世界模型:https://www.zuoshipin.com/link/30910.html
MoWorld可交互世界模型:https://www.zuoshipin.com/link/1109.html
LingBot-VA具身智能模型:https://www.zuoshipin.com/link/1338.html
Zing-0.5机器人基础模型:https://www.zuoshipin.com/link/27839.html






