暂无菜单项

H-JEPA开源:LeCun把世界模型分成3层,迷宫规划成功率从18%推到73%

发布于 更新于
4

导读:高层规划远期目标、低层执行具体动作;代码与预训练权重已经开放,但73.3%来自特定Visual AntMaze基准,并不等于通用机器人能力。真正值得注意的并不是一个孤立的跑分,而是世界模型开始把“想得远”和“做得细”拆给不同层级。

Yann LeCun参与的一项新研究把JEPA世界模型做成了分层结构。由AMI Labs、纽约大学、INRIA Paris与布朗大学研究者共同完成的H-JEPA,已经开放论文、代码、配置和预训练权重。

H-JEPA论文标题与研究团队
H-JEPA论文标题与研究团队。

01 / H-JEPA交出了什么:不是概念图,而是一套可复现的分层规划模型

H-JEPA全称可以理解为分层联合嵌入预测架构。它延续JEPA“不必逐像素生成未来”的思路,在潜空间里预测环境状态,并进一步加入多个时间尺度:越高的层看得越远,越低的层越接近当前动作。

这次公开内容包括训练与评估代码、不同环境配置、预训练检查点以及论文实验。对于研究者来说,这比只放一段演示视频更有价值,因为模型的结构、训练方式和失败边界都能被复核。

H-JEPA预训练权重与模型文件页面
H-JEPA预训练权重与模型文件页面。

02 / 为什么要分层:从纽约去巴黎,没人会一次规划完每一步

长时序任务的困难在于,模型既要看见很远的目标,又要处理眼前细节。如果只在单一时间尺度上规划,搜索空间会迅速膨胀,而且远期预测容易被局部噪声拖累。

分层JEPA按不同抽象层级预测未来的概念图
分层JEPA按不同抽象层级预测未来的概念图。

可以把它想成从纽约前往巴黎:高层只需要决定“先去机场、飞到巴黎”,中层决定“搭哪班交通工具”,低层才处理转弯、避障和每一步动作。高层不必关心快速变化的细节,低层也不必独自承担整段跨洲路线。

纽约到巴黎路线类比的AI生成示意图
纽约到巴黎路线类比的AI生成示意图。

03 / H-JEPA如何工作:高层预测变成低层的子目标

模型的每一层都拥有状态编码器、动作编码器和预测器。高层在自己的潜空间中预测较远未来,并把结果作为下一层的目标;低层再围绕这个子目标搜索更具体的动作序列。

H-JEPA高层子目标驱动低层规划的结构示意
H-JEPA高层子目标驱动低层规划的结构示意。

这种自上而下的规划把一条很长的决策链拆成多个更短的问题。论文的关键判断是:当环境确实存在快慢不同的变化尺度时,高层可以主动丢弃快速、难预测且对长期目标不重要的细节。

04 / 训练重点:逐层学习,还要避免潜空间坍塌

H-JEPA采用逐层构建与训练的方式,并使用SIGReg正则约束潜表示。潜空间模型如果学成“所有输入都映射到相近表示”,看似损失很低,实际上已经失去区分状态和预测未来的能力;正则化的目的就是降低这种表示坍塌。

H-JEPA逐层训练与SIGReg正则化流程
H-JEPA逐层训练与SIGReg正则化流程。

这条路线与此前的LeJEPA和动作条件LeWorldModel研究衔接:前者讨论如何让JEPA式表征学习更稳定,后者把动作放进世界模型,H-JEPA则继续把时间尺度与规划层级组织起来。

LeJEPA自监督学习论文标题
LeJEPA自监督学习论文标题。
LeWorldModel动作条件世界模型论文标题
LeWorldModel动作条件世界模型论文标题。

05 / 73.3%到底意味着什么:优势明显,但不能把基准结果写成通用能力

在论文的Visual AntMaze设置中,三层H-JEPA取得73.3%的任务成功率,平坦LeWorldModel基线为18.0%。分层结构还减少了长距离规划时的计算负担,说明高层子目标确实能缩小低层搜索空间。

Visual AntMaze分层子目标与规划成功率对比
Visual AntMaze分层子目标与规划成功率对比。

研究同时覆盖FourRoom Distractors、Visual AntMaze、OGBench Cube、Push-T,以及DROID数据上的离线机器人规划。整体趋势支持分层建模,但并非每项任务都随着层数增加而单调提升。

H-JEPA在多项视觉规划基准中的实验结果
H-JEPA在多项视觉规划基准中的实验结果。
实验 H-JEPA解决的问题 阅读时要注意
Visual AntMaze 长路径视觉导航与子目标规划 73.3%只对应论文特定设置
FourRoom / Cube 干扰环境与操作任务中的长时规划 仍是受控基准,不等同现实部署
Push-T 视觉操作与轨迹预测 两层更合适,继续加层可能下降
DROID离线数据 真实机器人数据上的计划一致性 离线规划不等于实时机器人成功率

06 / 复现教程:先跑通官方环境,再谈换数据和加层

项目当前建议使用Python 3.11.13。基础安装流程如下:

git clone https://github.com/kevinghst/H-JEPA.git
cd H-JEPA
conda create -n hjepa python=3.11.13
conda activate hjepa
pip install -e ".[train,env]" --extra-index-url https://download.pytorch.org/whl/cu128

然后为数据和实验文件设置本地目录:

export HJEPA_HOME=/path/to/data

建议按下面顺序复现:

  1. 确认GPU驱动、CUDA和PyTorch版本与官方安装要求匹配。
  2. 先下载公开权重并跑通一个官方评估配置,不要一开始就训练完整模型。
  3. 记录数据预处理、随机种子、层数、规划步数和候选动作数量。
  4. 分别测试一层、两层和三层,验证层级增加是否真的适合当前任务。
  5. 最后再替换自有数据;出现下降时先检查时间尺度是否存在,而不是盲目扩大模型。

公开权重可从官方Hugging Face页面获取。下载前建议核对模型卡、文件大小与对应实验配置,避免把不匹配的检查点用于其他层级。

07 / 和普通世界模型相比,H-JEPA赢在哪里?

路线 预测对象 长时规划 主要代价
像素生成式世界模型 未来画面或观测 可直观看结果,但远期生成成本高 要为大量视觉细节付费
平坦潜空间世界模型 单一尺度的未来表示 实现直接,长路径搜索容易变大 远近信息挤在同一表示里
H-JEPA 多个时间尺度的潜表示 高层给子目标,低层执行 训练、调参与层级设计更复杂

08 / 对CG和影视从业者有什么关系?短期不是生产工具,长期影响很大

H-JEPA不会直接替代Blender、Unreal Engine或视频生成软件。它当前更像研究底座,而不是点一下就能出片的工具。

但它代表的能力与虚拟制作高度相关:智能摄影机需要在场景里长期导航,数字角色需要理解动作后果,预演系统需要把导演目标拆成镜头与路径,现场机器人则要在动态环境里持续规划。分层世界模型如果成熟,可能成为这些系统的“规划层”。

做视频网观点:对创作者而言,H-JEPA今天最值得跟进的是方法而不是下载量。视频生成解决“画面像什么”,世界模型试图解决“环境如何变化、下一步该做什么”;真正可交互的空间内容最终需要两者会合。

09 / LeCun的路线正在从论文框架变成可运行代码

LeCun长期主张,仅靠语言预测不足以让机器获得对物理世界的理解,视觉表征、世界模型、记忆、规划和动作需要组成完整架构。H-JEPA并没有证明这条路线已经完成,但它把“多层规划”从架构草图推进到可复现实验。

Yann LeCun提出的自主机器智能认知架构
Yann LeCun提出的自主机器智能认知架构。
Yann LeCun关于世界模型研究方向的演讲页面
Yann LeCun关于世界模型研究方向的演讲页面。

这也不等于否定大语言模型作为工具的价值。更准确的表述是:语言模型擅长处理符号和知识任务,但要构建能够长期感知、预测并作用于现实环境的智能体,还需要视觉世界模型与规划机制。

Yann LeCun对大语言模型能力边界的公开说明
Yann LeCun对大语言模型能力边界的公开说明。

AMI Labs把研究重点放在高级机器智能与世界模型。资本规模、团队背景和论文指标都只能说明投入与方向,不能替代真实场景里的持续验证。

AMI Labs官方网站中的研究愿景页面
AMI Labs官方网站中的研究愿景页面。

10 / 最后判断:这是值得复现的研究节点,不是已经完成的通用智能

H-JEPA最扎实的贡献,是让高层远期预测与低层动作规划在同一套JEPA框架中协同,并通过公开代码和权重让外部研究者能够检验结果。

它的限制同样清楚:成绩依赖任务、层数和数据;部分实验仍是受控环境;离线机器人计划不能直接等同现实执行。把这些边界写清楚,73.3%才是有价值的研究进展,而不是一个被放大的营销数字。

相关站内内容

H-JEPA站内导航:https://www.zuoshipin.com/link/51279.html

World Labs Atlas世界模型:https://www.zuoshipin.com/link/30910.html

MoWorld可交互世界模型:https://www.zuoshipin.com/link/1109.html

LingBot-VA具身智能模型:https://www.zuoshipin.com/link/1338.html

Zing-0.5机器人基础模型:https://www.zuoshipin.com/link/27839.html

官方资料

H-JEPA官方论文

H-JEPA官方GitHub仓库

H-JEPA官方预训练权重

常见问题(FAQ)

H-JEPA是什么模型?
H-JEPA是分层动作条件联合嵌入预测架构,在多个潜空间层级中按不同时间尺度预测未来,并用高层预测为低层规划提供子目标。
H-JEPA把Visual AntMaze成功率提升到了多少?
论文报告三层H-JEPA在特定Visual AntMaze设置中达到73.3%,平坦LeWorldModel基线为18.0%。该结果不能直接外推到所有环境或现实机器人。
H-JEPA的代码和权重开放了吗?
已经开放。官方GitHub提供代码与配置,Hugging Face提供预训练权重,论文可在arXiv查看。
H-JEPA适合视频生成或CG制作吗?
它目前不是直接的视频生成或CG制作工具,主要面向视觉规划与世界模型研究;长期可能影响虚拟制作、智能摄影机、数字角色和交互式预演。
H-JEPA层级越多效果越好吗?
不一定。层级数量要与任务的时间尺度、轨迹长度和数据量匹配,论文的Push-T实验就显示增加层数可能导致效果下降。
0 点赞
0 收藏
分享
0 讨论
反馈
热门资讯
相关素材

暂无数据