動察 Beating AI 快訊,楊立坤創辦的 AMI Labs 聯合多所高校公布 H-JEPA,一種能夠分層預測未來、規劃動作的世界模型。高層負責遠期目標,低層負責具體動作。論文、代碼和預訓練權重均已公開。
H-JEPA 延續了 JEPA 的思路。它先把畫面轉成抽象的環境特徵,再結合動作預測未來狀態,不必逐幀生成視頻。但長期規劃和眼前控制需要的信息不同。比如四足機器人走迷宮,選路線主要看位置和通道,邁腿卻離不開身體姿態。單層模型用同一套特徵兼顧兩件事,規劃越遠越吃力。
H-JEPA 將多個 JEPA 組成不同的規劃層級。高層預測更遠的未來,把中途目標交給下層,再逐步細化成具體動作。與此前各層共用同一套特徵的 HWM 不同,H-JEPA 讓每個層級學習自己的環境特徵。在迷宮實驗中,高層保留了位置信息,逐漸忽略腿部姿態等短期細節。楊立坤早在 2022 年就提出過類似構想,如今團隊給出了可以端到端訓練的實現方案。
在 Visual AntMaze 仿真迷宮中,三個規劃層級的 H-JEPA 成功率达到 73.3%,單層 LeWorldModel 為 18.0%,前者所需的規劃計算量更少。不過,規劃層級並非越多越好。在模擬推物體的 Push-T 任務中,三層模型反而不如兩層。團隊還用真實機器人錄像數據集 DROID 進行了離線測試,預測動作軌跡比單層模型更接近專家示範。