少于 1 分钟阅读

generalizability data efficiency

World Model

world model 的核心是:基于当前和历史的状态观测,去预测未来的状态。

如何表征状态:

  1. 像素级图像(视频):VPP
  2. 3D场景:
  3. 隐式表征:JEPA

World Model for video/3D scene generation与 World Model for action policy的

关注的问题 实时性:减少去噪次数,甚至直接在inference阶段抛弃下一帧预测,只用action 闭环:先预测视频再decode action trajectory,可能出现幻觉 语义理解:把VLA和world model结合

更新时间: