How do world (action) model facilitate manipulation policy
generalizability data efficiency
World Model
world model 的核心是:基于当前和历史的状态观测,去预测未来的状态。
如何表征状态:
- 像素级图像(视频):VPP
- 3D场景:
- 隐式表征:JEPA
World Model for video/3D scene generation与 World Model for action policy的
关注的问题 实时性:减少去噪次数,甚至直接在inference阶段抛弃下一帧预测,只用action 闭环:先预测视频再decode action trajectory,可能出现幻觉 语义理解:把VLA和world model结合