Masked Visual Actions for Unified World Modeling
用于统一世界建模的掩码视觉动作
机构 * Stanford University(斯坦福大学) ; University of Maryland, College Park(马里兰大学帕克分校) ; Harvard University(哈佛大学)
专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV
AI总结 研究如何将动作传达给视频模型用于机器人世界建模,提出掩码视觉动作这一像素空间控制接口,经微调后单个检查点在多场景和实施例中表现出色,在下游操作中能辅助策略评估、改进决策和支持逆建模。
Comments Project webpage: https://masked-visual-actions.github.io