Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment
通过视觉动作结果推理对齐实现物理推理与任务泛化的桥梁
机构 * National Taiwan University(国立台湾大学) ; The University of California, Merced(加州大学默塞德分校)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对视觉语言模型在物理推理中难以泛化的问题,提出VAORA奖励设计,包括视觉对齐奖励和视觉-动作对齐奖励,通过预训练专家估计概率实现平滑密集奖励,经实验验证可有效提升模型在新任务和未见环境中的物理推理性能。
Comments ICML'26 Workshop RLxF: Reinforcement Learning from World Feedback