ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training
ALOE: 面向视觉-语言-动作模型后训练的动作级离策略评估
机构 * AgiBot ; The Hong Kong University of Science and Technology(香港科技大学) ; Fudan University(复旦大学) ; Nanjing University(南京大学) ; Independent Researcher(独立研究者)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI
AI总结 提出ALOE框架,通过离策略评估直接估计当前策略的价值,结合分块时序差分和保守值聚合,改善稀疏奖励下的信用分配,在四项真实世界操作任务中优于现有方法。