Offline Policy Evaluation for Manipulation Policies via Discounted Liveness Formulation
通过折扣存活公式评估操纵策略的离线策略评估
机构 * University of Southern California(南加州大学) ; Stanford University(斯坦福大学)
专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI
AI总结 本文提出基于存活Bellman算子的离线策略评估框架,解决稀疏奖励下任务完成问题,通过保守固定点值函数降低截断偏差,实验证明在折叠任务中优于传统基线方法。
Comments Published at RSS 2026