SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models
SRPO:用于视觉-语言-动作模型的自指政策优化
机构 * Fudan University(复旦大学) ; Tongji University(同济大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV
AI总结 SRPO通过自指政策优化方法,利用模型自身生成的成功轨迹作为参考,有效解决VLA-RL中的奖励稀疏问题,实现高成功率和鲁棒性。