From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation
从被动观察者到主动批评者:强化学习激发机器人操作的过程推理
机构 * Shanghai Jiao Tong University(上海交通大学) ; Northeastern University(东北大学) ; Xiamen University Malaysia(厦门大学马来西亚分校) ; The University of Hong Kong(香港大学) ; The Chinese University of Hong Kong(香港中文大学) ; Xspark AI
AI总结 本文提出PRIMO R1框架,通过强化学习使视频MLLMs成为主动批评者,提升机器人操作中长期任务的监督准确性,实验表明其在过程推理和零样本泛化方面表现优异。
Comments Accepted to ECCV 2026. 32 pages