Q-VGM: Q-Value-Gradient Matching for Off-Policy Reinforcement Learning of Flow-Matching VLA
Q-VGM: 基于Q引导的值梯度匹配的流匹配VLA策略
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; University of Electronic Science and Technology of China(电子科技大学)
AI总结 提出Q-VGM离线强化学习方法,通过将值梯度转化为去噪时间上的值梯度场,避免反向传播去噪链,高效微调流匹配VLA策略,在LIBERO等任务上显著提升成功率。
Comments 13 pages, 3 figures, 4 tables