Learning Self-Correction in Vision-Language Models via Rollout Augmentation
通过回滚增强学习视觉-语言模型中的自我纠正
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 本文提出一种基于回滚增强的强化学习框架Octopus,通过重新组合现有回滚生成密集的自我纠正示例,提高样本效率并稳定RL优化,同时引入响应遮蔽策略以解耦自我纠正与直接推理,从而在7个基准测试中实现开源VLM的SOTA性能。
Comments 18 pages
Journal ref ICML 2026