From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding
从失败到反馈:群体修订解锁对象级 grounding 的难题
机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所) ; Technical University of Munich(慕尼黑技术大学) ; University of Science and Technology of China(中国科学技术大学) ; Cornell University(康奈尔大学)
AI总结 本文提出群体修订优化方法,通过生成改进候选响应提升硬案例学习效果,改进奖励和优势函数以增强高质量修订影响,优于现有GRPO方法。
Comments 8 pages, 5 figures, IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026