Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO
作为自身评论家的智能体:通过循环组相对策略优化统一区域理解与定位
机构 * National University of Singapore(新加坡国立大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nanyang Technological University(南洋理工大学) ; Wuhan University(武汉大学)
AI总结 研究针对多模态大语言模型的区域理解与定位问题,提出循环组相对策略优化框架CycleGRPO,利用任务对偶性构建自我评估范式,仅需区域输入,通过质量感知奖励评估字幕,在多基准测试中提升能力,为推进MLLMs像素级能力提供新途径。
Comments Accepted to ECCV 2026