Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization
可信的GRPO:通过约束策略优化提升多模态语言模型的视觉空间推理
机构 * IIT Hyderabad(印度理工学院海得拉巴分校) ; Microsoft Research(微软研究院)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文提出Faithful GRPO,通过约束策略优化提升多模态模型的空间推理质量,减少推理不一致率并提升视觉 grounding 评分。