SAM-R1: Leveraging SAM for Reward Feedback in Multimodal Segmentation via Reinforcement Learning
SAM-R1:通过强化学习利用SAM进行多模态分割的奖励反馈
AI总结 本文提出SAM-R1框架,通过整合任务特定的细粒度奖励与定制优化目标,提升多模态模型在图像理解任务中的细粒度推理与分割对齐能力,仅用3k训练样本即在多个基准上取得优异表现。
Comments Accepted to NeurIPS 2025