Be Faithful When Response: Returning Fluent and Grounded Answers for Vision-Language Models Reinforcement Learning
回答时保持忠实:为视觉语言模型强化学习返回流畅且基于视觉依据的答案
机构 * GMLab ; Hong Kong Polytechnic University(香港理工大学) ; XPENG Robotics(XPENG机器人)
AI总结 提出Faithful Warm-Start (FWS)策略,通过构建具有明确视觉-语言因果关系的FaithfulQA数据集并利用VLM裁判净化,在强化学习前预热模型,提升答案准确性、稳定训练并减少无视觉依据的推理。