BalCapRL: A Balanced Framework for RL-Based MLLM Image Captioning
BalCapRL:一种基于RL的MLLM图像描述的平衡框架
机构 * Apple(苹果公司)
专题命中 视觉问答 :MLLM(title,title_cn);LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出BalCapRL框架,通过联合优化正确性、参考覆盖和语言质量,解决图像描述中因评价指标狭窄导致的权衡问题,并通过改进的奖励解耦归一化和长度条件奖励遮蔽提升性能。