Context-Aware RL for Agentic and Multimodal LLMs
上下文感知强化学习用于智能体与多模态大语言模型
机构 * Princeton University(普林斯顿大学) ; UC Davis(加州大学戴维斯分校)
AI总结 提出ContextRL方法,通过间接辅助目标(上下文选择奖励)增强大模型在长上下文和多模态任务中的细粒度推理能力,在5个长程基准和12个视觉问答基准上分别提升+2.2%和+1.8%。
Comments 29 pages, 9 figures