Optimizing Agentic Reasoning with Retrieval via Synthetic Semantic Information Gain Reward
通过合成语义信息增益奖励优化基于检索的智能推理
机构 * Hong Kong JC STEM Lab of Smart City.(香港JC STEM实验室) ; City University of Hong Kong.(香港城市大学) ; Lingnan University(岭南大学) ; Fudan University.(复旦大学) ; Huazhong University of Science and Technology.(华中科技大学)
AI总结 提出InfoReasoner框架,利用合成语义信息增益奖励优化检索过程,通过GRPO训练策略,在七个问答基准上平均准确率提升5.4%。
Comments Accepted by ICML'26