Grounding Multi-Hop Reasoning in Structural Causal Models via Group Relative Policy Optimization
通过群体相对策略优化在结构因果模型中 grounding 多跳推理
机构 * School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院,乌鲁木齐,中国) ; Beijing Institute of Technology, Beijing, China(北京理工大学,北京,中国) ; Military Science Information Research Center, Academy of Military Science, Beijing, China(军事科学院军事科学信息研究中心,北京,中国)
专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI
AI总结 本文提出基于结构因果模型的多跳事实验证框架,通过群体相对策略优化解决推理链长度与准确率的平衡问题,实验表明其在HoVer和EX-FEVER数据集上优于现有方法。