HopRefusalBench: Diagnosing Refusal Failures in Search-Augmented Agents for Multi-Hop Reasoning
HopRefusalBench:面向多跳推理的搜索增强智能体的弃权失败诊断基准
机构 * Ant Group(蚂蚁集团) ; NLPR, MAIS, CASIA(中国科学院自动化研究所模式识别国家重点实验室、多模态人工智能系统实验室)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL
AI总结 研究针对多跳搜索增强智能体的弃权问题,构建首个可控基准HopRefusalBench,经实验发现前沿模型弃权能力存在显著不足,为相关可靠性改进提供基础。
Comments 20 pages