LLMs Can See the Smoke but not the Fire: Evaluating Abductive Reasoning with Elenchos
大语言模型能看到烟雾却看不到火焰:用Elenchos评估溯因推理
机构 * Max-Planck-Institute for Biological Cybernetics(马克斯·普朗克生物控制论研究所) ; University Hospital Tübingen(图宾根大学医院)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型的溯因推理能力,引入Elenchos评估框架,通过给定形式系统及变异对应物,让智能体判断变异并推断规则修改,发现模型存在检测-归因分离问题,相互作用变异下性能降,推理时间收益递减。