Superficial Beliefs in LLM Decision-Making
LLM决策中的表面信念
机构 * Department of Computing, Imperial College London(帝国理工学院计算系)
AI总结 研究大型语言模型在二元选择中是否仅模仿理由,通过合成决策实验发现模型行为有系统性但自我报告与行为推断的驱动因素不完全一致,表明存在“表面信念”。
Comments Under review
高校专区
LLM决策中的表面信念
机构 * Department of Computing, Imperial College London(帝国理工学院计算系)
AI总结 研究大型语言模型在二元选择中是否仅模仿理由,通过合成决策实验发现模型行为有系统性但自我报告与行为推断的驱动因素不完全一致,表明存在“表面信念”。
Comments Under review
多任务大语言模型用于缺陷分类:基于辅助解码头的高效推理
机构 * Recurse Ltd. ; Department of Computing, Imperial College London(帝国理工学院计算机系)
AI总结 提出一种轻量级多任务大语言模型(MLC),通过令牌对齐算法和优化训练策略,实现全文件上下文下的行级缺陷定位,性能与代理方法相当但推理延迟降低数个数量级。
Comments 8 pages, 6 pages appendix
交叉编码器特征间的交互:一个紧凑证明的视角
机构 * Anthony J. Leggett Institute for Condensed Matter Theory(安东尼·J·莱格特凝聚态理论研究所) ; MATS ; UK AI Security Institute (AISI)(英国人工智能安全研究所) ; Imperial College London(帝国理工学院伦敦分校) ; Goodfire ; University of Cambridge(剑桥大学) ; Theorem Labs(定理实验室)
AI总结 本文从紧凑证明角度形式化交叉编码器特征交互,提出交互度量并应用于计算稀疏性、语义聚类和检测休眠代理。
Comments Accepted at the NeurIPS 2025 Workshop on Mechanistic Interpretability
PreAct-Bench:大语言模型中的预测性监控基准
机构 * King’s College London(伦敦国王学院) ; National University of Singapore(新加坡国立大学) ; Southern University of Science and Technology(南方科技大学) ; Thomson Reuters Foundational Research(汤姆森路透基础研究) ; Imperial College London(伦敦帝国学院) ; The Alan Turing Institute(艾伦·图灵研究所)
AI总结 提出预测性监控任务,在动作执行前判断是否会导致不道德行为,并构建PreActBench基准,评估多种模型发现该任务具有挑战性。
用于推理时间论证的神经符号学习
机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算机系)
AI总结 本文提出了一种用于三元主张验证的可训练神经符号框架,通过在训练和推理过程中结合形式论证语义来指导大语言模型生成论证并分配基础分数,从而提高三元预测的准确性。
Comments Under review