From Failed Trajectories to Reliable LLM Agents: Diagnosing and Repairing Harness Flaws
从失败轨迹到可靠的LLM代理:诊断与修复框架缺陷
专题命中 知识编辑与模型理解 :LLM(title,title_cn)
AI总结 提出HarnessFix框架,通过轨迹引导诊断代理失败并修复执行框架,在多个基准上提升15.2%-50.0%性能。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
从失败轨迹到可靠的LLM代理:诊断与修复框架缺陷
专题命中 知识编辑与模型理解 :LLM(title,title_cn)
AI总结 提出HarnessFix框架,通过轨迹引导诊断代理失败并修复执行框架,在多个基准上提升15.2%-50.0%性能。
跨层离散概念发现用于解释语言模型
机构 * University of Washington(华盛顿大学)
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出跨层向量量化变分自编码器(CLVQ-VAE),通过离散向量量化瓶颈将残差流中的重复特征压缩为紧凑可解释的概念向量,在三个数据集上优于聚类、单层VQ-VAE和稀疏自编码器基线。
机械论数据归因:追踪可解释LLM单元的训练起源
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出机械论数据归因(MDA)框架,利用影响函数将可解释单元追溯到特定训练样本,通过因果验证表明干预高影响样本可显著调节可解释头的涌现,并发现重复结构数据作为机械催化剂,同时验证了归纳头与上下文学习之间的功能联系。
Comments ICML2026 (Oral)
他们在想什么?LLM中概念的界定、探测与追踪
机构 * The Edward S. Rogers Sr. Department of Electrical and Computer Engineering(埃德华·S·罗杰斯 Sr. 部门电子与计算机工程系)
专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL
AI总结 本文提出通过线性探针低成本地检测LLM嵌入中的概念,并展示了概念界定、探针训练与跨上下文追踪的方法,为大规模模型监控奠定基础。
Comments Accepted to the 6th Workshop on Trustworthy Natural Language Processing (TrustNLP 2026)
Journal ref Proceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026)
大型语言模型中的可信不确定性:置信度校准与风险控制拒绝的统一框架
机构 * University of Liechtenstein(列支敦士登大学) ; University of the Republic of San Marino(圣马尔科共和国大学) ; University of Mauritius(毛里求斯大学) ; International University of Monaco(摩纳哥国际大学) ; University of Andorra(安道尔大学) ; University of Gibraltar(直布罗陀大学) ; University of the Faroe Islands(法罗群岛大学) ; Ilisimatusarfik (University of Greenland)(格陵兰岛研究所(格陵兰大学)) ; University of Prizren(普里兹伦大学)
专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL
AI总结 提出UniCR框架,融合多种不确定性证据为校准的正确概率,并通过原则性拒绝满足用户指定的错误预算,无需微调基础模型,在短问答、代码生成和检索增强长问答中提升校准指标并降低风险-覆盖曲线下面积。
Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation
大语言模型中的道德敏感性:通过行为剖析和机制可解释性对上下文偏见进行分层评估
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; Purdue University(普渡大学) ; Meta ; Apple(苹果公司) ; Wright State University(怀特州立大学) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)
专题命中 知识编辑与模型理解 :SLM(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出道德敏感性指数(MSI)量化大语言模型在七级压力测试中的偏见概率,并通过行为剖析和机制验证揭示模型偏见随情境变化的U型曲线,发现推理蒸馏会重新激活浅层统计关联。
LEX-EC:黑盒设置下用于零样本大语言模型人格分类的词汇证据通道审计框架
专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究针对大语言模型人格分类可解释性问题,提出LEX-EC框架,结合多种诊断与词汇消融,通过对不同文本体裁分析,展示特质关联与词汇证据关系,联合评估多项指标,将词汇方法应用于黑盒人格标签可解释性。
Comments Appendix and link to Code repo provided; this version also contains a refined Discussion section and a small error regarding Table 1 was corrected
无外部表达的知识:探索经典中文语言模型的泛化边界
机构 * Eaglewood Japan Co., Ltd.(日本鹰木公司)
专题命中 知识编辑与模型理解 :language model(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究通过训练纯经典中文语料库的Transformer模型,探讨模型能否区分已知与未知输入,并揭示内部与外部不确定性之间的差异。
Comments 27 pages, 4 figures, supplementary material included
迈向减轻基于大语言模型的智能体幻觉:渐进泛化边界探索与看门狗监测
机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) ; Haihe Lab of ITAI College of intelligent Science and Technology, Inner Mongolia University of Technology(内蒙古工业大学智能科学与技术学院海河实验室) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Department of Electrical and Computer Engineering, Stony Brook University(石溪大学电气与计算机工程系) ; Department of Computer Science, Michigan Technological University(密歇根技术大学计算机科学系)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型赋能智能体的幻觉问题,提出HalMit黑箱框架,用概率分形采样技术并行生成查询触发异常响应,以识别泛化边界来检测幻觉,提升智能体可靠性。
Journal ref Proceedings of the 28th European Conference on Artificial Intelligence (ECAI 2025), IOS Press, 2025
社会对齐框架可以改进大语言模型对齐
机构 * ETH Zurich(苏黎世联邦理工学院) ; Mila, McGill University(麦吉尔大学米尔人工智能实验室) ; University of Cambridge(剑桥大学) ; Columbia University(哥伦比亚大学) ; University of Toronto, Google DeepMind(多伦多大学与DeepMind) ; McGill University, ServiceNow(麦吉尔大学与ServiceNow) ; Google DeepMind(谷歌DeepMind) ; University of Utah(犹他大学) ; King's College London(伦敦国王学院) ; Johns Hopkins University(约翰霍普金斯大学) ; Mila, McGill University, ServiceNow(麦吉尔大学米尔人工智能实验室与ServiceNow)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出借鉴社会、经济和契约对齐框架来改进大语言模型对齐,探讨不确定性在其中的作用,并将目标未指定性视为机遇而非缺陷,同时强调参与式对齐界面设计的必要性。
基于关系场景图的对象接地自然语言指令
机构 * School of Electrical Engineering, Aalto University(艾尔沃大学电气工程学院) ; School of Science, Aalto University(艾尔沃大学科学学院)
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出基于关系场景图的方法,通过结合LLM和VLM增强自然语言指令中对象接地的准确性。
Comments Accepted to the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)
解释比单独预测更难:评估基于概念的MLLM解释作为ICL视觉分类器
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文通过五种形式化程度递增的条件,系统评估多模态大语言模型在少样本上下文学习中的基于概念的可解释性,发现解释比预测更难,且强制生成形式化解释会降低预测准确性。
Comments Accepted to the CompLearn Workshop at ICML 2026
重新思考基于AI编程能力的技术栈选择
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 提出AI编程能力概念,通过170个第三方库和6个LLM的实证研究发现,相似功能的库在LLM生成代码质量上差异高达84%,呼吁将AI编程能力纳入技术选择框架。
Comments 13 pages
MafiaScope:社交推理游戏中对大语言模型智能体的非侵入性、时间分辨信念探测
机构 * HSE University(俄罗斯高等经济研究大学)
专题命中 知识编辑与模型理解 :LLM(title,summary_cn);分类 cs.CL
AI总结 研究社交推理游戏中LLM智能体信念探测问题,提出MafiaScope测试平台,通过结构化问题让智能体私下作答并自动评分,可视化呈现信念轨迹,以DeepSeek为例进行研究,得出相关校准误差等结果并开源相关内容。
利用机制可解释性对大语言模型进行对抗攻击
机构 * Thales(泰勒斯)
专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.AI、cs.LG
AI总结 研究利用机制可解释性对大语言模型进行对抗攻击,通过识别接受子空间,用梯度优化使嵌入重新路由,降低计算成本,在多种模型上快速实现高成功率攻击,为攻防研究开辟新方向。
在视觉语言模型中保留局部化补丁语义
机构 * Department of Computer and Information Sciences, Temple University, Philadelphia, USA(计算机与信息科学系,特兰普大学,费城,美国)
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn)
AI总结 为解决视觉语言模型中图像与文本 tokens 信息扩散问题,提出 Logit Lens Loss(LLL)以保留图像 tokens 的局部化语义,提升模型可解释性和分割任务性能。
长文本语言模型输出的细粒度不确定性量化:一项比较研究
机构 * CVS Health(CVS健康公司) ; Wellesley, MA(马萨诸塞州韦尔士利)
专题命中 知识编辑与模型理解 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 针对长文本生成,提出细粒度不确定性量化分类法,通过响应分解、单元级评分和响应级聚合三阶段区分方法,引入FactScore-STEM-Geo数据集,实验发现声明-响应蕴含评分优于复杂方法,声明级评分优于句子级,不确定性感知解码有效提升事实性。
Comments Accepted by TMLR; UQLM repository: https://github.com/cvs-health/uqlm
Journal ref Transactions on Machine Learning Research, 2026
ELISA:一种可解释的混合生成式AI代理,用于单细胞组学中的表达基础发现
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.AI
AI总结 ELISA结合表达嵌入、语义检索和LLM解释,提供交互式单细胞发现,优于CellWhisperer,尤其在基因签名查询中表现突出。
探究LLM中的最简阶段结构:普遍依赖关系无法表示的内容
机构 * Dartmouth College(达特茅斯学院)
专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL
AI总结 通过设计UD距离不变的条件,使用结构探针评估LLM在wh-移位刺激上的表现,发现阶段计数梯度和阶段内凝聚性效应,表明分布预训练能诱导出超越UD的形式句法抽象表征。
通过梯度上升实现可解释人格控制与提示工程的桥梁
机构 * Department of Computer Science(计算机科学系) ; Indian Institute of Technology (ISM), Dhanbad(印度理工学院(ISM),丹巴德) ; National University of Singapore(新加坡国立大学) ; CIFAR Fellow(CIFAR研究员)
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出RESGA和SAEGA方法,利用梯度上升优化随机初始化提示,以实现与识别的人格方向更一致的表示,有效控制LLM中的人格行为。
基于稀疏MLP值向量的免训练真实性检测
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出TruthV方法,利用MLP值向量中稀疏子集的稳定方向性信号,无需训练即可检测LLM生成内容的真实性,在多个基准上超越现有免训练方法。
Comments KDD 2026 Oral
ErrorLLM: 为文本到SQL精炼建模SQL错误
机构 * The Hong Kong Polytechnic University(香港理工大学) ; City University of Macau(澳门城市大学) ; Jilin University(吉林大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Beihang University(北航大学)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出ErrorLLM框架,通过专用错误令牌和结构特征显式建模SQL错误,结合静态检测与错误引导精炼,显著提升文本到SQL生成质量。
Comments Accepted to SIGKDD2026
通过几何调控逃离大语言模型生成中的模式崩溃
机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) ; School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) ; Department of Communications and Computer Engineering, Waseda University, Tokyo, Japan(通信与计算机工程系,早稻田大学,东京,日本) ; Department of Computer Science and Engineering, Waseda University, Tokyo, Japan(计算机科学与工程系,早稻田大学,东京,日本) ; Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University, Shanghai, China(智能自主系统上海研究院,同济大学,上海,中国)
专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文从动力系统视角将模式崩溃解释为几何崩溃,并提出轻量级在线状态空间干预方法RMR(通过低秩阻尼调控Transformer值缓存中的自强化方向),显著降低模式崩溃并实现极低熵率下的稳定生成。
Comments Accepted to ICML 2026
定向幻觉:基于新闻的语言模型问答中的意识形态漂移
机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)
专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究基于新闻的语言模型问答中的意识形态漂移,提出可重复测量框架,利用大量新闻文章对多个模型进行实验,发现幻觉率因模型和话题而异,幻觉内容有向左漂移现象,并探讨了相关意义。
密度脊选择性预测:校准标签稀缺下的大语言模型与视觉语言模型幻觉检测
机构 * Northeastern University Boston, United States(东北大学波士顿分校)
专题命中 知识编辑与模型理解 :LLM(title,abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对校准标签稀缺时大语言模型和视觉语言模型的幻觉检测问题,提出基于核密度估计的密度脊方法,利用隐藏状态生成轨迹的六维运动特征图构建响应流形,通过到最近脊顶点的欧氏距离评分,在标签稀缺协议下AUROC提升5-20点。
LDI:面向文本丰富表的局部数据填补
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出LDI框架,通过局部推理利用LLM填补文本丰富表中的缺失值,提升准确性和可解释性,实验证明其优于现有方法。
CLT-Forge:一种可扩展的跨层转码器和归因图库
机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Jinesis AI Lab(Jinesis人工智能实验室) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; CMU(卡内基梅隆大学) ; EuroSafeAI ; ELLIS Institute Tübingen(图宾根ELLIS研究所)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出CLT-Forge库,通过分布式训练、模型分片和压缩激活缓存提升跨层转码器的可扩展性,提供统一的可解释性流程和可视化接口,解决归因图的冗余问题。
Comments 9 pages, 7 figures, 1 table. Code: https://github.com/LLM-Interp/CLT-Forge. Demonstration video: https://youtu.be/6ptrrLawTl8
超越语义等价:用于大语言模型不确定性量化的逻辑图
机构 * Institute of Intelligent Software(智能软件研究所) ; Institute of Software, CAS(中国科学院软件研究所) ; University of Liverpool(利物浦大学) ; Guangzhou Jiayi Software Technology Co., Ltd.(广州嘉意软件科技有限公司)
专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究大语言模型输出不可靠问题,提出逻辑图不确定性(LGU)框架,该框架能明确建模答案间逻辑关系,通过聚合概率质量、计算熵等方式改进不确定性估计,在多个问答基准测试中优于现有方法。
Comments 21 pages, 3 figures, 11 tables. Under review
最大化关键区域的局部熵:基于前缀的局部化大语言模型去敏感化
机构 * University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学)
专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出PALU框架,通过局部熵最大化减少冗余优化,提升大语言模型的去敏感化效果与通用性能。
Comments Accepted to ACL 2026 main
从奖励黑客激活到智能体风险状态:LLM智能体中的上下文校准机制监控
机构 * University of Cambridge(剑桥大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI
AI总结 本研究通过分析ReAct风格智能体在Gameable ALFWorld和WebShop环境中的奖励黑客行为,提出结合激活状态、熵和决策上下文的上下文校准监控方法,以更准确评估智能体风险。