Identifying and Mitigating the Influence of the Prior Distribution in Large Language Models
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 16 pages, 5 figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 16 pages, 5 figures
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);prompting(abstract)
Comments Accepted at NeurIPS 2024, code at https://github.com/siyan-zhao/ICL_decision_boundary
基于LLM概念化的事件本体扩展
机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);prompting(abstract);分类 cs.CL
AI总结 提出ConceptE框架,利用LLM从句子和触发词中提取概念级语义,增强事件聚类和层次扩展,在ACE、ERE和MAVEN上显著优于现有方法。
MultiHaluDet: 通过LLM隐藏状态探测实现多语言幻觉检测
机构 * United International University(国际联合大学) ; BRAC University(布拉克大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出MultiHaluDet框架,通过探测冻结LLM的全隐藏状态轨迹,结合多尺度注意力和自注意力池化的混合架构,以及校准的经典分类器集成,实现跨语言的高精度幻觉检测,在英语基准上达到98.55% AUROC,并展现出对高、中、低资源语言的强泛化能力。
Comments MeLLM @ ACL 2026
注意未见的质量:通过软混合字母估计揭示LLM幻觉
机构 * School of Data Science(数据科学学院)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出SHADE方法,通过结合通用Good-Turing覆盖与图谱特征,解决小样本下LLM语义字母估计问题,提升不确定性量化性能。
Comments 7 pages, 1 figure, 3 tables
超越“我不知道”:评估LLM在区分数据和模型不确定性中的自我意识
机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) ; Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出UA-Bench基准测试,评估LLM在区分数据不确定性和模型不确定性方面的能力,发现即使先进模型也难以可靠区分,并提出轻量数据合成与强化学习策略提升不确定性判断。
自指式归纳相比大型语言模型中不可解决问题和可验证问题会增加响应不稳定性
机构 * Birla Institute of Technology and Science, Pilani(比拉理工学院(皮拉尼))
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);prompting(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究通过Gemini API实验发现,大型语言模型对自指式问题的响应不稳定性高于不可解决哲学问题和可验证问题,为其诱导的主观体验报告提供了定量基线。
Comments 4 pages, 2 figures
InverseScope:用于解释大语言模型的可扩展激活反演
机构 * School of Mathematical Science, Peking University(北京大学数学科学学院) ; School of Science, Westlake University(西湖大学理学院) ; Beijing International Center for Mathematical Research(北京国际数学研究中心) ; New Cornerstone Science Laboratory, Peking University(北京大学新基石科学实验室)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 研究大语言模型内部表征解释难题,提出InverseScope框架,通过输入反演解释神经激活,用新颖架构提高采样效率,揭示模型表征空间结构,可扩展到14B参数模型并推广到分布外输入。
Comments 12 pages
贝叶斯稀疏低秩自适应用于大语言模型不确定性估计
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; Michigan State University(密歇根州立大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.CL、cs.LG
AI总结 提出DALorRA,一种变分贝叶斯稀疏框架,通过随机掩码低秩适应中的秩维度实现模型容量正则化和校准,在不牺牲推理精度下提升LLM校准性能。
Comments Preprint. 16 pages, 7 figures, 6 tables
可扩展的电路学习用于解释大型语言模型
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI、cs.LG
AI总结 提出CircuitLasso方法,基于稀疏线性回归高效学习LLM中的稀疏电路,以SAE特征为单元,在保持结构准确性的同时大幅降低计算成本,并揭示语义特征传播机制。
Comments Accepted to the Mechanistic Interpretability Workshop at ICML 2026
基于SAPPhIRE模型因果关系的生成技术内容参考知识选择研究
机构 * Indian Institute of Science(印度科学研究院)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文研究如何利用大语言模型生成与SAPPhIRE因果关系模型相关的技术内容,通过检索增强生成方法抑制幻觉,强调参考知识选择对生成准确性的重要性。
SeSE: 基于结构信息理论的大语言模型黑盒不确定性量化
机构 * School of Cyber Science and Technology Beihang University(北航信息科学与技术学院) ; School of Computer Science and Engineering Beihang University(北航计算机科学与工程学院) ; Didi Chuxing(滴滴出行) ; Laboratory for Big Data and Decision National University of Defense Technology(国防科技大学大数据与决策实验室) ; Department of Computer Science University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出SeSE框架,通过构建语义空间的最优层次抽象并计算结构熵,实现大语言模型的黑盒不确定性量化,理论推广了语义熵并在长文本生成中优于现有方法。
Comments Accepted by UAI 2026
重新审视大型语言模型中基于参数的知识编辑:理论极限与实证证据
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文通过理论分析和实证评估,揭示了基于参数的知识编辑方法会因维度坍缩假设导致全局干扰和推理崩溃,而简单的检索基线方法在所有条件下均表现更优。
Comments Accepted to ICML 2026. Equal contribution by the first two authors. 9 pages main paper, 10 figures, with appendix
大型语言模型中跨深度的涌现因果几何动力学
机构 * Champalimaud Centre for the Unknown(查普拉米乌德未知中心)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 通过结合几何分析与因果干预,揭示了解码器-only大型语言模型中从上下文处理到预测形成的跨层转变,并发现后期层中角度结构参数化下一词分布相似性并实现选择性因果控制。
基于概率的大型语言模型归因
机构 * Argonne Leadership Computing Facility(阿贡领导计算设施) ; Argonne National Laboratory(阿贡国家实验室) ; Mathematics and Computer Science Division(数学与计算机科学 division) ; Department of Computer Science(计算机科学系)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出了一种模型无关的概率性token归因度量,通过贝叶斯法则反向计算下一个token的对数概率,以捕捉模型对token序列分布的内部表示,从而提高大型语言模型的可解释性。
Comments 29 pages, 13 figures
黄金层与寻找它们的位置:通过层梯度分析改进大型语言模型的知识编辑
机构 * University of South Florida(佛罗里达州立大学) ; Brandeis University(布兰迪大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出通过层梯度分析(LGA)识别高效知识编辑的黄金层,验证其在不同数据集和模型类型中的有效性。
通过决策表示过渡理解层剪枝大型语言模型中的性能崩溃
机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) ; Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用重点实验室(东南大学),教育部,中国)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文通过决策表示过渡分析层剪枝对大型语言模型性能的影响,提出决策边际和选项频率两个指标,揭示剪枝导致决策阶段转变的机制,发现剪枝沉默阶段会引发性能崩溃。
大语言模型中的潜在轨迹动力学:一种具有实证验证的流形演化框架
机构 * The Chinese University Of Hongkong(香港中文大学) ; Fudan University(复旦大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出DMET框架,通过轨迹几何指标分析大语言模型生成过程中的潜在表示演化,实验证明其能有效预测文本质量并提升生成控制。
扰动探测:对齐语言模型中FFN行为电路的双次提示诊断
机构 * Palo Alto Networks(帕洛阿尔托网络公司)
专题命中 知识编辑与模型理解 :RLHF(summary_cn,abstract);LLM(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 通过双次提示传递和无反向传播的扰动探测,识别LLM中两种行为电路结构,揭示RLHF组织的行为机制及模板层编辑工具。
在大型语言模型中测量几何表示的鲁棒性
机构 * Department of Computer Science and Information Systems, BITS Pilani(比特学院计算机科学与信息系统系) ; School of Computer Science, KIIT University(KIIT大学计算机科学学院) ; Department of Mathematics, BITS Pilani(比特学院数学系)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)
AI总结 本文提出GeoRepEval框架,评估几何问题在不同表示形式下的正确性、不变性和一致性,发现表示选择对模型性能有显著影响,尤其在向量形式上表现脆弱,通过提示干预可提升高容量模型性能,但低容量模型无明显改进。
Comments 20 pages, 7 figures, 9 tables
在大型语言模型长格式问答中评估不确定性校准的基准测试
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);prompting(abstract)
AI总结 本研究提出首个大规模基准,评估大型语言模型在长格式问答中不确定性校准的可靠性,揭示了指令调优和推理过程对校准的影响及ECE指标的局限性。
Comments Under Review
通过不变轨迹学习实现通用的多模态大语言模型编辑
机构 * Zhejiang University, China(浙江大学) ; Singapore Management University, Singapore(新加坡管理学院) ; National University of Singapore, Singapore(新加坡国立大学) ; Hangzhou Dianzi University, China(杭州电子科技大学) ; Jiangxi Normal University, China(江西师范大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
AI总结 本文提出ODEit框架,通过不变轨迹学习提升多模态大语言模型的编辑可靠性、局部性和泛化能力。
面向大型语言模型事实生成的鲁棒不确定性量化
机构 * School of Cyberspace Security, Beijing University of Posts and Telecommunications(网络安全学院,北京邮电大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
AI总结 本文提出了一种新颖的鲁棒不确定性量化方法,用于评估大型语言模型在生成多事实任务中的可靠性,通过构建陷阱问题集验证了其有效性,提升了对抗性提问下的模型鲁棒性。
Comments 9 pages, 5 tables, 5 figures, accepted to IJCNN 2025
Journal ref 2025 International Joint Conference on Neural Networks (IJCNN), Rome, Italy, 2025, pp. 1-9
机构 * School of Computer Science, University of Sydney(悉尼大学计算机科学学院) ; City University of Hong Kong(香港城市大学) ; Shanghai Jiao Tong University(上海交通大学) ; Department of Engineering Science, University of Oxford(牛津大学工程科学系)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 10 pages
机构 * Smart Mobility and Infrastructure Lab College of Engineering University of Georgia(智能移动与基础设施实验室 工程学院 佐治亚大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 20 pages, 7 figures
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments ICONIP 2024
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 15 pages, 14 figures, 5 tables
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 9 Pages, 3 Figures, GTA3 Workshop-2024, October 2024, 33rd International Conference on Information and Knowledge Management, Boise, Idaho, USA
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments NeurIPS 2024