arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7526 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7526 篇

2604.06483 2026-04-09 cs.LG cs.AI 88%

Distributed Interpretability and Control for Large Language Models

大语言模型的分布式可解释性与控制

Dev Arpan Desai, Shaoyi Huang, Zining Zhu

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种适用于多GPU大语言模型的激活层可解释性和控制方法,通过减少激活内存和提升吞吐量,实现了对模型输出的可控调整,无需微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03764 2026-04-07 cs.LG cs.AI 88%

Automated Attention Pattern Discovery at Scale in Large Language Models

在大规模大型语言模型中实现自动化注意力模式发现

Jonathan Katzy, Razvan-Mihai Popescu, Erik Mekkes, Arie van Deursen, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析Java代码数据集中的完成场景,提出了一种在大规模大型语言模型中发现重复行为的方法,展示了注意力模式作为可扩展解释信号的潜力,并引入了AP-MAE模型以高效重建掩码注意力模式。

Comments Accepted to TMLR

Journal ref Transactions on Machine Learning Research 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25052 2026-04-02 cs.CL cs.AI 88%

Closing the Confidence-Faithfulness Gap in Large Language Models

弥合大语言模型中的置信度-忠实度差距

Miranda Muqing Miao, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过线性探针和对比激活添加分析,揭示大语言模型中置信度信号与校准的线性关系,提出双阶段适应性引导流程以提升校准对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07899 2026-04-01 cs.CL cs.AI 88%

On the Superimposed Noise Accumulation Problem in Sequential Knowledge Editing of Large Language Models

在大型语言模型序列知识编辑中的叠加噪声积累问题

Ding Cao, Yuchen Cai, Yuqing Huang, Xuesong He, Rongxi Guo, Guiquan Liu, Guangzhong Sun

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究提出DeltaEdit方法,通过动态正交约束策略减少知识冲突,提升长周期知识编辑效果,实验显示性能提升16.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23659 2026-03-26 cs.CL cs.AI 88%

Probing Ethical Framework Representations in Large Language Models: Structure, Entanglement, and Methodological Challenges

在大型语言模型中探测伦理框架表示:结构、纠缠与方法学挑战

Weilun Xu, Alexander Rusnak, Frederic Kaplan

机构 * School of Computer and Communication Sciences, École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院计算机与通信科学学院) Digital Humanities Lab, École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院数字人文实验室)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过分析五个伦理框架在不同LLM中的表示,揭示了伦理子空间的差异及转移模式,探讨了伦理判断的结构和方法学挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19144 2026-03-20 cs.CL cs.AI 88%

UGID: Unified Graph Isomorphism for Debiasing Large Language Models

UGID: 用于去偏大型语言模型的统一图同构

Zikang Ding, Junchi Yao, Junhao Li, Yi Zhang, Wenbo Jiang, Hongbo Liu, Lijie Hu

机构 * University of Electronic Science and Technology of China(电子科技大学) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) South China University of Technology(华南理工大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 UGID通过构建Transformer的结构化计算图,在内部表示层面减少模型偏见,通过约束注意力路由和隐藏表示,提升模型行为一致性并保持安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16749 2026-03-20 cs.CL cs.LG 88%

Probing Cultural Signals in Large Language Models through Author Profiling

通过作者画像探测大语言模型中的文化信号

Valentin Lafargue, Ariel Guerra-Adames, Emmanuelle Claeys, Elouan Vuichard, Jean-Michel Loubes

机构 * IMT, Toulouse, France(法国图卢兹IMT学院) INRIA Bordeaux, France(法国波尔多INRIA) ANITI 2, Toulouse, France(法国图卢兹ANITI) IRIT, Toulouse, France(法国图卢兹IRIT) Université de Bordeaux, Bordeaux, France(法国波尔多大学) BPH, Inserm, France(法国Inserm BPH) CNRS IRL CROSSING, Adelaide, Australia(澳大利亚阿德莱德CNRS IRL CROSSING)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究通过零样本设置评估大语言模型能否从歌曲歌词中推断歌手性别和种族,发现模型存在系统性文化偏见,提出两种公平性指标量化差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18346 2026-03-19 cs.CL cs.AI 88%

Comparing Uncertainty Measurement and Mitigation Methods for Large Language Models: A Systematic Review

比较大型语言模型的不确定性测量与缓解方法:系统综述

Toghrul Abbasli, Kentaroh Toyoda, Yuan Wang, Leon Witt, Muhammad Asif Ali, Yukai Miao, Dan Li, Qingsong Wei

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文系统回顾了大型语言模型中不确定性测量与缓解方法的有效性,提出严谨的基准测试,并通过实验证明了现有方法的显著发现,为未来研究方向和开放挑战提供了展望。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09989 2026-03-12 cs.CL cs.AI 88%

The System Hallucination Scale (SHS): A Minimal yet Effective Human-Centered Instrument for Evaluating Hallucination-Related Behavior in Large Language Models

系统幻觉量表(SHS):一种最小但有效的以人类为中心的评估工具,用于评估大语言模型中的幻觉相关行为

Heimo Müller, Dominik Steiger, Markus Plass, Andreas Holzinger

机构 * Machine Learning and Information Science Group, Medical University of Graz(格拉茨医科大学机器学习与信息科学组) Human Machine Mind Cooperation, Graz, Austria(格拉茨人类机智合作中心) MIDATA Cooperative, Zurich, Switzerland(苏黎世MIDATA合作组织) Human-Centered AI Lab, BOKU University Vienna(维也纳BOKU大学人本AI实验室)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 SHS是一种以人类为中心的评估工具,用于评估大语言模型中的幻觉相关行为,通过用户视角提供快速且可解释的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08017 2026-02-26 cs.CL cs.AI 88%

Mechanistic Indicators of Understanding in Large Language Models

大语言模型中理解机制的指示器

Pierre Beckmann, Matthieu Queloz

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(联邦理工学院) Idiap Research Institute(Idiap研究所) University of Bern, Department of Philosophy(伯尔尼大学哲学系)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个分层框架,探讨大语言模型中理解的三个层次,通过机制可解释性揭示AI理解的机制与人类认知的异同。

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21441 2026-02-26 cs.LG cs.AI cs.CV 88%

Causal Decoding for Hallucination-Resistant Multimodal Large Language Models

因果解码用于抗幻觉的多模态大语言模型

Shiwei Tan, Hengyi Wang, Weiyi Qin, Qi Xu, Zhigang Hua, Hao Wang

机构 * Rutgers University(新泽西罗格斯大学) Meta Ranking AI(Meta 排名人工智能)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出因果解码框架,通过针对性干预减少多模态大语言模型中的物体幻觉,提升响应的准确性和忠实度。

Comments Published in Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23081 2026-02-02 cs.CL cs.AI cs.CR 88%

Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures

字符作为大语言模型中的潜在变量:对涌现偏差和条件安全失败的机制解释

Yanghao Su, Wenbo Zhou, Tianwei Zhang, Qiu Han, Weiming Zhang, Nenghai Yu, Jie Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示了大语言模型中字符层面倾向对齐风险的核心机制,指出行为倾向的稳定转变是导致涌现偏差和安全失败的关键因素,而非单纯的能力退化或提示防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10543 2026-02-02 cs.AI cs.CL 88%

Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing

通过解码过程中的安全意识探测防御大型语言模型的劫持攻击

Yinzhi Zhao, Ming Wang, Shi Feng, Xiaocui Yang, Daling Wang, Yifei Zhang

机构 * Northeastern University, China(东北大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 通过在解码过程中激活内在安全意识,提升大型语言模型对劫持攻击的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13550 2026-01-28 cs.AI cs.CL cs.SC 88%

GOFAI meets Generative AI: Development of Expert Systems by means of Large Language Models

GOFAI与生成式AI的交汇:通过大语言模型开发专家系统

Eduardo C. Garrido-Merchán, Cristina Puente

机构 * Quantitative Methods Department, Comillas Pontifical University Institute of Research in Technology (IIT)(定量方法部门,科利马斯天主教大学技术研究所) Computer Science Department, ICAI School of Engineering, Comillas Pontifical University(计算机科学系,ICAI工程学院,科利马斯天主教大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过大语言模型开发专家系统的方法,结合LLMs的检索能力和符号系统的精确性,以实现可解释、可扩展和可靠的知识表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08893 2026-01-23 cs.LG cs.CL 88%

Spectral Generative Flow Models: A Physics-Inspired Replacement for Vectorized Large Language Models

谱生成流模型:一种受物理启发的向量大语言模型替代方案

Andrew Kiruluta

机构 * UC Berkeley(伯克利大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 谱生成流模型通过物理启发的连续场演化机制,替代传统向量大语言模型,实现长程一致性、多模态通用性和物理结构归纳偏置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13368 2026-01-21 cs.CL cs.LG 88%

Recurrent Confidence Chain: Temporal-Aware Uncertainty Quantification in Large Language Models

递归置信链:大型语言模型中的时间感知不确定性量化

Zhenjiang Mao, Anirudhh Venkat

机构 * University of Florida(佛罗里达大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出递归置信链方法,通过跨步骤注意力和隐藏置信机制,提升大型语言模型在不确定性量化中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11232 2026-01-19 cs.CL cs.AI 88%

FactCorrector: A Graph-Inspired Approach to Long-Form Factuality Correction of Large Language Models

FactCorrector:一种基于图的长文本事实性校正方法

Javier Carnerero-Cano, Massimiliano Pronesti, Radu Marinescu, Tigran Tchrakian, James Barry, Jasmina Gajcin, Yufang Hou, Alessandra Pascale, Elizabeth Daly

机构 * IBM Research Europe - Ireland(IBM欧洲研究院-爱尔兰)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 FactCorrector通过结构化反馈提升大语言模型的事实性准确性,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20949 2025-12-25 cs.CL cs.AI 88%

Neural Probe-Based Hallucination Detection for Large Language Models

基于神经探针的大型语言模型幻觉检测

Shize Liang, Hongzhi Wang

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于神经网络的token级幻觉检测框架,通过冻结语言模型参数并使用MLP探针进行非线性建模,结合多目标损失函数和贝叶斯优化,实现对LLMs幻觉内容的高效检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14862 2025-12-22 cs.LG cs.CL cs.CV 88%

LatentExplainer: Explaining Latent Representations in Deep Generative Models with Multimodal Large Language Models

LatentExplainer: 通过多模态大语言模型解释深度生成模型中的潜在表示

Mengdan Zhu, Raasikh Kanjiani, Jiahui Lu, Andrew Choi, Qirui Ye, Liang Zhao

机构 * Emory University(埃默里大学) University College London(伦敦大学学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 LatentExplainer通过多模态大语言模型为深度生成模型的潜在变量生成语义解释,提升模型可解释性。

Comments Accepted to CIKM 2025 Full Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04691 2025-12-05 cs.AI cs.CL cs.MA 88%

Towards Ethical Multi-Agent Systems of Large Language Models: A Mechanistic Interpretability Perspective

迈向伦理化的大型语言模型多智能体系统:从机制可解释性视角出发

Jae Hee Lee, Anne Lauscher, Stefano V. Albrecht

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文从机制可解释性视角出发,提出确保大型语言模型多智能体系统伦理行为的研究议程,聚焦于伦理评估框架、内部机制解析及参数高效对齐技术。

Comments Accepted to LaMAS 2026@AAAI'26 (https://sites.google.com/view/lamas2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13514 2025-12-03 cs.CL cs.AI 88%

Induction Head Toxicity Mechanistically Explains Repetition Curse in Large Language Models

诱导头毒性机制解释了大语言模型中的重复诅咒

Shuxun Wang, Qingyu Yin, Chak Tou Leong, Qiang Zhang, Linyi Yang

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文揭示诱导头的毒性机制导致大语言模型重复诅咒,并提出通过注意力头正则化技术缓解该问题的方法。

Comments Need to be refined

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10068 2025-12-01 cs.CV cs.AI cs.CL 88%

Mavors: Multi-granularity Video Representation for Multimodal Large Language Model

Mavors:多粒度视频表示用于多模态大语言模型

Yang Shi, Jiaheng Liu, Yushuo Guan, Zhenhua Wu, Yuanxing Zhang, Zihao Wang, Weihong Lin, Jingyun Hua, Zekun Wang, Xinlong Chen, Bohan Zeng, Wentao Zhang, Fuzheng Zhang, Wenjing Yang, Di Zhang

机构 * Peking University(北京大学) Kling Team(Kling团队) Nanjing University(南京大学) CASIA(中国科学院自动化研究所)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 Mavors通过多粒度视频表示方法,提升多模态大语言模型在长视频理解中的时空模式保留与计算效率平衡能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20713 2025-11-27 cs.LG cs.AI 88%

Active Slice Discovery in Large Language Models

大语言模型中的主动切片发现

Minhui Zhang, Prahar Ijner, Yoav Wald, Elliot Creager

机构 * University of Waterloo(多伦多大学) New York University(纽约大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出主动切片发现方法,通过主动学习算法有效识别大语言模型中的错误切片,提升毒性分类的准确性。

Comments Accepted for presentation at NeurIPS 2025 - Reliable ML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06265 2025-11-10 cs.LG cs.AI 88%

Large language models as uncertainty-calibrated optimizers for experimental discovery

Bojana Ranković, Ryan-Rhys Griffiths, Philippe Schwaller

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL)) National Centre of Competence in Research (NCCR) Catalysis(研究型研究中心(NCCR)催化)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10613 2025-11-04 cs.CL cs.AI 88%

Dynamic Topic Evolution with Temporal Decay and Attention in Large Language Models

Di Wu, Shuaidong Pan

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07290 2025-10-28 cs.CL cs.LG 88%

On the Convergence of Moral Self-Correction in Large Language Models

Guangliang Liu, Haitao Mao, Bochuan Cao, Zhiyu Xue, Xitong Zhang, Rongrong Wang, Kristen Marie Johnson

机构 * Michigan State University(密歇根州立大学) Amazon(亚马逊) Pennsylvania State University(宾夕法尼亚州立大学) University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20375 2025-10-24 cs.CL cs.AI 88%

The Impact of Negated Text on Hallucination with Large Language Models

Jaehyung Seo, Hyeonseok Moon, Heuiseok Lim

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to the EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19117 2025-10-23 cs.CL cs.LG eess.SP stat.ML 88%

A Graph Signal Processing Framework for Hallucination Detection in Large Language Models

Valentin Noël

机构 * Devoteam

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Preprint under review (2025). 11 pages, 7 figures. Code and scripts: to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19360 2025-10-21 cs.CL cs.AI 88%

Semantic Representation Attack against Aligned Large Language Models

Jiawei Lian, Jianhong Pan, Lefan Wang, Yi Wang, Shaohui Mei, Lap-Pui Chau

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) School of Electronics and Information, Northwestern Polytechnical University(西北工业大学电子与信息学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18244 2025-10-16 cs.CL cs.AI 88%

Multi-Scale Probabilistic Generation Theory: A Unified Information-Theoretic Framework for Hierarchical Structure in Large Language Models

Yukin Zhang, Qi Dong

机构 * The Chinese University Of Hongkong(香港中文大学) Fudan University(复旦大学) University of Edinburgh(爱丁堡大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏