arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7527 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7527 篇

2603.20562 2026-05-19 cs.CL cs.AI 87%

Permutation-Consensus Listwise Judging for Robust Factuality Evaluation

排列一致性列表判断用于鲁棒事实性评估

Tianyi Huang, Nathan Huang, Justin Tang, Wenqian Chen, Elsa Fan

机构 * App-In Club(App-In俱乐部) Carnegie Mellon University(卡内基梅隆大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PCFJudge方法,通过多排列重跑列表事实性提示以提高LLM事实性判断的鲁棒性,实验显示其在RewardBench 2 Factuality上显著提升准确率。

Comments Accepted at the Fifth Workshop on Natural Language Generation, Evaluation, and Metrics at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05953 2026-05-08 cs.CL cs.AI 87%

Hallucination as an Anomaly: Dynamic Intervention via Probabilistic Circuits

幻觉作为异常:通过概率电路进行动态干预

Erik Nielsen, Elia Cunegatti, Marcus Vukojevic, Giovanni Iacca

机构 * Department of Information Engineering and Computer Science(信息工程与计算机科学系) University of Trento(特伦托大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PCNET,通过概率电路估计LLM残差流密度,检测幻觉作为几何异常,从而改进幻觉纠正,减少错误生成并提升事实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26130 2026-04-30 cs.LG cs.AI 87%

reward-lens: A Mechanistic Interpretability Library for Reward Models

reward-lens: 一个用于奖励模型的机制可解释性库

Mohammed Suhail B Nadaf

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);RLHF(abstract,abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 reward-lens库将传统生成LLM的机制可解释性工具适配至奖励模型,通过奖励头权重向量作为核心分析轴,提供多种分析工具和扩展功能,验证发现线性归因与因果修补效果存在负相关。

Comments 30 pages, 5 figures, 9 tables, including appendix. Library available at https://github.com/suhailnadaf509/reward-lens (pip install reward-lens)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18177 2026-04-22 cs.CL cs.AI 87%

STaD: Scaffolded Task Design for Identifying Compositional Skill Gaps in LLMs

STaD:基于支架任务设计的LLM组合技能缺口识别

Sungeun An, Swanand Ravindra Kadhe, Shailja Thakur, Chad DeLuca, Hima Patel

机构 * IBM Research(IBM研究院)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 STaD框架通过生成受控变体任务,系统探测LLM在组合技能上的不足,揭示不同模型的独特技能缺口。

Comments 9 pages, 3 figures, 3 tables, ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01770 2026-04-21 cs.CR cs.AI cs.LG cs.SE 87%

ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction

ReGA:通过表示引导抽象的基于模型的安全保障方法

Zeming Wei, Chengcan Wu, Meng Sun

机构 * Peking University(北京大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ReGA框架,通过利用安全关键表示缩小模型分析在大规模语言模型中的可扩展性差距,有效区分安全与有害输入,提升LLM安全性。

Comments FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18918 2025-10-23 cs.CL cs.AI 87%

Misinformation Detection using Large Language Models with Explainability

Jainee Patel, Chintan Bhatt, Himani Trivedi, Thanh Thi Nguyen

机构 * Department of Computer Engineering, LDRP Institute of Technology and Research(计算机工程系,LDRP技术与研究学院) University of Wollongong(沃林根大学) Monash University(莫纳什大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

Comments Accepted for publication in the Proceedings of the 8th International Conference on Algorithms, Computing and Artificial Intelligence (ACAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20333 2025-10-14 cs.CL cs.AI 87%

Multi-Scale Manifold Alignment for Interpreting Large Language Models: A Unified Information-Geometric Framework

Yukun Zhang, Qi Dong

机构 * The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02762 2025-08-07 cs.LG cs.AI 87%

Context-Adaptive Multi-Prompt Embedding with Large Language Models for Vision-Language Alignment

Dahun Kim, Anelia Angelova

机构 * Google DeepMind(谷歌DeepMind)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07900 2025-03-27 cs.CL cs.AI 87%

High-Dimension Human Value Representation in Large Language Models

Samuel Cahyawijaya, Delong Chen, Yejin Bang, Leila Khalatbari, Bryan Wilie, Ziwei Ji, Etsuko Ishii, Pascale Fung

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15116 2024-10-22 cs.CL cs.AI 87%

Coarse-to-Fine Highlighting: Reducing Knowledge Hallucination in Large Language Models

Qitan Lv, Jie Wang, Hanzhu Chen, Bin Li, Yongdong Zhang, Feng Wu

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06271 2024-10-10 cs.CL cs.AI 87%

Probing the Robustness of Theory of Mind in Large Language Models

Christian Nickel, Laura Schrewe, Lucie Flek

专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06225 2024-10-10 cs.LG cs.AI 87%

A Timeline and Analysis for Representation Plasticity in Large Language Models

Akshat Kannan

专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05097 2024-08-12 cs.LG cs.AI 87%

Hyperbolic Learning with Multimodal Large Language Models

Paolo Mandica, Luca Franco, Konstantinos Kallidromitis, Suzanne Petryk, Fabio Galasso

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.AI、cs.LG

Comments ECCV 2024 - Beyond Euclidean Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01118 2024-04-03 cs.AI cs.CL 87%

PokeLLMon: A Human-Parity Agent for Pokemon Battles with Large Language Models

Sihao Hu, Tiansheng Huang, Ling Liu

专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08968 2024-04-02 cs.CL cs.AI 87%

Identifying Linear Relational Concepts in Large Language Models

David Chanin, Anthony Hunter, Oana-Maria Camburu

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

Comments To be published in NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15213 2024-02-27 cs.CL cs.LG 87%

Function Vectors in Large Language Models

Eric Todd, Millicent L. Li, Arnab Sen Sharma, Aaron Mueller, Byron C. Wallace, David Bau

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

Comments ICLR 2024. 52 pages, 30 figures, 23 tables. Code and data at https://functions.baulab.info

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08936 2024-01-18 cs.AI cs.LG 87%

DeLF: Designing Learning Environments with Foundation Models

Aida Afshar, Wenchao Li

专题命中 知识编辑与模型理解 :foundation model(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI、cs.LG

Comments AAAI 2024 Workshop on Synergy of Reinforcement Learning and Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04930 2023-11-10 cs.CL cs.AI 87%

Large language models implicitly learn to straighten neural sentence trajectories to construct a predictive representation of natural language

Eghbal A. Hosseini, Evelina Fedorenko

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

Comments 37th Conference on Neural Information Processing Systems (NeurIPS 2023). 20 pages, 5 main figures, 7 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10578 2026-07-14 cs.AI 新提交 87%

Laguerre Geometry for Interpreting Large Language Models

用于解释大语言模型的拉盖尔几何

Chunwei Ma, Russell Wolfinger

机构 * JMP Statistical Discovery(JMP统计发现公司)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract,comments);分类 cs.AI

AI总结 研究大语言模型中概念结构的形成,利用拉盖尔几何精确表征概念,通过分解Transformer层揭示隐藏轨迹控制机制,提出无需训练和超参数的几何透镜方法读出概念,开发可视化工具,还实现可操作的可解释性。

Comments Geometric Lens; LLM Interpretability; Code: https://github.com/horsepurve/Geometric-Lens

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02134 2025-04-28 cs.CL 87%

Optimising Calls to Large Language Models with Uncertainty-Based Two-Tier Selection

Guillem Ramírez, Alexandra Birch, Ivan Titov

机构 * University of Edinburgh(爱丁堡大学)

专题命中 知识编辑与模型理解 :language model(title,journal_ref);large language model(title);LLM(abstract);分类 cs.CL

Journal ref First Conference on Language Modeling. COLM 2024. Philadelphia, Pennsylvania, United States

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05587 2026-07-08 cs.SE 新提交 87%

A Mechanistic Lens on Semantic Conflicts: Using Activation Patching to Understand LLM Behavior

语义冲突的机制视角:使用激活修补来理解大语言模型行为

Youssef Abdelsalam, Norman Peitek, Anna-Maria Maurer, Marvin Wyrich, Sven Apel

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型在语义冲突下的行为,构建Python代码片段三元组,用行为性能度量和残差流激活修补评估四个LLMs在输出预测和单元测试生成任务中的表现,发现语义冲突影响任务且相关信息集中,展示分析LLMs整合代码信息的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06324 2026-07-03 cs.SE cs.MA 版本更新 87%

From Failed Trajectories to Reliable LLM Agents: Diagnosing and Repairing Harness Flaws

从失败轨迹到可靠的LLM代理:诊断与修复框架缺陷

Mengzhuo Chen, Junjie Wang, Zhe Liu, Yawen Wang, Haiming Zheng, Qing Wang

专题命中 知识编辑与模型理解 :LLM(title,title_cn)

AI总结 提出HarnessFix框架,通过轨迹引导诊断代理失败并修复执行框架,在多个基准上提升15.2%-50.0%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20040 2026-06-11 cs.LG cs.AI cs.CL 版本更新 87%

Cross-Layer Discrete Concept Discovery for Interpreting Language Models

跨层离散概念发现用于解释语言模型

Ankur Garg, Xuemin Yu, Hassan Sajjad, Samira Ebrahimi Kahou

机构 * University of Washington(华盛顿大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出跨层向量量化变分自编码器(CLVQ-VAE),通过离散向量量化瓶颈将残差流中的重复特征压缩为紧凑可解释的概念向量,在三个数据集上优于聚类、单层VQ-VAE和稀疏自编码器基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21996 2026-06-09 cs.CL cs.AI cs.LG 版本更新 87%

Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units

机械论数据归因:追踪可解释LLM单元的训练起源

Jianhui Chen, Yuzhang Luo, Liangming Pan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出机械论数据归因(MDA)框架,利用影响函数将可解释单元追溯到特定训练样本,通过因果验证表明干预高影响样本可显著调节可解释头的涌现,并发现重复结构数据作为机械催化剂,同时验证了归纳头与上下文学习之间的功能联系。

Comments ICML2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17193 2026-05-19 cs.MA 87%

Multi-LLM Systems Exhibit Robust Semantic Collapse

多语言模型系统表现出稳健的语义崩溃

Weiyi Kong, Shiyang Lai, Jinghua Piao, James Evans

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究探讨了多语言模型系统在闭环设置中维持开放知识生产的基本限制,发现系统在语义表示上出现系统性收敛,尽管表面上有词汇变化。

Comments 64 pages, 8 figures, 7 tables; includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15248 2026-05-18 cs.SE cs.CR 87%

Probing Privacy Leaks in LLM-based Code Generation via Test Generation

通过测试生成探测基于LLM的代码生成中的隐私泄露

Yifei Ge, Zhenpeng Chen, Weisong Sun, Yuchen Chen, Chunrong Fang, Juan Zhai, Xiaofang Zhang, Xia Feng, Yang Liu, Zhenyu Chen

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种模拟实际隐私相关代码生成场景的管道,采用测试驱动策略提取生成测试用例中的记忆信息,通过自动构建隐私特征库提高隐私泄露检测效果,实验表明检测到的隐私泄露增加2.56倍。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14128 2026-04-23 cs.CL cs.AI cs.LG 87%

Rhetorical Questions in LLM Representations: A Linear Probing Study

语言模型表示中的修辞问题:一项线性探测研究

Louie Hong Yao, Vishesh Anand, Yuan Zhuang, Tianyu Jiang

机构 * Independent Researcher(独立研究者) University of Cincinnati(辛辛那提大学) Amazon(亚马逊)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过线性探测研究语言模型对修辞问题的表示,发现修辞信号在模型早期层中出现,并主要由最后一层表示捕捉,且在不同数据集间可转移,但不同数据集训练的探测器在目标数据集上的排名差异较大,反映出修辞问题的多维度编码特性。

Comments 18 pages, 15 figures, accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18262 2026-02-23 cs.CL cs.AI cs.LG 87%

Simplifying Outcomes of Language Model Component Analyses with ELIA

用ELIA简化语言模型组件分析的结果

Aaron Louis Eidt, Nils Feldhus

机构 * Technische Universität Berlin(柏林技术大学) Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫茨研究所) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ELIA通过交互式界面和AI生成的自然语言解释,简化了语言模型组件分析,帮助非专家理解复杂模型。

Comments EACL 2026 System Demonstrations. GitHub: https://github.com/aaron0eidt/ELIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04398 2026-02-17 cs.CL cs.AI cs.CR cs.LG 87%

SECA: Semantically Equivalent and Coherent Attacks for Eliciting LLM Hallucinations

SECA:用于诱发LLM幻觉的语义等价且连贯的攻击

Buyun Liang, Liangzu Peng, Jinqi Luo, Darshan Thaker, Kwan Ho Ryan Chan, René Vidal

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SECA通过现实修改提示诱发LLM幻觉,提高攻击成功率并减少语义错误。

Comments Accepted at NeurIPS 2025. Code is available at https://github.com/Buyun-Liang/SECA

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11924 2026-02-12 cs.CL cs.AI cs.LG 87%

Intrinsic Self-Correction in LLMs: Towards Explainable Prompting via Mechanistic Interpretability

大语言模型中的内在自我修正:通过机制可解释性实现可解释的提示

Yu-Ting Lee, Fu-Chieh Chang, Yu-En Shu, Hui-Ying Shih, Pei-Yuan Wu

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taipei, Taiwan(通讯工程研究院,国立台湾大学) MediaTek Research, Taipei, Taiwan(联发科研究,台北,台湾) Department of Electrical Engineering, National Taiwan University, Taipei, Taiwan(电气工程系,国立台湾大学) Department of Electrical Engineering, National Tsing Hua University, Hsinchu, Taiwan(电气工程系,国立清华大学) AI Research Center (AINTU), National Taiwan University, Taipei, Taiwan(人工智能研究中心(AINTU),国立台湾大学)

专题命中 知识编辑与模型理解 :prompting(title,abstract);LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过机制可解释性揭示大语言模型中内在自我修正的机制,证明提示引导隐藏表示偏移是其核心驱动因素。

Journal ref 4th Deployable AI Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏