arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-29 至 2026-06-29 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 11 篇

2606.27679 2026-06-29 cs.CL cs.AI 新提交 90%

From Signals to Transfer: A Factorised Study of Probe-Based Uncertainty Estimation in Large Language Models

从信号到迁移:基于探针的大语言模型不确定性估计的分解研究

Ponhvoan Srey, Xiaobao Wu, Cong-Duy Nguyen, Quang Minh Nguyen, Duc Anh Vu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) VinUniversity KAIST(韩国科学技术院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 通过分解研究,发现原始隐藏状态和注意力特征在域内表现优异,但结构化压缩特征在分布偏移下更鲁棒,提示和标签构建显著影响探针行为,并训练出可迁移的预训练探针。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28153 2026-06-29 cs.CR cs.AI 新提交 88%

Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models

越狱攻击下的鲁棒有害特征:来自大型语言模型中注意力头特化的机制证据

Yanchen Yin, Dongqi Han, Linghui Li

专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 通过分析注意力头特化,发现越狱攻击通过抑制早期层的对抗妥协头(ACHs)绕过安全对齐,而中间层的安全对齐头(SAHs)保持鲁棒激活,揭示了鲁棒有害特征现象,并利用这些持久激活实现无需训练的检测。

Comments 33 pages, 19 figures. Accepted at ICML 2026 as an Oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27378 2026-06-29 cs.CL cs.LG 新提交 85%

Formalizing Latent Thoughts: Four Axioms of Thought Representation in LLMs

形式化潜在思维:LLM中思维表示的四条公理

Fahd Seddik, Fatemeh Fard

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL、cs.LG

AI总结 提出独立于下游基准的LLM潜在思维表示公理评估框架,发现当前表示不满足所有四条公理,且编码信息有限。

Comments 44 pages, 27 tables, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02896 2026-06-29 cs.LG 版本更新 84%

Bridging Mechanistic Interpretability and Prompt Engineering with Gradient Ascent for Interpretable Persona Control

通过梯度上升实现可解释人格控制与提示工程的桥梁

Harshvardhan Saini, Yiming Tang, Dianbo Liu

机构 * Department of Computer Science(计算机科学系) Indian Institute of Technology (ISM), Dhanbad(印度理工学院(ISM),丹巴德) National University of Singapore(新加坡国立大学) CIFAR Fellow(CIFAR研究员)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出RESGA和SAEGA方法,利用梯度上升优化随机初始化提示,以实现与识别的人格方向更一致的表示,有效控制LLM中的人格行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17932 2026-06-29 cs.CL 版本更新 84%

Training-free Truthfulness Detection via Sparse MLP Value Vectors

基于稀疏MLP值向量的免训练真实性检测

Runheng Liu, Heyan Huang, Xingchen Xiao, Yanghao Zhou, Zhijing Wu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出TruthV方法,利用MLP值向量中稀疏子集的稳定方向性信号,无需训练即可检测LLM生成内容的真实性,在多个基准上超越现有免训练方法。

Comments KDD 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28273 2026-06-29 cs.CL 新提交 79%

Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models

视觉默认,先验覆盖:视觉-语言模型中感知-知识冲突的因果机制

Niclas Lietzow, Danielle Bitterman, Carsten Eickhoff, William Rudman, Michal Golovanevsky

机构 * University of Tübingen(图宾根大学) Harvard University(哈佛大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 通过激活修补和消融实验,发现VLM中视觉默认激活,而先验知识依赖少量因果注意力头(2.5-4.8%),形成不对称因果结构。

Comments 14 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27460 2026-06-29 cs.CL 新提交 79%

Developmental approach reveals the statistical learning of Neural Language Models: Transformers generalize from the most abstract statistical patterns

发展方法揭示神经语言模型的统计学习:Transformer从最抽象的统计模式中泛化

Wang Bojun, Holly Jenkins, Elizabeth Wonnacott

机构 * Department of Education, University of Oxford(牛津大学教育学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本研究采用发展方法,通过训练生成式Transformer模型并分析其内部表征变化,发现神经语言模型先习得最抽象的全局统计知识,后习得局部统计依赖,并提出新的统计学习与语言认知框架。

Comments 10 pages, 7 figures, oral presentation at Interdisciplinary Advances in Statistical Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06722 2026-06-29 cs.CL cs.LG 版本更新 73%

On the Effect of Uncertainty on Layer-wise Inference Dynamics

不确定性对逐层推理动态的影响

Sunwoo Kim, Haneul Yoo, Alice Oh

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 通过Tuned Lens分析11个数据集和5个模型,发现确定与不确定预测的逐层概率轨迹高度一致,表明不确定性不影响推理动态,但更强大的模型可能以不同方式处理不确定性。

Comments Accepted to Actionable Interpretability Workshop - ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27601 2026-06-29 cs.SE 新提交 67%

Test Case Selection for Deep Neural Networks: A Replication Study on LLMs for Code

深度神经网络的测试用例选择:面向代码的大语言模型的复现研究

Ali Asgari, Mitchell Olsthoorn, Annibale Panichella

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn)

AI总结 本文对深度神经网络测试用例选择技术在代码大语言模型上的有效性进行了大规模复现研究,发现基于不确定性的特征对早期故障发现有效,而基于表示的特征对准确率估计更鲁棒,且性能因任务和模型而异。

Comments Accepted at ISSTA 2026, the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00705 2026-06-29 cs.CV 版本更新 67%

Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs

无训练不确定性引导的复杂视觉任务多模态大语言模型

Sanghwan Kim, Rui Xiao, Stephan Alaniz, Yongqin Xian, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Helmholtz Munich(海德堡-慕尼黑亥姆霍兹研究中心) Google(谷歌) LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工大学 LTCI 实验室)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 提出无需训练的框架,利用MLLM内在不确定性主动引导,通过响应不确定性评分候选视觉输入,使模型自主聚焦关键信息,在视觉搜索、长视频理解等任务中达到与微调系统相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27440 2026-06-29 cs.LG 新提交 57%

PairSAE: Mechanistic Interpretability from Pair Representations in Protein Co-Folding

PairSAE: 蛋白质共折叠中成对表示的机制可解释性

Giosue Migliorini, Aristofanis Rontogiannis, Grigori Guitchounts, Nicholas Franklin, Axel Elaldi, Olivia Viessmann

机构 * University of California, Irvine(加州大学尔湾分校) Flagship Pioneering

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 针对蛋白质共折叠模型中的成对表示,提出PairSAE方法,通过N-mode SVD总结成对张量为token级交互角色,再用稀疏自编码器学习共享特征,实现可解释性并避免传统SAE的二次爆炸问题。

Comments Accepted at the Machine Learning in Structural Biology (MLSB) 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏