arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7539 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7539 篇

2503.06269 2026-07-07 cs.LG cs.AI 版本更新 85%

Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models

利用机制可解释性对大语言模型进行对抗攻击

Thomas Winninger, Boussad Addad, Katarzyna Kapusta

机构 * Thales(泰勒斯)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 研究利用机制可解释性对大语言模型进行对抗攻击,通过识别接受子空间,用梯度优化使嵌入重新路由,降低计算成本,在多种模型上快速实现高成功率攻击,为攻防研究开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27378 2026-06-29 cs.CL cs.LG 新提交 85%

Formalizing Latent Thoughts: Four Axioms of Thought Representation in LLMs

形式化潜在思维:LLM中思维表示的四条公理

Fahd Seddik, Fatemeh Fard

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL、cs.LG

AI总结 提出独立于下游基准的LLM潜在思维表示公理评估框架,发现当前表示不满足所有四条公理,且编码信息有限。

Comments 44 pages, 27 tables, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21917 2026-06-23 cs.CL cs.LG 新提交 85%

Pre-Generation Hallucination Detection in Large Language Models via Soft-Target Attention Probing

通过软目标注意力探测在大型语言模型中进行生成前幻觉检测

Amina Miftakhova, Alexey Zaytsev

机构 * Applied AI Institute(应用人工智能研究所)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.LG

AI总结 提出一种基于软目标监督和注意力探测的生成前幻觉风险估计方法,在三个问答基准和五个模型上优于线性探测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16920 2026-06-16 cs.LG cs.AI 新提交 85%

Demystifying Variance in Circuit Discovery of LLMs

揭示LLM电路发现中的方差

Frank Zhengqing Wu, Francesco Tonin, Volkan Cevher

机构 * Laboratory for Information and Inference Systems (LIONS), École Polytechnique Fédérale de Lausanne (EPFL), Lausanne, Switzerland(信息与推理系统实验室(LIONS),洛桑联邦理工学院(EPFL),瑞士洛桑)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.AI、cs.LG

AI总结 本文研究LLM电路发现中的重采样、重述和样本方差,提出CEAP方法减少重采样方差,并分析重述方差源于不同模板激活不同电路,样本方差主要由不忠定义导致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09875 2026-06-10 cs.LG cs.AI stat.ML 新提交 85%

Integrating Local and Global Entropy for Uncertainty Quantification in LLMs

集成局部和全局熵用于大语言模型的不确定性量化

Johanne Medina, Tianyi Zhou, Keivin Isufaj, Aristides Gionis, Sanjay Chawla

机构 * Qatar Computing Research Institute, HBKU(卡塔尔计算研究所,哈马德·本·哈利法大学) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GLU方法,通过融合隐藏状态几何熵(全局)和token级熵(局部)来量化LLM不确定性,有效捕捉自信但错误的失败模式,无需额外训练。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09577 2026-06-09 cs.CL cs.LG cs.SE 新提交 85%

Code Is More Than Text: Uncertainty Estimation for Code Generation

代码不仅仅是文本:代码生成的不确定性估计

Yuling Shi, Caiqi Zhang, Yuexian Li, Haopeng Wang, Yeheng Chen, Nigel Collier, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Cambridge(剑桥大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对代码生成中错误程序的可靠性问题,提出基于词法、算法和功能三个正交轴的不确定性估计方法,在五个代码LLM上将AUROC提升8.1个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07969 2026-06-09 cs.CL cs.AI 新提交 85%

Neutrality Bites: Gender Representation in AI-Generated Animal Stories

中立性的代价:AI生成的动物故事中的性别表征

Imani Finkley, Yuanxi Li, Melanie Walsh

机构 * University of Washington(华盛顿大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究六种主流LLM在生成动物故事时的性别分配,发现模型常避免指定性别或使用中性语言,但一旦指定则显著偏向男性,女性角色几乎缺席,表明中立策略可能导致边缘视角的抹除。

Comments FAccT(ACM Conference on Fairness, Accountability, and Transparency) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07524 2026-06-09 cs.CL cs.AI 新提交 85%

ABLE: Representing and Mapping LLMs via Attribution-Based Large-model Embedding

ABLE:基于归因的大模型嵌入表示与映射

Zirui Wang, Yusen Hou, Shaofeng Liang, Bowen Tian, Yanlin Zhang, Wenshuo Chen, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Deep Interdisciplinary Intelligence Lab (DI2 Lab)(深度跨学科智能实验室(DI2 Lab))

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ABLE框架,利用梯度特征归因和分词器无关的词级对齐构建模型嵌入,实现异构LLM的高效比较,在关系预测、模型路由和基准分数预测上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02628 2026-06-03 cs.LG cs.CL 85%

Hallucination Is Linearly Decodable from Mid-Layer Hidden States in Quantized LLMs

幻觉可从量化LLM中间层隐藏状态线性解码

Aizierjiang Aiersilan

机构 * University of Macau(澳门大学)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL、cs.LG

AI总结 研究开源LLM在4位量化下中间层隐藏状态是否编码线性可分的真实性信号,发现单层线性探针AUROC达0.904-1.000,优于采样方法,且信号近似线性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28837 2026-05-29 cs.CL cs.AI 85%

SERC: LDPC-Inspired Semantic Error Correction for Retrieval-Augmented Generation

SERC: 受LDPC启发的检索增强生成语义纠错方法

Gyumin Kim, Juhwan Park, Jaeha Kim, Seunggyun Han, Kyungrak Son, Ikbeom Jang

机构 * Department of Information Communications Engineering, Hankuk University of Foreign Studies, Republic of Korea(韩国外国语大学信息通信工程系) Division of Computer Engineering, Hankuk University of Foreign Studies, Republic of Korea(韩国外国语大学计算机工程系) Department of Statistics, Hankuk University of Foreign Studies, Republic of Korea(韩国外国语大学统计学系)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 针对大语言模型幻觉问题,提出受LDPC码启发的语义纠错框架SERC,通过稀疏验证策略高效检测和纠正生成文本中的错误。

Comments 15 pages, 2 figures, 6 tables. To appear in the Proceedings of the 28th International Conference on Pattern Recognition (ICPR 2026). Code available at https://github.com/labhai/SERC

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14862 2026-05-28 stat.ML cs.AI cs.IT cs.LG math.IT stat.ME 85%

The Well-Tempered Classifier: Some Elementary Properties of Temperature Scaling

温度缩放分类器:温度缩放的一些基本性质

Pierre-Alexandre Mattei, Bruno Loureiro

机构 * Université Côte d’Azur, Inria, CNRS, LJAD, France(法国蔚蓝海岸大学、法国国家科学研究中心、法国国家信息与自动化研究所、里约达实验室) Département d’Informatique, École Normale Supérieure - PSL, CNRS, France(法国高等科学研究院信息学院、法国国家科学研究中心、法国)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过信息投影和线性缩放子模型等新视角,严格分析了温度缩放对分类器校准和LLM多样性的影响,证明升温普遍增加不确定性但质疑其增加多样性的说法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00959 2026-05-27 cs.LG cs.CL 85%

Probing the Knowledge Boundary: An Interactive Agentic Framework for Deep Knowledge Extraction

探测知识边界:一种用于深度知识提取的交互式智能体框架

Yuheng Yang, Siqi Zhu, Tao Feng, Ge Liu, Jiaxuan You

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Westlake University(西交利物浦大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出一种交互式智能体框架,通过四种自适应探索策略和三级知识处理流水线,系统性地提取和量化大语言模型的知识,发现递归分类法最有效,并揭示了知识缩放定律、Pass@1与Pass@k的权衡以及训练数据对知识轮廓的影响。

Comments Homepage: https://ulab-uiuc.github.io/KnowledgeExtraction/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18163 2026-05-19 cs.AI cs.CL 85%

TRACE: Trajectory Correction from Cross-layer Evidence for Hallucination Reduction

TRACE: 通过跨层证据进行轨迹修正以减少幻觉

Tej Sanibh Ranade

机构 * Independent Researcher(独立研究者)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TRACE算法,通过跨层证据在推理时修正LLM中的幻觉,无需训练或标注,通过内部证据选择修正策略,提升多个基准测试的性能。

Comments 25 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19649 2025-10-09 cs.LG cs.CL 85%

Taxonomy, Opportunities, and Challenges of Representation Engineering for Large Language Models

Jan Wehner, Sahar Abdelnabi, Daniel Tan, David Krueger, Mario Fritz

机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心) Microsoft(微软) University College London(伦敦大学学院) Mila, University of Montreal(蒙特利尔大学Mila)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13928 2025-08-07 cs.LG cs.CL 85%

Automatically Interpreting Millions of Features in Large Language Models

Gonçalo Paulo, Alex Mallen, Caden Juang, Nora Belrose

机构 * Northwestern University, Evanston, Illinois, USA(西北大学)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02790 2025-07-08 cs.CL cs.AI 85%

An Evolutionary Large Language Model for Hallucination Mitigation

Abdennour Boulesnane, Abdelhakim Souilah

机构 * BIOSTIM Laboratory Faculty of Medicine Salah Boubnider University Constantine, Algeria(BIOSTIM实验室医学院萨拉赫·布宾德大学阿尔及利亚科纳克特) Department of IFA Faculty of NTIC Abdelhamid Mehri University Constantine, Algeria(IFA部门NTIC学院阿卜杜勒哈米德·梅赫里大学阿尔及利亚科纳克特)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09341 2024-07-02 cs.CL cs.AI 85%

Large Language Model Bias Mitigation from the Perspective of Knowledge Editing

Ruizhe Chen, Yichen Li, Zikai Xiao, Zuozhu Liu

专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02962 2024-06-06 cs.CL cs.AI cs.IR 85%

Docs2KG: Unified Knowledge Graph Construction from Heterogeneous Documents Assisted by Large Language Models

Qiang Sun, Yuanyi Luo, Wenxiao Zhang, Sirui Li, Jichunyang Li, Kai Niu, Xiangrui Kong, Wei Liu

专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13356 2023-10-10 cs.CL cs.AI 85%

Probing the Moral Development of Large Language Models through Defining Issues Test

Kumar Tanmay, Aditi Khandelwal, Utkarsh Agarwal, Monojit Choudhury

专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.AI

Comments First three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01530 2026-08-12 cs.CV 版本更新 85%

Logit Lens Supervision for Patch-Level Explanations in Vision-Language Models

在视觉语言模型中保留局部化补丁语义

Parsa Esmaeilkhani, Longin Jan Latecki

机构 * Department of Computer and Information Sciences, Temple University, Philadelphia, USA(计算机与信息科学系,特兰普大学,费城,美国)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 为解决视觉语言模型中图像与文本 tokens 信息扩散问题,提出 Logit Lens Loss(LLL)以保留图像 tokens 的局部化语义,提升模型可解释性和分割任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07208 2026-08-10 cs.CL cs.AI cs.LG econ.GN q-fin.EC 新提交 85%

Measuring Concept Content in Text from LLM Activations: ESG Evidence from Concept Vectors and Linear Probes

从大语言模型激活值中测量文本的概念内容:基于概念向量与线性探测的ESG证据

Luc Hazenoot, Zhaochun Ren, Amirhossein Zohrehvand

机构 * Leiden Institute of Advanced Computer Science, Leiden University(莱顿大学高级计算机科学研究所)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出用冻结LLMs的激活值测量文本概念内容,在ESG金融文本实验中,线性探测效果接近微调分类器,优于模型自身答案,且优于RFM概念向量。

Comments 19 pages, 1 figure, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18555 2026-07-22 cs.SE 新提交 85%

LM2Alloy: Investigating LLM-Generated Formal Specifications for Automated Test Derivation in Production Software

LM2Alloy:研究用于生产软件自动测试推导的大语言模型生成的形式规范

Tasmim Rashid, Muhammad Zubair Malik

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究探索用大语言模型从需求文档和生产源代码生成Alloy形式规范及推导可执行测试用例,在Flipper和Cerberus库上评估,发现能揭示约束级缺陷,基于代码的规范方差更低,为生产软件自动测试推导提供了新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13911 2026-07-16 cs.NE 新提交 85%

How to Guide LLM Generation: Dual-Surrogate Guided Search for Automated Heuristic Design

如何引导大语言模型生成:用于自动启发式设计的双代理引导搜索

Yuhan Wang, Chaoda Peng, Xingyu Wu, Sheng-Hao Wu, Zhi-Hui Zhan

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究如何在有限预算下引导大语言模型进行自动启发式设计,提出双代理引导搜索方法,通过两个互补代理评分及不确定性感知规则选择行动,在多样套件中表现出色,超越简单排名和固定偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24952 2026-06-25 cs.CL cs.AI cs.LG 新提交 85%

Perfect Detection, Failed Control: The Geometry of Knowing vs. Steering in Language Models

完美检测,控制失败:语言模型中知道与引导的几何学

Cosimo Galeone, Anna Ettorre, Minsu Park, Giuseppe Ettorre, Daniele Ligorio

机构 * Alomana

专题命中 知识编辑与模型理解 :language model(title);instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过几何角度测量发现,语言模型中检测行为的表示方向与控制行为的方向存在显著偏差(余弦值约0.12),表明检测不等于可控性,且该偏差源于预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17431 2026-06-23 cs.CL cs.AI cs.LG 版本更新 85%

Fine-Grained Uncertainty Quantification for Long-Form Language Model Outputs: A Comparative Study

长文本语言模型输出的细粒度不确定性量化:一项比较研究

Dylan Bouchard, Mohit Singh Chauhan, Viren Bajaj, David Skarbrevik

机构 * CVS Health(CVS健康公司) Wellesley, MA(马萨诸塞州韦尔士利)

专题命中 知识编辑与模型理解 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对长文本生成,提出细粒度不确定性量化分类法,通过响应分解、单元级评分和响应级聚合三阶段区分方法,引入FactScore-STEM-Geo数据集,实验发现声明-响应蕴含评分优于复杂方法,声明级评分优于句子级,不确定性感知解码有效提升事实性。

Comments Accepted by TMLR; UQLM repository: https://github.com/cvs-health/uqlm

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11722 2026-06-11 cs.LG cs.AI cs.CL 新提交 85%

ICA Lens: Interpreting Language Models Without Training Another Dictionary

ICA Lens: 无需训练另一本词典即可解释语言模型

Sida Liu, Feijiang Han

机构 * Independent Researcher(独立研究员) University of Maryland(马里兰大学)

专题命中 知识编辑与模型理解 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ICALens,基于独立成分分析(ICA)高效提取语言模型表示中可解释方向,无需训练稀疏自编码器,在SAEBench上表现竞争力。

Comments Ongoing Project

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29395 2026-05-29 stat.ME stat.ML 85%

Low Rank for Rank: Uncertainty-Aware Task-Specific LLM Ranking under Sparse Pairwise Comparisons

低秩排序:稀疏成对比较下不确定性感知的任务特定大语言模型排名

Jiachun Li, David Simchi-Levi, Will Wei Sun

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出一种低秩框架,通过稀疏成对比较进行任务特定的大语言模型排名,利用任务-模型能力矩阵的低秩结构实现跨任务信息共享,并开发了不确定性量化方法以提供置信区间和排名证书。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27997 2026-05-28 cs.CL cs.AI cs.LG 85%

Where Does Toxicity Live? Mechanistic Localization and Targeted Suppression in Language Models

毒性存在于何处?语言模型中的机制定位与定向抑制

Himanshu Beniwal, Mayank Singh

机构 * Indian Institute of Technology Gandhinagar(印度理工学院冈德辛加尔)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过分析毒性与中性提示的激活差异,定位特定层和神经元中的毒性,并利用推理时缩放或最小秩一权重编辑进行抑制,无需梯度下降,实现毒性降低同时保持语言质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02178 2026-05-19 cs.CL cs.AI cs.LG 85%

The Expert Strikes Back: Interpreting Mixture-of-Experts Language Models at Expert Level

专家反击:在专家层面解读混合专家语言模型

Jeremy Herbst, Stefan Wermter, Jae Hee Lee

机构 * Department of Informatics, University of Hamburg, Hamburg, Germany(汉堡大学信息学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过k稀疏探测比较MoE专家与密集FFN,发现专家神经元更单语义,提出以专家为分析单位,揭示专家是细粒度任务专家,而非领域专家或token处理者。

Comments 8 pages, 7 Figures. Accepted at ICML 2026. Improved writing, changed author order, updated citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07148 2026-05-11 cs.CV 85%

Uncovering and Shaping the Latent Representation of 3D Scene Topology in Vision-Language Models

揭示和塑造视觉-语言模型中3D场景拓扑的潜在表示

Haoming Wang, Wei Gao

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 知识编辑与模型理解 :language model(title,abstract);SFT(abstract,abstract_cn)

AI总结 本文研究了视觉-语言模型是否能构建3D环境的拓扑表示,通过隔离空间子空间并数学塑造潜在表示,证明其与场景3D高斯核图的拉普拉斯特征映射一致,并在空间任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏