arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-17 至 2026-04-17 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 13 篇

2604.14325 2026-04-17 cs.CL cs.AI 92%

Faithfulness Serum: Mitigating the Faithfulness Gap in Textual Explanations of LLM Decisions via Attribution Guidance

Faithfulness Serum:通过归因引导缓解文本解释中LLM决策的忠实性差距

Bar Alon, Itamar Zimerman, Lior Wolf

机构 * Blavatnik School of Computer Science, Tel Aviv University(塔尔瓦夫大学比拉维克计算机科学学院)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过归因引导方法提升LLM决策解释的忠实性,验证了现有解释的epistemic忠实性不足,并展示了改进方法在多个模型和基准上的有效性。

Comments 24 pages, multiple figures (e.g., at least 6 main figures), includes experiments across several benchmarks (MMLU, CommonsenseQA, SciQ, ARC, OpenBookQA); code available on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14463 2026-04-17 cs.CL 91%

Psychological Steering of Large Language Models

对大语言模型的心理操控

Leonardo Blas, Robin Jia, Emilio Ferrara

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);prompting(abstract,abstract_cn);LLM(abstract_cn)

AI总结 本文提出一种心理操控框架,通过在语义校准的单元中进行无界、流畅性约束的扫描,改进大语言模型的干预方法,在14个模型中表现出色,优于传统方法。

Comments 66 pages, 60 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20091 2026-04-17 cs.CL 84%

How Retrieved Context Shapes Internal Representations in RAG

检索上下文如何塑造RAG中的内部表示

Samuel Yeh, Sharon Li

机构 * Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过潜在表示分析检索文档类型对LLM隐藏状态的影响,揭示上下文相关性和分层处理对内部表示的影响,为RAG系统设计提供见解。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14751 2026-04-17 cs.CL 77%

Query pipeline optimization for cancer patient question answering systems

癌症患者问答系统中的查询管道优化

Maolin He, Rena Gao, Mike Conway, Brian E. Chapman

机构 * School of Computing and Information Systems, University of Melbourne(墨尔本大学计算与信息系统学院) Health Data Science and Biostatistics, University of Texas Southwestern Medical Center(德克萨斯西南医学中心健康数据科学与生物统计学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出了一种针对癌症患者问答系统的RAG查询管道三方面优化方法,通过改进文档检索、段落检索和语义表示,提升了回答准确性。

Comments This paper has been accepted as a Findings Paper in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19807 2026-04-17 cs.AI cs.CL cs.CV cs.LG cs.MA 75%

KnowRL: Exploring Knowledgeable Reinforcement Learning for Factuality

KnowRL: 探索知识增强型强化学习以提升事实性

Baochang Ren, Shuofei Qiao, Da Zheng, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 KnowRL通过整合事实性奖励提升慢思考模型的事实准确性,实验表明其有效缓解了幻觉问题并保持推理能力。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14865 2026-04-17 cs.CL cs.CR 70%

Segment-Level Coherence for Robust Harmful Intent Probing in LLMs

分段级一致性用于LLMs中鲁棒有害意图探测

Xuanli He, Bilgehan Sel, Faizan Ali, Jenny Bao, Hoagy Cunningham, Jerry Wei

机构 * University College London(伦敦大学学院) Virginia Tech(弗吉尼亚理工大学) Anthropic

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出分段级一致性方法,通过多证据token增强检测鲁棒性,在固定误报率下提升真阳性率35.55%,并在对抗性微调下仍能有效检测有害意图。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14702 2026-04-17 cs.LG stat.ML 70%

Gating Enables Curvature: A Geometric Expressivity Gap in Attention

门控使曲率:注意力中的几何表达性差距

Satwik Bathula, Anand A. Joshi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) University of Southern California(南加州大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究揭示门控注意力机制在几何表达性上的优势,通过分析高斯分布均值参数的几何结构,发现门控能产生非平坦流形,提升模型表现,尤其在非线性决策边界任务中表现更佳。

Comments 41 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14477 2026-04-17 cs.AI 70%

Seeing Through Circuits: Faithful Mechanistic Interpretability for Vision Transformers

通过电路看见:面向视觉变换器的忠实机制可解释性

Nina Żukowska, Wolfgang Stammer, Bernt Schiele, Jonas Fischer

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了通过计算图在视觉变换器中识别有用机制电路的可能性,提出自动视觉电路发现方法,发现分类特定电路、CLIP中的文字攻击电路以及可引导纠正有害行为的电路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14251 2026-04-17 cs.LG 70%

Calibrate-Then-Delegate: Safety Monitoring with Risk and Budget Guarantees via Model Cascades

校准后再委托:通过模型级联实现具有风险和预算保证的安全监控

Edoardo Pona, Milad Kazemi, Mehran Hosseini, Yali Du, David Watson, Osvaldo Simeone, Nicola Paoletti

机构 * King’s College London(伦敦国王学院) University of Manchester(曼彻斯特大学) Northeastern University London(伦敦东北大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出Calibrate-Then-Delegate方法,通过模型级联在保证计算成本的同时实现实例级决策,有效提升安全监控的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04567 2026-04-17 cs.CV 67%

All Changes May Have Invariant Principles: Improving Ever-Shifting Harmful Meme Detection via Design Concept Reproduction

所有变化可能都有不变原则:通过设计概念再现改进永动有害迷因检测

Ziyou Jiang, Mingyang Li, Junjie Wang, Yuekai Huang, Jie Huang, Zhiyuan Chang, Zhaoyang Li, Qing Wang

机构 * State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Science and Technology on Integrated Information System Laboratory Institute of Software Chinese Academy of Sciences(软件研究所信息集成系统技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文提出RepMD方法,通过设计概念再现检测不断变化的有害迷因,利用攻击树定义设计概念图,并指导多模态大语言模型提高检测准确率。

Comments 19 pages, 11 figures, 9 tables accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15285 2026-04-17 stat.ML cs.LG math.ST stat.TH 57%

Structural interpretability in SVMs with truncated orthogonal polynomial kernels

支持向量机中基于截断正交多项式核的结构可解释性

Víctor Soto-Larrosa, Nuria Torrado, Edmundo J. Huertas

机构 * Dpto. de Matemáticas, Facultad de Ciencias, Universidad Autónoma de Madrid(数学系,科学学院,自治大学马德里) Instituto de Ciencias Matemáticas (ICMAT), Campus de Cantoblanco UAM(数学科学研究所(ICMAT),UAM坎托布兰科校区) Dpto. de Biociencias, Facultad de Ciencias Biomédicas y de la Salud, Universidad Europea de Madrid(生物科学系,生物医学与健康科学学院,欧洲大学马德里) Dpto. de Física y Matemáticas, Facultad de Ciencias, Universidad de Alcalá(物理与数学系,科学学院,阿尔卡拉大学)

专题命中 知识编辑与模型理解 :post-training(abstract);分类 cs.LG

AI总结 本文研究了基于截断正交多项式核的支持向量机的后训练可解释性,提出基于正交核贡献指数的诊断框架,揭示模型复杂度的结构特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20997 2026-04-17 cs.LG 57%

When Does Content-Based Routing Work? Representation Requirements for Selective Attention in Hybrid Sequence Models

基于内容的路由何时有效?混合序列模型中选择性注意的表示要求

Abhinaba Basu

机构 * National Institute of Electronics and Information Technology(国家电子与信息研究所)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 研究探讨了混合序列模型中基于内容的路由有效性的条件,通过实验发现需双向上下文表示和成对比较以实现高路由精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10069 2026-04-17 cs.RO 50%

Humanoid Factors: Design Principles for AI Humanoids in Human Worlds

人形因素:人工智能人形在人类世界中的设计原则

Xinyuan Liu, Eren Sadikoglu, Ransalu Senanayake, Lixiao Huang

机构 * School of Computing and Augmented Intelligence, Arizona State University, AZ, USA(计算与增强智能学院,亚利桑那州立大学,亚利桑那州,美国) School of Manufacturing Systems and Networks, Arizona State University, AZ, USA(制造系统与网络学院,亚利桑那州立大学,亚利桑那州,美国) Human Systems Engineering, Arizona State University, AZ, USA(人机系统工程,亚利桑那州立大学,亚利桑那州,美国)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出人形因素框架,旨在指导人工智能人形与人类共存与协作的设计,强调物理、认知、社会和伦理四个支柱,以解决人形与人类交互中的新挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏