arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-24 至 2026-07-24 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 15 篇

2607.20995 2026-07-24 cs.CL 新提交 88%

Where Animacy Lives in Large Language Models: Tracing the Circuits of the Animacy Concept

大语言模型中 animacy 的所在之处:追踪 animacy 概念的电路

Samuele Punzo, Giovanni Cinà, Sandro Pezzelle

机构 * Graduate School of Informatics, University of Amsterdam(阿姆斯特丹大学信息学研究生院) Amsterdam University Medical Center(阿姆斯特丹大学医学中心) ILLC, University of Amsterdam(阿姆斯特丹大学逻辑、语言与计算研究所)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究大语言模型中 animacy 概念相关电路,构建受控数据集对四个开放权重模型进行电路发现,通过实验和消融表明存在处理 animacy 的因果机制,发现的电路定位性差且泛化有限,证实 animacy 概念特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21262 2026-07-24 cs.AI cs.CL 版本更新 88%

ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents

ARCO: 基于自适应规则与协同进化的多步LLM智能体

Zihang Tian, Jingsen Zhang, Rui Li, Xiaohe Bo, Yuanzi Li, Xu Chen

机构 * Renmin University of China(中国人民大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出ARCO框架,通过同尺度模型的双头结构(生成头与评分头)实现步骤级规则生成与奖励分配,结合轨迹分解约束和策略协同进化,在多个多跳QA任务上取得最优EM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20529 2026-07-24 cs.LG cs.AI 新提交 86%

Uncertainty-Aware Trust Estimation for Multi-LLM Systems via Structured Expert Judgement

通过结构化专家判断对多语言模型系统进行不确定性感知信任估计

Jiawei Zheng, Jiazhen Zhang

机构 * DigitLab, University of Exeter(数字实验室,埃克塞特大学)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究多语言模型聚合问题,核心方法是采用结构化专家判断,通过上下文感知校准问题及库克式对数加权估计专家可靠性,主要贡献是在异构和受污染情况下实现更好的准确性-可靠性平衡,强调聚合时需校准信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14180 2026-07-24 cs.CL cs.AI 版本更新 86%

Internal Knowledge Without External Expression: Probing the Generalization Boundary of a Classical Chinese Language Model

无外部表达的知识:探索经典中文语言模型的泛化边界

Jiuting Chen, Yuan Lian, Hao Wu, Tianqi Huang, Hiroshi Sasaki, Makoto Kouno, Jongil Choi

机构 * Eaglewood Japan Co., Ltd.(日本鹰木公司)

专题命中 知识编辑与模型理解 :language model(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究通过训练纯经典中文语料库的Transformer模型,探讨模型能否区分已知与未知输入,并揭示内部与外部不确定性之间的差异。

Comments 27 pages, 4 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20433 2026-07-24 cs.CL cs.AI 新提交 85%

Moir: Let the Model Direct Its Own Story for Robust Cross-Domain Knowledge Editing

莫尔:让模型为稳健的跨域知识编辑指引自身方向

Jea Kwon, Jiwon Kim, Dong-kyum Kim, Meeyoung Cha

机构 * Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所)

专题命中 知识编辑与模型理解 :SFT(abstract,abstract_cn);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 研究针对语言模型训练后知识编辑核心能力退化问题,提出莫尔方法,通过从模型自身解码分布采样估计保留协方差,无需外部数据,可作插入组件。实验表明该方法能在多模型上扩展保留能力,提升准确率,凸显分布对齐对无损编辑的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20778 2026-07-24 cs.LG physics.ao-ph 新提交 83%

Toward Mechanistic Interpretability of an AI Foundation Model Fine-Tuned for Atmospheric Chemistry

迈向针对大气化学进行微调的人工智能基础模型的机理可解释性

Jason Y. Hu, Ivan Higuera-Mendieta, Patrick Obin Sturm, Makoto M. Kelp

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学) University of Utah(犹他大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 研究针对大气化学微调的人工智能基础模型学到了什么,通过对微软Aurora模型施加化学扰动、检查内部表示等方法,发现其虽捕捉到部分臭氧响应但未执行化学约束,提供了测试模型是否学大气化学的框架,强调预测应依内部机制评判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19806 2026-07-24 cs.LG cs.AI 版本更新 73%

OPIUM: Mitigating Steering Externalities and Over-Refusal via Dual Objective Latent Optimization

OPIUM:通过双目标潜在优化减轻引导外部性和过度拒绝

Kavin Aravindan, Arihant Rastogi, Krishak Aneja, Aadi Prasad, Saiyam Jain, Vaishnavi Shivkumar, Ponnurangam Kumaraguru

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究激活引导向量存在的外部性问题,提出无训练方法OPIUM,通过表示匹配净化引导向量,在给定参考行为下优化新向量,改善安全与效用权衡,减轻激活引导的有害副作用。

Comments Accepted to the Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02619 2026-07-24 cs.LG cs.CL 73%

Understanding Addition and Subtraction in Transformers

理解变换器中的加法与减法

Philip Quirke, Clement Neo, Fazl Barez

机构 * University of Oxford(牛津大学) NTU(南洋理工大学) Martian(火星)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过训练和分析变换器模型,揭示了加法和减法的因果结构,并提出了新的精确算法。

Comments 8 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20993 2026-07-24 cs.CV cs.AI 新提交 70%

Sparse Concept Channels in Frozen 3D CT Vision Encoders

冻结的3D CT视觉编码器中的稀疏概念通道

Farhad Nooralahzadeh, Lea Bogensperger, Christian Bluethgen, Michael Krauthammer

专题命中 知识编辑与模型理解 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 研究3D医学图像解释中视觉语言模型内部单元对临床发现的编码,提出无训练概念通道探测(CCP)方法,通过实验证明该方法能清晰表征冻结医学编码器对发现的表示,在临床疗效和NLG指标上表现优且延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20484 2026-07-24 cs.AI 新提交 70%

The Devil is in the Spectrum: Mitigating Representation Collapse in LLMs via Topologically Regularized Side-Path

问题出在频谱中:通过拓扑正则化侧路径减轻大语言模型中的表示坍缩

Yiheng Tao, Kaiwen Cheng, Yao Lu, Chang Liu, Jie Chen

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型表示坍缩问题,通过频谱分析得出混合效率与信息容量的权衡,提出TRSP方法,采用无参数三角盒机制和长度感知门正则化令牌交互拓扑,实验证明该方法在多方面有显著改进。

Comments 22pages, 4 figures, poster of icml 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20432 2026-07-24 cs.CL cs.PL 新提交 70%

Position: Natural Language Should Not Fully Replace Formal Languages

立场:自然语言不应完全取代形式语言

Eitan Wagner, Elisha Rosensweig, Omri Abend

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对自然语言能否完全取代形式语言的争议,引入基于“任务特异性”的形式框架并证明“特异性交叉定理”,通过跨模态案例分析表明二者各有优势,是互补工具,倡导开发混合系统。

Comments To be published in ICML 2026 (position track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18672 2026-07-24 cs.LG stat.ML 版本更新 70%

Concept Concentration for Faithful Representation Intervention

用于忠实表示干预的概念集中化

Hongzheng Yang, Yongqiang Chen, Zeyu Qin, Tongliang Liu, Chaowei Xiao, Kun Zhang, Bo Han

机构 * SAIC Centre, USYD(SAIC中心)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究大语言模型表示干预中定位忠实概念的问题,提出概念集中化(COCA)方法,通过重构训练数据简化决策边界,有效降低分布内和分布外越狱成功率,且在常规任务上保持性能。

Comments ICML'26; Hongzheng and Yongqiang contributed equally; project page: https://causalcoat.github.io/coca

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21491 2026-07-24 cs.CL cs.LG 新提交 62%

What, Where, and How: Disentangling the Roles of Task, Language, and Model in Code Model Representations

是什么、在哪里以及如何:解开任务、语言和模型在代码模型表示中的作用

Piotr Wilam

机构 * University College London(伦敦大学学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究独立训练的语言模型在代码表示上的情况,通过2x2设计扩展概念电路提取方法,测量语法概念,发现任务决定概念获专用电路,模型决定电路位置及增长方式,还得出如Rust与Python电路差异等结论,为后续测试奠定基础。

Comments 16 pages, 11 figures, 6 tables. Code: https://github.com/piotrwilam/Atlas2x2 ; dataset: https://huggingface.co/datasets/piotrwilam/Atlas2x2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20652 2026-07-24 cs.LG cs.AI 新提交 62%

Scaling Interpretable Transformers with Parity Bottleneck Layers

使用奇偶瓶颈层扩展可解释的Transformer

Andrew Mack, Kraig Yuheng Tou, Mark Henry, Zhengxun Wu, Lauren Greenspan

机构 * Principles of Intelligence(智能原理)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在解决训练可解释Transformer模型的难题,提出ParityTransformer架构,通过奇偶瓶颈层实现,实验表明其在稀疏探测任务中表现良好,在特征相关指标上更优,朝着训练内部表示可设计解释的模型迈出一步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01145 2026-07-24 cs.LG eess.SP 版本更新 57%

Hierarchical Self-Supervised Representation Learning Framework for Multivariate Time Series Grounded in ECG Analysis

一种用于多变量时间序列的轻量级自监督学习框架:基于层次JEPA的心电图数据方法

Siwon Kim

机构 * Research Institute of Basic Sciences, Seoul National University(首尔大学基础科学研究院)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 提出ER-JEPA,一种轻量级自监督学习框架,通过层次化联合嵌入预测架构对多变量时间序列进行表征学习,在心电图数据上实现高效预训练和下游任务最优性能。

Comments 29 pages, 8 figures. Further clarified, added the new downstream task in the abstract and intro since last update.<< Polished text, improved formatting, fixed speed benchmark result, and added new downstream task. Code will be made publicly available soon

详情

展开后加载摘要…

URL PDF HTML 收藏