arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-20 至 2026-03-20 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 17 篇

2603.18009 2026-03-20 cs.CL cs.AI 90%

How Confident Is the First Token? An Uncertainty-Calibrated Prompt Optimization Framework for Large Language Model Classification and Understanding

第一个token的可信度如何?一种用于大型语言模型分类和理解的不确定性校准提示优化框架

Wei Chen, Guoyang Ju, Yuanyuan Qi

机构 * China Jiliang University(中国嘉兴大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LSFU指标和UCPOF框架,通过校准提示优化提升模型性能,实验显示在少样本基准上准确率提升6.03%,超越全RAG方法,并降低检索触发率50.66%。

Comments 27 pages,16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19144 2026-03-20 cs.CL cs.AI 88%

UGID: Unified Graph Isomorphism for Debiasing Large Language Models

UGID: 用于去偏大型语言模型的统一图同构

Zikang Ding, Junchi Yao, Junhao Li, Yi Zhang, Wenbo Jiang, Hongbo Liu, Lijie Hu

机构 * University of Electronic Science and Technology of China(电子科技大学) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) South China University of Technology(华南理工大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 UGID通过构建Transformer的结构化计算图,在内部表示层面减少模型偏见,通过约束注意力路由和隐藏表示,提升模型行为一致性并保持安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16749 2026-03-20 cs.CL cs.LG 88%

Probing Cultural Signals in Large Language Models through Author Profiling

通过作者画像探测大语言模型中的文化信号

Valentin Lafargue, Ariel Guerra-Adames, Emmanuelle Claeys, Elouan Vuichard, Jean-Michel Loubes

机构 * IMT, Toulouse, France(法国图卢兹IMT学院) INRIA Bordeaux, France(法国波尔多INRIA) ANITI 2, Toulouse, France(法国图卢兹ANITI) IRIT, Toulouse, France(法国图卢兹IRIT) Université de Bordeaux, Bordeaux, France(法国波尔多大学) BPH, Inserm, France(法国Inserm BPH) CNRS IRL CROSSING, Adelaide, Australia(澳大利亚阿德莱德CNRS IRL CROSSING)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究通过零样本设置评估大语言模型能否从歌曲歌词中推断歌手性别和种族,发现模型存在系统性文化偏见,提出两种公平性指标量化差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10045 2026-03-20 cs.CL 83%

Do Language Models Associate Sound with Meaning? A Multimodal Study of Sound Symbolism

语言模型是否将声音与意义关联?一种多模态研究声音象征主义

Jinhong Jeong, Sunghyun Lee, Jaeyoung Lee, Seonah Han, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学) Korea University(韩国大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 研究语言模型在多模态输入中对声音象征性的处理,通过分析不同语义维度下的音节注意力分数,揭示模型对声音与意义关联的理解机制。

Comments 33 pages, 27 tables, 10 figures, accepted to AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18523 2026-03-20 cs.CV cs.AI 79%

Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models

计数电路:大视觉-语言模型中视觉推理的机制可解释性

Liwei Che, Zhiyu Xue, Yihao Quan, Benlin Liu, Zeru Shi, Michelle Hurst, Jacob Feldman, Ruixiang Tang, Ranjay Krishna, Vladimir Pavlovic

机构 * Rutgers University(罗格斯大学) UC Santa Barbara(加州大学圣巴巴拉分校) University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文研究了大视觉-语言模型在计数任务中的机制,提出两种新方法揭示计数电路结构,并通过干预策略提升模型计数精度和视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18353 2026-03-20 cs.AI 79%

Interpretability without actionability: mechanistic methods cannot correct language model errors despite near-perfect internal representations

无需可操作性:机制方法无法纠正语言模型错误,尽管内部表示几乎完美

Sanjay Basu, Sadiq Y. Patel, Parth Sheth, Bhairavi Muralidharan, Namrata Elamaran, Aakriti Kinra, John Morgan, Rajaie Batniji

机构 * University of California San Francisco(加州大学旧金山分校) Waymark University of Pennsylvania(宾夕法尼亚大学) Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学) Stanford University(斯坦福大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 研究探讨了机制解释方法在纠正语言模型错误中的有效性,发现尽管内部表示接近完美,但现有方法无法有效将知识转化为正确输出,揭示了AI安全框架中的潜在问题。

Comments 27 pages, 5 figures, 10 tables. Code available at https://github.com/sanjaybasu/interpretability-triage

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03415 2026-03-20 cs.CL cs.AI 73%

Farther the Shift, Sparser the Representation: Analyzing OOD Mechanisms in LLMs

越远离分布,表示越稀疏:分析LLM中的OOD机制

Mingyu Jin, Yutong Yin, Jingcheng Niu, Qingcheng Zeng, Wujiang Xu, Mengnan Du, Wei Cheng, Zhaoran Wang, Tianlong Chen, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Northwestern University(西北大学) UKP Lab, TU Darmstadt(德累斯顿技术大学UKP实验室) New Jersey Institute of Technology(新泽西理工学院) NEC Lab American(美国NEC实验室) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究LLM在面对难度增加的输入时内部表示的适应机制,发现任务难度提升导致最后隐藏层表示稀疏化,提出基于稀疏性的课程学习策略提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09734 2026-03-20 cs.CL cs.AI 73%

From Detection to Diagnosis: Advancing Hallucination Analysis with Automated Data Synthesis

从检测到诊断:通过自动化数据合成推进幻觉分析

Yanyi Liu, Qingwen Yang, Tiezheng Guo, Feiyu Qu, Jun Liu, Yingyou Wen

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出从检测到诊断的新范式,通过自动化数据合成生成高质量训练样本,训练出HDM-4B-RL模型,在幻觉诊断任务中超越现有检测模型,实现更可靠的生成式AI系统。

Comments Accepted at The 40th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16698 2026-03-20 cs.LG 70%

Causality is Key for Interpretability Claims to Generalise

因果性是可解释性主张泛化的关键

Shruti Joshi, Aaron Mueller, David Klindt, Wieland Brendel, Patrik Reizinger, Dhanya Sridhar

机构 * Mila - Qu\'ebec AI Institute \& Universit\'e de Montr\'eal Boston University Cold Spring Harbor Laboratory Max-Planck-Institute for Intelligent Systems, ELLIS Institute T\"ubingen, University of T\"ubingen

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨了大语言模型可解释性研究中因果推理的重要性,提出通过因果表示学习框架,明确可解释性研究的因果层级,以指导方法选择和评估,确保研究结果的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06678 2026-03-20 cs.CV cs.LG 70%

Flexible Concept Bottleneck Model

灵活的概念瓶颈模型

Xingbo Du, Qiantong Dou, Lei Fan, Rui Zhang

专题命中 知识编辑与模型理解 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出灵活的概念瓶颈模型(FCBM),通过动态概念适应和改进的稀疏max模块,提升模型在新概念下的适应性与灵活性,实验表明其在多个基准上的表现优异。

Comments To appear in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18911 2026-03-20 cs.CL cs.AI 62%

Progressive Training for Explainable Citation-Grounded Dialogue: Reducing Hallucination to Zero in English-Hindi LLMs

逐步训练用于可解释的引用导向对话:在英语-印地语LLM中将幻觉减少到零

Vedant Pandya

机构 * School of Artificial Intelligence and Data Engineering (SAIDE)(人工智能与数据工程学院) Indian Institute of Technology Jodhpur(印度理工学院朱罗普尔)

专题命中 知识编辑与模型理解 :SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出XKD-Dial,一种逐步四阶段训练流程,用于生成可解释的引用导向对话,通过跨语言适应、英语对话SFT与引用定位、双语对话SFT及GRPO对齐与引用感知奖励,减少幻觉并提升印地语能力。

Comments 30 pages, 15 figures, 11 tables. Comprehensive study across 6 LLMs (250M-7B parameters) with explainability analysis. Code and data available upon request

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19980 2026-03-20 cs.SE cs.AI 57%

Neuron-Guided Interpretation of Code LLMs: Where, Why, and How?

指导神经元的代码LLM解释:在哪里、为什么和如何?

Zhe Yin, Xiaodong Gu, Beijun Shen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 研究通过分析代码LLM的神经元层面,发现语言特定神经元和概念层在多语言生成中的作用,提出基于神经元的微调、克隆检测和跨语言总结方法。

Comments Accepted by FSE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18184 2026-03-20 cs.CL 57%

CWoMP: Morpheme Representation Learning for Interlinear Glossing

CWoMP:形态表示学习用于互线 glossing

Morris Alper, Enora Rice, Bhargav Shandilya, Alexis Palmer, Lori Levin

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Colorado Boulder(科罗拉多大学波德福分校)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.CL

AI总结 CWoMP通过对比学习将词素作为原子形式-意义单元进行表示,提升低资源语言的互线 glossing 效率与效果。

Comments Project page: http://cwomp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19232 2026-03-20 cs.CV 50%

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

三次离散扩散:高维表示上的离散视觉生成

Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Carnegie Mellon University(卡内基梅隆大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出CubiD,首个高维表示离散生成模型,通过精细掩码实现高维离散表示的生成,具备固定步数的生成能力,且在ImageNet-256上达到SOTA性能,验证离散token保留原始表示能力。

Comments Accepted by CVPR 2026 main track; Code: https://github.com/YuqingWang1029/CubiD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18660 2026-03-20 cs.CV 50%

Multimodal Model for Computational Pathology:Representation Learning and Image Compression

多模态模型用于计算病理学:表示学习与图像压缩

Peihang Wu, Zehong Chen, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳大学先进技术学院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文探讨了多模态计算病理学中的表示学习和图像压缩技术,分析了自监督学习、多模态数据生成、参数高效适应及多代理协作推理等方向,旨在提升病理诊断的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18598 2026-03-20 cs.CV 50%

Complementary Text-Guided Attention for Zero-Shot Adversarial Robustness

互补文本引导注意力用于零样本对抗鲁棒性

Lu Yu, Haiyang Zhang, Changsheng Xu

机构 * School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of the Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出TGA-ZSR和Comp-TGA方法,通过局部注意力细化模块和全局注意力约束模块提升CLIP模型的零样本对抗鲁棒性,实验显示在16个数据集上分别提升9.58%和11.95%。

Comments Accepted to TPAMI 2026. arXiv admin note: substantial text overlap with arXiv:2410.21802

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04714 2026-03-20 cs.CV 50%

Object-Centric Representation Learning for Enhanced 3D Semantic Scene Graph Prediction

面向增强三维语义场景图预测的对象感知表示学习

KunHo Heo, GiHyun Kim, SuYeon Kim, MyeongAh Cho

机构 * Kyung Hee University(庆熙大学)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 本文提出一种高判别性的对象特征编码器和对比预训练策略,提升三维语义场景图预测的准确性和关系预测能力,实验表明在3DSSG数据集上优于现有方法。

Comments Accepted by NeurIPS 2025. Code: https://github.com/VisualScienceLab-KHU/OCRL-3DSSG-Codes

详情

展开后加载摘要…

URL PDF HTML 收藏