arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-11 至 2026-08-11 共收录 772 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 42 篇

2608.08024 2026-08-11 cs.CL cs.AI 新提交 82%

Prompt Embedding Probes (PEP): Hallucination Detection in LLMs from Hidden States

提示嵌入探针(PEP):基于隐藏状态的大语言模型幻觉检测

Zakhar Mrykhin, Valentin Malykh

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出提示嵌入探针(PEP),一种白盒幻觉检测方法,通过少量可学习提示嵌入扩充标准线性探针,在TriviaQA等数据集的Qwen3模型上验证其在生成前、跨模型等场景的有效性,仅需少量参数即可提升检测性能。

Comments 10 pages, 7 figures. Code available at https://github.com/zazamrykh/internal_probing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00143 2026-08-11 cs.CR cs.AI 版本更新 81%

Symbolic Attack Chain Generation from Atomic Red Team Techniques: An Empirical Study of Predicate Representation Granularity

基于Atomic Red Team技术的符号化攻击链生成:谓词表示粒度的实证研究

Ramya Varunsegar

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究对比九类与五类谓词粒度的AALM,发现粒度对攻击链有效性影响小,81.3%结果一致,高粒度仅提升规划论证的内部结构分辨率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07594 2026-08-11 cs.CL cs.AI 新提交 81%

Scaling Inherently Interpretable Language Models

扩展固有可解释的语言模型

Guide Labs Team, Andreas Madsen, Aya Abdelsalam Ismail, Giang Nguyen, Isaac Plant, Muawiz Chaudhary, Nathaniel Monson, Saqib Azim, Zhichen Guo, Julius Adebayo

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究将可解释性作为训练约束而非事后补充,在多规模计算下验证了其随模型能力同步扩展的特性,通过Steerling-8B模型实现闭环干预,且性能优于更大计算量的同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09202 2026-08-11 cs.AI 新提交 79%

CRUISE: Vision-Language Model-Guided Uncertainty-Aware Cross-Modal Sensor Fusion for Robust Autonomous Driving

CRUISE:面向鲁棒自动驾驶的视觉语言模型引导的不确定性感知跨模态传感器融合

Junyao Wang, Yulin Xu, Yu Li, Pramod Khargonekar, Mohammad Abdullah Al Faruque

机构 * University of California, Irvine(加利福尼亚大学欧文分校)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 针对现有不确定性感知融合方法泛化性差的问题,提出CRUISE框架,结合VLM引导的UQ模块与动态自适应机制,实现鲁棒的自动驾驶跨模态传感器融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08791 2026-08-11 cs.CL 新提交 79%

Unsure but Certain: Uncovering the Representation-Confidence Gap in Diffusion Language Models

不确定但确定:揭示扩散语言模型中的表示-置信度差距

Saurabh Yadav, Badri Narayana Patro, Vijay Srinivas Agneeswaran

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 该研究揭示扩散语言模型存在表示-置信度差距,其高置信度集中是误导性症状,现有补救措施难修复排序缺陷,提出轻量级工具利用隐藏状态信号改进排序,指出噪声下置信度可靠性是更紧迫限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08772 2026-08-11 cs.CL eess.AS 新提交 79%

Multilingual Emotion Neurons in Large Audio-Language Models

大型音频语言模型中的多语言情感神经元

Xiutian Zhao, Philipp Koehn, Björn Schuller, Berrak Sisman

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本研究通过首个神经元层面可解释性研究,提出多语言情感神经元(MLENs)定义及一致性正则化融合(CR-Fusion)方法,证实其在零样本和低资源场景下情感控制更精准,为LALMs跨语言情感编码提供因果解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07857 2026-08-11 cs.CV cs.AI 新提交 79%

Distilling CT Foundation Models into Editable Concept Bottlenecks for Lung Nodule Malignancy Prediction

将CT基础模型蒸馏为可编辑概念瓶颈用于肺结节恶性程度预测

Fakrul Islam Tushar, Stephen Adamo, Geoffrey D. Rubin

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 该研究将CT基础模型蒸馏为可编辑概念瓶颈模型,在肺结节恶性程度预测任务中,其判别力与仅用结节大小相当,且支持概念干预以实现透明可解释的预测。

Comments Submitted to SPIE Medical Imaging 2027 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07562 2026-08-11 cs.CV cs.LG 新提交 79%

Mechanistic Interpretability-Guided Selective Fine-Tuning of Vision-Language Models for Centimeter-Level Flood Depth Estimation

面向厘米级洪水深度估计的、由机械可解释性引导的视觉-语言模型选择性微调

Nafis Fuad, Xiaodong Qian, Dongxiao Zhu

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 该研究针对城市洪水缺乏厘米级实时深度估计的问题,提出三种视觉-语言模型,通过机械可解释性分析确定关键交叉注意力层进行选择性微调,在合成与真实基准测试中均实现高精度洪水深度估计,大幅减少可训练参数。

Comments This Paper is accepted in International Conference on Machine Learning and Application (ICMLA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03115 2026-08-11 cs.CL eess.AS 版本更新 79%

Discovering and Causally Validating Emotion-Sensitive Neurons in Large Audio-Language Models

在大型音频-语言模型中发现并因果验证情绪敏感神经元

Xiutian Zhao, Björn Schuller, Berrak Sisman

机构 * Center for Language and Speech Processing (CLSP)(语言与语音处理中心) Johns Hopkins University(约翰霍普金斯大学) Group on Language, Audio & Music (GLAM)(语言、音频与音乐小组) Imperial College London(伦敦帝国学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本研究通过神经元层面的干预验证了大型音频-语言模型中情绪敏感神经元的存在,并揭示了情绪识别的因果机制。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07531 2026-08-11 cs.CL cs.AI 新提交 79%

Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards

Search-G1:基于表征内在奖励的接地搜索智能体

Cheng Ruoxi, Ma Haoxuan, Zhang Hongyi, Zhang Junming, Duan Ranjie, Xia Qiaolin, Wang Hao, Lu Yu, Shi Haibo, Ma Xingjun

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);language agent(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Search-G1框架,通过两个经干预校准的读数构成的表征内在奖励,改善了搜索增强语言智能体的接地性与搜索成本的权衡,在多基准和模型规模上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07998 2026-08-11 cs.LG cs.AI 版本更新 79%

Enhancing AI Interpretability with Localised Architectures

通过局部化架构增强AI可解释性与安全性

Ian Seet, Jonas Bozenhard, Simon Ostermann

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对大型生成式AI模型可解释性差、计算成本高的问题,提出局部化机器学习架构,通过降低带宽、提高节点表达能力来提升可解释性和效率,并评估了多种硬件实现方案的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09427 2026-08-11 cs.CV 新提交 78%

Foundation Models are Implicit Deepfake Detectors

基础模型是隐式深度伪造检测器

Stefan Smeu, Dragos-Alexandru Boldisor, Elisabeta Oneata, Dan Oneata

机构 * AAAI Press(AAAI出版社)

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 该研究发现基础模型的特征幅度可区分真实与伪造媒体,将深度伪造检测建模为异常检测,简单统计指标即可达到竞争性能,且模型规模越大判别信号越强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09095 2026-08-11 cs.AI 新提交 77%

Who Bridges Safety? Identifying and Targeting Cross-Lingual Shared Safety Pathways

谁搭建安全桥梁?识别并靶向跨语言共享安全路径

Shuyi Miao, Wangjie Qiu, Pengyang Shao, Canran Xiao, Fei Shen, Zhiming Zheng, Tat-Seng Chua

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究识别出跨语言共享安全路径,提出基于该路径的靶向对齐方法,仅更新少量参数即可提升非高资源语言安全性并保留模型通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09928 2026-08-11 cs.CV cs.AI cs.CL cs.LG 新提交 75%

Multimodal Model Diffing for Feature Discovery and Control

用于特征发现与控制的多模态模型差异分析

Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr, Christian Schroeder de Witt, Constantin Venhoff, Ronald Clark

机构 * University of Oxford(牛津大学) Microsoft(微软公司)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出MMDiff多模态模型差异分析框架,训练多模态SAEs以识别多模态训练改变的特征,实现特征隔离、检测与控制,在空间、OCR任务及多模态安全攻击评估中展现出良好效果。

Comments Preprint. Accepted at ICML 2026 Trustworthy AI for Good Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09654 2026-08-11 cs.AI 新提交 70%

Hallucination-Free GUI Grounding via Regression-Free Layout-Aware Matching

无幻觉的GUI定位:基于无回归的布局感知匹配

Yuke Li, Xuehan Hou

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出无回归框架,通过解耦指令理解与布局感知定位,在ScreenSpot-Pro和Mind2Web数据集上显著提升GUI定位的准确率、成功率及元素选择率,抑制了坐标幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08159 2026-08-11 cs.AI 新提交 70%

When Is a Steerable Concept Representation Real? Measurement Confounds in a Cross-Family Audit of Neuroscience Parallels in LLMs

可操控概念表征何时为真?大型语言模型中神经科学相似性跨系列审计的测量混淆

Yuqi Wu, Shengming Zhao, Jie Chen

机构 * College of Biomedical Engineering, Fudan University(复旦大学生物医学工程学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究对17个不同规模的LLMs审计4种神经科学启发范式,发现AI神经科学研究受测量混淆限制,发布了相关方案、刺激与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07933 2026-08-11 cs.CR cs.CL 新提交 70%

EvoTrustRAG: Evolution-Aware Conflict Attribution and Evidence Handling for Reliable Retrieval-Augmented Generation

EvoTrustRAG:面向可靠检索增强生成的感知演化冲突归因与证据处理

Xi Nie, Hongwei Li, Shenghao Wu, Wenshu Fan, Qiyang Song, Wenbo Jiang

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对RAG在动态对抗环境中面临的冲突证据挑战,提出无训练框架EvoTrustRAG,通过构建冲突证据图并利用时间关系等进行归因,提升了冲突归因的准确率与宏F1值,降低了协同攻击下的错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07481 2026-08-11 cs.HC cs.AI 新提交 70%

Cross-Model Humor Preference Modeling with Cards Against Humanity

基于《反人类牌》的跨模型幽默偏好建模

Victor Winter, Farhan Lakhany

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究以《反人类牌》风格任务开展实验,发现大语言模型可通过裁判的先前选择及理由,提升近似另一模型幽默偏好的准确率,为跨模型偏好建模提供操作层面的证据。

Comments 11 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05971 2026-08-11 cs.CV cs.CL 版本更新 70%

Is CLIP Cross-Eyed? Revealing and Mitigating Center Bias in the CLIP Family

CLIP是否双目偏视?揭示并缓解CLIP家族中的中心偏差

Oscar Chew, Hsiao-Ying Huang, Kunal Jain, Tai-I Chen, Khoa D Doan, Kuan-Hao Huang

机构 * Texas A&M University(德克萨斯A&M大学) National Taiwan University(国立台湾大学) ASUS(华硕) VinUniversity

专题命中 知识编辑与模型理解 :language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究揭示CLIP家族模型存在中心偏差问题,导致对图像边缘重要物体识别困难,通过可解释方法分析发现嵌入表示和注意力机制中的信息丢失是原因,提出无需训练的视觉提示和注意力重分布策略缓解偏差。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03100 2026-08-11 cs.CV cs.AI 版本更新 70%

TGIF: Text-Guided Layer Fusion Mitigates Hallucination in Multimodal LLMs

基于文本引导的层融合缓解多模态大语言模型中的幻觉

Chenchen Lin, Sanbao Su, Rachel Luo, Yuxiao Chen, Yan Wang, Marco Pavone, Fei Miao

机构 * University of Connecticut(康涅狄格大学) NVIDIA(NVIDIA公司) Stanford University(斯坦福大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TGIF通过文本引导的层融合方法,有效缓解多模态大语言模型中的幻觉问题,提升视觉接地能力。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09344 2026-08-11 cs.CV 新提交 67%

Beyond Global Editing: Per-Instance Disentangled Subspaces for Training-Free Hallucination Mitigation in LVLMs

超越全局编辑:用于LVLMs无训练幻觉缓解的实例级解耦子空间

Ali Cheraghian, Hamidreza Dastmalchi, Hamed Barzamini, Morteza Saberi, Mojtaba Golzan, Shafin Rahman, Hossein Rahmani

机构 * Macquarie University(麦考瑞大学) York University(约克大学) Northern Illinois University(北伊利诺伊大学) University of Technology Sydney(悉尼科技大学) North South University(北南大学) Lancaster University(兰卡斯特大学) Australian National University(澳大利亚国立大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 针对LVLMs现有模型编辑技术采用单一全局子空间无法适配多样幻觉模式的问题,提出无训练的实例级解耦子空间框架,经多基准实验验证其鲁棒性、通用性与效率。

Comments BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09638 2026-08-11 cs.AI cs.CL cs.CY cs.GT 新提交 62%

Avalon-ToM-Bench: Evaluating Fine-Grained Theory of Mind via Asymmetric Game Mechanics

Avalon-ToM-Bench:通过非对称游戏机制评估细粒度心理理论

Yen-Shan Chen, Yu Chian Duan, Chih-En Kuo, Jian-Bin Wu, Yun-Nung Chen

机构 * National Taiwan University(台湾大学) CyCraft AI Lab(CyCraft人工智能实验室)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出Avalon-ToM-Bench基准,基于阿瓦隆游戏机制评估大语言模型的细粒度心理理论,发现模型ToM能力不足源于推理策略而非知识或表征,推理训练比测试时思维链增益更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08266 2026-08-11 cs.SE cs.AI cs.LG 新提交 62%

On the Robustness of LLMs' Internal Representation of Code Correctness

大型语言模型内部代码正确性表示的鲁棒性研究

Francisco Ribeiro, Sohaila Abdulsattar, Renata Gonzalez, Mahmoud Kassem, Sarah Nadi

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究系统探究大型语言模型内部代码正确性信号的鲁棒性,发现无最优提取配置且分离故障无法提升信号质量。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07886 2026-08-11 cs.CV cs.AI cs.CL 新提交 62%

Vision-Language Grounding as Bidirectional Concept Correspondence

视觉-语言 Grounding 作为双向概念对应

Jieyu Zhang, Ziqi Gao, Luke Zettlemoyer, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所) FAIR at Meta(Meta FAIR实验室)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究将视觉-语言 Grounding 建模为双向概念对应,提出 ConCor-1 模型统一相关任务,在长文本数据集和零样本 LVIS 上对应 F1 分别提升 48%、29%,性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04154 2026-08-11 cs.LG cs.AI 62%

Robust Filter Attention: Self-Attention as Precision-Weighted State Estimation

鲁棒滤波注意力:自注意力作为精度加权状态估计

Peter Racioppo

机构 * Independent Researcher, Los Angeles, CA, USA(独立研究者,美国加利福尼亚州洛杉矶)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出鲁棒滤波注意力(RFA),将自注意力建模为基于线性随机微分方程的状态估计,在语言建模中实现优于RoPE的困惑度与零样本外推稳定性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21249 2026-08-11 cs.AI cs.LG 版本更新 62%

Position: Certifiable State Integrity Should Be Built from Local Validity, Not Global Scale

位置:可信的状态完整性在网络物理系统中——为什么模块主权解决塑性-稳定性悖论

Enzo Nicolás Spotorno, Joao R. Campos, Antônio Augusto Medeiros Fröhlich

机构 * Software/Hardware Integration Lab (LISHA), Department of Statistics and Informatics, UFSC, Florianópolis, Brazil(软件/硬件集成实验室(LISHA)、统计与信息学系,UFSC,弗洛里亚诺波利斯,巴西)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出模块主权范式,通过冻结领域特定专家和不确定性感知融合,解决网络物理系统中塑性-稳定性悖论,确保状态完整性和可验证性。

Comments v2, 15 pages, (8 main text, 6 references and appendices), 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09011 2026-08-11 cs.LG 新提交 57%

Dynamic Distribution-Aware Uncertainty Tracking in Vision-Language Representation Learning

视觉-语言表示学习中的动态分布感知不确定性跟踪

Ao Zhou, Zhiwei Jiang, Zifeng Cheng, Cong Wang, Shufan Yang, Haoru Chen, Qing Gu

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ByteDance Inc(字节跳动公司)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 针对视觉-语言模型事后不确定性量化方法忽略测试分布动态性的问题,提出DDA-UQ框架,通过高斯混合模型建模嵌入空间,实现动态不确定性估计,性能优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08167 2026-08-11 cs.CV cs.LG 新提交 57%

Wiener Representation Filtering for VLM Hallucination Suppression

用于抑制视觉语言模型幻觉的维纳表示滤波

Ameen Ali, Tamim Zoabi, Lidor Brami, Lior Wolf

机构 * Tel Aviv University(特拉维夫大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 该研究提出一种无需训练的事后维纳表示滤波技术,通过离线校准校正视觉语言模型深层前馈输出投影,可在保持运行速度的同时降低其对象幻觉,在多类模型及基准上均验证了有效性与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08398 2026-08-11 cs.AI astro-ph.IM 新提交 57%

Estimating Uncertainty in Galaxy Morphology Classification

星系形态分类中的不确定性估计

Kai Cheng, Ruoqi Wang, Qiong Luo

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 针对星系形态分类(GMC)中基础模型无法量化不确定性的问题,提出后验框架UEGMC,可从冻结骨干网络提取的表示中直接预测不确定性,实验显示其不确定性量化性能具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00421 2026-08-11 cs.AI 版本更新 57%

Self-Routing: Parameter-Free Expert Routing from Hidden States

自路由:从隐藏状态中无参数的专家路由

Jama Hussein Mohamud, Drew Wagner, Mirco Ravanelli

机构 * Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所) Universite de Montreal(蒙特利尔大学) Concordia University(康考迪亚大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本文提出自路由机制,通过直接利用隐藏状态子空间作为专家logits,无需额外路由参数,实现更平衡的专家利用。在GPT-2语言模型和ImageNet-1K分类任务中,自路由在性能上与传统路由方法相当,且提升专家利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏