arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7552 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7552 篇

2606.02374 2026-06-02 cs.AI 79%

Spatial Representation Learning Beyond Pixels: Unifying Raster Data and Vector Semantics for Human-Centric Geospatial Foundation Models

超越像素的空间表示学习:统一栅格数据和向量语义以构建以人为中心的地理空间基础模型

Steffen Knoblauch, Hao Li, Gengchen Mai, Konstantin Klemmer, Song Gao, WenWen Li

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出统一栅格感知与向量推理的联合空间表示学习范式,旨在解决当前地球观测基础模型仅依赖栅格模态、忽略向量数据中丰富结构化信息的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01899 2026-06-02 eess.SP cs.AI 79%

RA-LWLM: Retrieval-Augmented In-Context Localization with Wireless Foundation Models

RA-LWLM:基于检索增强的上下文无线定位基础模型

Guangjin Pan, Hui Chen, Hei Victor Cheng, Henk Wymeersch

机构 * Department of Electrical Engineering, Chalmers University of Technology(查尔姆斯理工大学电子工程系) Department of Electrical and Computer Engineering, Aarhus University(阿鲁斯大学电子与计算机工程系)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 提出RA-LWLM框架,通过将场景特定信息外化到指纹数据库,实现无需训练的跨场景无线定位,利用冻结的无线基础模型编码器、检索模块和基于Transformer的上下文学习模块预测用户位置。

Comments 13 pages, 9 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01427 2026-06-02 stat.ML cs.LG 79%

On the Uncertainty Quantification Ability of Tabular Foundation Models

关于表格基础模型的不确定性量化能力

Tyler R. Johnson, Kian Ben-Jacob, Nima Negarandeh, Oriol Vendrell-Gallart, Ramin Bostanabad

机构 * Department of Mechanical and Aerospace Engineering, University of California, Irvine(加州大学欧文分校机械与航空航天工程系) Department of Civil and Environmental Engineering, University of California, Irvine(加州大学欧文分校土木与环境工程系)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 通过对比TabPFN与高斯过程在回归任务上的实证研究,揭示了显式先验与学习先验之间的权衡:TabPFN在复杂高维问题中表现优异,而高斯过程在数据稀缺时提供更优的预测精度和不确定性量化。

Comments 12 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30865 2026-06-01 cs.LG 79%

GlucoFM: A Dual-Stream Foundation Model for Continuous Glucose Monitoring

GlucoFM: 一种用于连续血糖监测的双流基础模型

Zechen Li, Keerthana Natarajan, Weizhi Zhang, Menglian Zhou, Simon A. Lee, Yuwei Zhang, Maxwell A. Xu, Zeinab Esmaeilpour, Flora D. Salim, Mark Malhotra, Lindsey Sunden, Shwetak Patel, Yuzhe Yang, Ahmed A. Metwally

机构 * Google Research(谷歌研究) University of New South Wales(新南威尔士大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 提出GlucoFM,一种轻量级CGM基础模型,通过将血糖动态分解为慢生理状态和瞬态事件流,在7个临床预测任务上平均PR-AUC比最佳CGM专用模型提高4.1点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29881 2026-05-29 cs.CV cs.AI 79%

Mitigating Hallucination in Vision-Language Models through Barrier-Regulated Adaptive Closed-form Steering

通过屏障调控自适应闭式引导缓解视觉语言模型中的幻觉

Soumyadeep Jana, Pulkit Mittal, Sanasam Ranbir Singh

机构 * Indian Institute of Technology Guwahati(印度理工学院果阿班加)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 提出BRACS框架,通过监测视觉注意力并仅在接地退化时进行闭式修正,无需训练即可有效减少LVLM中的物体幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23853 2026-05-29 cs.AI cs.MA 79%

SCoOP: Semantic Consistent Opinion Pooling for Uncertainty Quantification in Multiple Vision-Language Model Systems

SCoOP: 多视觉-语言模型系统中用于不确定性量化的语义一致意见池化

Chung-En Johnny Yu, Brian Jalaian, Nathaniel D. Bastian

机构 * University of West Florida(西佛罗里达大学) United States Military Academy(美国军事学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 提出SCoOP框架,通过不确定性加权的线性意见池化聚合多个视觉-语言模型的输出,实现无训练的不确定性量化,有效检测幻觉并支持高不确定性样本的弃权。

Comments Accepted to ICLR 2026 Workshop on Agentic AI in the Wild: From Hallucinations to Reliable Autonomy

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28554 2026-05-28 cs.LG 79%

High Performance, Low Reliability: Uncertainty Benchmarking for Tabular Foundation Models

高性能,低可靠性:表格基础模型的不确定性基准测试

José Lucas De Melo Costa, Fabrice Popineau, Arpad Rimmel, Bich-Liên Doan

机构 * CentraleSupélec(中央理工大学) ENS Paris-Saclay(巴黎-萨克雷大学) Université Paris-Saclay(巴黎-萨克雷大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 通过TALENT基准测试,发现表格基础模型虽在预测性能上优于梯度提升决策树,但在不确定性校准上表现更差,存在性能-不确定性权衡。

Comments 6 pages, 2 figures, 2 tables. Accepted at ESANN 2026 (European Symposium on Artificial Neural Networks, Computational Intelligence and Machine Learning), 22-24 April 2026, Bruges (Belgium)

Journal ref ESANN 2026 proceedings, European Symposium on Artificial Neural Networks, Computational Intelligence and Machine Learning, Bruges (Belgium) and online event, 22-24 April 2026, pp. 115-120, i6doc.com publ., ISBN 9782875870964

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00913 2026-05-28 cs.CV cs.CL 79%

Benchmarking and Mechanistic Analysis of Vision-Language Models for Cross-Depiction Assembly Instruction Alignment

跨描绘装配指令对齐的视觉-语言模型基准测试与机制分析

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿alto大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 构建IKEA-Bench基准,评估19个视觉-语言模型在装配图与视频帧对齐任务上的表现,发现视觉编码是提升跨描绘鲁棒性的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07961 2026-05-26 cs.AI 79%

Probing the Preferences of a Language Model: Integrating Verbal and Behavioral Tests of AI Welfare

探究语言模型的偏好:整合AI福祉的言语与行为测试

Valen Tagliabue, Leonard Dung

机构 * Future Impact Group (FIG)(未来影响集团) Ruhr-University Bochum(波鸿鲁尔大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本研究通过言语报告和行为实验(虚拟环境导航与话题选择)测量语言模型的偏好,发现偏好满足可作为AI福祉的实证代理,但测量一致性因模型和条件而异。

Comments Forthcoming in Philosophy and the Mind Sciences (PhiMiSci)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13930 2026-05-25 cs.LG cs.HC cs.NE 79%

Mechanistic Interpretability of EEG Foundation Models via Sparse Autoencoders

基于稀疏自编码器的脑电图基础模型机制可解释性

William Lehn-Schiøler, Magnus Ruud Kjær, Rahul Thapa, Magnus Guldberg Pedersen, Anton Mosquera Storgaard, Nick Williams, Radu Gatej, Tue Lehn-Schiøler, Andreas Brink-Kjær, Sadasivan Puthusserypady, Sándor Beniczky, James Zou, Lars Kai Hansen

机构 * BrainCapture DTU Health Tech(技术大学丹麦健康技术) DTU Compute(技术大学丹麦计算) Department of Biomedical Data Science(生物医学数据科学系) Department of Computer Science(计算机科学系) Seer Medical(Seer医疗) Filadelfia Epilepsy Hospital(菲拉德尔菲亚癫痫医院) University Hospital of Copenhagen(哥本哈根大学医院)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 通过TopK稀疏自编码器从三种EEG Transformer中提取稀疏特征字典,结合临床分类法评估单语义性和纠缠性,并引入概念引导分析目标与非目标区域,揭示模型表征失败和临床纠缠问题。

Comments Preprint. 14 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22679 2026-05-22 cs.CV cs.LG 79%

Conceptualizing Embeddings: Sparse Disentanglement for Vision-Language Models

将嵌入概念化:面向视觉-语言模型的稀疏解缠

Piotr Kubaty, Patryk Marszałek, Łukasz Struski, Adam Wróbel, Jacek Tabor, Marek Śmieja

机构 * Faculty of Mathematics and Computer Science, Jagiellonian University(雅盖隆大学数学与计算机科学学院) Doctoral School of Exact and Natural Sciences, Jagiellonian University(雅盖隆大学精确与自然科学博士学校) Centre for Credible AI, Warsaw University of Technology(华沙技术大学可信人工智能中心)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 本文提出CEDAR方法,通过稀疏解缠技术在不增加维度的情况下揭示预训练嵌入的组成结构,从而提升视觉-语言模型的可解释性和与人类感知的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15151 2026-05-22 cs.SD cs.AI 79%

Exploring How Audio Effects Alter Emotion with Foundation Models

探索音频效果如何通过基础模型改变情感

Stelios Katsis, Vassilis Lyberatos, Spyridon Kantarelis, Edmund Dervakos, Giorgos Stamou

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 本文研究音频效果如何通过基础模型影响情感,探讨了基础模型在分析音频效果与情绪关系中的作用,揭示了声音设计技术对感知影响的模式。

Comments https://github.com/stelioskt/audioFX

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21391 2026-05-21 cs.CL 79%

Post-Hoc Understanding of Metaphor Processing in Decoder-Only Language Models via Conditional Scale Entropy

通过条件尺度熵理解解码器-only语言模型中的隐喻处理

Lawhori Chakrabarti, Jennifer Johnson-Leung, Bert Baumgaertner, Aleksandar Vakanski, Min Xian, Boyu Zhang

机构 * Department of Computer Science, University of Idaho(计算机科学系,爱达荷大学) Department of Mathematics and Statistical Science, University of Idaho(数学与统计科学系,爱达荷大学) Department of Politics and Philosophy, University of Idaho(政治与哲学系,爱达荷大学) Department of Nuclear Engineering and Industrial Management, University of Idaho(核工程与工业管理系,爱达荷大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 研究探讨了解码器-only语言模型中隐喻处理的机制,通过条件尺度熵(CSE)分析不同层位的频率尺度变化,发现隐喻性词 token 在连续层位上产生显著更高的频谱宽度,且该效应不受语义复杂度或命题内容影响,验证了多尺度协调作为隐喻语言处理的特征。

Comments 18 pages, 3 figures, submitted to ICPR workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21288 2026-05-21 cs.LG 79%

A Mechanistic Study of Tabular Foundation Models

表格基础模型的机理研究

Marin Biloš, James T. Wilson, Anderson Schneider, Yuriy Nevmyvaka

机构 * Morgan Stanley(摩根大通)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 本文研究了不同架构的表格基础模型在分类和回归任务中的准确性收敛问题,揭示了模型内部算法、对称性来源以及扰动鲁棒性的机理,发现先前指出的表示崩溃并非实际问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20105 2026-05-20 cs.LG 79%

Optimal Representation Size: High-Dimensional Analysis of Pretraining and Linear Probing

最优表示尺寸:预训练和线性探测的高维分析

Valentina Njaradi, Clémentine Dominé, Rachel Swanson, Marco Mondelli, Andrew Saxe

机构 * Gatsby Computational Neuroscience Unit(Gatsby计算神经科学单元) University College London(伦敦大学学院) Institute of Science and Technology Austria(奥地利科学与技术研究所) Sainsbury Wellcome Centre(萨金斯-韦尔科姆中心)

专题命中 知识编辑与模型理解 :pretraining(title,abstract);分类 cs.LG

AI总结 本文研究了预训练和线性探测过程中的最优表示尺寸问题,通过高维分析揭示了表示维度、未标记和标记样本数量以及任务对齐性对训练和泛化误差的影响,提出了在不同预训练和下游数据条件下优化表示尺寸的条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22161 2026-05-20 cs.LG 79%

Causal Evidence that Language Models use Confidence to Drive Behavior

语言模型使用置信度驱动行为的因果证据

Dharshan Kumaran, Nathaniel Daw, Simon Osindero, Petar Veličković, Viorica Patraucean

机构 * Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 研究探讨了语言模型是否利用置信度信号来控制行为,如决定回答或 abstain,通过四个阶段实验发现模型使用多维内部置信表示和阈值策略来实现 abstention,揭示了结构化的元认知控制机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10292 2026-05-20 cs.CV cs.AI 79%

Adaptive Residual-Update Steering for Low-Overhead Hallucination Mitigation in Large Vision Language Models

自适应残差更新引导用于大型视觉语言模型中低开销幻觉抑制

Zhengtao Zou, Ya Gao, Jiarui Guan, Bin Li, Pekka Marttinen

机构 * Aalto University, Espoo, Finland(艾尔沃大学,芬兰 Espoo) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院,中国科学院,深圳)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出RUDDER框架,通过创建持久视觉锚点来对抗视觉稀释,利用模型的prefill残差更新提取鲁棒证据方向,并通过自适应门控机制注入解码过程,有效抑制幻觉并保持高吞吐量。

Comments Accepted by ICML 2026; Code available at: https://github.com/Akko000/RUDDER-Residual-Update-Directed-DEcoding-Regulation-

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17765 2026-05-19 cs.LG 79%

AURORA: Contextual Orthogonalization for Geometric Representation Learning in Healthcare Foundation Models

AURORA:用于医疗基础模型中几何表示学习的上下文正交化

Yuanyun Zhang, Shi Li

机构 * University of the Chinese Academy of Sciences(中国科学院大学) Columbia University(哥伦比亚大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出AURORA框架,通过上下文潜在几何进行正交化,以解决医疗基础模型中潜在表示的语义模糊和上下文变化不稳定性问题,提升了模型在不同机构分布变化下的鲁棒性和预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19774 2026-05-12 cs.LG 79%

If Concept Bottlenecks are the Question, are Foundation Models the Answer?

如果概念瓶颈是问题,那么基础模型是答案吗?

Nicola Debole, Pietro Barbiero, Francesco Giannini, Andrea Passerini, Stefano Teso, Emanuele Marconato

机构 * DISI, University of Trento(特伦托大学DISI实验室) IBM Research Zurich(IBM瑞士苏黎世研究实验室) Faculty of Sciences, Scuola Normale Superiore(科学学院,正则大学) CIMeC, University of Trento(特伦托大学CIMeC实验室)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 本文研究了基础模型在概念瓶颈模型中的影响,发现其在不同任务中与专家标注存在差异,且概念准确性与质量不强相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05045 2026-05-12 cs.CV cs.CL 79%

When Relations Break: Analyzing Relation Hallucination in Vision-Language Model Under Rotation and Noise

关系破裂:在旋转和噪声下的视觉语言模型关系幻觉分析

Philip Wootaek Shin, Ajay Narayanan Sridhar, Sivani Devarapalli, Rui Zhang, Jack Sampson, Vijaykrishnan Narayanan

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 研究探讨了旋转和噪声对视觉语言模型关系推理的影响,发现轻微扰动显著降低模型性能,提示需更鲁棒的几何感知模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09224 2026-05-12 cs.LG 79%

SMIXAE: Towards Unsupervised Manifold Discovery in Language Models

SMIXAE:朝向语言模型中无监督流形发现

Collin Francel

机构 * Department of Arts and Sciences, University of Alabama, Tuscaloosa, AL, United States(艺术与科学系,阿拉巴马大学,塔斯基吉,AL,美国)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 SMIXAE通过引入稀疏混合自编码器架构,解决传统自编码器无法直接建模多维特征的问题,实现在Gemma 2模型中有效学习和发现流形结构。

Comments 20 pages, 10 figures, 11 tables. Submitted to Mechanistic Interpretability Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09129 2026-05-12 cs.AI 79%

Data-driven Circuit Discovery for Interpretability of Language Models

数据驱动的电路发现用于语言模型的可解释性

Daking Rai, Mor Geva, Ziyu Yao

机构 * George Mason University(乔治·马歇尔大学) Tel Aviv University(特拉维夫大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出数据驱动电路发现方法,通过数据聚类发现多个电路,而非单一电路,提升模型内部机制的可解释性。

Comments 40 pages, 54 figures, 12 tables, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07748 2026-05-11 cs.CL 79%

TextLDM: Language Modeling with Continuous Latent Diffusion

TextLDM:基于连续潜在扩散的语言建模

Jiaxiu Jiang, Jingjing Ren, Wenbo Li, Bo Wang, Haoze Sun, Yijun Yang, Jianhui Liu, Yanbing Zhang, Shenghe Zheng, Yuan Zhang, Haoyang Huang, Nan Duan, Wangmeng Zuo

机构 * Joy Future Academy(京东探索研究院) HIT(Harbin Institute of Technology) HKUST(GZ)(Hong Kong University of Science and Technology (Guangzhou))

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 TextLDM将视觉潜在扩散框架应用于文本生成,通过Representation Alignment提升文本表示质量,在OpenWebText2上训练后优于现有扩散语言模型,匹配GPT-2性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00607 2026-05-04 cs.CL eess.AS 79%

Beyond Decodability: Reconstructing Language Model Representations with an Encoding Probe

超越解码性:使用编码探针重建语言模型表示

Gaofei Shen, Martijn Bentum, Tom Lentz, Afra Alishahi, Grzegorz Chrupała

机构 * Tilburg University(蒂尔堡大学) Radboud University(拉德堡德大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本文提出编码探针方法,用于重建语言模型内部表示,解决传统解码探针无法比较不同特征贡献和特征相关性影响的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25642 2026-04-29 cs.CV cs.AI 79%

Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models

预填充阶段干预用于缓解大视觉-语言模型中的幻觉

Chengsheng Zhang, Chenghao Sun, Xinyan Jiang, Wei Li, Xinmei Tian

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Advanced Research Institute, Chinese Academy of Sciences(上海先进研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出PTI方法,在预填充阶段干预KV缓存以减少幻觉,通过模态感知方向修正错误表示,提升模型可靠性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07802 2026-04-29 cs.CV cs.AI 79%

Latent Anomaly Knowledge Excavation: Unveiling Sparse Sensitive Neurons in Vision-Language Models

潜在异常知识挖掘:揭示视觉-语言模型中的稀疏敏感神经元

Shaotian Li, Shangze Li, Chuancheng Shi, Wenhua Wu, Yanqiu Wu, Xiaohan Yu, Fei Shen, Tat-Seng Chua

机构 * Macquarie University(麦考瑞大学) Nanjing University of Science and Technology(南京理工大学) The University of Sydney(悉尼大学) National University of Singapore(新加坡国立大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出LAKE框架,通过挖掘视觉-语言模型中稀疏敏感神经元,实现异常检测的内在可解释性,实验表明其在工业基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14837 2026-04-28 cs.CL 79%

V-SEAM: Visual Semantic Editing and Attention Modulating for Causal Interpretability of Vision-Language Models

V-SEAM:视觉语义编辑与注意力调节用于视觉-语言模型的因果可解释性

Qidong Wang, Junjie Hu, Ming Jiang

机构 * Tongji University(同济大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本文提出V-SEAM框架,结合视觉语义编辑和注意力调节,提升视觉-语言模型的因果可解释性,通过多级语义分析增强模型性能。

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14888 2026-04-28 cs.CV cs.AI 79%

Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models

超越跨模态对齐:测量和利用模态差距在视觉-语言模型中

Hanqi Yan, Xiangxiang Cui, Lu Yin, Jindong Gu, Paul Pu Liang, Yulan He, Yifei Wang

机构 * King’s College London(伦敦国王学院) University of Surrey(萨里大学) University of Oxford(牛津大学) MIT CSAIL(麻省理工学院CSAIL实验室) The Alan Turing Institute(阿兰·图灵研究院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出通过测量和利用模态差距改进视觉-语言模型的下游任务,引入模态主导分数和自动可解释性度量,实现轻量级编辑和系统分析。

Comments accepted by ACL26-findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22166 2026-04-27 cs.CL 79%

Fine-Grained Analysis of Shared Syntactic Mechanisms in Language Models

语言模型中共享句法机制的细粒度分析

Ryoma Kumon, Hitomi Yanaka

机构 * The University of Tokyo(东京大学) RIKEN(日本理化学研究所) Tohoku University(东北大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本研究通过细粒度分析探讨语言模型在不同句法结构中是否共享神经机制,发现填词-缺口依赖在早期至中期层有高度局部化的共享机制,而否定极性项目许可则无统一机制。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12430 2026-04-27 cs.CL 79%

System-Mediated Attention Imbalances Make Vision-Language Models Say Yes

系统介导的注意力失衡使视觉-语言模型倾向于说‘是’

Tsan Tsai Chan, Varsha Suresh, Anisha Saha, Michael Hahn, Vera Demberg

机构 * Saarland Informatics Campus, Saarland University, Germany(萨尔兰州信息学校区,萨尔兰州大学,德国) Max Planck Institute for Informatics, Germany(马克斯·普朗克信息研究所,德国)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了视觉-语言模型中系统介导的注意力失衡对‘是’偏见的影响,提出通过重新分配注意力以减少这种偏见,从而提升模型可靠性。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏