arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-01 至 2026-06-01 共收录 409 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 26 篇

2605.30984 2026-06-01 cs.CV cs.AI cs.CL 62%

Generating Reports or Repeating Templates? Measuring and Mitigating Template Collapse in 3D CT Report Generation

生成报告还是重复模板?测量和缓解三维CT报告生成中的模板崩溃

Tom Maye-Lasserre, Yitong Li, Bailiang Jian, Morteza Ghahremani, Benedikt Wiestler, Christian Wachinger

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) TUM Hospital(TUM医院) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI

AI总结 针对三维CT报告生成中模型输出多样性低、病理检测能力差的模板崩溃问题,提出解耦框架CLarGen,通过分离临床检测与语言合成,显著提升临床准确性并保持报告流畅性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29833 2026-06-01 cs.AI 57%

OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields

OmniMatBench:跨19个材料科学子领域的人类校准多模态推理基准

Wanhao Liu, Jiaqing Xie, Qian Tan, Weida Wang, Jue Wang, Ran Sun, Zhuo Yang, Wanli Ouyang, Lei Bai, Tianfan Fu, Lu Chen, Xin Chen, Yuqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Southeast University(东南大学) Nanjing University(南京大学) Suzhou Laboratory(苏州实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 针对现有基准忽视从材料知识到应用的推理过程,提出OmniMatBench,包含3171个专家策划的问答与计算问题,覆盖19个子领域,评估13个多模态大模型,最佳模型仅得0.372分,揭示当前模型在材料科学推理中的显著差距。

Comments 22 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20941 2026-06-01 cs.CV 50%

Decoding the Surgical Scene: A Scoping Review of Scene Graphs in Surgery

解码手术场景:手术中场景图的范围综述

Angelo Henriques, Korab Hoxha, Daniel Zapp, Peter C. Issa, Nassir Navab, M. Ali Nasseri

机构 * School of Computation, Information and Technology, Technical University of Munich(计算信息学院,慕尼黑技术大学) Klinik und Poliklinik für Augenheilkunde, TUM University Hospital(眼科诊所,TUM大学医院) Computer Aided Medical Procedures, Technical University of Munich(医学辅助程序,慕尼黑技术大学) Department of Biomedical Engineering, University of Alberta(生物医学工程系,阿尔伯塔大学)

专题命中 领域大模型 :foundation model(abstract)

AI总结 本文通过PRISMA-ScR指导的范围综述,系统梳理了手术中场景图(SG)的研究现状,分析了52项研究,揭示了从图神经网络向基础模型和生成式AI的方法论转变,并提出了“验证三位一体”评估框架以弥合临床转化差距。

Comments Submitted and accepted to Medical Image Analysis (DOI: 10.1016/j.media.2026.104083). An interactive version of the summary tables is available at: osf.io/fruq8

Journal ref Medical Image Analysis (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 29 篇

2605.30913 2026-06-01 cs.CL cs.AI cs.CY cs.HC 92%

Toxic HallucinAItions: Perturbing Prompts and Tracing LLM Circuits

有毒幻觉:扰动提示与追踪LLM电路

Soorya Ram Shimgekar, Agam Goyal, Amruta Parulekar, Joshua Chen, Yian Wang, Navin Kumar, Hari Sundaram, Eshwar Chandrasekharan, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nimblemind

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究有毒语言扰动对LLM事实可靠性的影响,发现有毒词汇降低准确率并增加不确定性,通过归因图分析揭示内部机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31478 2026-06-01 cs.SE cs.CL cs.SY eess.SY 92%

Knowledge Boundary Probing and Demand-Guided Intervention for LLM-Based Power System Code Generation

知识边界探测与需求引导干预:面向基于LLM的电力系统代码生成

Hui Wu, Xiaoyang Wang, Zhong Fan

机构 * Department of Engineering, University of Exeter(工程系,埃克塞特大学) Department of Computer Science, University of Exeter(计算机科学系,埃克塞特大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对LLM在电力系统代码生成中因API知识边界错误导致失败的问题,提出PowerCodeBench基准、L0-L3文档驱动探测和边界感知干预方法,显著提升模型准确率。

Comments 43 pages, 12 figures, includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29751 2026-06-01 cs.CL 89%

DySem: Uncovering Dynamic Semantic Components of Large Language Models for Calculating Semantic Textual Similarity

DySem: 揭示大语言模型的动态语义组件以计算语义文本相似度

Kaijie Zheng, Weiqin Wang, Yile Wang, Hui Huang

机构 * College of Computer Science and Software Engineering(计算机科学与软件工程学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 提出DySem框架,通过多语言共识提取大语言模型中与语义更相关的内部组件,并构建文本相关的联合语义集实现动态维度相似度计算,无需训练且性能优于基线。

Comments 18 pages, 23 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14928 2026-06-01 cs.LG cs.AI cs.CL cs.SI 89%

Graph Machine Learning in the Era of Large Language Models (LLMs)

大语言模型时代的图机器学习

Shijie Wang, Jiani Huang, Zhikai Chen, Yu Song, Wenzhuo Tang, Haitao Mao, Wenqi Fan, Hui Liu, Xiaorui Liu, Dawei Yin, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Michigan State University(密歇根州立大学) North Carolina State University(北卡罗来纳州立大学) Baidu Inc(百度公司)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了大语言模型如何增强图机器学习的泛化、迁移和少样本学习能力,以及图如何提升大语言模型的推理和可解释性。

Comments Accepted by TIST

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24319 2026-06-01 cs.CL cs.AI 88%

Dual Mechanisms of Value Expression: Intrinsic vs. Prompted Values in Large Language Models

价值表达的双重机制:大型语言模型中的内在价值与提示价值

Jongwook Han, Jongwon Lim, Injin Kong, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过价值向量和价值神经元分析,揭示大型语言模型中内在价值表达与提示价值表达在机制上部分共享核心组件,但各自拥有独特功能,内在机制促进多样性,提示机制增强指令遵从。

Comments Accepted at ICML 2026. Project page: https://holi-lab.github.io/ValueMechanism/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31363 2026-06-01 cs.CL 85%

The Latin Substrate: How Language Models Represent and Mediate Script Choice

拉丁基底:语言模型如何表示和中介文字选择

Daniil Gurgurov, Alan Saji, Katharina Trinley, Josef van Genabith, Simon Ostermann

机构 * German Research Center for AI(德国人工智能研究中心) Saarland University(萨尔兰大学) Indian Institute of Technology, Madras(印度理工学院-马德拉斯) Nilekani Centre at AI4Bharat(AI4Bharat的Nilekani中心)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL

AI总结 通过logit透镜、表征和机制分析,发现语言模型在转写时存在一致的潜在拉丁化,且通过少量后期注意力头因果中介文字选择,非拉丁输出由紧凑可识别门控产生,拉丁输出则来自网络扩散贡献,表明模型围绕共享潜在表示组织文字变异并偏向拉丁基底。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22068 2026-06-01 cs.LG 83%

Quantifying the Uncertainty of Foundation Models with Singular Value Ensembles

用奇异值集合量化基础模型的不确定性

Mehmet Ozgur Turkoglu, Dominik J. Mühlematter, Alexander Becker, Konrad Schindler, Helge Aasen

机构 * ETH Zürich, Photogrammetry \& Remote Sensing

专题命中 知识编辑与模型理解 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出奇异值集成(SVE)方法,通过冻结奇异向量并仅训练每个成员的奇异值,以极小的参数开销实现隐式集成,从而有效量化基础模型的不确定性。

Comments Accepted at ICML 2026 (camera-ready version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30790 2026-06-01 cs.IR cs.AI cs.CL 82%

On the impact of retrieved content representations in RAG Pipelines

关于检索内容表示对RAG管道的影响

Jonathan J Ross, Bevan Koopman, Anton van der Vegt, Guido Zuccon

机构 * The University of Queensland(昆士兰大学) CSIRO(澳大利亚联邦科学与工业研究组织)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过控制变量实验,研究检索文档的不同表示(选择、摘要、改写等)对RAG生成准确性的影响,发现答案保留是主要决定因素。

Comments 23 pages, 15 figures, submitted to ACL May 2026 ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31196 2026-06-01 cs.CV cs.AI cs.CL cs.RO 81%

Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration

探索视觉-语言模型中的碰撞接地以实现安全的人机协作

Jun Wang, Xiaohao Xu, Xiaonan Huang

机构 * University of Michigan, Ann Arbor(密歇根大学,安娜堡)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对安全人机协作,提出碰撞接地概念及物理基准TouchSafeBench,评估视觉-语言模型在分类当前安全状态和预警即将碰撞任务中的表现,发现现有模型不可靠,视觉流畅性不等于物理责任性。

Comments 31 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08145 2026-06-01 cs.CV cs.AI cs.LG 81%

Self-Captioning Multimodal Interaction Tuning: Amplifying Exploitable Redundancies for Robust Vision Language Models

自描述多模态交互调优:放大可利用冗余以实现鲁棒的视觉语言模型

Yuriel Ryan, Hei Man Ip, Adriel Kuek, Paul Pu Liang, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) DSO National Laboratories(国防部国家实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对视觉语言模型中的幻觉和鲁棒性问题,提出自描述多模态交互调优方法,通过放大模态间冗余信息来补偿受损模态,并设计多模态交互门机制将独特交互转化为冗余交互,实验表明该方法可减少38.3%的视觉诱导错误并提升16.8%的一致性。

Comments Accepted to ICML 2026. Code: https://github.com/yurielryan/Multimodal-Interaction-Tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30865 2026-06-01 cs.LG 79%

GlucoFM: A Dual-Stream Foundation Model for Continuous Glucose Monitoring

GlucoFM: 一种用于连续血糖监测的双流基础模型

Zechen Li, Keerthana Natarajan, Weizhi Zhang, Menglian Zhou, Simon A. Lee, Yuwei Zhang, Maxwell A. Xu, Zeinab Esmaeilpour, Flora D. Salim, Mark Malhotra, Lindsey Sunden, Shwetak Patel, Yuzhe Yang, Ahmed A. Metwally

机构 * Google Research(谷歌研究) University of New South Wales(新南威尔士大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 提出GlucoFM,一种轻量级CGM基础模型,通过将血糖动态分解为慢生理状态和瞬态事件流,在7个临床预测任务上平均PR-AUC比最佳CGM专用模型提高4.1点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30385 2026-06-01 cs.LG cs.AI 79%

LLMs Without Deep Neural Networks: New Architecture, Benefits and Case Study

无需深度神经网络的LLM:新架构、优势与案例研究

Vincent Granville

专题命中 知识编辑与模型理解 :LLM(title_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种基于RBF网络的新架构,无需深度神经网络即可通过闭式解找到损失函数全局最优,消除繁琐训练步骤,并提高可解释性和准确性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30750 2026-06-01 cs.CV 78%

SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling

SLAP: 用于变分视频-语言建模的语义最小作用原理

Xiang Fang, Wanlong Fang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 提出语义最小作用原理(SLAP),将视频插值建模为黎曼流形上的边界值问题,通过离散欧拉-拉格朗日方程保持对象持久性,解决大视频语言模型中的时间间隙问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10495 2026-06-01 cs.CL 77%

Why Don't You Know? Evaluating the Impact of Uncertainty Sources on Uncertainty Quantification in LLMs

为什么你不知道?评估不确定性来源对大型语言模型中不确定性量化的影响

Maiya Goloburda, Roman Vashurin, Fedor Chernogorskii, Nurkhan Laiyk, Daniil Orel, Preslav Nakov, Maxim Panov

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过引入一个明确分类不确定性来源的新数据集,系统评估了现有不确定性量化方法在不同不确定性来源下的表现,发现多数方法在模型知识局限下表现良好,但在其他来源下性能下降或产生误导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31561 2026-06-01 cs.CL 70%

What Am I Missing? Question-Answering as Hidden State Probing

我遗漏了什么?将问答作为隐藏状态探测

Chu Fei Luo, Samuel Dahan, Xiaodan Zhu

机构 * Department of Electrical and Computer Engineering & Ingenuity Labs, Queen’s University(电子与计算机工程系及Ingenuity实验室,女王大学) Conflict Analytics Lab, Queen’s University(冲突分析实验室,女王大学) Cornell Law School(康奈尔法学院) Vector Institute for AI(人工智能向量研究所)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出将问答作为推理时干预手段,通过学生-教师框架探测隐藏状态,发现提问前的隐藏状态可预测最终正确性,并设计门控策略优化提问时机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31497 2026-06-01 cs.LG stat.ML 70%

Assign and Add: A Mechanistic Study of Compositional Arithmetic

Assign and Add: 组合算术的机制研究

Brady Exoo, Alberto Bietti, John Sous

机构 * Yale University(耶鲁大学) Flatiron Institute(Flatiron研究所)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过变量赋值和模加法任务,研究Transformer中组合泛化的机制,发现模型利用同一模加法模块处理直接和间接输入,并揭示了三阶段学习动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31562 2026-06-01 cs.LG 61%

Effective Biological Representation Learning by Masking Gene Expression

通过掩码基因表达实现有效的生物表示学习

Kian Kenyon-Dean, Alina Selega, Ihab Bendidi, Jordan M. Sorokin, Luca Bertinetto, David Errington, Hayley Donnella, Oren Kraus

机构 * Recursion Valence Labs École Normale Supérieure PSL

专题命中 知识编辑与模型理解 :foundation model(abstract,comments);分类 cs.LG

AI总结 提出自监督模型TxFM,采用掩码自编码方法处理RNA-seq数据,通过消融研究确定关键架构,并在精心策划的DiverseRNA-1.4M数据集上训练,获得优于大规模基础模型的基因表示。

Comments 31 pages, 11 figures. Preprint; presented at ICLR 2026 2nd Workshop on Foundation Models for Science: Real-World Impact and Science-First Design

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31547 2026-06-01 cs.LG math.DS stat.ML 57%

The Dynamic-Probabilistic Consistency Gap in Chaotic Surrogate Modeling

混沌替代建模中的动态-概率一致性差距

Andre Herz, Matthijs Pals, Daniel Durstewitz, Georgia Koppe

机构 * Interdisciplinary Center for Scientific Computing, Heidelberg University, Germany(海德堡大学交叉科学计算中心) Faculty of Mathematics and Computer Science, Heidelberg University, Germany(海德堡大学数学与计算机科学学院) Dept. of Theoretical Neuroscience, Central Institute of Mental Health (CIMH), Mannheim, Germany(曼海姆中央心理健康研究所理论神经科学部门) Faculty of Physics and Astronomy, Heidelberg University, Germany(海德堡大学物理与天文学学院) Hector Institute for AI in Psychiatry and Dept. of Psychiatry and Psychotherapy, CIMH, Mannheim, Germany(曼海姆中央心理健康研究所精神病AI研究所及精神病学与心理学系) Hertie Institute for AI in Brain Health, University of Tübingen, Germany(图宾根大学脑健康AI研究所)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 针对混沌系统替代建模中动态与概率目标不一致的问题,提出基于可微扩展卡尔曼滤波的KAFFEE框架,通过局部预测残差似然和雅可比协方差传播来缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31040 2026-06-01 cs.LG 57%

UniRTL: Unifying Code and Graph for Robust RTL Representation Learning

UniRTL:统一代码和图以实现稳健的RTL表示学习

Yi Liu, Hongji Zhang, Lei Chen, Mingxuan Yuan, Qiang Xu

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong SAR(计算机科学与工程系,香港中文大学,香港特别行政区) Noah's Ark Lab, Huawei, Hong Kong SAR(华为诺亚实验室,香港特别行政区)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 提出UniRTL多模态预训练框架,通过互掩码建模和分层训练策略联合利用RTL代码与控制数据流图,实现细粒度对齐,在性能预测和代码检索任务上优于现有方法。

Comments Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30968 2026-06-01 cs.CV cs.AI 57%

Variational Adapter for Cross-modal Similarity Representation

变分适配器用于跨模态相似性表示

WenZhang Wei, Zhipeng Gui, Dehua Peng, Tiandi Ye, Huayi Wu

机构 * School of Remote Sensing and Information Engineering(遥感与信息工程学院) Wuhan University(武汉大学) School of Data Science and Engineering(数据科学与工程学院) East China Normal University(华东师范大学) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing(测绘遥感信息工程国家重点实验室)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 针对跨模态匹配中细粒度标注稀缺导致二元分类边界压缩和假负样本问题,提出变分适配器VACSR,将匹配任务重构为变分推断问题,通过构建潜在相似性空间和正则化缓解过拟合,在图像-文本检索、域泛化和基类到新类泛化任务上验证了有效性。

Comments Accepted by the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30911 2026-06-01 cs.CV cs.AI 57%

What Makes LVLMs Hallucinate Less? Unveiling the Architectural Factors Behind Hallucination Robustness

什么使LVLMs更少产生幻觉?揭示影响幻觉鲁棒性的架构因素

Yusheng He, Jizhe Zhou, Xia Du, Zheng Lin, Jun Luo, Jiancheng Lv

机构 * School of Computer Science, Engineering Research Center of Machine Learning and Industry Intelligence, Sichuan University(计算机科学学院,机器学习与产业智能工程研究中心,四川大学) School of Computer and Information Engineering, Xiamen University of Technology(计算机与信息工程学院,厦门理工大学) Department of Electrical and Computer Engineering, University of Hong Kong(电气与计算机工程系,香港大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本文通过将架构设计分解为语言基础、视觉表示和语义对齐三个维度,并引入CoSimUE基准,系统探索了架构因素对LVLMs幻觉鲁棒性的影响,发现模型参数扩展效果有限,而增强视觉编码器、语言基础和语义对齐能分别减少不同类型的幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16305 2026-06-01 cs.SD cs.LG 57%

BAT: Better Audio Transformer Guided by Convex Gated Probing

BAT: 基于凸门控探测的更好音频Transformer

Houtan Ghaffari, Lukas Rauch, Christoph Scholz, Paul Devos

机构 * Ghent University(根特大学) University of Kassel(卡塞尔大学)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 提出凸门控探测(CGP)方法,通过门控机制有效利用所有冻结层,缩小音频自监督学习中探测与微调的差距,并基于CGP改进SSL流程,构建Better Audio Transformer(BAT),在音频基准上取得新最优结果。

Comments Accepted @ ICML26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11561 2026-06-01 cs.LG 57%

View Space: Learning Representation across Arbitrary Graphs

视图空间:跨任意图的学习表示

Dooho Lee, Myeong Kong, Minho Jeong, Jaemin Yoo

机构 * School of Electrical Engineering, KAIST, Daejeon, Republic of Korea(韩国釜山科学技术院电子工程学院) Department of Computer Science and Engineering, Seoul National University, Seoul, Republic of Korea(首尔国立大学计算机科学与工程系)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 本文提出视图空间概念,通过图视图变换(GVT)实现跨任意图的归纳节点表示学习,并在节点分类任务中显著优于现有方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05038 2026-06-01 cs.LG 57%

The SuperActivator Mechanism: Transformers Concentrate Reliable Concept Signals in the Tail

超级激活机制:Transformer将可靠概念信号集中在尾部

Cassandra Goldberg, Chaehyeon Kim, Adam Stein, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 知识编辑与模型理解 :prompting(abstract);分类 cs.LG

AI总结 本文发现Transformer中的超级激活机制,通过放大概念激活差距,将最可靠的概念证据集中在少数高激活token上,并基于此提出检测方法,在图像和文本模态中F1提升高达0.14。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24901 2026-06-01 cs.SD cs.LG 57%

Unmute the Patch Tokens: Rethinking Probing in Multi-Label Audio Classification

取消补丁令牌静音:重新审视多标签音频分类中的探测方法

Lukas Rauch, René Heinrich, Houtan Ghaffari, Lukas Miklautz, Ilyass Moummad, Bernhard Sick, Christoph Scholz

机构 * University of Kassel(卡塞尔大学) Fraunhofer IEE(弗劳恩霍夫研究所) Ghent University(根特大学) ML and Systems Biology, MPI of Biochemistry(生物化学Max Planck研究所) INRIA Montpellier(蒙彼利埃INRIA)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 针对自监督音频模型线性探测性能不佳的问题,提出二值化原型探测方法,通过学习原型进行类别级信息聚合,在13个数据集上超越线性探测和注意力探测,建立探测作为高效评估范式的可行性。

Comments Accepted @ ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01926 2026-06-01 cs.CV cs.AI 57%

Cross-Modal Attention Calibration for LVLM Hallucination Mitigation

跨模态注意力校准用于LVLM幻觉缓解

Jiaming Li, Jiacheng Zhang, Zequn Jie, Lin Ma, Guanbin Li

机构 * Sun Yat-sen University(中山大学) The University of Hong Kong(香港大学) Meituan(美团) Inspur Database Technology(Inspur数据库技术) Guilin University of Electronic Technology(桂林电子科技大学) Shenzhen Loop Area Institute(深圳河套学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 提出一种无需训练的跨模态注意力校准方法,通过设计模态间解码和位置校准模块,缓解大型视觉语言模型中的幻觉问题。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31234 2026-06-01 cs.RO 50%

HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model

HARP-VLA:面向视觉-语言-动作模型的人机对齐表示学习

Xiang Zhu, Puzhen Yuan, Yichen Liu, Jianyu Chen

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, China(清华大学交叉信息研究院) Shanghai Qi Zhi Institute, China(上海启智研究院)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 提出HARP框架,通过有限配对人机演示和未配对视频,学习对齐的人机视觉与潜在动作表示,提升VLA模型预训练效果,在CALVIN和真实世界任务中取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏