arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-16 至 2026-06-16 共收录 37 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 37 篇

2606.15788 2026-06-16 cs.CR cs.AI 新提交 92%

GAS-Leak-LLM: Genetic Algorithm-Based Suffix Optimization for Black-Box LLM Jailbreaking

GAS-Leak-LLM:基于遗传算法的后缀优化实现黑盒LLM越狱

Aman Anifer, Vignesh Kumar Kembu, Vishnu M, Antonino Nocera, Vinod P., Amal Murali PK, Akshay S Rajan

机构 * Department of Electrical, Computer and Biomedical Engineering(电气、计算机与生物医学工程系) University of Pavia(帕维亚大学) Department of Computer Applications(计算机应用系) Cochin University of Science and Technology(科钦科学技术大学)

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出GAS-Leak-LLM方法,利用遗传算法在黑盒设置下自动进化对抗后缀以绕过LLM安全约束,验证了现有安全机制的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15267 2026-06-16 eess.AS cs.SD 新提交 91%

Dynamic Prosody Prediction in LLM-based TTS for Improving Speaker Similarity

基于LLM的TTS中的动态韵律预测以提高说话人相似度

Zhenwei Mou, Liping Chen, Yajun Hu, Zhen-Hua Ling, Xin Fang, Jianqing Gao

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM-based TTS忽略风格特定韵律模式导致说话人相似度不足的问题,提出基于先前预测语音的动态音节韵律预测方法,显著提升韵律学习能力和说话人相似度。

Comments Accepted to INTERSPEECH 2026. 5 pages, 2 figures. Audio samples: https://muzw.github.io/dynapros/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15264 2026-06-16 eess.AS cs.SD 新提交 91%

DuraMark: Duration-Embedded Watermarking in LLM-based TTS

DuraMark: 基于LLM的文本转语音中的时长嵌入水印

Zhenwei Mou, Weili Jiang, Liping Chen, Zhen-Hua Ling, Kong Aik Lee, Kai Gao, Boyu Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Forensic Science, Ministry of Public Security(公安部刑侦科学研究所) The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出DuraMark,一种基于音节时长编辑的信息级水印框架,利用可控时长的LLM-TTS模型嵌入水印,并使用时长提取器检测,有效抵抗生成式攻击。

Comments Accepted to INTERSPEECH 2026. 5 pages, 1 figure. Audio samples: https://muzw.github.io/duramark_demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15565 2026-06-16 cs.HC cs.LG 新提交 90%

If These Walls Could Talk: Critical Play with Large Language Models in Museums

如果这些墙会说话:博物馆中大语言模型的批判性游戏

Anders Sundnes Løvlie

机构 * The Dalí Museum(达利博物馆)

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 针对博物馆中大语言模型聊天机器人不可靠但吸引人的矛盾,提出设计批判性游戏,将机器人作为虚构角色呈现历史叙事、话语风格和多元视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15914 2026-06-16 cs.CL cs.HC 新提交 90%

Contaminated Collaboration: Measuring Gender Bias Transfer in LLM-Assisted Student Writing

污染的合作:测量LLM辅助学生写作中的性别偏见迁移

Ariyan Hossain, Kazi Kamruzzaman Rabbi, Farig Sadeque, S M Taiabul Haque

机构 * Brac University(布拉卡大学)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.CL

AI总结 通过实验发现,使用性别偏见的LLM写作助手会显著增加学生职业规划作文中的性别刻板印象,且偏见迁移不对称:女性目标作文的能动性被抑制,男性目标作文受影响较小。

Comments 18 pages, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14796 2026-06-16 cs.SE 新提交 89%

Faster Code, Deeper Debt? A Multivocal Literature Review on Technical Debt and Its Early Signs in LLM-Assisted Software Development

更快的代码,更深的债务?关于LLM辅助软件开发中技术债务及其早期迹象的多声部文献综述

Ramtin Ehsani, Shriya Rawal, Yuanfang Cai, Preetha Chatterjee

专题命中 其他LLM :LLM(title,title_cn)

AI总结 通过104篇文献的多声部综述,发现LLM辅助开发放大传统技术债务(代码、设计、文档债务)并引入新债务(快速集成、提示、伦理、数据、来源债务),提出人机协同、提示工程等缓解策略,但缺乏标准化基准。

Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16358 2026-06-16 cs.CR cs.AI cs.ET cs.MA 新提交 89%

The Proxy Knows Too Much: Sealing LLM API Routers with Attested TEEs

代理知道太多:用认证TEE密封LLM API路由器

Sipeng Xie, Qianhong Wu, Hengrun Lu, Ziliang Sun, Qi Wu, Bo Qin, Qin Wang

机构 * Beihang University(北京航空航天大学) Renmin University of China(中国人民大学) Independent(独立)

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对API路由器作为应用层中间人可窃取明文交互的问题,提出AEGIS,一种提供者透明的认证API路由器,通过硬件飞地保护数据路径,客户端验证飞地后释放明文,阻止所有恶意路由器攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14742 2026-06-16 q-bio.NC cs.AI cs.HC 新提交 88%

Do Large Language Models Have Emotions?

大型语言模型有情感吗?

Amit Goldenberg, James J. Gross

机构 * Harvard Business School(哈佛商学院) Department of Psychology, Harvard University(哈佛大学心理学系) Harvard University, Digital, Data and Design Institute(哈佛大学数字、数据与设计研究所) Department of Psychology, Stanford University(斯坦福大学心理学系)

专题命中 其他LLM :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文评估Anthropic声称Claude Sonnet 4.5具有“功能性情感”的说法,从生物情感功能角度分析,指出其部分支持情境解释功能,但缺乏动态重组能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10680 2026-06-16 cs.DB 88%

Evaluating SQL Understanding in Large Language Models

评估大型语言模型对SQL的理解能力

Ananya Rahaman, Anny Zheng, Mostafa Milani, Fei Chiang, Rachel Pottinger

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract)

AI总结 本文评估大型语言模型在SQL任务中的理解能力,通过检测语法错误、识别缺失token、预测查询性能等任务,揭示模型在语义理解和连贯性方面的局限。

Comments 12 pages conference submission

Journal ref Proc. EDBT 2025, pp. 909-921, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15092 2026-06-16 cs.LG 新提交 87%

High-Dimensional Random Projection for Activation Steering in Language Models

高维随机投影用于语言模型中的激活引导

Minh-Hieu Pham, Bach Do, Laziz Abdullaev, Tan Minh Nguyen, Khoat Than

机构 * Hanoi University of Science and Technology(河内科技大学) National University of Singapore(新加坡国立大学)

专题命中 其他LLM :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.LG

AI总结 针对现有激活引导方法仅捕捉均值差异的局限,提出无训练的高维随机投影激活引导方法(HiDRA),通过在投影高维空间中进行激活加法,捕获非线性特征子空间中的判别信号,实验证明其优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15052 2026-06-16 cs.AR cs.AI 新提交 87%

PANDA: An LLM-Enhanced Performance-Driven Analog Design Framework Bridging Design Intent and Layout Generation

PANDA:一种LLM增强的性能驱动模拟设计框架,弥合设计意图与版图生成

Haoyi Zhang, Weijian Fan, Xiaohan Gao, Bingyang Liu, Runsheng Wang, Yibo Lin

机构 * School of Integrated Circuits, Peking University(集成电路学院,北京大学) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进创新中心) Institute of Electronic Design Automation, Peking University(电子设计自动化研究所,北京大学)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI

AI总结 提出PANDA框架,利用大语言模型将高层设计意图转化为最终版图,通过引导拓扑综合、子结构感知尺寸优化和约束驱动版图生成,实现跨阶段协同设计,将设计周期从数天/周缩短至数小时并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15024 2026-06-16 cs.MA cs.AI cs.SY eess.SY 新提交 86%

Resilient Consensus in Agentic AI

智能体AI中的弹性共识

Sribalaji C. Anand, George J. Pappas

机构 * KTH(瑞典皇家理工学院) University of Pennsylvania(宾夕法尼亚大学)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究LLM智能体在多智能体系统中的共识问题,发现经典弹性共识理论在LLM智能体中失效,但结合经典滤波器可改善一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16989 2026-06-16 cs.GT cs.AI cs.CY 新提交 84%

Stable Menus of Public Goods: AI-Enabled Progress

公共物品的稳定菜单:AI驱动的进展

Sara Fish

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 其他LLM :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 以EC 2025论文的开放问题为测试平台,实验评估AI辅助研究流程的有效性,发现提供人类直觉提示和自动多轮交互有助于提升LLM表现,但LLM略逊于一年级博士生。

Comments Accepted to the EC'26 Workshop on AI-Driven Research in EconCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15994 2026-06-16 cs.AI cs.LG 新提交 82%

Agentic Framework for Deep Learning workload migration via In-Context Learning

基于上下文学习的深度学习工作负载迁移智能体框架

Qiyue Liang, Steven Ingram, George Vanica, Andi Gavrilescu, Newfel Harrat, Hassan Sipra, Sethuraman Sankaran

机构 * Google(谷歌)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出结合上下文学习与Oracle驱动的自调试的自主系统,实现从PyTorch到JAX的深度学习模型自动迁移,在神经模块上达到91%数值等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16867 2026-06-16 cs.CL 新提交 81%

Revisiting the Systematicity in Negation in the Era of In-Context Learning

重新审视上下文学习时代否定中的系统性

Hitomi Yanaka, Taisei Yamamoto

机构 * The University of Tokyo(东京大学) Riken(理化学研究所) Tohoku University(东北大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过行为与表征系统性分析,发现大型语言模型在上下文学习中能部分识别否定表达和范围,但无法完美执行,且功能向量在否定线索提取任务中可组合,但范围识别更具挑战。

Comments Accepted to the 6th Workshop Natural Language Meets Logic and Machine Learning (NALOMA2026) at ESSLLI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16817 2026-06-16 cs.CL cs.IR 新提交 81%

Understanding the Behaviors of Environment-aware Information Retrieval

理解环境感知的信息检索行为

Ruifeng Yuan, Chaohao Yuan, David Dai, Yu Rong, Hong Cheng, Hou Pong Chan, Chenghao Xiao

机构 * Fudan University(复旦大学) Alibaba DAMO Academy(阿里巴巴达摩院) Chinese University of Hong Kong(香港中文大学) Stanford University(斯坦福大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL

AI总结 通过强化学习使LLM适应不同检索器的查询策略,发现不同检索器偏好不同查询风格,并提出分支式滚动技术提升训练稳定性。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15033 2026-06-16 cs.HC cs.CL cs.CY 新提交 81%

Cloze: An Open Research Platform for Studying Human-AI Conversations in Mental Health Contexts

Cloze:一个用于研究心理健康背景下人机对话的开放研究平台

Matthew Flathers, Francesco Cipriani, John Torous

机构 * Beth Israel Deaconess Medical Center(贝塞斯达以色列德acons医疗中心) University College London(伦敦大学学院) Division of Digital Psychiatry(数字精神病学部)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出开源平台Cloze,支持在心理健康研究中控制、监控人机对话,统一配置模型、指令、安全约束并记录完整溯源,为建立人机交互证据基础提供研究基础设施。

Comments 7 pages, 2 figures. Cloze is released under AGPL-3.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09222 2026-06-16 cs.CR cs.AI 版本更新 81%

MUZZLE: Adaptive Agentic Red-Teaming of Web Agents Against Indirect Prompt Injection Attacks

MUZZLE: 针对间接提示注入攻击的自适应智能体红队测试框架

Georgios Syros, Evan Rose, Brian Grinstead, Christoph Kerschbaumer, William Robertson, Cristina Nita-Rotaru, Alina Oprea

机构 * Northeastern University(东北大学) Mozilla Corporation(Mozilla公司)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MUZZLE框架,利用智能体轨迹自动识别高显著性注入面,自适应生成上下文相关的恶意指令,评估网络智能体对间接提示注入攻击的安全性,发现44种新攻击和跨应用攻击策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09625 2026-06-16 cs.HC 版本更新 80%

AwareLLM: A Proactive Multimodal Ecosystem for Personalized Human-AI Collaboration to Enhance Productivity

AwareLLM: 一种主动多模态生态系统,用于个性化人机协作以提升生产力

Amog Rao, Utkarsh Agarwal, Amol Harsh, Siddharth Siddharth

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 AwareLLM通过整合多模态数据与大语言模型,实现主动适应用户心理生理状态,提升任务表现并降低认知疲劳,推动人机协作新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15327 2026-06-16 cs.LG 新提交 79%

Semantic DLM+: Improving Diffusion Language Models through Bias-variance Trade-off in Transition Kernel Design

语义DLM+:通过转移核设计中的偏差-方差权衡改进扩散语言模型

Keyue Jiang, Yuxiang Wang, Yanan Zhao, Xiang Yu, Qifang Zhao, Bohan Tang, Baojian Zhou, Yanghua Xiao, Lin Qu, Xiaoxiao Xu

机构 * Alibaba Group(阿里巴巴集团) Fudan University(复旦大学) University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.LG

AI总结 本文通过分析泛化误差的三个关键因素,提出SemDLM+模型,通过全局转移和语义频率惩罚解决语义盆地问题,在LM1B和OpenWebText上提升了训练动态和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05878 2026-06-16 cs.LG 版本更新 79%

TS-ICL: A Flexible Time-Indexed Foundation Model for Time Series via In-Context Learning

TS-ICL: 一种基于上下文学习的灵活时间索引时间序列基础模型

Etienne Le Naour, Tahar Nabil, Adrien Petralia

机构 * EDF R&D(EDF研究与发展)

专题命中 其他LLM :foundation model(title,abstract);分类 cs.LG

AI总结 提出TS-ICL,一种基于上下文学习的概率编码器-回归器Transformer,统一了时间序列预测与插值,并在插值任务上达到新最优,同时在部分观测回溯窗口预测中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24275 2026-06-16 cs.LG math.OC stat.ML 版本更新 79%

GradPower: Powering Gradients for Faster Language Model Pre-Training

GradPower: 通过梯度加速更快的语言模型预训练

Jinbo Wang, Mingze Wang, Jiaqi Zhang, Wei Wang, Peng Pei, Xunliang Cai, Weinan E, Lei Wu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.LG

AI总结 本文提出GradPower,一种轻量级的梯度变换技术,用于加速语言模型预训练。通过元素级符号幂变换,将梯度输入基础优化器,无需修改优化器内部逻辑或超参数,从而在多种架构、参数规模、数据集和学习率调度方案中均取得更低的终端损失。

Comments 24 pages, accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12977 2026-06-16 cs.LG 版本更新 79%

Exact Federated Continual Unlearning for Ridge Heads on Frozen Foundation Models

冻结基础模型上岭回归头的精确联邦持续遗忘

Yijun Quan, Wentai Wu, Giovanni Montana

机构 * WMG, University of Warwick, Coventry CV4 7AL, UK(沃里克大学WMG学院,沃里克大学,英格兰考文特里CV4 7AL,英国) Department of Computer Science, Jinan University, Guangzhou 510632, China(广州大学计算机科学系,广州510632,中国)

专题命中 其他LLM :foundation model(title,abstract);分类 cs.LG

AI总结 针对冻结基础模型+岭回归头的联邦学习场景,提出基于充分统计量的通信协议,实现精确且高效的连续遗忘,支持任意添加和删除请求,保证与集中式重训练等价的确定性。

Comments Accepted to ECML-PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12219 2026-06-16 q-bio.GN q-bio.MN 新提交 78%

m6A-FORM: An m6A-focused Foundation Model for Decoding m6A Regulatory Function

m6A-FORM:解码N6-甲基腺苷生物学的基础模型

Ting-He Zhang, Sumin Jo, Shou-Jiang Gao, Yufei Huang

专题命中 其他LLM :foundation model(title,abstract)

AI总结 提出基于Transformer的基础模型m6A-FORM,利用MeRIP-seq峰作为先验,预训练后微调实现m6A位点预测,性能优于现有方法,并支持调控因子结合位点预测和组织保守位点分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08059 2026-06-16 cs.RO 新提交 78%

Perceptive Behavior Foundation Model: Adapting Human Motion Priors to Robot-Centric Terrain

感知行为基础模型:将人体运动先验适应到以机器人为中心的地形

Zifan Wang, Yizhao Li, Teli Ma, Qiang Zhang, Yudong Fan, Hao Xu, Shuo Yang, Junwei Liang

机构 * Mondo Robotics The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Artificial General Intelligence Institute, University of Science and Technology of China(中国科学技术大学通用人工智能研究院)

专题命中 其他LLM :foundation model(title,abstract)

AI总结 提出感知行为基础模型(Perceptive BFM),通过地形一致参考合成(TCRS)将人体运动先验适应到机器人局部地形,实现地形感知的人形机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15919 2026-06-16 cs.RO 版本更新 78%

ReMoBot: Retrieval-Based Few-Shot Imitation Learning for Mobile Manipulation with Vision Foundation Models

ReMoBot: 基于检索的少样本模仿学习用于移动操作与视觉基础模型

Yuying Zhang, Wenyan Yang, Francesco Verdoja, Ville Kyrki, Joni Pajarinen

机构 * School of Electrical Engineering, Aalto University, Espoo, Finland(艾尔沃大学电气工程学院,埃斯波,芬兰)

专题命中 其他LLM :foundation model(title,abstract)

AI总结 提出ReMoBot,一种基于检索的少样本模仿学习框架,利用视觉基础模型从演示中检索信息,解决移动操作任务中的部分可观测性和数据有限问题,在真实世界任务中取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19610 2026-06-16 cs.SE 版本更新 75%

The Influence of Code Comments on the Perceived Helpfulness of Stack Overflow Posts

代码注释对 Stack Overflow 帖子感知有用性的影响

Kathrin Figl, Maria Kirchner, Sebastian Baltes, Michael Felderer

专题命中 其他LLM :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过在线实验(n=91)研究代码注释如何影响 Stack Overflow 答案的感知有用性,发现块注释和行内注释均显著提高有用性,且新手认为块注释更有用,而答案位置和分数影响较小。

Comments 32 pages, 7 figures, 2 tables, accepted in Empirical Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09465 2026-06-16 stat.ML cs.LG 版本更新 70%

Branching Flows: Discrete, Continuous, and Manifold Flow Matching with Splits and Deletions

分支流:带有分裂和删除的离散、连续和流形流匹配

Lukas Billera, Hedwig Nora Nordlinder, Jack Collier Ryder, Anton Oresten, Aron Stålmarck, Theodor Mosetti Björk, Ben Murrell

机构 * Department of Microbiology, Tumor and Cell Biology, Karolinska Institutet(卡罗林斯卡研究所微生物学、肿瘤和细胞生物学系)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出分支流框架,通过随机分支和死亡过程控制序列元素数量,适用于变长数据生成,并在小分子、抗体序列和蛋白质骨架生成中验证效果。

Comments 39 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06855 2026-06-16 math.OC cs.LG 版本更新 70%

Design and Scheduling of an AI-based Queueing System

基于AI的排队系统的设计与调度

Jiung Lee, Hongseok Namkoong, Yibo Zeng

机构 * Columbia University(哥伦比亚大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对预测模型在服务系统中与人类服务器交互的场景,研究预测误差对拥塞成本的影响,提出一种基于索引的策略,在重流量下近最优地利用预测类别信息,并指导预测模型选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00344 2026-06-16 cs.CV cs.AI cs.CL 版本更新 62%

When RAG Hurts: Diagnosing and Mitigating Attention Distraction in Retrieval-Augmented LVLMs

当RAG有害:诊断和缓解检索增强LVLMs中的注意力分散

Beidi Zhao, Wenlong Deng, Xinting Liao, Yushu Li, Nazim Shaikh, Yao Nie, Xiaoxiao Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文发现检索增强生成(RAG)在LVLMs中导致注意力分散(AD)问题,即检索文本抑制视觉注意力并偏离问题相关区域,提出MAD-RAG方法通过双问题公式和注意力混合来解耦视觉定位与上下文整合,在三个基准上提升性能并纠正大部分失败案例。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏