arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-15 至 2026-05-15 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2605.14291 2026-05-15 cs.CR cs.AI cs.CL cs.CV cs.LG 85%

To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model

看清并非学习:保护多模态数据免受大视觉语言模型的未经授权微调

Chengshuai Zhao, Zhen Tan, Dawei Li, Zhiyuan Yu, Huan Liu

机构 * School of Computing Augmented Intelligence, Arizona State University, Tempe, AZ, USA Department of Computer Science Engineering, Texas A\&M University, College Station, TX, USA

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MMGuard,通过注入不可察觉扰动主动利用LVLM学习动态,生成不可学习示例,从而保护多模态数据免受未经授权的微调。通过最小化训练损失,扰动创建优化捷径,导致模型在推理时因噪声过拟合而性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14906 2026-05-15 cs.CV 83%

MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models

MemLens:大型视觉-语言模型多模态长期记忆的基准测试

Xiyu Ren, Zhaowei Wang, Yiming Du, Zhongwei Xie, Chi Liu, Xinlin Yang, Haoyue Feng, Wenjun Pan, Tianshi Zheng, Baixuan Xu, Zhengnan Li, Yangqiu Song, Ginny Wong, Simon See

机构 * CSE Deparment, HKUST(香港科技大学计算机科学与工程系) CUHK(香港大学) OmniMemory (Shenzhen) Intelligent Technology Co., Ltd.(深圳奥米克记忆科技有限公司) NVIDIA AI Technology Center (NVAITC), NVIDIA, Santa Clara, USA(英伟达AI技术中心(NVAITC),英伟达,美国圣克拉拉)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 MemLens基准测试评估大型视觉-语言模型在多模态多会话对话中的长期记忆能力,通过789个问题测试五种记忆能力,揭示长上下文模型和记忆增强代理的优缺点,推动混合架构发展。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03532 2026-05-15 cs.CV 77%

OpenTrack3D: Towards Accurate and Generalizable Open-Vocabulary 3D Instance Segmentation

OpenTrack3D: 向准确且通用的开放词汇3D实例分割迈进

Zhishan Zhou, Siyuan Wei, Zengran Wang, Chunjie Wang, Xiaosheng Yan, Xiao Liu

机构 * PICO, ByteDance, Beijing(字节跳动北京研究院)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV

AI总结 本文提出OpenTrack3D框架,通过在线构建跨视角一致的对象提案和多模态大语言模型提升开放词汇3D实例分割的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14966 2026-05-15 cs.CV cs.AI 73%

MHSA: A Lightweight Framework for Mitigating Hallucinations via Steered Attention in LVLMs

MHSA:一种轻量级框架,通过引导注意力缓解LVLMs中的幻觉

Wei Ding, Yilin Li, Yudong Zhang, Ruobing Xie, Xingwu Sun, Jiansheng Chen, Yu Wang

机构 * Tsinghua University(清华大学) Tsinghua University, Tencent(清华大学腾讯) Tencent(腾讯) University of Science and Technology Beijing(北京科技大学) University of Macau(澳门大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MHSA框架,通过学习修正跨模态注意力模式来缓解LVLMs中的幻觉,采用简单三层MLP生成器和DHCP判别器信号指导训练,无需修改模型参数即可在多种数据集和模型上有效减少判别和生成幻觉。

Comments 19 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14621 2026-05-15 cs.CV cs.AI cs.CL 67%

Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

我们真的需要外部工具来缓解幻觉吗?SIRA:共享前缀内部重构归因

Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen

机构 * Tsinghua University(清华大学) The University of Sydney(悉尼大学) Stanford University(斯坦福大学) Baichuan AI(百川AI)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 SIRA通过内部构建对比参考减少视觉语言模型的幻觉,无需外部工具或额外计算,保持描述覆盖并降低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14893 2026-05-15 cs.CV cs.AI cs.LG 62%

Your CLIP has 164 dimensions of noise: Exploring the embeddings covariance eigenspectrum of contrastively pretrained vision-language transformers

你的CLIP有164个噪声维度:探索对比性预训练视觉-语言变换器的嵌入协方差特征谱

Jakub Grzywaczewski, Dawid Płudowski, Przemysław Biecek

机构 * Warsaw University of Technology(华沙技术大学) Centre for Credible Artificial Intelligence(可信人工智能中心) University of Warsaw(华沙大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过协方差矩阵谱分解,揭示对比预训练VLMs的潜在空间中多模态噪声结构,发现去除共享噪声维度对下游任务性能无害,提供对现代VLMs表征结构的新见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06202 2026-05-15 cs.CV cs.AI 62%

LoRA in LoRA: Towards Parameter-Efficient Architecture Expansion for Continual Visual Instruction Tuning

LoRA in LoRA: 朝着参数高效架构扩展的方向:持续视觉指令微调

Chang Che, Ziqi Wang, Pengwan Yang, Qi Wang, Hui Ma, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) University of Amsterdam(阿姆斯特丹大学) Tsinghua University(清华大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LiLoRA,一种高效的持续视觉指令微调架构扩展方法,通过共享LoRA矩阵A、低秩分解矩阵B以及余弦正则化损失,提升参数效率和任务学习性能。

Comments AAAI 2026 Oral Presentation. 9 pages

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(24):19978--19986, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04657 2026-05-15 cs.CV 57%

TRIO: Token Reduction via Inference-Objective Guidance for Efficient Vision-Language Models

TRIO: 通过推理目标引导的令牌缩减以提高视觉-语言模型的效率

Haokui Zhang, Congyang Ou, Dawei Yan, Peng Wang, Qingsen Yan, Yu Zhang, Ying Li, Rong Xiao

机构 * School of Cyberspace Security, Northwestern Polytechnical University(网络安全学院,西北工业大学) School of Computer Science, Northwestern Polytechnical University(计算机学院,西北工业大学) Intellifusion(智融科技)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 TRIO从推理目标角度出发,通过梯度显著性指导视觉令牌压缩,保留输出不变性,提升视觉-语言模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏