arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-08 至 2026-05-08 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 8 篇

2605.05909 2026-05-08 cs.AI 91%

Null Space Constrained Contrastive Visual Forgetting for MLLM Unlearning

空域约束对比遗忘用于MLLM反学习

Yuhang Wang, Zhenxing Niu, Haoxuan Ji, Guangyu He, Linlin Zhang, Haichang Gao

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Xi’an Jiaotong University(西安交通大学)

专题命中 跨模态检索 :MLLM(title,title_cn);multimodal(abstract);分类 cs.AI

AI总结 本文提出一种MLLM反学习方法,通过冻结LLM主干并微调视觉模块,在保留非目标视觉知识和全部文本知识的同时,有效遗忘目标视觉知识。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05834 2026-05-08 cs.LG 85%

Hidden in the Multiplicative Interaction: Uncovering Fragility in Multimodal Contrastive Learning

乘积交互中的隐藏问题:揭示多模态对比学习中的脆弱性

Tillmann Rheude, Stefan Hegselmann, Roland Eils, Benjamin Wild

机构 * Berlin Institute of Health, Charité - Universitätsmedizin Berlin(柏林健康研究所,柏林查理医院) Intelligent Medicine Institute, Fudan University(智能医学研究院,复旦大学) Department of Mathematics and Computer Science, Freie Universität Berlin(数学与计算机科学系,柏林自由大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract)

AI总结 本文提出Gated Symile,通过引入对比门机制,解决多模态对比学习中因单个模态信息不足、错位或缺失导致的脆弱性问题,提升检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05594 2026-05-08 cs.CL cs.CV cs.LG 81%

The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation

上下文的成本:减轻多模态检索增强生成中的文本偏差

Hoin Jung, Xiaoqian Wang

机构 * Elmore Family School of Electrical and Computer Engineering(埃尔莫夫家族电气与计算机工程学院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文探讨了多模态大语言模型在整合检索增强生成时出现的文本偏差问题,提出BAIR方法通过恢复视觉显著性并施加位置感知惩罚来提升多模态接地和诊断可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05572 2026-05-08 cs.CV 70%

Text-to-CAD Retrieval: a Strong Baseline

基于文本的CAD检索:一个强大的基线

Honghu Pan, Zibo Du, Daxiang Liu, Chengliang Liu, Xiaoling Luo

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) College of Computer Science and Software Engineer, Shenzhen University(深圳大学计算机科学与软件工程学院) Faculty of Science and Technology, University of Macau(澳门大学科学与技术学院)

专题命中 跨模态检索 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出文本到CAD检索任务,通过多模态嵌入框架实现CAD模型的语义检索,为下游CAD生成奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06012 2026-05-08 cs.CV cs.AI 62%

T2I-VeRW: Part-level Fine-grained Perception for Text-to-Image Vehicle Retrieval

T2I-VeRW: 基于部件级细粒度感知的文本到图像车辆检索

Xiao Wang, Ziwen Wang, Weizhe Kong, Wentao Wu, Yuehang Li, Aihua Zheng, Chenglong Li, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PFCVR模型,通过部件级局部对齐和双向掩码恢复模块实现文本到图像的车辆检索,构建了新的大规模数据集T2I-VeRW,实验结果显示PFCVR在两个基准数据集上均取得优异的检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06245 2026-05-08 cs.MM 57%

Modality-Aware Contrastive and Uncertainty-Regularized Emotion Recognition

模态感知的对比学习与不确定性正则化情绪识别

Yan Zhuang, Minhao Liu, Yanru Zhang, Jiawen Deng, Fuji Ren

专题命中 跨模态检索 :multimodal(abstract);分类 cs.MM

AI总结 本文提出MCUR框架,通过表征一致性方法提升多模态情绪识别的鲁棒性,采用模态组合对比学习和样本级不确定性正则化,实验表明在MOSI、MOSEI和IEMOCAP数据集上均取得显著提升。

Comments 24 pages, 6 figures and 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24909 2026-05-08 cs.LG cs.CE 50%

Contrastive Image-Metadata Pre-Training for Materials Transmission Electron Microscopy

对比图像-元数据预训练用于材料透射电子显微镜

Georgia Channing, Debora Keller, Marta D. Rossell, Philip Torr, Stig Helveg, Henrik Eliasson

机构 * Hugging Face University of Oxford(牛津大学) Empa Dübendorf(Empa杜宾根) Technical University of Denmark(丹麦技术大学)

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 本文提出CIMP模型,通过对比图像与元数据实现对低剂量图像的去噪,实验表明其在去噪效果上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12941 2026-05-08 cs.IR 50%

JARVIS: An Evidence-Grounded Retrieval System for Interpretable Deceptive Reviews Adjudication

JARVIS:一种基于证据的可解释欺骗性评论裁决检索系统

Nan Lu, Leyang Li, Yurong Hu, Rui Lin, Shaoyi Xu

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出JARVIS框架,通过混合密集-稀疏多模态检索和证据图结构,提升可解释性欺骗性评论裁决的精度和召回率,实验显示其在精度和召回率上均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏