arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-28 至 2026-04-28 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 11 篇

2508.05318 2026-04-28 cs.CV cs.AI 86%

mKG-RAG: Leveraging Multimodal Knowledge Graphs in Retrieval-Augmented Generation for Knowledge-intensive VQA

mKG-RAG:利用多模态知识图谱在检索增强生成中进行知识密集型视觉问答

Xu Yuan, Liangbo Ning, Qingqing Ye, Wenqi Fan, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出mKG-RAG框架,通过整合多模态知识图谱提升检索增强生成在知识密集型视觉问答中的性能,采用双阶段检索策略和图提取方法构建高质量知识图谱,实验表明优于现有方法。

Comments In Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR'26), July 20-24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23323 2026-04-28 cs.CL cs.SD 83%

Robust Audio-Text Retrieval via Cross-Modal Attention and Hybrid Loss

通过跨模态注意力和混合损失实现鲁棒的音频-文本检索

Meizhu Liu, Matthew Rowe, Amit Agarwal, Michael Avendi, Yassi Abbasi, Hitesh Laxmichand Patel, Paul Li, Kyu J. Han, Tao Sheng, Sujith Ravi, Dan Roth

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 本文提出一种新的多模态检索框架,通过跨模态嵌入细化模块和混合损失函数提升音频与文本检索的鲁棒性,有效处理长音频和噪声。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23281 2026-04-28 cs.LG cs.CV 83%

Contrastive Learning for Multimodal Human Activity Recognition with Limited Labeled Data

基于有限标记数据的多模态人类活动识别对比学习

Long Jing, Zhixiong Yang, Yajun Zhang, Xinlong Feng

机构 * College of Computer Science, Northwest University(西北大学计算机学院) Xinjiang University(新疆大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出CLMM框架,通过两阶段训练策略提升有限标记数据下的多模态人类活动识别性能,实验表明在三个公开数据集上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24029 2026-04-28 cs.CV cs.CL cs.IR cs.MM 82%

DeepTaxon: An Interpretable Retrieval-Augmented Multimodal Framework for Unified Species Identification and Discovery

DeepTaxon: 一种可解释的检索增强多模态框架,用于统一的物种识别与发现

Jiawei Wang, Ming Lei, Yaning Yang, Xinyan Lin, Yuquan Le, Qiwei Ma, Zhiwei Xu, Zheqi Lv, Yuchen Ang, Zhe Quan, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Hunan University(湖南大学) Xiangtan University(湘潭大学) Hunan Normal University(湖南师范大学) Zhejiang University(浙江大学) Cornell University(康奈尔大学) Meituan(美团)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 DeepTaxon通过可解释的检索增强多模态框架,统一物种识别与发现,通过检索证据进行链式推理,提升识别和发现的准确性与可解释性。

Comments 13 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23195 2026-04-28 cs.CV cs.AI 81%

AnalogRetriever: Learning Cross-Modal Representations for Analog Circuit Retrieval

AnalogRetriever: 为模拟电路检索学习跨模态表示

Yihan Wang, Lei Li, Yao Lai, Jing Wang, Yan Lu

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Cambridge(剑桥大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出AnalogRetriever,通过构建高质量数据集和三模态检索框架,实现跨模态的模拟电路检索,实验表明其在六个方向上的Recall@1达到75.2%,显著优于现有方法。

Comments 10 pages, 7 figures. Yihan Wang and Lei Li contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22885 2026-04-28 cs.CV cs.AI 81%

Federated Cross-Modal Retrieval with Missing Modalities via Semantic Routing and Adapter Personalization

联邦跨模态检索与缺失模态的语义路由和适配器个性化

Hefeng Zhou, Xuan Liu, Sicheng Chen, Wutong Zhang, Wu Yan, Jiong Lou, Chentao Wu, Guangtao Xue, Wei Zhao, Jie Li

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-鲁克桑克鲁特研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室) Shanghai Jiao Tong University(上海交通大学) Hohai University(河海大学) Shaanghai Jiao Tong University(上海交通大学)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出RCSR框架,通过语义路由和适配器个性化解决联邦跨模态检索中异构数据和缺失模态的问题,提升全局检索准确性和训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23522 2026-04-28 cs.IR cs.MM 79%

Beyond Static Collision Handling: Adaptive Semantic ID Learning for Multimodal Recommendation at Industrial Scale

超越静态碰撞处理:面向工业级多模态推荐的自适应语义ID学习

Yongsen Pan, Yuxin Chen, Zheng Hu, Xu Yuan, Daoyuan Wang, Yuting Yin, Songhao Ni, Hongyang Wang, Jun Wang, Fuji Ren, Wenwu Ou

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出AdaSID框架,通过两阶段过程自适应处理多模态推荐中的语义ID碰撞问题,提升召回率和NDCG,并在工业场景中取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20291 2026-04-28 cs.CV cs.CL 62%

VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval

VisRet:可视化改进知识密集型文本到图像检索

Di Wu, Yixin Wan, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 VisRet通过将文本查询投影到图像模态,提升跨模态检索效果,优于传统方法,在四个基准测试中提升nDCG@30,并提高下游问答准确性。

Comments ACL 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24469 2026-04-28 cs.IR cs.CV 57%

Geometric Analysis of Self-Supervised Vision Representations for Semantic Image Retrieval

视觉语义图像检索中自监督表示的几何分析

Esteban Rodríguez-Betancourt, Edgar Casasola-Murillo

机构 * Universidad de Costa Rica(哥斯达黎加大学)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 研究评估现代自监督学习方法在图像检索中的表现,发现高各向异性表示会损害基于分区和哈希的搜索性能,而更各向同性表示能提升语义检索效果。

Comments 8 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22755 2026-04-28 cs.IR cs.AI 57%

RADIANT-LLM: an Agentic Retrieval Augmented Generation Framework for Reliable Decision Support in Safety-Critical Nuclear Engineering

RADIANT-LLM:一种用于安全关键核工程中可靠决策支持的代理检索增强生成框架

Zavier Ndum Ndum, Jian Tao, John Ford, Mansung Yim, Yang Liu

机构 * Department of Nuclear Engineering, Texas A\&M University, College Station, TX, USA College of Performance, Visualization Fine Arts, Texas A\&M University, College Station, TX, USA

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出RADIANT-LLM框架,通过多模态检索增强生成技术,结合领域知识库和代理层,提升核工程中的决策支持准确性与透明度,降低幻觉风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16730 2026-04-28 cs.LG cs.AI stat.AP 57%

"Noisier" Noise Contrastive Eestimation is (Almost) Maximum Likelihood

更嘈杂的噪声对比估计几乎等同于最大似然估计

Peiyu Yu, Dinghuai Zhang, Hengzhi He, Xiaojian Ma, Sirui Xie, Ruiyao Miao, Yifan Lu, Yasi Zhang, Deqian Kong, Ruiqi Gao, Jianwen Xie, Guang Cheng, Ying Nian Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Mila - Quebec AI Institute(魁北克人工智能研究所) Google DeepMind(谷歌DeepMind) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Akool Research(Akool研究)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出'Noisier' NCE,通过增大噪声幅度使NCE梯度接近最大似然估计,从而在理论和实践中实现更快收敛,适用于高维和多模态数据集的密度比估计。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏