arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-09 至 2026-04-09 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 7 篇

2604.07201 2026-04-09 cs.IR cs.CV 83%

BRIDGE: Multimodal-to-Text Retrieval via Reinforcement-Learned Query Alignment

BRIDGE:通过强化学习查询对齐实现多模态到文本检索

Mohamed Darwish Mounis, Mohamed Mahmoud, Shaimaa Sedek, Mahmoud Abdalla, Mahmoud SalahEldin Kasem, Abdelrahman Abdallah, Hyun-Soo Kang

机构 * High institute for computer & information systems(高等计算机与信息系统学院) Chungbuk National University(忠北大学) Assiut University(艾斯尤特大学) University of Innsbruck(因斯布鲁克大学)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 BRIDGE通过强化学习查询对齐模型和增强神经搜索检索器,解决多模态查询在文本库中的检索问题,实现优于多模态编码器的nDCG@10性能。

Comments Accepted at CVPR 2026 Workshop GRAIL-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05268 2026-04-09 cs.CV cs.AI cs.CL 82%

Region-R1: Reinforcing Query-Side Region Cropping for Multi-Modal Re-Ranking

Region-R1: 增强多模态重排序的查询侧区域裁剪

Chan-Wei Hu, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Region-R1通过在重排序阶段引入区域裁剪机制,提升多模态重排序的鲁棒性,实验表明其在E-VQA和InfoSeek基准上显著提升召回率。

Comments 12 pages, 4 figures, accepted to ACL 2026 Findings, code available at https://github.com/taco-group/Region-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06179 2026-04-09 cs.IR cs.CL 79%

ARIA: Adaptive Retrieval Intelligence Assistant -- A Multimodal RAG Framework for Domain-Specific Engineering Education

ARIA:自适应检索智能助手——面向领域特定工程教育的多模态RAG框架

Yue Luo, Dibakar Roy Sarkar, Rachel Herring Sangree, Somdatta Goswami

机构 * Dalian University of Technology(大连理工大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 ARIA通过多模态内容提取管道和e5-large-v2模型,实现领域特定工程教育的智能教学助手,展现高精度和教学一致性,验证了其在课程相关问题上的高准确率和响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29441 2026-04-09 cs.CV 79%

EarthEmbeddingExplorer: A Web Application for Cross-Modal Retrieval of Global Satellite Images

地球嵌入探索器:一种用于全球卫星图像跨模态检索的Web应用

Yijie Zheng, Weijie Wu, Bingyue Wu, Long Zhao, Guoqing Li, Mikolaj Czerkawski, Konstantin Klemmer

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences(中国科学院地理科学与资源研究所) Asterisk Labs(Asterisk实验室) LGND AI, Inc.(LGND AI公司) University College London(伦敦大学学院)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文介绍EarthEmbeddingExplorer,一种Web应用,通过跨模态查询实现全球卫星图像的动态检索,帮助研究人员将研究成果转化为实际应用。

Comments ICLR 2026 Workshop ML4RS Tutorial Track (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07079 2026-04-09 cs.IR 78%

MARVEL: Multimodal Adaptive Reasoning-intensiVe Expand-rerank and retrievaL

MARVEL:多模态自适应推理-增强扩展-排序和检索

Mahmoud SalahEldin Kasem, Mohamed Mahmoud, Mostafa Farouk Senussi, Mahmoud Abdalla, Abdelrahman Abdallah, Hyun-Soo Kang

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出MARVEL框架,通过统一的扩展-检索-排序流程,结合LLM驱动的查询扩展、增强推理的密集检索器和基于GPT-4o的逐步推理排序,提升了多模态检索性能,在MM-BRIGHT基准上实现了37.9nDCG@10的高分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07220 2026-04-09 cs.IR 78%

HIVE: Query, Hypothesize, Verify An LLM Framework for Multimodal Reasoning-Intensive Retrieval

HIVE:一种用于多模态推理密集检索的LLM框架

Mahmoud Abdalla, Mahmoud SalahEldin Kasem, Mohamed Mahmoud, Mostafa Farouk Senussi, Abdelrahman Abdallah, Hyun-Soo Kang

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 HIVE通过引入LLM进行显式视觉-文本推理,提升多模态检索效果,达到41.7的nDCG@10,优于现有文本和多模态模型。

Comments accepted at CVPR 2026 Workshop GRAIL-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15623 2026-04-09 cs.CV 70%

PCSR: Pseudo-label Consistency-Guided Sample Refinement for Noisy Correspondence Learning

PCSR:基于伪标签一致性的样本细化用于噪声对应学习

Zhuoyao Liu, Yang Liu, Wentao Feng, Shudong Huang

专题命中 跨模态检索 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出PCSR框架,通过伪标签一致性提升对应可靠性,解决噪声对应问题,提升检索鲁棒性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏