arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-07 至 2026-04-07 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 6 篇

2505.22095 2026-04-07 cs.CL 83%

Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation

基于推理引导的多模态知识利用的检索专家混合

Chunyi Peng, Zhipeng Xu, Zhenghao Liu, Yishan Li, Yukun Yan, Shuo Wang, Yu Gu, Minghe Yu, Ge Yu, Maosong Sun

机构 * Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL

AI总结 本文提出MoRE框架,通过动态选择检索专家提升多模态大语言模型的知识利用效率,实验表明在开放领域问答基准上性能提升超过7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03666 2026-04-07 cs.IR 78%

MMP-Refer: Multimodal Path Retrieval-augmented LLMs For Explainable Recommendation

MMP-Refer: 多模态路径检索增强的可解释推荐LLM

Xiangchen Pan, Wei Wei

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 MMP-Refer通过多模态路径检索增强LLM,提升推荐系统的可解释性,采用联合残差编码获取多模态嵌入,并设计启发式搜索算法获取检索路径,通过轻量级协作适配器映射图编码至LLM语义空间,提升交互信息理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22783 2026-04-07 cs.IR cs.CV cs.LG cs.MM cs.SD 62%

Compact Hypercube Embeddings for Fast Text-based Wildlife Observation Retrieval

紧凑超立方体嵌入用于快速基于文本的野生动物观察检索

Ilyass Moummad, Marius Miron, David Robinson, Kawtar Zaher, Hervé Goëau, Olivier Pietquin, Pierre Bonnet, Emmanuel Chemla, Matthieu Geist, Alexis Joly

机构 * Inria, LIRMM, UM(法国国家信息与自动化研究所,蒙彼利埃计算机科学实验室,蒙彼利埃大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出紧凑超立方体嵌入框架,通过二进制表示实现高效文本检索,提升大规模野生动物图像和音频数据库的检索效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03039 2026-04-07 cs.CV 57%

GenSmoke-GS: A Multi-Stage Method for Novel View Synthesis from Smoke-Degraded Images Using a Generative Model

GenSmoke-GS:一种基于生成模型的多阶段方法,用于从烟雾退化图像中生成新视角

Qida Cao, Xinyuan Hu, Changyue Shi, Jiajun Ding, Zhou Yu, Jun Yu

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院)

专题命中 跨模态检索 :MLLM(abstract);分类 cs.CV

AI总结 本文提出GenSmoke-GS方法,通过多阶段流程提升烟雾退化图像的可视性,减少场景内容变化,实验表明其在定量和视觉质量上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04175 2026-04-07 cs.LG 50%

Uncertainty-Aware Foundation Models for Clinical Data

具有不确定性的临床数据基础模型

Qian Zhou, Yuanyun Zhang, Shi Li

机构 * University of the Chinese Academy of Sciences(中国科学院大学) Columbia University(哥伦比亚大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出一种考虑不确定性的临床数据基础模型框架,通过学习集合值表示并强制一致性,提升预测性能和数据缺失下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00681 2026-04-07 cs.SD cs.IR cs.LG 50%

Audio-to-Image Bird Species Retrieval without Audio-Image Pairs via Text Distillation

无需音频图像对的音频到图像鸟类物种检索:通过文本蒸馏

Ilyass Moummad, Marius Miron, Lukas Rauch, David Robinson, Alexis Joly, Olivier Pietquin, Emmanuel Chemla, Matthieu Geist

机构 * Inria, LIRMM, Université de Montpellier(法国国家信息与自动化研究所,蒙彼利埃计算机科学、机器人学与微电子学实验室,蒙彼利埃大学) University of Kassel(卡塞尔大学)

专题命中 跨模态检索 :image-text(abstract)

AI总结 本文提出无需音频图像配对的音频到图像检索方法,通过文本作为语义中介,利用预训练图像文本模型蒸馏出音频文本模型,实现音频与图像表示的对齐,从而在数据稀缺的生物声学场景中有效进行物种识别。

详情

展开后加载摘要…

URL PDF HTML 收藏