arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3454 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3454 篇

2606.08979 2026-06-09 cs.IR 新提交 78%

EviProp: Seeded Relevance Diffusion on Chunk-Page Graphs for Long Multimodal Document Retrieval

EviProp: 基于种子相关性扩散的块-页图用于长多模态文档检索

Hongwei Zhang, Xiaoman Wang, Zehui Ling, Ruicheng Zhu, Yue Zhang, Pinlong Cai, Fuke Shen, Botian Shi, Tongquan Wei, Guohang Yan

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 提出EviProp方法,通过构建多模态块-页图并利用个性化PageRank扩散相关性,解决长文档中证据页检索的独立匹配局限,提升检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07252 2026-06-09 cs.IR 新提交 78%

Constrained Dominant Sets for Multimodal Document Question Answering

约束主导集用于多模态文档问答

Ambuj Mehrish, Sebastiano Vascon

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 提出基于查询增强亲和图的约束主导集检索方法,通过谱边界自动平衡相关性与冗余性,利用复制动态实现全局均衡,无需训练,在多模态文档问答中取得新最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07235 2026-06-09 cs.IR cs.LG 版本更新 78%

FLOWREADER: Min-Cost Flow Optimization for Multi-Modal Long Document Q&A

FLOWREADER: 多模态长文档问答的最小成本流优化

Ambuj Mehrish, Sebastiano Vascon

机构 * Ca’ Foscari University of Venice(威尼斯卡布里亚大学)

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract)

AI总结 提出FLOWREADER,将多模态长文档中的证据组装建模为最小成本流问题,通过统一评分向量控制源选择、汇选择和边成本,在碎片化证据场景下优于top-k检索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29956 2026-05-29 cs.IR 78%

Uncertainty Quantification for Multimodal Retrieval Augmented Generation

多模态检索增强生成的不确定性量化

Simon Binz, Heydar Soudani, Faegheh Hasibi

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 提出 LeMUQ 方法,通过多模态和检索感知的概率信号建模不确定性,提升多模态 RAG 系统的可靠性,AUROC 平均提升 3.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22073 2026-05-22 cs.IR 78%

Behavior-Guided Candidate Calibration for Multimodal Recommendation

基于行为的候选校准用于多模态推荐

Zesheng Li, Chengchang Pan, Honggang Qi

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出了一种基于行为的候选校准方法,通过将训练-only的共用户重叠转换为带符号的候选证据,并仅应用于多模态骨干网络生成的短名单,以提高多模态推荐系统的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18835 2026-05-20 cs.LG 78%

StampFormer: A Physics-Guided Material-Geometry-Coupled Multimodal Model for Rapid Prediction of Physical Fields in Sheet Metal Stamping

StampFormer: 一种基于物理的材料-几何耦合多模态模型,用于快速预测冲压板料的物理场

Jiajie Luo, Mohamed Mohamed, Osama Hassan, Haosu Zhou, Yingxue Zhao, Haoran Li, Xinrun Li, Zhutao Shao, Yang Long, Nan Li, Jichun Li

机构 * Dyson School of Design Engineering, Imperial College London(帝国理工学院设计工程学院) School of Computing, Newcastle University(新castle大学计算机学院) Department of Computing, Imperial College London(帝国理工学院计算系) Multi-X Solution Limited(Multi-X解决方案有限公司) Department of Computer Science, Durham University(达勒姆大学计算机科学系) Department of Mechanical Engineering, Faculty of Engineering, Helwan University(Helwan大学工程学院机械工程系)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出StampFormer模型,通过结合材料和几何信息,实现对冲压板料物理场的快速准确预测,从而提高设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11010 2026-05-20 cs.IR cs.DL 78%

GovScape: A Public Multimodal Search System for 70 Million Pages of Government PDFs

GovScape:一个公共的多模态搜索系统,用于7000万页的政府PDF文件

Ying-Hsiang Huang, Claire Gong, Shreya Shaji, Alison Yan, Leslie Harka, Albert Du, Anjali Gopal, Samuel J Klein, Shannon Zejiang Shen, Mark Phillips, Trevor Owens, Kyle Deeds, Benjamin Charles Germain Lee

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出GovScape,一个支持多模态搜索的公共系统,用于搜索7000万页的政府PDF文件,展示了其在大规模PDF数据处理中的高效性和可扩展性。

Comments 11 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16999 2026-05-19 cs.LG 78%

Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning

基于排名的校准:可靠多模态强化学习

Peng Cui, Boyao Yang, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, BNRist Center, Tsinghua-Bosch Joint ML Center, THBI Lab, Tsinghua University, Beijing(计算机科学与技术系,人工智能研究院,BNRist中心,清华大学-博世联合机器学习中心,THBI实验室,清华大学,北京) Dept. of Automation, Tsinghua University, Beijing(自动化系,清华大学,北京)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出Ranking-Aware Calibration方法,通过利用组内强化学习自然产生的比较信号,提升多模态强化学习的校准能力,从而提高任务准确性和校准效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14113 2026-05-15 cs.CR cs.IR 78%

Adversarial Hubness in Multi-Modal Retrieval

多模态检索中的对抗性Hub现象

Tingwei Zhang, Fnu Suya, Rishi Jha, Collin Zhang, Vitaly Shmatikov

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 本文研究了攻击者如何利用Hub现象在多模态检索系统中生成对抗性Hub,通过实验展示对抗性Hub在大量查询中的高召回率,并发现传统缓解自然Hub的方法对对抗性Hub无效。

Comments in IEEE S&P 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14156 2026-05-15 cs.LG 78%

Uncovering Trajectory and Topological Signatures in Multimodal Pediatric Sleep Embeddings

揭示多模态儿童睡眠嵌入中的轨迹和拓扑特征

Scott Ye, Harlin Lee

机构 * Department of Radiology(放射科) University of California San Francisco(加州大学旧金山分校) UNC–Chapel Hill(北卡罗来纳大学教堂山分校) UNC School of Data Science and Society(北卡罗来纳大学教堂山分校数据科学与社会学院)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文研究多模态掩码自编码器生成的儿童睡眠嵌入中包含的会话级诊断信息,通过结合PHATE坐标、持久同调和EHR数据,发现几何、拓扑和临床特征互补提升预测性能,尤其在极端不平衡情况下提升校准和鲁棒性。

Comments Accepted to ML4H 2025, 20 pages, 6 figures

Journal ref Proceedings of the Fifth Machine Learning for Health Symposium, PMLR 297:1392-1411, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05955 2026-05-12 cs.DC 78%

Multi-Modal Style Transfer-based Prompt Tuning for Efficient Federated Domain Generalization

基于多模态风格迁移的提示微调的高效联邦领域泛化

Yuliang Chen, Xi Lin, Jun Wu, Xiangrui Cai, Qiaolun Zhang, Xichun Fan, Jiapeng Xu, Xiu Su

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 本文提出FaST-PT框架,通过多模态风格迁移和双提示模块实现高效联邦领域泛化,提升跨领域适应能力。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(25): 20427-20435, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00670 2026-05-04 cs.IR cs.SI 78%

Robust Multimodal Recommendation via Graph Retrieval-Enhanced Modality Completion

通过图检索增强的模态完成实现鲁棒的多模态推荐

Yuan Li, Jun Hu, Jiaxin Jiang, Bryan Hooi, Bingsheng He

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出GRE-MC框架,通过图检索增强模态完成,解决多模态数据不完整问题,提升推荐系统鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19176 2026-04-23 cs.LG cs.IR 78%

From Raw Features to Effective Embeddings: A Three-Stage Approach for Multimodal Recipe Recommendation

从原始特征到有效嵌入:一种多模态食谱推荐的三阶段方法

Jeeho Shin, Kyungho Kim, Kijung Shin

机构 * KAIST(韩国科学技术院)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出TESMR三阶段框架,通过内容、关系和学习增强多模态特征,提升食谱推荐性能,实验表明其在Recall@10上比现有方法高7-15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19267 2026-04-22 cs.RO 78%

Multimodal embodiment-aware navigation transformer

多模态具身感知导航Transformer

Louis Dezons, Quentin Picard, Rémi Marsal, François Goulette, David Filliat

机构 * LARIAD

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出ViLiNT,通过融合多模态数据提升机器人导航鲁棒性,利用Transformer和扩散模型生成可导航路径,实现在不同环境中导航成功率提升166%。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18965 2026-04-22 eess.SY cs.SY 78%

Transformer Architecture with Minimal Inference Latency for Multi-Modal Wireless Networks

具有最小推理延迟的多模无线网络变压器架构

Minsu Kim, Walid Saad, Kui Wang, Zongdian Li, Tao Yu, Kei Sakaguchi

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 本文提出一种快速多模变压器推理框架,通过仅处理重要令牌来支持无线通信任务,减少推理延迟和内存消耗,同时保持任务精度。

Comments Under minor revision, IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07079 2026-04-09 cs.IR 78%

MARVEL: Multimodal Adaptive Reasoning-intensiVe Expand-rerank and retrievaL

MARVEL:多模态自适应推理-增强扩展-排序和检索

Mahmoud SalahEldin Kasem, Mohamed Mahmoud, Mostafa Farouk Senussi, Mahmoud Abdalla, Abdelrahman Abdallah, Hyun-Soo Kang

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出MARVEL框架,通过统一的扩展-检索-排序流程,结合LLM驱动的查询扩展、增强推理的密集检索器和基于GPT-4o的逐步推理排序,提升了多模态检索性能,在MM-BRIGHT基准上实现了37.9nDCG@10的高分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07220 2026-04-09 cs.IR 78%

HIVE: Query, Hypothesize, Verify An LLM Framework for Multimodal Reasoning-Intensive Retrieval

HIVE:一种用于多模态推理密集检索的LLM框架

Mahmoud Abdalla, Mahmoud SalahEldin Kasem, Mohamed Mahmoud, Mostafa Farouk Senussi, Abdelrahman Abdallah, Hyun-Soo Kang

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 HIVE通过引入LLM进行显式视觉-文本推理,提升多模态检索效果,达到41.7的nDCG@10,优于现有文本和多模态模型。

Comments accepted at CVPR 2026 Workshop GRAIL-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05462 2026-04-08 stat.ML cs.LG math.ST stat.TH 78%

Hierarchical Contrastive Learning for Multimodal Data

多模态数据的层次对比学习

Huichao Li, Junhan Yu, Doudou Zhou

机构 * University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出层次对比学习框架,通过统一模型学习全局共享、部分共享和模态特定的表示,解决多模态数据中部分共享因素的建模问题,提升预测性能。

Comments 34 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03666 2026-04-07 cs.IR 78%

MMP-Refer: Multimodal Path Retrieval-augmented LLMs For Explainable Recommendation

MMP-Refer: 多模态路径检索增强的可解释推荐LLM

Xiangchen Pan, Wei Wei

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 MMP-Refer通过多模态路径检索增强LLM,提升推荐系统的可解释性,采用联合残差编码获取多模态嵌入,并设计启发式搜索算法获取检索路径,通过轻量级协作适配器映射图编码至LLM语义空间,提升交互信息理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06393 2026-04-03 cs.IR 78%

MuCo: Multi-turn Contrastive Learning for Multimodal Embedding Model

MuCo:多轮对比学习用于多模态嵌入模型

Geonmo Gu, Byeongho Heo, Jaemyung Yu, Jaehui Hwang, Taekyung Kim, Sangmin Lee, HeeJae Jun, Yoohoon Kang, Sangdoo Yun, Dongyoon Han

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出MuCo,一种基于对话的多轮对比学习框架,通过多轮查询-目标对提升多模态嵌入模型的训练效率和表征一致性。

Comments CVPR 2026 camera-ready; 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11750 2026-03-17 q-bio.QM cs.LG 78%

PRISM: Enhancing Protein Inverse Folding through Fine-Grained Retrieval on Structure-Sequence Multimodal Representations

PRISM:通过结构-序列多模态表示的细粒度检索增强蛋白质反向折叠

Sazan Mahbub, Souvik Kundu, Eric P. Xing

机构 * Carnegie Mellon University(卡内基梅隆大学) GenBio AI(基因组生物人工智能) Intel(英特尔)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 PRISM通过结构-序列多模态表示的细粒度检索提升蛋白质反向折叠性能,结合混合自交叉注意力解码器,实现更高效的序列生成与折叠预测。

Comments Published as a conference paper at International Conference on Learning Representation (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05641 2026-03-09 cs.RO cs.HC 78%

RFM-HRI : A Multimodal Dataset of Medical Robot Failure, User Reaction and Recovery Preferences for Item Retrieval Tasks

RFM-HRI : 一项医疗机器人故障、用户反应和恢复偏好的多模态数据集用于物品检索任务

Yashika Batra, Giuliano Pioldi, Promise Ekpo, Arman Sayatqyzy, Purnjay Maruur, Shalom Otieno, Kevin Ching, Angelique Taylor

机构 * Cornell University, Cornell Tech(康奈尔大学,康奈尔科技)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 RFM-HRI数据集通过多模态数据研究医疗机器人故障下的用户反应与恢复偏好,揭示故障对情感和控制的影响,并为安全关键场景的故障恢复提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02695 2026-03-04 cs.LG 78%

Addressing Missing and Noisy Modalities in One Solution: Unified Modality-Quality Framework for Low-quality Multimodal Data

解决缺失和噪声模态:统一的模态质量框架用于低质量多模态数据

Sijie Mai, Shiqin Han, Haifeng Hu

机构 * Department of Computer Science(计算机科学系) South China Normal University(华南师范大学) School of Electronics and Information Technology(电子与信息学院) Sun Yat-sen University(中山大学)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出统一的模态质量框架,通过联合处理缺失和噪声模态,提升低质量多模态数据的模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01590 2026-03-03 cs.IR cs.LG 78%

IDProxy: Cold-Start CTR Prediction for Ads and Recommendation at Xiaohongshu with Multimodal LLMs

IDProxy:小红书广告与推荐中基于多模态大语言模型的冷启动CTR预测

Yubin Zhang, Haiming Xu, Guillaume Salha-Galvan, Ruiyan Han, Feiyang Xiao, Yanhua Huang, Li Lin, Yang Luo, Yao Hu

机构 * Xiaohongshu Inc.(小红书公司) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 IDProxy通过多模态大语言模型生成代理嵌入,解决广告和推荐系统中物品冷启动的CTR预测问题,实现与现有嵌入空间的对齐和端到端优化,已在小红书大规模应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04724 2026-02-27 q-bio.QM cs.LG 78%

Understanding protein function with a multimodal retrieval-augmented foundation model

通过多模态检索增强基础模型理解蛋白质功能

Timothy Fei Truong, Tristan Bepler

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 PoET-2通过多模态检索增强方法提升蛋白质功能理解与预测能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19987 2026-02-24 cs.LG cs.IR 78%

Counterfactual Understanding via Retrieval-aware Multimodal Modeling for Time-to-Event Survival Prediction

基于检索感知多模态建模的反事实理解用于生存预测

Ha-Anh Hoang Nguyen, Tri-Duc Phan Le, Duc-Hoang Pham, Huy-Son Nguyen, Cam-Van Thi Nguyen, Duc-Trong Le, Hoang-Quynh Le

机构 * University of Engineering and Technology(工程大学) Hanoi Vietnam National University(河内越南国家大学) Delft University of Technology(代尔夫特理工大学)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 CURE通过多模态建模和潜在子组检索提升生存预测,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13345 2026-02-17 cs.LG cs.IR cs.MA 78%

BLUEPRINT Rebuilding a Legacy: Multimodal Retrieval for Complex Engineering Drawings and Documents

BLUEPRINT 重筑遗产:面向复杂工程图纸和文档的多模态检索

Ethan Seefried, Ran Eldegaway, Sanjay Das, Nathaniel Blanchard, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(橡树岭国家实验室) Colorado State University(科罗拉多州立大学)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 Blueprint通过布局感知的多模态检索系统,提升对复杂工程图纸和文档的自动化检索能力,实现结构化元数据生成与跨设施搜索效率提升。

Comments 20 pages 8 main + 12 appendix + references

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13179 2026-02-16 cs.IR 78%

Fix Before Search: Benchmarking Agentic Query Visual Pre-processing in Multimodal Retrieval-augmented Generation

在搜索前修复:多模态检索增强生成中代理查询视觉预处理的基准测试

Jiankun Zhang, Shenglai Zeng, Kai Guo, Xinnan Dai, Hui Liu, Jiliang Tang, Yi Chang

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出V-QPP-Bench,通过代理决策任务评估视觉查询预处理的改进,揭示视觉不完美对检索性能的严重影响及训练方法的优化潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04263 2026-02-05 cs.IR 78%

LILaC: Late Interacting in Layered Component Graph for Open-domain Multimodal Multihop Retrieval

LILaC:基于分层组件图的开放域多模态多跳检索中的后期交互

Joohyung Yun, Doyup Lee, Wook-Shin Han

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 LILaC通过分层组件图和后期交互子图检索方法,提升开放域多模态多跳检索的精度与效率。

Comments Project page: https://lilac-emnlp2025.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03713 2026-02-04 cs.IR 78%

Multimodal Generative Recommendation for Fusing Semantic and Collaborative Signals

多模态生成推荐:融合语义和协同信号

Moritz Vandenhirtz, Kaveh Hassani, Shervin Ghasemlou, Shuai Shao, Hamid Eghbalzadeh, Fuchun Peng, Jun Liu, Michael Louis Iuzzolino

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 MSCGRec通过融合语义和协同信号,提升大规模物品集上的推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏