arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-22 至 2026-04-22 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 10 篇

2604.19689 2026-04-22 cs.AI 85%

A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork Understanding

A-MAR:基于代理的多模态艺术检索用于细粒度艺术作品理解

Shuai Wang, Hongyi Zhu, Jia-Hong Huang, Yixian Shen, Chengxi Zeng, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) University of Bristol(布里斯托大学) Amazon AGI(亚马逊人工智慧) College of Business and Economics(商学院和经济学学院) University of Johannesburg(约翰内斯堡大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出A-MAR框架,通过结构化推理计划显式指导多模态艺术检索,提升解释质量和证据 grounding 能力,在艺术领域验证了代理式多模态推理的有效性。

Journal ref ICMR 2026, ACM International Conference on Multimedia Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21893 2026-04-22 cs.LG 82%

Breaking the Illusion: Consensus-Based Generative Mitigation of Adversarial Illusions in Multi-Modal Embeddings

打破幻觉:基于共识的生成对抗多模态嵌入中对抗性幻觉的缓解

Fatemeh Akbarian, Anahita Baninajjar, Yingyi Zhang, Ananth Balashankar, Amir Aminifar

机构 * Lund University(隆德大学) Google DeepMind(谷歌DeepMind)

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract)

AI总结 本文提出一种任务无关的缓解机制,利用生成模型恢复多模态嵌入的自然对齐,通过生成采样策略和共识聚合方案提升防御效果,实验显示其显著降低对抗性幻觉攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19093 2026-04-22 cs.CV cs.AI 81%

Multi-modal Test-time Adaptation via Adaptive Probabilistic Gaussian Calibration

多模态测试时适应 via 自适应概率高斯校准

Jinglin Xu, Yi Li, Chuxiong Sun, Xiao Xu, Jiangmeng Li, Fanjiang Xu

机构 * Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) National Defense University(国防大学)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出自适应概率高斯校准方法,解决多模态测试时适应中类别条件分布建模不足问题,通过引入自适应对比不对称修正技术,提升预测准确性和决策边界可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12735 2026-04-22 cs.CV cs.CL 81%

VimRAG: Navigating Massive Visual Context in Retrieval-Augmented Generation via Multimodal Memory Graph

VimRAG:通过多模态记忆图导航大规模视觉上下文

Qiuchen Wang, Shihang Wang, Yu Zeng, Qiang Zhang, Fanrui Zhang, Zhuoning Guo, Bosi Zhang, Wenxuan Huang, Lin Chen, Zehui Chen, Pengjun Xie, Ruixue Ding

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 VimRAG通过多模态记忆图提升检索增强生成在处理大规模视觉上下文中的能力,采用动态有向无环图结构和图调制视觉记忆编码机制,实现高效的信息检索与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18892 2026-04-22 cs.CL 79%

Prioritizing the Best: Incentivizing Reliable Multimodal Reasoning by Rewarding Beyond Answer Correctness

优先选择最佳:通过奖励超越答案正确性来激励可靠的多模态推理

Mengzhao Jia, Zhihan Zhang, Meng Jiang

机构 * University of Notre Dame(北德克萨斯大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出Groupwise Ranking Reward方法,通过在单次遍历中对相同提示下的验证通过轨迹进行排名并重新分配奖励,有效缓解多模态强化学习中的推理-答案不一致问题,提升可靠性条件下的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19267 2026-04-22 cs.RO 78%

Multimodal embodiment-aware navigation transformer

多模态具身感知导航Transformer

Louis Dezons, Quentin Picard, Rémi Marsal, François Goulette, David Filliat

机构 * LARIAD

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出ViLiNT,通过融合多模态数据提升机器人导航鲁棒性,利用Transformer和扩散模型生成可导航路径,实现在不同环境中导航成功率提升166%。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18965 2026-04-22 eess.SY cs.SY 78%

Transformer Architecture with Minimal Inference Latency for Multi-Modal Wireless Networks

具有最小推理延迟的多模无线网络变压器架构

Minsu Kim, Walid Saad, Kui Wang, Zongdian Li, Tao Yu, Kei Sakaguchi

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 本文提出一种快速多模变压器推理框架,通过仅处理重要令牌来支持无线通信任务,减少推理延迟和内存消耗,同时保持任务精度。

Comments Under minor revision, IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14165 2026-04-22 cs.CL 57%

EviSearch: A Human in the Loop System for Extracting and Auditing Clinical Evidence for Systematic Reviews

EviSearch:一个用于系统综述中提取和审计临床证据的人机协作系统

Naman Ahuja, Saniya Mulla, Muhammad Ali Khan, Zaryab Bin Riaz, Kaneez Zahra Rubab Khakwani, Mohamad Bassam Sonbol, Irbaz Bin Riaz, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Mayo Clinic(梅奥诊所)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 EviSearch通过多智能体系统自动化从原始试验PDF中生成与本体对齐的临床证据表,并提供细胞级可追溯性以供审计和人工验证,提升提取精度并减少手动校对负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19562 2026-04-22 cs.LG 50%

Structure-guided molecular design with contrastive 3D protein-ligand learning

基于结构的分子设计与对比学习3D蛋白质-配体学习

Carles Navarro, Philipp Tholke, Gianni de Fabritiis

机构 * Acellera Labs(Acellera实验室)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出结合对比学习3D结构编码与自回归分子生成的统一框架,用于解决结构导向分子设计中的挑战,生成具有优良结合性质的候选分子。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19055 2026-04-22 cs.SD 50%

ATRIE: Adaptive Tuning for Robust Inference and Emotion in Persona-Driven Speech Synthesis

ATRIE:面向基于人物驱动语音合成的鲁棒推理与情感自适应调优

Aoduo Li, Haoran Lv, Shengmin Li, Sihao Qin, Hongjian Xu

机构 * Guangdong University of Technology(广东工业大学) South China University of Technology(华南理工大学) Shenzhen Polytechnic University(深圳职业技术大学) University of Macau(澳门大学) Huizhou University(惠州市大学)

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 本文提出ATRIE框架,通过分离静音音色和动态语调生成,实现人物特征的稳定保留与情感表达,实验表明其在生成和跨模态检索上达到SOTA水平。

Comments 10 pages, 6 figures. Accepted to ACM ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏