arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-23 至 2026-04-23 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 10 篇

2604.20429 2026-04-23 cs.CV 83%

Fast-then-Fine: A Two-Stage Framework with Multi-Granular Representation for Cross-Modal Retrieval in Remote Sensing

快速-精细:一种用于遥感跨模态检索的两阶段框架,具有多粒度表示

Xi Chen, Xu Chen, Xiangyang Jia, Xu Zhang, Shuquan Wei, Wei Wang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)

专题命中 跨模态检索 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出一种两阶段框架,通过多粒度表示提升遥感跨模态检索效率与精度,采用文本无关召回和文本引导重排序阶段,减少计算资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08923 2026-04-23 cs.AI 83%

Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs

相同内容,不同答案:多模态大语言模型中的跨模态不一致

Angela van Sprang, Laurens Samson, Ana Lucic, Erman Acar, Sennay Ghebreab, Yuki M. Asano

机构 * University of Amsterdam(阿姆斯特丹大学) City of Amsterdam(阿姆斯特丹市) University of Technology Nuremberg(努尔堡技术大学)

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文提出REST和REST+基准测试,评估多模态大语言模型的跨模态不一致性。研究发现,即使在相同语义信息下,不同模态的推理结果也不一致,且OCR错误和视觉特征影响模型性能。

Comments Accepted at CVPR 2026. Angela van Sprang and Laurens Samson contributed equally as first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00798 2026-04-23 cs.CV cs.AI 81%

Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering

逐步多模态搜索与推理用于知识密集型视觉问答

Changin Choi, Wonseok Lee, Jungmin Ko, Wonjong Rhee

机构 * Interdisciplinary Program in Artificial Intelligence(人工智能交叉学科项目) Department of Intelligence and Information(智能与信息系) Samsung Advanced Institute of Technology(三星先进技术研究院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出PMSR框架,通过逐步构建结构化推理轨迹提升知识获取与综合能力,实验显示在六个基准测试中提升了检索召回率和端到端回答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20444 2026-04-23 cs.RO cs.AI cs.DB cs.LG 79%

VTouch++: A Multimodal Dataset with Vision-Based Tactile Enhancement for Bimanual Manipulation

VTouch++:一个用于双臂操作的多模态数据集,具有基于视觉的触觉增强

Qianxi Hua, Xinyue Li, Zheng Yan, Yang Li, Chi Zhang, Yongyao Li, Yufei Liu

机构 * Humanoid Robot (Shanghai) Co., Ltd.(人形机器人(上海)有限公司) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学) School of Astronautics, Harbin Institute of Technology(航天学院,哈尔滨工程大学)

专题命中 跨模态检索 :multimodal(title);cross-modal(abstract);分类 cs.AI

AI总结 本文提出VTouch++数据集,通过视觉触觉传感提供高保真的物理交互信号,采用矩阵式任务设计实现系统学习,并利用自动化数据采集管道确保可扩展性,通过跨模态检索和真实机器人评估验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20283 2026-04-23 cs.CL 79%

Multi-Perspective Evidence Synthesis and Reasoning for Unsupervised Multimodal Entity Linking

多视角证据综合与推理用于无监督多模态实体链接

Mo Zhou, Jianwei Wang, Kai Wang, Helen Paik, Ying Zhang, Wenjie Zhang

机构 * The University of New South Wales(新南威尔士大学) Shanghai Jiao Tong University(上海交通大学) University of Technology Sydney(技术大学悉尼)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出MSR-MEL框架,通过多视角证据综合与推理提升无监督多模态实体链接性能,采用图神经网络和大语言模型进行证据整合与推理,实验表明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19176 2026-04-23 cs.LG cs.IR 78%

From Raw Features to Effective Embeddings: A Three-Stage Approach for Multimodal Recipe Recommendation

从原始特征到有效嵌入:一种多模态食谱推荐的三阶段方法

Jeeho Shin, Kyungho Kim, Kijung Shin

机构 * KAIST(韩国科学技术院)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出TESMR三阶段框架,通过内容、关系和学习增强多模态特征,提升食谱推荐性能,实验表明其在Recall@10上比现有方法高7-15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20460 2026-04-23 cs.CV 74%

CCTVBench: Contrastive Consistency Traffic VideoQA Benchmark for Multimodal LLMs

CCTVBench:用于多模态大语言模型的对比一致性交通视频问答基准

Xingcheng Zhou, Hao Guo, Rui Song, Walter Zimmer, Mingyu Liu, André Schamschurko, Hu Cao, Alois Knoll

机构 * Technical University of Munich(慕尼黑技术大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 跨模态检索 :multimodal(title);分类 cs.CV

AI总结 CCTVBench通过真实事故视频与世界模型生成的反事实场景配对,提出对比一致性评估方法,揭示视频问答中对比一致性与标准指标间的显著差距,并引入C-TCD方法提升问答与一致性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08508 2026-04-23 cs.CV cs.CL 73%

Re:Verse -- Can Your VLM Read a Manga?

Re:Verse -- 能读懂漫画吗?

Aaditya Baranwal, Madhav Kataria, Naitik Agrawal, Yogesh S Rawat, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学) Indian Institute of Technology, Jodhpur(印度理工学院,朱达浦尔) Indian Institute of Technology, Varanasi(印度理工学院,瓦拉纳西)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文通过分析漫画叙事理解,揭示现有VLM在时间因果和跨面板连贯性上的不足,提出新的评估框架,系统研究长篇叙事理解能力。

Comments Accepted (oral) at ICCV (AISTORY Workshop) 2025

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 3820-3830

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14222 2026-04-23 cs.CR cs.AI 70%

Membership Inference for Contrastive Pre-training Models with Text-only PII Queries

对比预训练模型的成员推断与仅文本隐私信息查询

Ruoxi Cheng, Yizhong Ding, Jian Zhao, Hongyi Zhang, Haoxuan Ma, Tianle Zhang, Yiyan Huang, Xuelong Li

机构 * Beijing Electronic Science and Technology Institute(北京电子科技研究所) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) School of Computing and Information Technology, Great Bay University(广东大湾区大学计算机与信息科技学院)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出UMID框架,通过仅文本模态推断多模态模型的记忆,有效检测隐私信息泄露,无需生物特征输入,提升隐私审计效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19386 2026-04-23 cs.CV 57%

Air-Know: Arbiter-Calibrated Knowledge-Internalizing Robust Network for Composed Image Retrieval

Air-Know: 基于仲裁校准的知识内化鲁棒网络用于组合图像检索

Zhiheng Fu, Yupeng Hu, Qianyun Yang, Shiqi Zhang, Zhiwei Chen, Zixu Li

机构 * Shandong University(山东大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对组合图像检索中噪声三元组对应问题,Air-Know提出专家-代理-分流解耦范式,通过外部先验仲裁、专家知识内化和双流协调模块,提升鲁棒性和检索性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏