arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-18 至 2026-03-18 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 6 篇

2603.16455 2026-03-18 cs.CV 83%

Evo-Retriever: LLM-Guided Curriculum Evolution with Viewpoint-Pathway Collaboration for Multimodal Document Retrieval

Evo-Retriever:基于观点-路径协作的LLM引导课程进化多模态文档检索框架

Weiqing Li, Jinyue Guo, Yaqi Wang, Haiyang Xiao, Yuewei Zhang, Guohua Liu, Hao Henry Wang

机构 * Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 跨模态检索 :multimodal(title);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出Evo-Retriever框架,通过LLM引导的课程进化和观点-路径协作提升多模态文档检索性能,实现在ViDoRe V2和MMEB数据集上达到SOTA水平。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15623 2026-03-18 cs.IR cs.AI 79%

Finder: A Multimodal AI-Powered Search Framework for Pharmaceutical Data Retrieval

Finder:一种多模态AI驱动的制药数据检索框架

Suyash Mishra, Srikanth Patil, Satyanarayan Pati, Sagar Sahu, Baddu Narendra

机构 * Researcher, Global Product Strategy F. Hoffmann-La Roche Ltd. Basel, Switzerland(全球产品战略研究员 罗氏有限公司 巴塞尔,瑞士) Associate Vice President (Gen AI) Involead Services Pvt Ltd. Pune, India(高级副总裁(生成式人工智能) Involead服务私人有限公司 普纳,印度) Lead Data Scientist Involead Services Pvt Ltd. Delhi, India(首席数据科学家 Involead服务私人有限公司 德里,印度) Data Scientist Involead Services Pvt Ltd. Bhubaneswar, India(数据科学家 Involead服务私人有限公司 奇塔拉,印度)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 Finder利用混合向量搜索统一文本、图像、音频和视频的检索,通过稀疏词汇和密集语义模型提升多模态内容处理能力,支持自然语言推理搜索,已处理超过29万文档、3.1万视频和1192音频文件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16737 2026-03-18 cs.CV cs.AI cs.CL 67%

Retrieving Counterfactuals Improves Visual In-Context Learning

检索反事实改进视觉上下文学习

Guangzhi Xiong, Sanchit Sinha, Zhenghao He, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出CIRCLES框架,通过主动检索反事实样例提升视觉语言模型的因果推理能力,实验表明其在多个数据集上优于现有方法,尤其在小规模模型和信息稀缺场景下表现突出。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16165 2026-03-18 cs.CV cs.AI 62%

Homogeneous and Heterogeneous Consistency progressive Re-ranking for Visible-Infrared Person Re-identification

同质与异质一致性渐进重排序用于可见-红外人重识别

Yiming Wang

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HHCR方法,通过同质和异质一致性重排序解决跨模态人重识别中的模态差异问题,实验表明其方法具有泛化能力并达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11192 2026-03-18 cs.CV cs.AI 62%

FALCON: False-Negative Aware Learning of Contrastive Negatives in Vision-Language Alignment

FALCON:视觉-语言对齐中对比负样本的假阴性感知学习

Myunsoo Kim, Seongwoong Shim, Byung-Jun Lee

机构 * Korea University(韩国大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 FALCON通过动态选择合适难度的负样本平衡硬负样本与假阴性,提升视觉-语言对齐性能,验证其在多种框架和任务中的有效性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16645 2026-03-18 cs.CV 57%

BUSSARD: Normalizing Flows for Bijective Universal Scene-Specific Anomalous Relationship Detection

BUSSARD:基于归一化流的生物jective通用场景特定异常关系检测

Melissa Schween, Mathis Kruse, Bodo Rosenhahn

机构 * Institute for Information Processing, L3S - Leibniz University Hannover(信息处理研究所,L3S-汉诺威莱布尼茨大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出BUSSARD模型,通过归一化流学习场景图中对象-关系-对象三元组到基础分布的可逆变换,实现异常关系检测。在SARD数据集上取得优于当前SOTA的AUROC提升,并展示出更强的鲁棒性和通用性。

Comments CVPR 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏