arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-17 至 2026-03-17 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 13 篇

2603.13537 2026-03-17 cs.IR cs.LG 82%

AMES: Approximate Multi-modal Enterprise Search via Late Interaction Retrieval

AMES:基于晚期交互检索的近似多模态企业搜索

Tony Joseph, Carlos Pareja, David Lopes Pegna, Abhishek Singh

机构 * Apple(苹果公司)

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);cross-modal(abstract)

AI总结 AMES通过晚期交互检索架构实现多模态企业搜索,无需架构重设计,利用多向量编码器将文本、图像和视频嵌入共享空间,实验显示其在可扩展的Solr系统中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15341 2026-03-17 cs.AI cs.HC cs.MA 79%

Intelligent Co-Design: An Interactive LLM Framework for Interior Spatial Design via Multi-Modal Agents

智能协同设计:一种基于多模态代理的交互式LLM框架用于室内空间设计

Ren Jian Lim, Rushi Dai

机构 * Hong Kong Center for Construction Robotics(香港建设机器人中心)

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的多模态多代理框架,通过自然语言描述和图像动态生成3D设计,提升用户参与度和设计效率。

Comments 25 pages, 20 figures; accepted for publication in the Proceedings of ACADIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19554 2026-03-17 cs.LG cs.AI 79%

CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning

CARE:对比锚定反射用于可验证多模态推理

Yongxin Wang, Zhicheng Yang, Meng Cao, Mingfei Han, Haokun Lin, Yingying Zhu, Xiaojun Chang, Xiaodan Liang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 CARE通过对比锚定反射框架,将错误转化为监督信号,提升多模态推理的准确性和训练平滑度,在六个可验证视觉推理基准上提升4.6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11750 2026-03-17 q-bio.QM cs.LG 78%

PRISM: Enhancing Protein Inverse Folding through Fine-Grained Retrieval on Structure-Sequence Multimodal Representations

PRISM:通过结构-序列多模态表示的细粒度检索增强蛋白质反向折叠

Sazan Mahbub, Souvik Kundu, Eric P. Xing

机构 * Carnegie Mellon University(卡内基梅隆大学) GenBio AI(基因组生物人工智能) Intel(英特尔)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 PRISM通过结构-序列多模态表示的细粒度检索提升蛋白质反向折叠性能,结合混合自交叉注意力解码器,实现更高效的序列生成与折叠预测。

Comments Published as a conference paper at International Conference on Learning Representation (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09894 2026-03-17 cs.AI cs.CY cs.LG 70%

Beyond AlphaEarth: Toward Human-Centered Geospatial Foundation Models via POI-Guided Contrastive Learning

超越AlphaEarth:通过POI引导对比学习实现以人为中心的地理空间基础模型

Junyuan Liu, Quan Qin, Guangsheng Dong, Xinglei Wang, Jiazhuang Feng, Zichao Zeng, Tao Cheng

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出AETHER框架,通过POI引导的多模态对齐,将AlphaEarth与以人为中心的城市分析结合,提升地理空间表示的可解释性与语言可访问性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05197 2026-03-17 cs.AI cs.CL cs.CV 69%

QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering

QA-Dragon:面向知识密集型视觉问答的查询感知动态RAG系统

Zhuohang Jiang, Pangjing Wu, Xu Yuan, Wenqi Fan, Qing Li

专题命中 跨模态检索 :multimodal(abstract,journal_ref);分类 cs.CV、cs.CL、cs.AI

AI总结 QA-Dragon通过引入领域路由器和搜索路由器,实现多模态、多轮和多跳推理,提升复杂视觉问答任务的推理性能,实验显示其在单源、多源和多轮任务中均优于基线模型。

Comments The source code for our system is released in https://github.com/jzzzzh/QA-Dragon

Journal ref 2025 KDD Cup Workshop for Multimodal Retrieval Augmented Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15259 2026-03-17 cs.LG cs.AI cs.CL cs.CR 62%

Directional Embedding Smoothing for Robust Vision Language Models

方向嵌入平滑用于鲁棒视觉语言模型

Ye Wang, Jing Liu, Toshiaki Koike-Akino

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过方向嵌入平滑技术提升视觉语言模型的鲁棒性,针对多模态劫持攻击,验证了方向嵌入噪声在降低攻击成功率中的有效性。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14170 2026-03-17 cs.IR cs.AI cs.CL 62%

Citation-Enforced RAG for Fiscal Document Intelligence: Cited, Explainable Knowledge Retrieval in Tax Compliance

引用强化的财政文档智能:在税务合规中的引用、可解释知识检索

Akhil Chandra Shanivendra

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种引用强化的RAG框架,用于财政文档智能,强调可解释性和可审计性,通过源优先的摄入策略和引用强制机制提升税务合规中的引用准确性与解释性。

Comments 22 pages, 3 figures. Applied AI systems paper focused on citation-enforced RAG and abstention for fiscal document intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14541 2026-03-17 cs.AI cs.IR 57%

Expert Mind: A Retrieval-Augmented Architecture for Expert Knowledge Preservation in the Energy Sector

专家思维:一种用于能源领域专家知识保留的检索增强架构

Diego Ezequiel Cervera

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出Expert Mind系统,通过RAG、大语言模型和多模态技术,解决能源领域专家知识流失问题,提升知识传递效率与入职效率。

Comments 6 pages, 1 figure, conceptual architecture paper on retrieval-augmented expert knowledge systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13660 2026-03-17 cs.CV 57%

Learning Generalizable 3D Medical Image Representations from Mask-Guided Self-Supervision

从掩码引导自监督学习中学习通用的3D医学图像表示

Yunhe Gao, Yabin Zhang, Chong Wang, Jiaming Liu, Maya Varma, Jean-Benoit Delbrouck, Akshay Chaudhari, Curtis Langlotz

机构 * Stanford University(斯坦福大学)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出MASS方法,通过掩码引导自监督学习,学习通用的医学图像表示,实现了在不同数据集上的高效分割和分类任务。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19621 2026-03-17 cs.CV 57%

Exemplar Med-DETR: Toward Generalized and Robust Lesion Detection in Mammogram Images and beyond

示例医学DETR:迈向乳腺X线图像及其他图像中的通用和稳健病变检测

Sheethal Bhat, Bogdan Georgescu, Adarsh Bhandary Panambur, Mathias Zinnen, Tri-Thien Nguyen, Awais Mansoor, Karim Khalifa Elbarbary, Siming Bayer, Florin-Cristian Ghesu, Sasa Grbic, Andreas Maier

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出Exemplar Med-DETR,一种多模态对比检测器,通过交叉注意力和内在衍生的类特定示例特征实现基于特征的检测,展示了在多种影像模态上的卓越性能。

Comments I am asking for a withdrawal of the paper as I did not have institutional approval to release this paper right now

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14822 2026-03-17 cs.IR 50%

A Survey of Model Architectures in Information Retrieval

信息检索中模型架构的综述

Zhichao Xu, Fengran Mo, Zhiqi Huang, Crystina Zhang, Puxuan Yu, Bei Wang, Jimmy Lin, Vivek Srikumar

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文综述了信息检索中模型架构的发展,重点探讨了特征提取的骨干模型和端到端的相关性估计系统,分析了传统术语检索模型向神经网络方法的转变,以及Transformer架构和大语言模型的影响。

Comments TMLR camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13774 2026-03-17 cs.DB 50%

AgenticScholar: Agentic Data Management with Pipeline Orchestration for Scholarly Corpora

AgenticScholar: 基于管道编排的代理数据管理用于学术语料

Hai Lan, Tingting Wang, Zhifeng Bao, Guoliang Li, Daomin Ji, Ge Lee, Feng Luo, Zi Huang, Hailang Qiu, Gang Hua

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 本文提出AgenticScholar系统,整合结构化知识表示层、LLM中心混合查询规划层和统一执行层,实现多模态学术数据的端到端推理,有效提升学术数据管理的效率和可解释性。

Comments 54 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏