arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-27 至 2026-03-27 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 7 篇

2208.09843 2026-03-27 cs.CV 83%

CODER: Coupled Diversity-Sensitive Momentum Contrastive Learning for Image-Text Retrieval

CODER: 耦合多样性敏感动量对比学习用于图像-文本检索

Haoran Wang, Dongliang He, Wenhao Wu, Boyang Xia, Min Yang, Fu Li, Yunlong Yu, Zhong Ji, Errui Ding, Jingdong Wang

机构 * Department of Computer Vision Technology (VIS), Baidu Inc., Beijing, China(百度公司计算机视觉技术部(VIS),北京,中国) Key Lab of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, Beijing, China(中国科学院智能信息处理重点实验室,中国科学院计算技术研究所,北京,中国) College of Information Science & Electronic Engineering, Zhejiang University, Hangzhou, China(浙江大学信息与电子工程学院,杭州,中国) School of Electrical & Information Engineering, Tianjin University, Tianjin, China(天津大学电气与信息工程学院,天津,中国) The University of Sydney, Sydney, Australia(悉尼大学,悉尼,澳大利亚)

专题命中 跨模态检索 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出CODER,通过耦合多样性敏感动量对比学习提升跨模态表示,引入动态字典扩大图像-文本对规模,结合常识知识图谱生成概念级描述,实验表明在MSCOCO和Flickr30K上优于现有方法。

Comments Accepted by ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24736 2026-03-27 cs.AI cs.LG 79%

AutoSAM: an Agentic Framework for Automating Input File Generation for the SAM Code with Multi-Modal Retrieval-Augmented Generation

AutoSAM:一种用于自动化生成SAM代码输入文件的代理框架,结合多模态检索增强生成

Zaid Abulawi, Zavier Ndum Ndum, Eric Cervi, Rui Hu, Yang Liu

机构 * Department of Nuclear Engineering, Texas A\&M University. Engineering Division, Argonne National Laboratory

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 AutoSAM通过多模态检索增强生成技术,自动化生成SAM代码输入文件,解决异构工程文档中提取设计数据并转换为求解器语法的难题,实现100%结构化输入利用和88%PDF文本提取。

Comments 34 Pages, 14 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14961 2026-03-27 cs.LG cs.CV 70%

Graph Memory: A Structured and Interpretable Framework for Modality-Agnostic Embedding-Based Inference

图记忆:一种结构化且可解释的多模态嵌入推理框架

Artur A. Oliveira, Mateus Espadoto, Roberto M. Cesar, Roberto Hirata

机构 * Institute of Mathematics and Statistics, University of São Paulo(数学统计研究所,圣保罗大学)

专题命中 跨模态检索 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 图记忆通过紧凑的可靠性标注原型区域图表示嵌入空间,结合原型关系编码局部几何和区域模糊性,实现查询证据扩散推理,统一实例检索、原型推理和图扩散,提供更准确和可解释的多模态推理。

Comments This version expands the published conference paper (VISAPP 2026) with additional methodological details, experiments, and analysis that were omitted due to page limits. The final published version is available via DOI: 10.5220/0014578800004084

Journal ref Proc. 21st Int. Conf. Comput. Vision Theory Appl. (VISAPP 2026), Vol. 1, pp. 652-659 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25216 2026-03-27 cs.NI cs.AI eess.SP 57%

A Wireless World Model for AI-Native 6G Networks

面向AI原生6G网络的无线世界模型

Ziqi Chen, Yi Ren, Yixuan Huang, Qi Sun, Nan Li, Yuhong Huang, Chih-Lin I, Yifan Li, Liang Xia

机构 * China Mobile Research Institute(中国移动研究院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出无线世界模型(WWM),通过内化三维几何与信号动态的因果关系,预测无线信道的时空演化,实现跨动态环境的泛化能力,优于现有单模基础模型和任务专用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22013 2026-03-27 cs.CV 57%

RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations

RobustVisRAG: 基于因果性的视觉增强检索增强生成方法在视觉退化下的鲁棒性

I-Hsiang Chen, Yu-Wei Liu, Tse-Yu Wu, Yu-Chien Chiang, Jen-Chien Yang, Wei-Ting Chen

机构 * National Taiwan University(国立台湾大学) Microsoft(微软)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出RobustVisRAG,通过双路径框架分离语义与退化因素,提升在视觉退化下的检索生成性能,实验显示在真实退化条件下性能提升显著。

Comments Accepted by CVPR2026; Project Page: https://robustvisrag.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05631 2026-03-27 cs.CV 57%

OFFSET: Segmentation-based Focus Shift Revision for Composed Image Retrieval

OFFSET: 基于分割的聚焦偏移修正用于复合图像检索

Zhiwei Chen, Yupeng Hu, Zixu Li, Zhiheng Fu, Xuemeng Song, Liqiang Nie

机构 * Shandong University(山东大学) City University of Hong Kong(香港城市大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出OFFSET网络,通过分割模块和双聚焦映射模块修正复合图像检索中的视觉和文本焦点偏差,提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24744 2026-03-27 cs.LG 50%

Contrastive Learning Boosts Deterministic and Generative Models for Weather Data

对比学习提升确定性和生成性模型用于天气数据

Nathan Bailey

机构 * Imperial College London(帝国理工学院伦敦分校) The Grantham Institute for Climate Change(格兰塔姆气候变化研究所)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文研究对比学习在天气数据压缩中的应用,提出SPARTA模型,通过对比损失和图神经网络融合提升稀疏数据的嵌入质量,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏