arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-20 至 2026-04-20 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 8 篇

2604.15628 2026-04-20 cs.CV cs.CL cs.IR cs.LG cs.MM 93%

SIMMER: Cross-Modal Food Image--Recipe Retrieval via MLLM-Based Embedding

SIMMER:通过基于MLLM的嵌入进行跨模态食物图像-食谱检索

Keisuke Gomi, Keiji Yanai

机构 * The University of Electro-Communications(电通大学)

专题命中 跨模态检索 :MLLM(title,title_cn);cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文提出SIMMER,利用基于MLLM的嵌入模型VLM2Vec,通过统一编码器处理食物图像和食谱文本,设计定制化提示模板和数据增强策略,实现跨模态检索的高精度。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15979 2026-04-20 cs.CV 89%

MMGait: Towards Multi-Modal Gait Recognition

MMGait:迈向多模态步态识别

Chenye Wang, Qingyuan Cai, Saihui Hou, Aoqi Li, Yongzhen Huang

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 跨模态检索 :multi-modal(title,summary_cn);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MMGait多模态步态基准,整合五种异构传感器数据,评估单模态、跨模态和多模态步态识别方法,引入Omni Multi-Modal Gait Recognition任务和OmniGait基线模型。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16427 2026-04-20 cs.CV 85%

Cross-modal learning for plankton recognition

跨模态学习用于浮游生物识别

Joona Kareinen, Veikka Immonen, Tuomas Eerola, Lumi Haraguchi, Lasse Lensu, Kaisa Kraft, Sanna Suikkanen, Heikki Kälviäinen

机构 * Lappeenranta-Lahti University of Technology LUT(拉佩宁拉-拉赫蒂技术大学) Finnish Environment Institute(芬兰环境研究所) Faculty of Information Technology(信息科技学院) Brno University of Technology(布拉格技术大学)

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出利用自监督跨模态协调策略,结合大量未标记浮游生物数据,构建多模态识别模型。通过图像与光学测量数据共同指导学习,无需人工标注,提升识别精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13660 2026-04-20 cs.CV 83%

VRAG-DFD: Verifiable Retrieval-Augmentation for MLLM-based Deepfake Detection

VRAG-DFD: 可验证检索增强的基于大语言模型的深度伪造检测

Hui Han, Shunli Wang, Yandan Zhao, Taiping Yao, Shouhong Ding

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 跨模态检索 :MLLM(title,abstract);分类 cs.CV

AI总结 本文提出VRAG-DFD框架,通过结合检索增强生成和强化学习,解决深度伪造检测中专业伪造知识不足的问题,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12193 2026-04-20 cs.CV 77%

VeRVE: Versatile Retrieval for Videos via Unified Embeddings

VeRVE:通过统一嵌入实现视频的多功能检索

Shaunak Halbe, Bhagyashree Puranik, Jayakrishnan Unnikrishnan, Kushan Thakkar, Vimal Bhat, Toufiq Parag

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊) Keystone AI

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出VeRVE框架,结合语义和时刻级检索能力,支持复杂多模态查询,通过对比对齐视觉和文本嵌入实现高效检索,优于其他多模态大语言模型方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16247 2026-04-20 cs.LG cs.AI 70%

Joint-Centric Dual Contrastive Alignment with Structure-Preserving and Information-Balanced Regularization

基于结构保持和信息平衡正则化的联合中心双对比对齐

Habibeh Naderi, Behrouz Haji Soleimani, Stan Matwin

机构 * Dalhousie University(达尔豪斯大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出HILBERT框架,通过跨模态注意力和自注意力池化学习文档级音频文本表示,采用双对比目标和辅助正则化提升跨模态对齐效果,实现长序列语义表示学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15735 2026-04-20 cs.CV cs.AI 66%

Sketch and Text Synergy: Fusing Structural Contours and Descriptive Attributes for Fine-Grained Image Retrieval

草图与文本协同:融合结构轮廓和描述属性用于细粒度图像检索

Siyuan Wang, Hanchen Gao, Guangming Zhu, Jiang Lu, Yiyue Ma, Tianci Wu, Jincai Huang, Liang Zhang

机构 * Xidian University First Aircraft Design Institute(西安电子科技大学第一飞机设计院)

专题命中 跨模态检索 :cross-modal(abstract,comments);分类 cs.CV、cs.AI

AI总结 本文提出STBIR框架,通过融合草图的结构轮廓与文本的色彩纹理信息,提升细粒度图像检索性能,采用课程学习、特征空间优化和多阶段跨模态对齐机制,实验验证其优于现有方法。

Comments Image Retrieval, Hand-drawn Sketch, Multi-stage Cross-modal Feature Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15663 2026-04-20 cs.SE cs.AI 57%

CodeMMR: Bridging Natural Language, Code, and Image for Unified Retrieval

CodeMMR:连接自然语言、代码和图像以实现统一检索

Jiahui Geng, Qing Li, Fengyu Cai, Fakhri Karray

机构 * MBZUAI Linköping University(林雪平大学) University of Groningen(格罗宁根大学) TU Darmstadt(图宾根大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出CodeMMR,通过指令式多模态对齐,将自然语言、代码和图像嵌入共享语义空间,实现跨模态和语言的强泛化,优于基线模型,并提升RAG中的代码生成精度与视觉 grounding。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏