arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-30 至 2026-06-30 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 14 篇

2606.28350 2026-06-30 cs.IR cs.CV 87%

UniCA: Bi-directional Cross-Attention with Positive Similarity Loss for Robust Multi-Modal Retrieval

UniCA:具有正相似性损失的双向交叉注意力用于鲁棒多模态检索

Yini Huang, Wenlong Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Southern Medical University(南方医科大学)

专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract);image-text(abstract)

AI总结 提出UniCA模型,通过双向交叉注意力块和正相似性损失增强跨模态语义对齐,在WebQA基准上混合任务Recall@5提升4.09%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28845 2026-06-30 cs.CV 85%

Personalizing MLLMs via Reinforced Multimodal Reference Game

通过强化多模态参考游戏个性化多模态大语言模型

Deepayan Das, Davide Talon, Yiming Wang, Massimiliano Mancini, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·科塞勒基金会)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出强化参考游戏(RRG)框架,通过对比游戏学习生成准确、有区分性的概念描述,在三个个性化基准上达到最先进性能。

Comments Accepted to ECCV26. Project page: https://deepayan137.github.io/papers/conversational-personalization.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29888 2026-06-30 cs.LG cs.CV 79%

Same Concept, Different Directions: Cross-Modal Feature Heterogeneity in Sparse Autoencoders

同一概念,不同方向:稀疏自编码器中的跨模态特征异质性

Chungpa Lee, Jihoon Kwon, Kyle Min, Jy-yong Sohn

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 发现视觉-语言模型中同一概念在不同模态下的特征方向不一致(跨模态特征异质性),并提出训练模态特定稀疏自编码器后对齐对应特征的方法,提升重建保真度和跨模态检索与概念引导性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29464 2026-06-30 cs.CV cs.AI 79%

Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation

秩感知双曲对齐用于视觉-语言数据集蒸馏

Jongoh Jeong, Sun-Kyung Lee, Kuk-Jin Yoon

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 提出RAHA方法,利用双曲几何和显式对齐容量控制,通过非对称目标优化蒸馏对,在共享范围强制测地线对齐并正则化残差子空间,提升跨模态检索和迁移鲁棒性。

Comments Accepted for publication at ECCV 2026. Project Page: https://andyj1.github.io/raha

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03253 2026-06-30 cs.CV 70%

LaVPR: Benchmarking Language and Vision for Place Recognition

LaVPR:语言与视觉用于位置识别的基准测试

Ofer Idan, Dan Badur, Yosi Keller, Yoli Shavit

专题命中 跨模态检索 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 LaVPR通过引入超过65万条自然语言描述扩展现有VPR数据集,研究多模态融合与跨模态检索,证明语言描述在视觉退化条件下提升性能,尤其对小模型效果显著。

Comments Accepted to ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30196 2026-06-30 cs.CL cs.AI cs.LG eess.AS 67%

Forewarned is Forearmed: When Non-Sequential Embedding Turns Into an Anomaly Detector

有备无患:当非序列嵌入变成异常检测器

Elys Allesiardo, Antoine Caubrière, Valentin Vielzeuf

机构 * Orange Research(Orange研究院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文深入分析非序列多模态句子级嵌入(SONAR模型),发现某些嵌入维度对扰动敏感,可作为解码异常指标,并利用编解码一致性构建准确检测器,同时探索修正异常维度。

Comments Accepted for presentation at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29069 2026-06-30 cs.AI cs.CL cs.CV 67%

Low-cost concept-based localized explanations: How far can we get with training-free approaches?

低成本基于概念的可解释性:无训练方法能走多远?

Darian Fernández-Gutiérrez, Rafael Bello, Marilyn Bello, Natalia Díaz-Rodríguez

机构 * Dept. of Computer Science and Artificial Intelligence, University of Granada (UGR)(计算机科学与人工智能系,格拉纳达大学(UGR))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出零样本概念命名协议,利用中等规模多模态大模型对局部区域进行概念标注,无需训练即可实现62%-88%的物体级精确匹配,为低成本可解释AI提供新思路。

Comments 6 pages, 2 figures, 4 tables. Accepted at the 2026 IEEE International Conference on Artificial Intelligence (CAI), 8-10 May 2026, Granada, Spain. Code: https://github.com/darianfgUgr/CoNa

Journal ref 2026 IEEE International Conference on Artificial Intelligence (CAI), Granada, Spain, 2026, pp. 1405-1410

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28344 2026-06-30 cs.IR cs.AI cs.CL cs.CV cs.LG 67%

PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

PIXELRAG:网页截图在检索增强生成中优于文本

Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin, Matei Zaharia, Joseph E. Gonzalez, Sewon Min

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出PixelRAG方法,以网页截图替代文本进行检索和阅读,利用视觉嵌入模型和对比学习,在30M截图库上实现端到端RAG,在多项任务中优于文本基线,准确率提升最高18.1%,并通过图像压缩降低3倍token成本。

Comments Our code is available at https://github.com/StarTrail-org/PixelRAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28697 2026-06-30 cs.CV cs.CL 62%

Mitigating Batch Effects in Histopathology via Language-Mediated Robust Embedding Generation

通过语言介导的鲁棒嵌入生成减轻组织病理学中的批次效应

Yishu Zhang, Shushan Wu, Zhenzhong Zhang, Didong Li, Huaxiu Yao, Yun Li, Iain Carmichael, Katherine A. Hoadley, Hongtu Zhu, Di Wu, Daiwei Zhang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出GLMP框架,利用通用多模态大语言模型将组织学图像转化为文本表示,再生成数值嵌入,有效抑制批次效应,提升跨机构泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12282 2026-06-30 cs.CV cs.AI 62%

CytoCLIP: Learning Cytoarchitectural Characteristics in Developing Human Brain Using Contrastive Language Image Pre-Training

CytoCLIP:利用对比语言图像预训练学习发育人类大脑的细胞架构特征

Pralaypati Ta, Sriram Venkatesaperumal, Keerthi Ram, Mohanasankar Sivaprakasam

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 CytoCLIP通过对比语言图像预训练框架学习人类大脑细胞架构特征,通过低分辨率和高分辨率模型变体实现区域分类和跨模态检索,实验表明其在整体区域和高分辨率图像分类中表现优异。

Journal ref Neuroinformatics, Volume 24, article number 38 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29328 2026-06-30 cs.IR cs.AI 57%

Covering the Unseen: Information Demand Coverage Optimization for Retrieval-Augmented Generation

覆盖未见:面向检索增强生成的信息需求覆盖优化

Bingxue Zhang, Jianying Jia, Feida Zhu

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 针对复杂查询中top-k选择忽略关键子问题的问题,提出GeoRAG,通过多维度需求分布和Sinkhorn-Wasserstein距离优化上下文选择,实现无监督、免训练且与检索无关的覆盖优化,在六个开放域QA基准上提升6.5-7.5个EM点。

Comments 12 pages, 5 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26553 2026-06-30 cs.CV 57%

SemConFlow: Semantic Grounding of Holistic Co-Speech Gesture Generation with Contrastive Flow-Matching

HolisticSemGes: 语义 grounding 的整体共语手势生成与对比流匹配

Lanmiao Liu, Esam Ghaleb, Aslı Özyürek, Zerrin Yumak

机构 * Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) Utrecht University(乌得勒支大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于对比流匹配的共语手势生成模型,通过引入不匹配的音频-文本条件作为负样本,确保跨模态一致性,并在BEAT2和SHOW数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06891 2026-06-30 cs.CV 57%

CLIMP: Contrastive Language-Image Mamba Pretraining

CLIMP:对比语言-图像Mamba预训练

Nimrod Shabtay, Itamar Zimerman, Eli Schwartz, Raja Giryes

机构 * Tel-Aviv University(特拉维夫大学) IBM Research(IBM研究院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 CLIMP是首个全Mamba架构的对比视觉语言模型,通过Mamba替代视觉和文本编码器,提升跨模态检索和鲁棒性,优于CLIP-ViT-B 7.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28483 2026-06-30 quant-ph 50%

Quantum Fourier Generative Models Trainable at Large Scale

可大规模训练的量子傅里叶生成模型

Cenk Tüysüz, Oleksandr Kyriienko, Michele Grossi

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 提出一种基于并行傅里叶特征映射和forrelation型量子电路的量子生成模型,利用基于Parseval恒等式的对数似然损失实现大规模训练,并通过逆量子傅里叶变换构建采样电路,在超过1000量子比特上验证了有效性。

Comments 12 pages, 6 figures; supplementary material 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏