arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-19 至 2026-05-19 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 11 篇

2604.11043 2026-05-19 cs.AI 88%

EmergentBridge: Improving Zero-Shot Cross-Modal Transfer in Unified Multimodal Embedding Models

EmergentBridge: 提升统一多模态嵌入模型中的零样本跨模态迁移

Jincheng Xie, Xingchen Xiao, Runheng Liu, Zhongyi Huang, Yu Zheng, Heyan Huang

机构 * Tsinghua University(清华大学) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) JD iCity, JD Technology, JD Intelligent Cities Research(京东i城、京东科技、京东智能城市研究院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.AI

AI总结 本文提出EmergentBridge框架,通过学习噪声桥梁锚点和子空间对齐,提升未配对模态对的零样本迁移性能,无需 exhaustive pairwise 监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17509 2026-05-19 eess.AS 83%

Audio-Image Cross-Modal Retrieval with Onomatopoeic Images

音频-图像跨模态检索与拟声图像

Keisuke Imoto, Yamato Kojima, Takao Tsuchiya

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 eess.AS

AI总结 本文提出了一种双向检索框架,用于将拟声图像与对应声音片段进行跨模态检索,通过训练模态特定的投影头来重新对齐视觉拟声和声音的嵌入表示,并构建了包含50种声音事件类别的多模态图像-音频拟声数据集MIAO,实验结果表明该方法在两个方向上的检索效果均优于基于预训练CLIP和CLAP嵌入的零样本基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14787 2026-05-19 cs.CV cs.CL 81%

Do Composed Image Retrieval Benchmarks Require Multimodal Composition?

组合图像检索基准是否需要多模态组合?

Matteo Attimonelli, Alessandro De Bellis, Aryo Pradipta Gema, Rohit Saxena, Monica Sekoyan, Wai-Chung Kwan, Claudio Pomo, Alessandro Suglia, Dietmar Jannach, Tommaso Di Noia, Pasquale Minervini

机构 * Politecnico di Bari(巴里理工大学) Sapienza University of Rome(罗马萨皮恩扎大学) University of Edinburgh(爱丁堡大学) University of Klagenfurt(克雷格弗特大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究发现组合图像检索任务中,许多查询可通过单一模态解决,而非真正的多模态组合,揭示了多模态组合的假设不成立。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16638 2026-05-19 cs.AI 79%

TTE-Flash: Accelerating Reasoning-based Multimodal Representations via Think-Then-Embed Tokens

TTE-Flash: 通过思考-然后-嵌入标记加速基于推理的多模态表示

Jianpeng Cheng, Xian Wu, Jiangfan Zhang, Wentao Bao, Chaitanya Ahuja, Shlok Kumar Mishra, Hanchao Yu, Yang Gao, Fan Xia, Qi Guo, Shaodan Zhai, Xiangjun Fan, Jun Xiao

机构 * Meta AI

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出TTE-Flash模型,通过引入隐式思考标记替代显式推理链,实现多模态表示的高效推理。模型在MMEB-v2基准上优于显式CoT方法,且在零样本评估中展示了可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16999 2026-05-19 cs.LG 78%

Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning

基于排名的校准:可靠多模态强化学习

Peng Cui, Boyao Yang, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, BNRist Center, Tsinghua-Bosch Joint ML Center, THBI Lab, Tsinghua University, Beijing(计算机科学与技术系,人工智能研究院,BNRist中心,清华大学-博世联合机器学习中心,THBI实验室,清华大学,北京) Dept. of Automation, Tsinghua University, Beijing(自动化系,清华大学,北京)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出Ranking-Aware Calibration方法,通过利用组内强化学习自然产生的比较信号,提升多模态强化学习的校准能力,从而提高任务准确性和校准效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00505 2026-05-19 cs.IR cs.AI cs.CL 62%

LLM-Oriented Information Retrieval: A Denoising-First Perspective

面向大语言模型的信息检索:一种去噪优先的视角

Lu Dai, Liang Sun, Fanpu Cao, Ziyang Rao, Cehao Yang, Hao Liu, Hui Xiong

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种以去噪为核心的信息检索方法,强调在信息检索全流程中,最大化可利用证据密度和可验证性是关键瓶颈,通过四个阶段框架和信号-噪声优化技术分类,探讨了信息检索中的挑战和解决方案。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18434 2026-05-19 cs.IR cs.CV 57%

TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval

TIGER-FG: 基于文本引导的隐式细粒度 grounding 用于电商检索

Xinyu Sun, Huangyu Dai, Lingtao Mao, Zexin Zheng, Zihan Liang, Ben Chen, Chenyi Lei, Wenwu Ou

机构 * Kuaishou Technology(快手科技)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TIGER-FG框架,通过文本引导生成目标聚焦的物品表示,解决电商检索中模态和粒度不匹配的问题,并在两个基准测试中提升了检索精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18029 2026-05-19 cs.CV 57%

What Matters for Grocery Product Retrieval with Open Source Vision Language Models

在开源视觉语言模型中,什么因素影响杂货产品检索

Emmanuel G. Maminta, Rowel O. Atienza

机构 * AI Graduate Program, University of the Philippines, Diliman, Quezon City(菲律宾大学达林学院人工智能研究生项目) EEEI, University of the Philippines, Diliman, Quezon City(菲律宾大学达林学院电子工程系)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了开源视觉语言模型在杂货产品检索任务中的表现,发现数据质量比规模更重要,高效模型可以胜出,并且存在召回率差距的问题。

Comments Accepted in the 28th International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16755 2026-05-19 cs.LG cs.AI 57%

Learning Unbiased Permutations via Flow Matching

通过流匹配学习无偏排列

Yimeng Min, Carla P. Gomes

机构 * Department of Computer Science(计算机科学系) Cornell University(康奈尔大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出PermFlow框架,通过在具有单位行和列和的矩阵仿射子空间上直接操作,学习多模态排列分布,避免了基于熵正则化Sinkhorn方法在模糊性下的崩溃问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18750 2026-05-19 cs.DC cs.LG 50%

A Readiness-Driven Runtime for Pipeline-Parallel Training under Runtime Variability

一种面向运行时变异的流水线并行训练的准备驱动运行时

Ruitao Liu, Xinyang Tian, Shuo Chen, Tingrui Zhang, Guang Yang, Alan Zhao, Wei Xu

机构 * Tsinghua University(清华大学) Scitix AI

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出了一种准备驱动的流水线运行时,以解决流水线并行训练中由于运行时变异导致的阶段对齐问题和空闲泡现象,通过非绑定提示顺序来优化当前就绪工作的排序,从而提高资源利用率。

Comments 29 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17152 2026-05-19 cs.DB 50%

LSM-VEC: A Large-Scale Disk-Based System for Dynamic Vector Search

LSM-VEC:一种大规模磁盘基系统用于动态向量搜索

Shurui Zhong, Dingheng Mo, Siqiang Luo

专题命中 跨模态检索 :multimodal(abstract)

AI总结 LSM-VEC结合分层图索引与LSM树存储,实现高效的动态向量搜索,支持出地更新,降低I/O开销,实验显示其在大规模数据集上优于现有磁盘基ANN系统。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏