arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-08 至 2026-04-08 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 9 篇

2604.05887 2026-04-08 cs.AI 83%

HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference

HybridKV: 为高效多模态大语言模型推理设计的混合KV缓存压缩

Bowen Zeng, Feiyang Ren, Jun Zhang, Xiaoling Gu, Ke Chen, Lidan Shou, Huan Li

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出HybridKV框架,通过分层预算分配和不同压缩策略,有效减少KV缓存内存占用并提升解码速度,实验表明在11个多模态基准上内存减少达7.9倍,解码速度提升1.52倍,性能损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06156 2026-04-08 cs.CV cs.AI cs.CL 82%

MMEmb-R1: Reasoning-Enhanced Multimodal Embedding with Pair-Aware Selection and Adaptive Control

MMEmb-R1: 基于推理增强的多模态嵌入与配对感知选择及自适应控制

Yuchi Wang, Haiyang Yu, Weikang Bian, Jiefeng Long, Xiao Liang, Chao Feng, Hongsheng Li

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) ByteDance(字节跳动)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MMEmb-R1框架,通过引入配对感知推理选择和强化学习,解决多模态嵌入中推理与对比监督不匹配及推理冗余的问题,实验显示其在MMEB-V2基准上达到71.2分,参数更少且推理效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18095 2026-04-08 cs.IR cs.CL cs.CV 81%

MetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late Interaction

MetaEmbed:通过灵活的后期交互实现测试时多模态检索的扩展

Zilin Xiao, Qi Ma, Mengting Gu, Chun-cheng Jason Chen, Xintao Chen, Vicente Ordonez, Vijai Mohan

机构 * Meta Superintelligence Labs(Meta超级智能实验室) Rice University(莱斯大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 MetaEmbed通过灵活的后期交互机制,在测试时实现多模态检索的扩展,通过多向量检索训练提升信息组织能力,实现在大规模模型下的高效检索性能。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05773 2026-04-08 cs.CV 79%

PDMP: Rethinking Balanced Multimodal Learning via Performance-Dominant Modality Prioritization

PDMP:通过性能主导模态优先级重思平衡多模态学习

Shicai Wei, Chunbo Luo, Qiang Zhu, Yang Luo

机构 * Laboratory of Intelligent Collaborative Computing, University of Electronic Science and Technology of China(电子科技大学智能协同计算实验室) School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出PDMP策略,通过性能主导模态优先级提升多模态学习效果,解决传统方法中因模态不平衡导致的优化不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05038 2026-04-08 cs.CL 79%

Guided Query Refinement: Multimodal Hybrid Retrieval with Test-Time Optimization

引导查询细化:多模态混合检索与测试时优化

Omri Uzan, Asaf Yehudai, Roi pony, Eyal Shnarch, Ariel Gera

机构 * Stanford University(斯坦福大学) IBM Research(IBM研究院) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出引导查询细化方法,通过测试时优化提升多模态检索性能,使视觉中心模型在效率和性能上达到更优平衡。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05462 2026-04-08 stat.ML cs.LG math.ST stat.TH 78%

Hierarchical Contrastive Learning for Multimodal Data

多模态数据的层次对比学习

Huichao Li, Junhan Yu, Doudou Zhou

机构 * University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出层次对比学习框架,通过统一模型学习全局共享、部分共享和模态特定的表示,解决多模态数据中部分共享因素的建模问题,提升预测性能。

Comments 34 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05393 2026-04-08 cs.CV cs.MM 62%

Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval

超越语义检索:面向组合图像检索的指代锚定

Yuxin Yang, Yinan Zhou, Yuxin Chen, Ziqi Zhang, Zongyang Ma, Chunfeng Yuan, Bing Li, Jun Gao, Weiming Hu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Tencent Inc.(腾讯公司) PeopleAI Inc.(人民人工智能公司) HelloGroup Inc.(哈啰集团) ShanghaiTech University(上海科技大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出OACIR任务,通过引入对象锚定机制提升组合图像检索的实例一致性,构建了包含16万多个四元组的OACIRR基准,采用AdaFocal框架实现动态关注平衡,实验表明其在保持实例一致性方面表现优异。

Comments Accepted to CVPR 2026. Project page, dataset, and code are available at: https://hahajun1101.github.io/OACIR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18027 2026-04-08 cs.CL 57%

PDF Retrieval Augmented Question Answering

PDF检索增强型问答

Thi Thu Uyen Hoang, Meenakshi Rajendran, Kun Zhang, Yuhan Wu, Viet Anh Nguyen

机构 * Saarland University(萨尔兰大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 本文提出基于检索增强生成框架的PDF多模态问答系统,通过整合非文本元素提升复杂查询的准确性与相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04976 2026-04-08 cs.IR 50%

Tencent Advertising Algorithm Challenge 2025: All-Modality Generative Recommendation

腾讯广告算法挑战2025:全模态生成推荐

Junwei Pan, Wei Xue, Chao Zhou, Xing Zhou, Lunan Fan, Yanbo Wang, Haoran Xin, Zhiyu Hu, Yaozheng Wang, Fengye Xu, Yurong Yang, Xiaotian Li, Junbang Huo, Wentao Ning, Yuliang Sun, Chengguo Yin, Jun Zhang, Shudong Huang, Lei Xiao, Huan Yu, Irwin King, Haijie Gu, Jie Jiang

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 本文介绍了腾讯广告算法挑战2025,通过两个全模态数据集TencentGR-1M和TencentGR-10M,推动生成推荐研究,提供大规模真实数据和评估方法,旨在促进工业级全模态生成推荐技术的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏