arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-05 至 2026-06-05 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 7 篇

2606.05843 2026-06-05 cs.CL cs.AI 84%

Mechanistic Insights into Functional Sparsity in Multimodal LLMs via CoRe Heads

多模态大语言模型中通过CoRe头的功能稀疏性机制洞察

Ruoxi Sun, Quantong Qiu, Juntao Li, Zecheng Tang, Yihang Lou, Min Zhang

机构 * Soochow University(苏州大学) Peking University(北京大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 通过识别和分析CoRe头,揭示多模态大语言模型在跨模态检索中功能稀疏的结构特性,并验证其必要性及加速推理的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05515 2026-06-05 cs.CV 79%

BRepCLIP: Contrastive Multimodal Pretraining on BRep Primitives for CAD Understanding

BRepCLIP: 面向CAD理解的BRep基元对比多模态预训练

Muhammad Usama, Didier Stricker, Mohammad Sadil Khan, Muhammad Zeshan Afzal

机构 * DFKI, Germany(德意志联邦共和国DFKI) RPTU Kaiserslautern-Landau, Germany(德国凯撒斯劳滕-兰道大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 提出BRepCLIP框架,通过对比预训练对齐CAD边界表示(BRep)几何与语言/图像嵌入,显著提升检索和零样本分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10020 2026-06-05 cs.CL cs.AI cs.CV 67%

The Mirage of Performance Gains: Why Contrastive Decoding Fails to Mitigate Object Hallucinations in MLLMs?

性能提升的幻象:为何对比解码无法减轻多模态大语言模型中的对象幻觉?

Hao Yin, Guangzong Si, Zilei Wang

机构 * University of Science and Technology of China(中国科学技术大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究所)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文研究了对比解码方法在减轻多模态大语言模型(MLLMs)中对象幻觉方面的有效性,发现其性能提升主要源于两个误导性因素,挑战了对比解码策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05812 2026-06-05 cs.MM eess.AS 62%

FORTE: FOL-guided Optimal Refinement for Text-audio rEtrieval

FORTE: 基于一阶逻辑引导的文本-音频检索优化

Arghya Pal, Sailaja Rajanala

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.MM、eess.AS

AI总结 提出FORTE框架,通过一阶逻辑转换、约束搜索优化和谓词感知重排序,结合参数高效跨模态对齐,提升文本-音频检索的细粒度语义匹配精度。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05489 2026-06-05 cs.CV cs.DB 57%

LLM-Guided ANN Index Optimization for Human-Object Interaction Retrieval

LLM引导的ANN索引优化用于人-物交互检索

Shahrzad Esmat, Chaunte W. Lacewell, Sameh Gobriel, Nilesh Jain, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Intel Corporation(英特尔公司)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 提出一种基于大语言模型的阶段感知智能体,通过耦合参数空间的分阶段优化,在HICO-DET等基准上显著提升向量检索吞吐量。

Comments 13 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01113 2026-06-05 cs.CV 57%

R^3: Composed Video Retrieval via Reasoning-Guided Recalling and Re-ranking

R^3: 基于推理引导的召回与重排序的组合视频检索

Zixu Li, Yupeng Hu, Zhiheng Fu, Zhiwei Chen, Weili Guan, Liqiang Nie

机构 * Shandong University(山东大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出R^3零样本组合视频检索流程,通过生成推理轨迹增强查询表示,并融合重排序验证候选视频,有效解决源视频与编辑指令组合检索的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06429 2026-06-05 cs.HC 50%

Computational Modeling of Human Adaptation in Urban Infrastructure Management under Extreme Conditions: A Case Study of Subway Flood Scenarios

极端条件下城市基础设施管理中人类适应的计算建模:以地铁洪水情景为例

Jinfeng Lou, Zijie Liang, Pengkun Liu, Yuxin Zhang, Cleotilde Gonzalez, Pingbo Tang

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 本研究通过将基于实例的学习理论(IBLT)整合到土木工程计算中,建立了一个模拟操作员决策过程的计算认知架构,揭示了人类适应中的非单调性和心理偏差,并通过地铁洪水情景的人机交互实验验证了模型的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏