arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-16 至 2026-04-16 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 10 篇

2604.14044 2026-04-16 cs.CV 85%

Decoding the Delta: Unifying Remote Sensing Change Detection and Understanding with Multimodal Large Language Models

解读Delta:利用多模态大语言模型统一遥感变化检测与理解

Xiaohe Li, Jiahao Li, Kaixin Zhang, Yuqiang Fang, Leilei Lin, Hong Wang, Haohua Wu, Zide Fan

机构 * Aerospace Information Research Institute, CAS(航天信息研究所,中国科学院) Space Engineering University(航天工程大学) Capital Normal University(首都师范大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出Delta-LLaVA框架,通过多时间尺度对比推理和空间定位,解决遥感变化理解中的时间盲问题,实现像素级分割与视觉问答的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13268 2026-04-16 cs.CV cs.CL cs.IR 84%

Indexing Multimodal Language Models for Large-scale Image Retrieval

多模态大语言模型的索引用于大规模图像检索

Bahey Tharwat, Giorgos Kordopatis-Zilos, Pavel Suma, Ian Reid, Giorgos Tolias

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) VRG, FEE, Czech Technical University in Prague(布拉格捷克技术大学VRG学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文探讨了多模态大语言模型作为无训练相似性估计器在实例级图像到图像检索中的应用,通过提示配对图像并转换下一个词的概率为相似性分数,实现了零样本重排序,展示了其在大规模检索中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14147 2026-04-16 cs.CV 70%

ROSE: Retrieval-Oriented Segmentation Enhancement

ROSE:基于检索的分割增强

Song Tang, Guangquan Jie, Henghui Ding, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出ROSE框架,通过引入网络检索模块和提示增强模块,提升多模态大语言模型在新兴实体和新实体分割任务中的性能,实验表明其在NEST基准上表现优异。

Comments CVPR 2026 Findings, Project Page: https://henghuiding.com/ROSE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02697 2026-04-16 cs.CV 57%

GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localization

GeoBridge:一种语义锚定的多视图基础模型,用于图像与文本之间的地理定位

Zixuan Song, Jing Zhang, Di Wang, Zidie Zhou, Wenbin Liu, Haonan Guo, En Wang, Bo Du

机构 * School of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 GeoBridge通过语义锚定机制实现多视图特征桥接,提升地理定位的鲁棒性和灵活性。该模型构建了首个大规模跨模态多视图对齐数据集GeoLoc,验证了预训练对地理定位精度和跨领域泛化能力的提升。

Comments The paper is accepted by CVPR 2026! Code, dataset, and pretrained models will be released at https://github.com/MiliLab/GeoBridge

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13101 2026-04-16 cs.SE cs.AI 57%

Building Trust in the Skies: A Knowledge-Grounded LLM-based Framework for Aviation Safety

在天空中建立信任:一种基于知识的LLM框架用于航空安全

Anirudh Iyengar, Alisa Tiselska, Dumindu Samaraweera, Hong Liu

机构 * Senior Member, IEEE(IEEE高级会员) IEEE

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出结合LLM和知识图谱的框架,提升航空安全分析的可信度,通过双阶段流程构建和验证安全知识,提高准确性和可追溯性。

Comments Initial version of a conference publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12371 2026-04-16 cs.CV 57%

Reading Between the Pixels: Linking Text-Image Embedding Alignment to Typographic Attack Success on Vision-Language Models

在像素之间阅读:将文本-图像嵌入对齐与字体攻击成功性联系起来

Ravikumar Balakrishnan, Sanket Mendapara, Ankit Garg

机构 * Cisco Systems(思科系统)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 研究了视觉-语言模型中字体提示注入攻击的影响,发现字体大小、文本攻击有效性及嵌入距离对攻击成功率有显著影响,为防御策略提供实证指导。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15170 2026-04-16 cs.CV 57%

Multi-Dimensional Knowledge Profiling with Large-Scale Literature Database and Hierarchical Retrieval

多维知识谱系:基于大规模文献数据库与分层检索

Zhucun Xue, Jiangning Zhang, Juntao Jiang, Jinzhuo Liu, Haoyang He, Teng Hu, Xiaobin Hu, Yong Liu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) APRIL Lab(APRIL实验室) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文通过整合22个顶级会议2020-2025年的10万+论文,构建多维知识谱系分析框架,结合主题聚类、LLM解析与结构检索,揭示研究主题生命周期、方法迁移、数据集与模型使用模式及机构研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16662 2026-04-16 cs.HC cs.AI cs.IR cs.LG 57%

Safire: Similarity Framework for Visualization Retrieval

Safire:可视化检索的相似性框架

Huyen N. Nguyen, Nils Gehlenborg

机构 * Harvard Medical School(哈佛医学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出Safire框架,通过比较标准和表示模态两个维度,系统化分析可视化相似性,揭示不同应用场景中相似性标准与表示模态的关联,并探讨其对多模态学习、AI应用和可视化可重复性的影响。

Comments To appear in IEEE VIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13867 2026-04-16 gr-qc astro-ph.CO hep-ph hep-th 50%

Robust parameter inference for Taiji via time-frequency contrastive learning and normalizing flows

为Taiji探测器开发鲁棒参数推断方法:通过时频对比学习和归一化流

Tian-Yang Sun, Bo Liang, Ji-Yu Song, Song-Tao Liu, Shang-Jie Jin, He Wang, Ming-Hui Du, Jing-Fei Zhang, Xin Zhang

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出一种结合时频多模态融合编码器和对比学习的鲁棒参数推断框架,用于Taiji探测器中的大质量黑洞双星参数推断,通过生成高保真合成瞬态数据提升训练效率,验证了深度学习在空间引力波观测中的有效性。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13313 2026-04-16 cs.LG 50%

Concrete Jungle: Towards Concreteness Paved Contrastive Negative Mining for Compositional Understanding

具体丛林:迈向由具体性铺就的对比负样本挖掘以实现组合理解

Eun Woo Im, Dhruv Madhwal, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 本文提出ConcretePlant,通过增强具体性术语的修改来提升对比学习信号,解决负样本生成中的梯度失衡问题,提出Cement损失函数以动态校准惩罚,实现更有效的组合理解。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏