arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 203 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 203 篇

2607.16316 2026-07-21 cs.CV 新提交 79%

Eddy-VL 1.9B: Structural Pruning and Layered Distillation for Edge-Deployable Multimodal Embedding

Eddy-VL 1.9B:用于边缘可部署多模态嵌入的结构剪枝与分层蒸馏

HanYeong Cho, Changwoo Kim, Taeuk Chu, Jimin Park

机构 * Urock-AI Lab(Urock人工智能实验室)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 介绍用于边缘可部署视觉语言检索的Eddy-VL 1.9B模型,采用探针驱动结构剪枝和分层知识蒸馏压缩,参数减少约9.5%,在MMEB-V2等评估中保留教师模型大部分性能,降低延迟,证明其在受限边缘部署下多模态检索的有效性。

Comments 11pages,4figures,Model weights and inference code are available on Hugging Face

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14568 2026-07-17 cond-mat.other cs.AI 新提交 79%

A Modern Multimodal Assistant on a 6 GB 2011 GPU: Stage-Validated, All-GPU CUDA Inference for Fermi

在6GB 2011 GPU上的现代多模态助手:针对费米架构的阶段验证、全GPU CUDA推理

A. C. Opus, J. Q. Lu

机构 * Department of Physics, University of Puerto Rico(物理系,波多黎各大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 研究在6GB 2011费米GPU上部署MiniCPM-V-4.6多模态助手,通过构建全GPU引擎、移植验证视觉部分、优化长上下文处理等方法,实现了高效的推理,能在1.7秒内端到端回答图像问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09428 2026-07-13 cs.CV cs.LG 新提交 79%

Multimodal Scenario Similarity Search for Autonomous Driving

用于自动驾驶的多模态场景相似性搜索

Tamás Matuszka, András Tamásy, Balázs Szolár

机构 * aiMotive(爱莫提夫)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 研究自动驾驶场景相似性搜索,提出多模态框架结合视觉与轨迹表示,对比两种基于轨迹的方法与视觉基线,实验表明轨迹表示在运动事件中性能强,视觉嵌入在外观线索丰富时出色,结合二者可提升检索质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04410 2026-07-07 cs.CL 新提交 79%

AI Wizards at EXIST 2026: Hierarchical Soft-Label Learning for Multimodal Sexism Identification in Memes

2026年EXIST竞赛中的AI奇才:用于表情包中多模态性别歧视识别的分层软标签学习

Matteo Fasulo, Antonio Gravina, Luca Tedeschini, Luca Babboni

机构 * EXIST Lab(EXIST实验室) CLEF(信息检索评价论坛) Swiss Data Science Center, ETH Zürich(瑞士苏黎世联邦理工学院瑞士数据科学中心) Everest Systems GmbH(珠穆朗玛峰系统有限公司) Villanova.ai S.P.A(维拉诺瓦人工智能股份公司)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 针对表情包多模态性别歧视识别,将任务分层建模为基于经验注释者分布的条件软标签预测,用轻量级门控MLP映射视觉语言表征,在竞赛中取得好成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20280 2026-07-07 cs.IR cs.AI 新提交 79%

ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval

ELVA:探索排序驱动的通用多模态检索

Yuhan Liu, Pei Fu, Hang Li, Yukun Qi, Chao Jiang, Jingwen Fu, Zhen Liu, Bin Qin, Zhenbo Luo, Jian Luan, Jingmin Xin

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家级重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) MiLM Plus Xiaomi Inc(小米公司) Zhongguancun Academy(中关村学院) Beijing, China(北京市)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 提出ELVA框架,通过基于规则的强化学习缓解对比学习中的粒度盲视问题,在通用多模态检索中实现排序优化,并在新基准MRBench上提升13.1%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02010 2026-07-03 cs.AI 新提交 79%

InduceKV: Fixed-Footprint Continual Adaptation of Multimodal LLMs via Inducing KV Memories

InduceKV: 通过诱导KV记忆实现多模态大语言模型的固定足迹持续适应

Qianyu Chen, Ziteng Feng, Canran Xiao, Runxuan Tang

机构 * Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 提出InduceKV方法,通过检索将训练前缀存储为注意力就绪的记忆条目,在固定内存预算下实现多模态大语言模型的持续适应,无需更新骨干模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26458 2026-06-26 cs.AI 新提交 79%

MKG-RAG-Bench: Benchmarking Retrieval in Multimodal Knowledge Graph-Augmented Generation

MKG-RAG-Bench:多模态知识图谱增强生成中的检索基准

Xiaochen Wang, Bao Hoang, Han Liu, Ting Wang, Fenglong Ma

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Michigan State University(密歇根州立大学) Dalian University of Technology(大连理工大学) Stony Brook University(石溪大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 提出MKG-RAG-Bench基准,通过构建跨领域多模态知识图谱和问答数据集,系统评估多模态知识图谱增强生成中的检索性能,揭示检索质量对生成结果的决定性作用。

Comments Accepted by KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19684 2026-06-19 cs.CV 新提交 79%

Exploring Multi-Modal Large Language Models and Two-Stage Fine-Tuning for Fashion Image Retrieval

探索多模态大语言模型与两阶段微调在时尚图像检索中的应用

Nguyen Cao Hoang, Hoang Bui Le, Nam Vo Hoang, Trung-Nghia Le

机构 * University of Science, VNU-HCM(胡志明市国家大学下属理科大学) Vietnam National University, Ho Chi Minh(胡志明市国家大学)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出融合多模态大语言模型(LLaVA)生成属性感知三元组,并采用两阶段微调策略增强对比学习,以解决时尚图像检索中标注数据稀缺和负采样简单的问题。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15287 2026-06-16 cs.CV 新提交 79%

G2IA: Geometry-Guided Instance-Aware Retrieval and Refinement for Cross-Modal Place Recognition

G2IA: 几何引导的实例感知跨模态地点识别检索与精炼

Xianyun Jiao, Jingyi Xu, Zhongmiao Yan, Xieyuanli Chen, Ling Pei

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Defense Technology(国防科技大学)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出G2IA框架,通过几何引导的实例感知检索和跨模态局部形状与空间布局验证,解决图像到点云地点识别中的模态差异和感知混淆问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12744 2026-06-12 cs.CV 新提交 79%

GRIP: Feedback-Guided Prompt Retrieval for Large Multimodal Models

GRIP:面向大型多模态模型的反馈引导提示检索

Garvita Allabadi, Matteo Sodano, Roberto Estevão, Yuxiong Wang, Vikram Adve, Emre Kiciman, Ranveer Chandra

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Bonn(波恩大学) Microsoft(微软)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 提出GRIP,一种可学习的视觉检索框架,利用多模态模型反馈识别真正提升上下文学习性能的示例,在分类、描述和VQA任务上优于基于相似度的检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07365 2026-06-08 cs.LG cs.AI 新提交 79%

A robust PPG foundation model using multimodal physiological supervision

一种使用多模态生理监督的鲁棒PPG基础模型

Eloy Geenjaar, Vince Calhoun, Scott Daly, Gouthaman KV, Lie Lu, Trisha Mittal, Daniel P. Darcy

机构 * Dolby Laboratories(杜比实验室)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 提出一种PPG基础模型,利用ICU数据集中的心电和呼吸信号选择对比样本,无需高质量或场域数据预训练,在15个下游任务中14个取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20523 2026-06-19 cs.CV cs.AI cs.DB 新提交 79%

SARLO-80: Worldwide Slant SAR Language Optic Dataset 80cm

SARLO-80:全球斜距SAR语言光学数据集80cm

Solène Debuysère, Nicolas Trouvé, Nathan Letheule, Elise Colin, Georgia Channing

机构 * DEMR-ONERA – The French Aerospace Lab, Université Paris-Saclay(法国航空航天实验室DEMR-ONERA,巴黎-萨克雷大学) DTIS-ONERA – The French Aerospace Lab, Université Paris-Saclay(法国航空航天实验室DTIS-ONERA,巴黎-萨克雷大学) Hugging Face

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 为解决高分辨率SAR与光学图像及文本对齐的数据稀缺问题,基于Umbra SLC数据构建了80cm斜距网格的SAR-光学-文本三元组数据集,支持跨模态检索与生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10857 2026-08-12 cs.LG 新提交 78%

FiGuRO: Intrinsic Dimension Estimation for Multi-Modal Data

FiGuRO:面向多模态数据的本征维度估计

Viktoria Schuster, Sana Tonekaboni, Caroline Uhler

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 本研究提出FiGuRO框架,用于在模型容量与超参数约束下估计单/多模态数据的本征维度,可实现共享与私有信息解耦,性能优于现有技术且可应用于单模态预训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07067 2026-08-10 cs.AI cs.CL cs.IR cs.MM 新提交 78%

DocMemo: Dynamic Evidence Discovery via Probabilistic Memory-Guided Retrieval for Multi-Modal Document Understanding

DocMemo:面向多模态文档理解的概率记忆引导检索动态证据发现框架

Hanshu Yao, Janfeng Zhong, Niu Lian, Jinpeng Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 跨模态检索 :multi-modal(title);分类 cs.CL、cs.AI、cs.MM

AI总结 针对长文档理解的静态检索与跨轮记忆局限,提出记忆引导框架DocMemo,通过三层记忆与多轮优化实现动态证据发现,在3个基准上取得SOTA性能。

Comments DocMemo is a memory-guided framework for long-document reasoning that uses tri-level memory and dynamic Bayesian belief updating to overcome static retrieval limits and improve evidence tracking. 16 pages, 4 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05655 2026-08-07 cs.IR 新提交 78%

Is Personalized Modality Weighting Actually Personalized? A Controlled Audit of Per-User Weighting Claims in Multimodal Recommenders

个性化模态加权真的是个性化的吗?多模态推荐器中每用户加权声明的受控审计

Jingyuan Zheng, Xin Zhang, Yang Gu, Dongjing Wang, Yuxiang Wang, Xudong Shen, Haiping Zhang, Youhuizi Li, Dongjin Yu

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 该研究审计多模态推荐器的每用户模态加权是否真正个性化,发现单一全局模态权重已提供几乎全部内容增益,每用户加权无一致效用,建议将real-GM与real-shuf作为个性化声明的最低证据标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02907 2026-08-05 cs.LG 新提交 78%

Bayesian Data Reweighting Improves Multimodal Retrieval for Knowledge-Based Visual Question Answering

贝叶斯数据重加权改进基于知识的视觉问答的多模态检索

Jingchen Sun, Shaobo Han, Ruiyi Zhang, Naresh Kumar Devulapally, Ming Liu, Yitao Long, Vishnu Suresh Lokhande, Changyou Chen

机构 * University at Buffalo(布法罗大学) NEC Laboratories America(美国 NEC 实验室) Adobe Research(奥多比研究院) Iowa State University(爱荷华州立大学) New York University(纽约大学)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对基于知识的视觉问答中多模态检索的负样本处理问题,提出贝叶斯数据重加权框架,通过概率建模与随机EM优化,在三个检索器和七个基准上提升了检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01852 2026-08-04 cs.DB cs.IR 新提交 78%

Multimodal Embeddings for 3D Similarity Search in Semantic Web-of-Things Digital-Twin Platforms

面向语义物联网数字孪生平台中三维相似度搜索的多模态嵌入

Oussama Zaid, Romaric Gaudel, Hassan Thomas, Maria Massri, Philippe Raipin-Parv{é}dy

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文针对语义物联网数字孪生平台缺乏三维相似度搜索能力的问题,提出多模态嵌入框架,在Thing'in平台实现后经S3DIS验证,可支持混合本体-向量查询,满足相关领域的三维相似度搜索需求。

Journal ref 4th International Workshop on the Semantic WEb of EveryThing (SWEET 2026), co-located with ICWE 2026, Jun 2026, Lyon, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24875 2026-07-29 cs.LG 新提交 78%

FinAbstain: Uncertainty-Calibrated Multimodal RAG for Selective Financial Forecasting

FinAbstain:用于选择性金融预测的不确定性校准多模态检索增强生成模型

Dorothy Torres, Wei Cheng, Henan Huang

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 研究针对大语言模型在金融预测中证据不足时高置信度的问题,提出FinAbstain框架,通过多模态检索增强生成及选择性预测,经多种不确定性评估方法和指标评估,贡献了时间安全架构、复合不确定性公式和可重复评估蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20517 2026-07-24 cs.LG 新提交 78%

Multimodal CoLRAG-TF: Triple-Filtered Retrieval for Complex PDFs

多模态CoLRAG-TF:复杂PDF的三重过滤检索

Takato Yasuno

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 研究针对异构PDF集合检索增强生成的挑战,提出多模态CoLRAG-TF四轴融合架构,集成多种技术。构建多模态索引,经贝叶斯优化确定融合权重。实验显示其检索召回率高,多跳答案相似性提升显著,还适用于视觉输入,提供通用框架。

Comments 18 pages, 8 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20797 2026-07-24 astro-ph.CO astro-ph.GA 新提交 78%

A Multimodal Approach to Star--Galaxy Separation using SPHEREx Spectrophotometry and DESI Legacy Survey Imaging

一种使用SPHEREx分光光度法和DESI遗产调查成像的恒星-星系分离多模态方法

Kendrick Nguyen, Richard M. Feder, Sean Bruton, Uroš Seljak

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 研究利用多模态模型,结合光学宽带成像与SPHEREx近红外分光光度法,通过对比学习分离恒星和星系。经实验,变换表示训练的分类器效果更好,能将恒星污染控制在百分之一以下,凸显多模态方法对现代星系调查的实用价值。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20358 2026-07-23 cs.ET cs.AR 新提交 78%

PolySim: Deterministic Polynomial Surrogates for Cross-Modal Retrieval on CiM

PolySim:用于CiM上跨模态检索的确定性多项式代理

Xinzhao Li, Charles Power, Pengyu Ren, Jongun Won, Likai Pei, Yuting Hu, Jinjun Xiong, Alptekin Vardar, Ningyuan Cao, Xiaobo Sharon Hu, Thomas Kämpfe, Kai Ni, Ruiyang Qin

专题命中 跨模态检索 :cross-modal(title,abstract)

AI总结 研究边缘设备跨模态检索在CiM硬件部署问题,提出PolySim框架,将概率检索转为确定性管道,用低阶多项式基近似高斯嵌入维度,经实验其提升R@1,减少推理计算,是首个在CiM硬件实现概率跨模态检索的方法。

Comments Accepted by ICCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14995 2026-07-17 cs.LG q-bio.QM 新提交 78%

Multimodal Semantic-Aware Contrastive Learning For False Negative Mitigation in 3D Medical Imaging

用于减轻 3D 医学成像中假阴性的多模态语义感知对比学习

Sara Ketabi, Matthias W. Wagner, Cynthia Hawkins, Uri Tabori, Birgit Betina Ertl-Wagner, Farzad Khalvati

机构 * University of Toronto(多伦多大学) The Hospital for Sick Children(病童医院) Vector Institute(向量研究所) University Hospital Augsburg(奥格斯堡大学医院)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 研究针对3D医学成像中假阴性问题,提出多模态语义感知对比学习框架MseaCL,通过纳入放射学报告语义相似性作指导信号,经实验验证该框架用于预训练可提升下游任务表现,如儿科脑肿瘤分子分类AUC至少增22.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10909 2026-07-14 cs.IR 新提交 78%

Stream-aware Side Adaptation for Large Pre-trained Multimodal Embedding Models in Sequential Recommendation

用于序列推荐中大型预训练多模态嵌入模型的流感知侧适应

Junchen Fu, Kaiwen Zheng, Ioannis Arapakis, Wenhao Deng, Xin Xin, Joemon M. Jose, Xuri Ge

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对大型预训练多模态嵌入模型用于序列推荐时因域不对准性能不佳的问题,提出Stresa框架,通过流感知隐藏适配器融合和残差流适配器,有效解锁模型潜力,实验证明其性能优于标准侧适配器和基线。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08698 2026-07-10 cs.HC 新提交 78%

How YouTube Frames ChatGPT Use in Education: An Epistemic Network Analysis with Supporting Multimodal Metadata

YouTube如何构建教育领域中ChatGPT的使用:基于支持多模态元数据的认知网络分析

Shayla Sharmin, Mohammad Al-Ratrout, Mohammad Fahim Abrar, Roghayeh Leila Barmaki

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 研究通过多模态元数据分析教育类YouTube视频中ChatGPT的使用,识别出三个话语组,发现不同组在构建方式、观众反应和平台影响力上有差异,揭示了自主AI学习中优先快速输出与促进深度参与内容的差距及相关问题。

Comments This paper has been accepted in ICMI 2026 and will be presented in October

Journal ref In Proceedings of the 28th ACM International Conference on Multimodal Interaction (ICMI '26), Napoli, Italy, October 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08470 2026-07-10 cs.LG 新提交 78%

MatBind: A Shared Embedding Space for Multimodal Materials Characterization

MatBind:用于多模态材料表征的共享嵌入空间

Le Yang, Anoop K. Chandran, Jona Östreicher, Evgenii Sovetkin, Adrian Mirza, Sebastien Bompas, Bashir Kazimi, Pascal Friederich, Stefan Kesselheim, Kevin Maik Jablonka, Stefan Sandfeld

专题命中 跨模态检索 :multimodal(title);cross-modal(abstract)

AI总结 研究旨在整合异构材料数据以全面表征晶体材料。提出MatBind对比学习框架,以晶体结构为锚点将四种模态对齐到统一空间,实现零样本跨模态检索,且学习空间能依物理属性组织材料,组合模态可提升检索性能。

Comments 24 pages, 12 figures, submitted to npj computational material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04820 2026-07-07 cs.LG 新提交 78%

KinEMbed: Decoding Kinematics from Electromyography via Cross-Modal Contrastive Learning

KinEMbed:通过跨模态对比学习从肌电图中解码运动学

Sofia Gilardini, Chenfei Ma, Kianoush Nazarpour

机构 * Department of Statistics, University of Oxford(牛津大学统计学系) School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 跨模态检索 :cross-modal(title,abstract)

AI总结 研究从表面肌电图解码手部运动学这一挑战,提出跨模态对比学习框架KinEMbed训练双编码器,用于手部运动学回归,在NinaPro DB8数据集上优于基线方法。

Comments ICML 2026 Workshop on Structured Data for Health, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23291 2026-06-23 cs.IR 新提交 78%

URecJPQ: Memory-efficient Multimodal Recommendation Models through RecJPQ in Large-Scale Scenarios

URecJPQ:大规模场景下通过RecJPQ实现内存高效的多模态推荐模型

Giuseppe Spillo, Zixuan Yi, Aleksandr Petrov, Cataldo Musto, Craig Macdonald, Iadh Ounis

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 提出URecJPQ方法,通过联合乘积量化将用户/物品表示为共享子嵌入的拼接,显著减少参数量和内存占用,在大规模多模态推荐中实现86%-98%的模型压缩,仅轻微损失精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20167 2026-06-19 cs.LG 新提交 78%

Multi-Modal Contrastive Learning for Implicit Earth Embeddings via Location Tying

多模态对比学习用于基于位置绑定的隐式地球嵌入

Jonathan Hecht, Lukas Arzoumanidis, Ziyue Li, Youness Dehbi

机构 * Computational Methods Lab, HafenCity University Hamburg(汉堡港城大学计算方法实验室) Dept. of Operations & Technology, Technical University of Munich(慕尼黑工业大学运营与技术系;海尔布隆数据科学中心;慕尼黑数据科学研究所) Heilbronn Data Science Center(波恩大学大地测量与地理信息研究所) Munich Data Science Institute Institute of Geodesy and Geoinformation, University of Bonn

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract)

AI总结 提出两种多模态对比学习架构MELT和SALT,通过位置绑定整合未配对地理数据,在四个下游任务中匹配最强双模态基线SATCLIP,但增加模态数未持续提升性能,表明位置编码器是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15838 2026-06-16 cs.IR 新提交 78%

Intelligent Multimodal Retrieval and Reasoning for Geospatial Knowledge Discovery on the I-GUIDE Platform

面向I-GUIDE平台地理空间知识发现的智能多模态检索与推理

Yunfan Kang, Erick Li, Furqan Baig, Wei Hu, Alexander Michels, Anand Padmanabhan, Shaowen Wang

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 提出I-GUIDE Smart Search系统,结合多模态索引与知识图谱的迭代RAG管道,实现地理空间异构数据的语义检索、图谱溯源和对话合成,在单A100部署下支持约100并发用户,提升检索覆盖与答案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08979 2026-06-09 cs.IR 新提交 78%

EviProp: Seeded Relevance Diffusion on Chunk-Page Graphs for Long Multimodal Document Retrieval

EviProp: 基于种子相关性扩散的块-页图用于长多模态文档检索

Hongwei Zhang, Xiaoman Wang, Zehui Ling, Ruicheng Zhu, Yue Zhang, Pinlong Cai, Fuke Shen, Botian Shi, Tongquan Wei, Guohang Yan

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 提出EviProp方法,通过构建多模态块-页图并利用个性化PageRank扩散相关性,解决长文档中证据页检索的独立匹配局限,提升检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏