arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-06-11 至 2026-06-11 共收录 3 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 3 篇

2606.12294 2026-06-11 cs.CV eess.IV 新提交 62%

Bridging the Modality Gap in Forensic Image Retrieval

弥合法医图像检索中的模态差距

Ricardo González-Gazapo, Annette Morales-González, Yoanna Martínez-Díaz, Heydi Méndez-Vázquez, Milton García-Borroto

机构 * Advanced Technologies Application Center (CENATAV)(先进技术应用中心(CENATAV)) Centro de Sistemas Complejos, Facultad de Física, Universidad de La Habana(哈瓦那大学物理学院复杂系统中心)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV、eess.IV

AI总结 提出统一检索框架,利用多模态大语言模型生成文本描述并结合视觉与文本特征融合,提升纹身、人脸素描等法医任务的检索精度与鲁棒性。

Comments 23 pages, 5 figures, paper submitted to Elsevier journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11420 2026-06-11 cs.CL cs.SI 新提交 50%

Context-Aware Multimodal Claim Verification in Spoken Dialogues

口语对话中的上下文感知多模态声明验证

Chaewan Chun, Delvin Ce Zhang, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Sheffield(谢菲尔德大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 提出MAD2基准和上下文感知多模态融合方法,验证对话音频中的声明,发现对话结构比虚假信息框架对验证更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22141 2026-06-11 cs.CL cs.IR 50%

DAPFAM: A Domain-Aware Family-level Dataset to benchmark cross domain patent retrieval

DAPFAM: 一个领域感知的家族级数据集用于跨领域专利检索基准测试

Iliass Ayaou, Denis Cavallucci, Hicham Chibane

机构 * Institut National des Sciences de l'Univers, Strasbourg(斯特拉斯堡国家科学大学)

专题命中 融合架构与评测 :hybrid fusion(abstract)

AI总结 DAPFAM通过引入基于IPC3重叠的新方案,构建了包含1247个查询家族和45336个目标家族的家族级基准数据集,通过249次实验揭示跨领域检索中的显著领域差距,展示了段落级检索和密集方法的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏