arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 1405 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 1405 篇

2205.03645 2023-05-17 cs.CV eess.IV 81%

Automatic Velocity Picking Using a Multi-Information Fusion Deep Semantic Segmentation Network

H. T. Wang, J. S. Zhang, Z. X. Zhao, C. X. Zhang, L. Li, Z. Y. Yang, W. F. Geng

专题命中 融合架构与评测 :information fusion(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.00102 2023-04-10 cs.CV cs.AI cs.MM 81%

Dynamic Multimodal Fusion

Zihui Xue, Radu Marculescu

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by 6th Multi-Modal Learning and Applications Workshop (MULA), CVPR 2023. Code available at: https://github.com/zihuixue/DynMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00827 2023-04-04 cs.CV cs.MM 81%

Multi-modal Fake News Detection on Social Media via Multi-grained Information Fusion

Yangming Zhou, Yuzhou Yang, Qichao Ying, Zhenxing Qian, Xinpeng Zhang

专题命中 融合架构与评测 :information fusion(title);multi-modal fusion(abstract);分类 cs.CV、cs.MM

Comments Accepted by ICMR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.07027 2023-03-03 eess.IV cs.CV cs.LG 81%

MedFuse: Multi-modal fusion with clinical time-series data and chest X-ray images

Nasir Hayat, Krzysztof J. Geras, Farah E. Shamout

专题命中 融合架构与评测 :multi-modal fusion(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.06080 2022-11-14 cs.RO cs.CV 81%

Multi-modal Fusion Technology based on Vehicle Information: A Survey

Yan Gong, Jianli Lu, Jiayi Wu, Wenzhuo Liu

专题命中 融合架构与评测 :multi-modal fusion(title,abstract);分类 cs.CV、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.00979 2022-09-07 eess.IV cs.CV cs.LG 81%

Multimodal Information Fusion for Glaucoma and DR Classification

Yihao Li, Mostafa El Habib Daho, Pierre-Henri Conze, Hassan Al Hajj, Sophie Bonnin, Hugang Ren, Niranchana Manivannan, Stephanie Magazzeni, Ramin Tadayoni, Béatrice Cochener, Mathieu Lamard, Gwenolé Quellec

专题命中 融合架构与评测 :information fusion(title,abstract);分类 cs.CV、eess.IV

Comments Accepted preprint for presentation at MICCAI-OMIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.09290 2021-01-01 cs.CV cs.MM 81%

Frame Aggregation and Multi-Modal Fusion Framework for Video-Based Person Recognition

Fangtao Li, Wenzhe Wang, Zihe Liu, Haoran Wang, Chenghao Yan, Bin Wu

专题命中 融合架构与评测 :multi-modal fusion(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by MMM 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.04048 2019-11-12 stat.ML cs.LG eess.IV eess.SP stat.AP 81%

Multidataset Independent Subspace Analysis with Application to Multimodal Fusion

Rogers F. Silva, Sergey M. Plis, Tulay Adali, Marios S. Pattichis, Vince D. Calhoun

专题命中 融合架构与评测 :multimodal fusion(title);information fusion(abstract);分类 eess.IV、eess.SP

Comments For associated code, see https://github.com/rsilva8/MISA For associated data, see https://github.com/rsilva8/MISA-data Submitted to IEEE Transactions on Image Processing on Nov/7/2019: 13 pages, 8 figures Supplement: 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.03196 2019-07-09 cs.CV eess.AS eess.IV 81%

Multimodal Fusion with Deep Neural Networks for Audio-Video Emotion Recognition

Juan D. S. Ortega, Mohammed Senoussaoui, Eric Granger, Marco Pedersoli, Patrick Cardinal, Alessandro L. Koerich

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.07709 2019-05-28 eess.IV cs.CV 81%

An Objective Evaluation Metric for image fusion based on Del Operator

Ali A. Kiaei, Hassan Khotanlou, Mahdi Abbasi, Paniz Kiaei, Yasin Bhrouzi

专题命中 融合架构与评测 :image fusion(title,abstract);分类 cs.CV、eess.IV

Comments 22 pages, 14 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.07275 2018-08-23 cs.AI cs.CV cs.MM 81%

CentralNet: a Multilayer Approach for Multimodal Fusion

Valentin Vielzeuf, Alexis Lechervy, Stéphane Pateux, Frédéric Jurie

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV、cs.MM

Journal ref European Conference on Computer Vision Workshops: Multimodal Learning and Applications, Sep 2018, Munich, Germany. https://mula2018.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.03232 2018-07-10 eess.SP cs.CV physics.med-ph 81%

Robust Heartbeat Detection from Multimodal Data via CNN-based Generalizable Information Fusion

B S Chandra, C S Sastry, S Jana

专题命中 融合架构与评测 :information fusion(title,abstract);分类 cs.CV、eess.SP

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07303 2024-09-24 cs.CV cs.CL cs.LG 80%

Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion

Peiyuan Chen, Zecheng Zhang, Yiping Dong, Li Zhou, Han Wang

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV

Comments Visual Question Answering, Rank VQA, Faster R-CNN, BERT, Multimodal Fusion, Ranking Learning, Hybrid Training Strategy

详情

展开后加载摘要…

URL PDF HTML 收藏
1003.1598 2010-07-05 cs.AI cs.NE 80%

Information Fusion in the Immune System

Jamie Twycross, Uwe Aickelin

专题命中 融合架构与评测 :information fusion(title,abstract)

Comments 10 pages, 6 tables, 6 figures, Information Fusion

Journal ref Information Fusion, 11 (1), 35-44, 2010

详情

展开后加载摘要…

URL PDF HTML 收藏
1003.0789 2010-07-05 cs.AI cs.CR cs.NE 80%

Information Fusion for Anomaly Detection with the Dendritic Cell Algorithm

Julie Greensmith, Uwe Aickelin, Gianni Tedesco

专题命中 融合架构与评测 :information fusion(title,abstract)

Comments 21 pages, 17 figures, Information Fusion

Journal ref Information Fusion, 11 (1), 21-34, 2010

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13092 2026-08-14 cs.CV 新提交 79%

Paths: Prompt-aware Spatio-temporal Transformer with Hierarchical Multi-modal Fusion for RGB-Event Video Person Re-Identification

Paths:面向RGB-Event视频行人重识别的感知提示的时空Transformer与分层多模态融合

Yakun Huo, Yingquan Wang, Yangyang Liu, Tianyu Yan, Yunzhi Zhuge, Pingping Zhang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学)

专题命中 融合架构与评测 :multi-modal fusion(title,abstract);分类 cs.CV

AI总结 针对现有RE-VReID方法时空建模解耦、多模态融合不足的问题,提出含MAB、PST、HMF模块的Paths框架,在三个基准上验证了有效性。

Comments Accepted by ACM MM2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11839 2026-07-14 cs.CV cs.AI 新提交 79%

LoRA-Based Cascaded Multimodal Fusion for Action Recognition in Medical Training Environments

基于LoRA的级联多模态融合在医学训练环境中的动作识别

Divya Mereddy, Jeevan Beedareddy

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 研究面向医疗训练环境的动作识别,提出基于LoRA的级联多模态融合框架,结合特定模态适应与顺序融合,无需重新训练组件,在两个数据集上评估,结果显示该策略优于单模态模型且性能有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05311 2026-07-07 cs.CV 新提交 79%

Deep Learning for Semen Analysis in Male Infertility: Computer Vision, Multimodal Fusion, and Clinical Translation

男性不育症精液分析深度学习技术:计算机视觉、多模态融合与临床转化

Runwei Guan, Shaofeng Liang, Jiacheng Weng, Xiaoyi Gu, Jia Weng, Daizong Liu, Duo Pan, Qingxin Zhang, Xiao Liang, Weiping Ding, Suoyu Zhu, Ming Yuan, Yanhua Fei

机构 * Department of Gynaecology and Obstetrics, The Affiliated Jiangyin Hospital of Nantong University(南通大学附属江阴医院妇产科) Department of Oncology, the Affiliated Jiangyin Hospital of Nantong University(南通大学附属江阴医院肿瘤科) Thrust of AI, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能推力实验室) FertiTech AI(生殖科技人工智能公司) Department of Oncology, Suzhou Xiangcheng People’s Hospital(苏州市相城区人民医院肿瘤科) Department of Biological Sciences and Bioinformatics, School of Science, Xi’an Jiaotong-Liverpool University(西交利物浦大学理学院生物科学与生物信息学系) School of Artificial Intelligence and Computer Science, Nantong University(南通大学人工智能与计算机科学学院)

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 针对传统精液分析的主观性强等缺陷,综述聚焦计算机视觉与深度学习驱动的精子分析技术,梳理方法、数据集与落地障碍,提出分阶段临床转化路线。

Comments 46 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20008 2026-03-25 cs.CV cs.AI 79%

Pedestrian Crossing Intention Prediction Using Multimodal Fusion Network

基于多模态融合网络的行人过街意图预测

Yuanzhe Li, Steffen Müller

机构 * Chair of Automotive Engineering, Technische Universität Berlin(柏林技术大学汽车工程系)

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 本文提出多模态融合网络,通过视觉和运动分支提取七种模态特征,有效整合互补信息,提升自动驾驶车辆在城市环境中对行人意图预测的准确性。

Comments 29th IAVSD International Symposium on Dynamics of Vehicles on Roads and Tracks (IAVSD 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22371 2026-03-25 eess.IV 79%

Multimodal Fusion of Skeleton Dynamics and Clinical Gait Features for Video-Based Cerebral Palsy Severity Assessment

基于骨骼动力学和临床步态特征的多模态融合用于视频基于的脑瘫严重程度评估

Kaiyuan Yang, Xupeng Chen, Jiangpeng He

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 eess.IV

AI总结 本文提出一种多模态融合框架,结合骨骼动力学和临床有意义的步态特征,提升视频脑瘫严重程度评估的预测性能和生物力学可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17966 2026-03-02 cs.IR cs.CV 79%

LLM-Enhanced Multimodal Fusion for Cross-Domain Sequential Recommendation

基于大语言模型的跨域序列推荐多模态融合

Wangyu Wu, Zhenhong Chen, Wenqiao Zhang, Xianglin Qiu, Siqi Song, Xiaowei Huang, Fei Ma, Jimin Xiao

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学) Microsoft(微软公司) Zhejiang University(浙江大学)

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 本文提出LLM-EMF方法,通过融合视觉和文本数据提升跨域序列推荐性能,利用CLIP模型生成多模态嵌入并引入多重注意力机制,实验证明其在多领域推荐中的有效性。

Comments arXiv admin note: substantial text overlap with arXiv:2504.15085

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19140 2026-02-24 cs.CV cs.LG 79%

CaReFlow: Cyclic Adaptive Rectified Flow for Multimodal Fusion

CaReFlow:循环适应修正流用于多模态融合

Sijie Mai, Shiqin Han

机构 * South China Normal University(华南师范大学)

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 CaReFlow通过循环适应修正流实现多模态融合,解决模态间隙问题,提升分布对齐和特征转换的鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10138 2026-02-12 cs.CV cs.AI cs.CL cs.LG 79%

Multimodal Information Fusion for Chart Understanding: A Survey of MLLMs -- Evolution, Limitations, and Cognitive Enhancement

多模态信息融合用于图表理解:MLLMs的综述——演变、局限与认知增强

Zhihang Yi, Jian Zhao, Jiancheng Lv, Tao Wang

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) Engineering Research Center of Machine Learning(机器学习工程研究中心) China Telecom Institute of AI(中国电信人工智能研究院)

专题命中 融合架构与评测 :information fusion(title,abstract);分类 cs.CV

AI总结 本文综述了多模态大语言模型在图表理解中的应用,分析了其演变、局限及未来发展方向,旨在推动更稳健的系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.05403 2026-01-28 cs.CV cs.LG 79%

Image deblurring based on lightweight multi-information fusion network

基于轻量级多信息融合网络的图像去模糊

Yanni Zhang, Yiming Liu, Qiang Li, Miao Qi, Dahong Xu, Jun Kong, Jianzhong Wang

专题命中 融合架构与评测 :information fusion(title,abstract);分类 cs.CV

AI总结 本文提出轻量级多信息融合网络,通过多尺度信息提取与融合策略,实现高效图像去模糊,减少参数量并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11354 2026-01-15 cs.CV 79%

A Multi-Mode Structured Light 3D Imaging System with Multi-Source Information Fusion for Underwater Pipeline Detection

一种基于多源信息融合的多模式结构光3D成像系统用于水下管道检测

Qinghan Hu, Haijiang Zhu, Na Sun, Lei Chen, Zhengqiang Fan, Zhiqing Li

机构 * College of Information Science and Technology, Beijing University of Chemical Technology, Beijing 100029, China(信息科学与技术学院,北京化工大学,中国北京100029) Department of Mechanical Engineering, Tsinghua University, Beijing 100084, China(机械工程系,清华大学,中国北京100084) Guoneng Zhishen Control Technology Co., Ltd., Beijing 102211, China(国能智深控制技术有限公司,中国北京102211) College of Intelligent Science and Engineering, Beijing University of Agriculture, Beijing 102206, China(智能科学与工程学院,北京农业大学,中国北京102206)

专题命中 融合架构与评测 :information fusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于多源信息融合的多模式结构光3D成像系统,用于水下管道检测,通过改进的校正方法和融合策略提升检测精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22878 2025-12-30 cs.CV cs.AI 79%

SwinTF3D: A Lightweight Multimodal Fusion Approach for Text-Guided 3D Medical Image Segmentation

SwinTF3D: 一种轻量级多模态融合方法用于文本引导的3D医学图像分割

Hasan Faraz Khan, Noor Fatima, Muzammil Behzad

机构 * King Fahd University of Petroleum(国王法赫德石油大学) SDAIA-KFUPM Joint Research Center for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心)

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 SwinTF3D通过统一视觉和语言表示,实现文本引导的3D医学图像分割,具备高效且适应性强的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13191 2025-12-16 cs.CV 79%

CoRA: A Collaborative Robust Architecture with Hybrid Fusion for Efficient Perception

CoRA: 一种具有混合融合的协作鲁棒架构以实现高效的感知

Gong Chen, Chaokun Zhang, Pengcheng Lv, Xiaohui Xie

专题命中 融合架构与评测 :hybrid fusion(title);feature-level fusion(abstract);分类 cs.CV

AI总结 CoRA通过混合融合方法实现高效且鲁棒的协作感知,显著提升性能并降低通信开销。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10210 2025-11-20 cs.CV 79%

MK-SGN: A Spiking Graph Convolutional Network with Multimodal Fusion and Knowledge Distillation for Skeleton-based Action Recognition

Naichuan Zheng, Hailun Xia, Zeyu Liang, Yuchen Du

机构 * Beijing Laboratory of Advanced Information Networks, Beijing Key Laboratory of Network System Architecture and Convergence, School of Information and Communication Engineering, Beijing University of Posts and Telecommunications(北京先进信息网络实验室、网络系统架构与收敛重点实验室、信息与通信工程学院、北京邮电大学)

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26289 2025-11-17 cs.MM 79%

Contribution-Guided Asymmetric Learning for Robust Multimodal Fusion under Imbalance and Noise

Zijing Xu, Yunfeng Kou, Kunming Wu, Hong Liu

专题命中 融合架构与评测 :multimodal fusion(title);information fusion(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10568 2025-11-17 cs.LG cs.AI cs.CL cs.CV 79%

MoPE: Mixture of Prompt Experts for Parameter-Efficient and Scalable Multimodal Fusion

Ruixiang Jiang, Lingbo Liu, Changwen Chen

机构 * Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学) Research Institute of Multiple Agents and Embodied Intelligence, Pengcheng Laboratory(多智能体与具身智能研究院,鹏城实验室)

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV

Comments Accepted to IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏