arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 495 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 495 篇

2507.09966 2025-10-21 eess.IV cs.AI cs.CV cs.LG 76%

Multimodal Fusion at Three Tiers: Physics-Driven Data Generation and Vision-Language Guidance for Brain Tumor Segmentation

Mingda Zhang

机构 * Software School, Yunnan University, Kunming 650504, Yunnan, China(云南大学软件学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(title);分类 cs.CV、eess.IV

Comments 31 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.05222 2024-07-09 cs.CV cs.SD eess.AS eess.IV 76%

Cross Attentional Audio-Visual Fusion for Dimensional Emotion Recognition

R. Gnana Praveen, Eric Granger, Patrick Cardinal

专题命中 音视频/视觉语言融合 :audio-visual fusion(title);分类 cs.CV、eess.IV

Comments Accepted in FG2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10331 2023-11-20 eess.IV cs.CV 76%

Leveraging Multimodal Fusion for Enhanced Diagnosis of Multiple Retinal Diseases in Ultra-wide OCTA

Hao Wei, Peilun Shi, Guitao Bai, Minqing Zhang, Shuangle Li, Wu Yuan

专题命中 音视频/视觉语言融合 :multimodal fusion(title);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.05961 2022-02-15 cs.CV eess.IV 76%

Audio-Visual Fusion Layers for Event Type Aware Video Recognition

Arda Senocak, Junsik Kim, Tae-Hyun Oh, Hyeonggon Ryu, Dingzeyu Li, In So Kweon

专题命中 音视频/视觉语言融合 :audio-visual fusion(title);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12715 2026-08-05 cs.CV 版本更新 74%

VLC Fusion: Vision-Language Conditioned Sensor Fusion for Robust Object Detection

VLC Fusion:面向鲁棒目标检测的视觉-语言条件传感器融合

Aditya Taparia, Noel Ngu, Mario Leiva, Joshua Shay Kricheli, John Corcoran, Nathaniel D. Bastian, Gerardo Simari, Paulo Shakarian, Ransalu Senanayake

机构 * Arizona State University(亚利桑那州立大学) Department of Computer Science and Engineering, Universidad Nacional del Sur and Institute for Computer Science and Engineering(计算机科学与工程系,国家南方大学和计算机科学与工程研究所) U.S. Department of Defense(美国国防部) United States Military Academy(美国军事学院) Syracuse University(雪城大学)

专题命中 音视频/视觉语言融合 :sensor fusion(title);分类 cs.CV

AI总结 本文提出VLC Fusion视觉-语言条件传感器融合框架,利用VLM捕捉环境线索动态调整模态权重,在多传感器融合目标检测任务中,于自动驾驶与军事目标数据集上较传统方法实现更优性能。

Comments 27 pages, 20 figures, Accepted for presentation at ECML PKDD 2026, Shortlisted for the Best Research Track Student Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02533 2026-07-23 cs.RO cs.LG 74%

HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models

HMVLA:超几何多模态融合用于视觉-语言-动作模型

Kun Wang, Xiao Feng, Mingcheng Qu, Tonghua Su

机构 * Harbin Institute of Technology(哈尔滨工业大学) Chongqing Research Institute of HIT(重庆HIT研究 institute) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 音视频/视觉语言融合 :multimodal fusion(title);分类 cs.RO

AI总结 HMVLA通过在双曲空间中融合视觉、语言和动作信息,提升多模态语义对齐的效率和准确性。

Comments 5 pages,5 figures,ICASSP

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19682 2026-06-19 cs.CV 新提交 74%

Vortex: Multi-Modal Fusion System for Intelligent Video Retrieval

Vortex: 面向智能视频检索的多模态融合系统

Duc-Tho Nguyen, Hieu-Hoc Tran-Minh, Khanh-Hoa Lam, Hoang-Nhut Ly, Huu-Phuc Huynh, Thanh-Tien Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南国立大学胡志明市理科大学) Vietnam National University, Ho Chi Minh City(越南国立大学胡志明市)

专题命中 音视频/视觉语言融合 :multi-modal fusion(title);分类 cs.CV

AI总结 提出Vortex系统,融合自适应关键帧提取、多模态元数据生成及混合检索策略(CLIP与SigLIP2的倒数秩融合),结合Rocchio反馈和多阶段时序搜索,在比赛中取得优异成绩。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05760 2026-06-05 cs.CV 74%

ExpSpeech-Net: Multimodal Fusion of Expression and Speech for Deepfake Detection

ExpSpeech-Net: 表情与语音的多模态融合用于深度伪造检测

Ruchika Sharma, Rudresh Dwivedi

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(title);分类 cs.CV

AI总结 提出轻量级ExpSpeech-Net模型,通过融合面部表情和语音模式,利用SqueezeNet和RNN骨干网络及智能特征选择,实现高效深度伪造检测,准确率达94.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15818 2026-03-18 cs.CV 74%

Conflict-Aware Multimodal Fusion for Ambivalence and Hesitancy Recognition

具有冲突意识的多模态融合用于矛盾与犹豫识别

Salah Eddine Bekhouche, Hichem Telli, Azeddine Benlamoudi, Salah Eddine Herrouz, Abdelmalik Taleb-Ahmed, Abdenour Hadid

机构 * University of the Basque Country UPV/EHU(巴斯克大学UPV/EHU) Laboratory of LESIA, University of Biskra(贝斯克拉大学LESIA实验室) Lab. de Génie Electrique (LAGE), University Kasdi Merbah Ouargla(奥尔加拉大学LAGE实验室) Institute of Electronics, Microelectronics and Nanotechnology (IEMN), Polytechnic University of Hauts-de-France, University of Lille(电子、微电子与纳米技术研究所(IEMN),法国 Hauts-de-France 工业大学,里尔大学) Sorbonne Center for Artificial Intelligence, Sorbonne University Abu Dhabi, UAE(索邦人工智能中心,索邦大学阿布扎比校区,阿联酋)

专题命中 音视频/视觉语言融合 :multimodal fusion(title);分类 cs.CV

AI总结 本文提出ConflictAwareAH框架,通过多模态融合识别矛盾与犹豫状态,提升F1指标,采用冲突特征作为双向线索,改进模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20818 2026-02-25 cs.CV 74%

GatedCLIP: Gated Multimodal Fusion for Hateful Memes Detection

GatedCLIP:用于仇恨表情包检测的门控多模态融合

Yingying Guo, Ke Zhang, Zirong Zeng

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 音视频/视觉语言融合 :multimodal fusion(title);分类 cs.CV

AI总结 GatedCLIP通过门控融合和对比学习提升多模态仇恨表情包检测性能,实现0.66 AUROC优于CLIP基线。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06351 2026-02-09 cs.AI cs.CV 74%

Trifuse: Enhancing Attention-Based GUI Grounding via Multimodal Fusion

Trifuse: 通过多模态融合增强基于注意力的GUI定位

Longhui Ma, Di Zhao, Siwei Wang, Zhao Lv, Miao Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) Intelligent Game and Decision Lab, Academy of Military Sciences(智能游戏与决策实验室,军事科学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(title);分类 cs.CV

AI总结 Trifuse通过多模态融合提升GUI定位性能,整合注意力、OCR文本和图标描述语义,无需任务微调即可实现高效定位。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10560 2025-10-14 cs.CL cs.AI cs.CV 74%

BitMar: Low-Bit Multimodal Fusion with Episodic Memory for Edge Devices

Euhid Aman, Esteban Carlin, Hsing-Kuo Pao, Giovanni Beltrame, Ghaluh Indah Permata Sari, Yie-Tarng Chen

机构 * NTUST(国立台湾科技大学) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(title);分类 cs.CV

Comments 6 pages, BabyLM Workshop, EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02247 2025-09-30 cs.CV 74%

EgoVIS@CVPR: PAIR-Net: Enhancing Egocentric Speaker Detection via Pretrained Audio-Visual Fusion and Alignment Loss

Yu Wang, Juhyung Ha, David J. Crandall

机构 * Indiana University(印第安纳大学)

专题命中 音视频/视觉语言融合 :audio-visual fusion(title);分类 cs.CV

Comments 4 pages, 1 figure, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19719 2025-09-25 cs.CV 74%

Frequency-domain Multi-modal Fusion for Language-guided Medical Image Segmentation

Bo Yu, Jianhua Yang, Zetao Du, Yan Huang, Chenglong Li, Liang Wang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院)

专题命中 音视频/视觉语言融合 :multi-modal fusion(title);分类 cs.CV

Comments Accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19052 2025-07-28 cs.CV 74%

Probing Multimodal Fusion in the Brain: The Dominance of Audiovisual Streams in Naturalistic Encoding

Hamid Abdollahi, Amir Hossein Mansouri Majoumerd, Amir Hossein Bagheri Baboukani, Amir Abolfazl Suratgar, Mohammad Bagher Menhaj

机构 * Distributed and Intelligent Optimization Research Laboratory(分布式智能优化研究实验室) Electrical Engineering Department(电气工程系) Amirkabir University of Technology(阿米尔卡比尔技术大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09323 2025-07-15 cs.CV 74%

Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition

Kaixuan Cong, Yifan Wang, Rongkun Xue, Yuyang Jiang, Yiming Feng, Jing Yang

机构 * School of Automation Science and Engineering, Xi’an Jiaotong University, Xi’an, China(自动化科学与工程学院,西安交通大学,西安,中国) School of Software Engineering, Xi’an Jiaotong University, Xi’an, China(软件工程学院,西安交通大学,西安,中国)

专题命中 音视频/视觉语言融合 :audio-visual fusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10019 2025-06-17 cs.CV 74%

Dissecting RGB-D Learning for Improved Multi-modal Fusion

Hao Chen, Haoran Zhou, Yunshu Zhang, Zheng Lin, Yongjian Deng

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及跨学科应用国家重点实验室(东南大学)) Tsinghua University(清华大学) College of Computer Science, Beijing University of Technology(北京理工大学计算机学院)

专题命中 音视频/视觉语言融合 :multi-modal fusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02393 2025-05-09 cs.CV 74%

Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection

Sungheon Jeong, Jihong Park, Mohsen Imani

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 音视频/视觉语言融合 :multimodal fusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02243 2024-09-05 cs.CV 74%

A Novel Audio-Visual Information Fusion System for Mental Disorders Detection

Yichun Li, Shuanglin Li, Syed Mohsen Naqvi

专题命中 音视频/视觉语言融合 :information fusion(title);分类 cs.CV

Comments 27th International Conference on Information (FUSION)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14441 2024-08-27 cs.CV cs.AI 74%

Attend-Fusion: Efficient Audio-Visual Fusion for Video Classification

Mahrukh Awan, Asmar Nadeem, Muhammad Junaid Awan, Armin Mustafa, Syed Sameed Husain

专题命中 音视频/视觉语言融合 :audio-visual fusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.14779 2024-07-09 cs.CV cs.HC cs.SD eess.AS 74%

A Joint Cross-Attention Model for Audio-Visual Fusion in Dimensional Emotion Recognition

R. Gnana Praveen, Wheidima Carneiro de Melo, Nasib Ullah, Haseeb Aslam, Osama Zeeshan, Théo Denorme, Marco Pedersoli, Alessandro Koerich, Simon Bacon, Patrick Cardinal, Eric Granger

专题命中 音视频/视觉语言融合 :audio-visual fusion(title);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2111.05222

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12853 2024-07-02 cs.CV 74%

Inconsistency-Aware Cross-Attention for Audio-Visual Fusion in Dimensional Emotion Recognition

G Rajasekhar, Jahangir Alam

专题命中 音视频/视觉语言融合 :audio-visual fusion(title);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2403.19554

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01210 2024-06-05 cs.CV 74%

GeminiFusion: Efficient Pixel-wise Multimodal Fusion for Vision Transformer

Ding Jia, Jianyuan Guo, Kai Han, Han Wu, Chao Zhang, Chang Xu, Xinghao Chen

专题命中 音视频/视觉语言融合 :multimodal fusion(title);分类 cs.CV

Comments Accepted by ICML 2024, code and models are available at https://github.com/JiaDingCN/GeminiFusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13659 2024-04-16 cs.CV cs.SD eess.AS 74%

Recursive Joint Cross-Modal Attention for Multimodal Fusion in Dimensional Emotion Recognition

R. Gnana Praveen, Jahangir Alam

专题命中 音视频/视觉语言融合 :multimodal fusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07212 2023-12-13 cs.MM cs.AI cs.SD eess.AS 74%

More than Vanilla Fusion: a Simple, Decoupling-free, Attention Module for Multimodal Fusion Based on Signal Theory

Peiwen Sun, Yifan Zhang, Zishan Liu, Donghao Chen, Honggang Zhang

专题命中 音视频/视觉语言融合 :multimodal fusion(title);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05071 2023-11-10 cs.LG cs.CV cs.SD eess.AS 74%

On the Behavior of Audio-Visual Fusion Architectures in Identity Verification Tasks

Daniel Claborne, Eric Slyman, Karl Pazdernik

专题命中 音视频/视觉语言融合 :audio-visual fusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07925 2023-09-18 eess.AS cs.AI cs.MM cs.SD 74%

Hierarchical Audio-Visual Information Fusion with Multi-label Joint Decoding for MER 2023

Haotian Wang, Yuxuan Xi, Hang Chen, Jun Du, Yan Song, Qing Wang, Hengshun Zhou, Chenxi Wang, Jiefeng Ma, Pengfei Hu, Ya Jiang, Shi Cheng, Jie Zhang, Yuzhe Weng

专题命中 音视频/视觉语言融合 :information fusion(title);分类 cs.MM

Comments 5 pages, 4 figures

Journal ref The 31st ACM International Conference on Multimedia (MM'23), 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.17404 2023-07-03 cs.CV 74%

QuAVF: Quality-aware Audio-Visual Fusion for Ego4D Talking to Me Challenge

Hsi-Che Lin, Chien-Yi Wang, Min-Hung Chen, Szu-Wei Fu, Yu-Chiang Frank Wang

专题命中 音视频/视觉语言融合 :audio-visual fusion(title);分类 cs.CV

Comments 1st place at Ego4D Talking to Me (TTM) Challenge 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.07958 2023-04-18 cs.CV cs.SD eess.AS 74%

Recursive Joint Attention for Audio-Visual Fusion in Regression based Emotion Recognition

R Gnana Praveen, Eric Granger, Patrick Cardinal

专题命中 音视频/视觉语言融合 :audio-visual fusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.00135 2022-12-02 cs.CV 74%

Attention Bottlenecks for Multimodal Fusion

Arsha Nagrani, Shan Yang, Anurag Arnab, Aren Jansen, Cordelia Schmid, Chen Sun

专题命中 音视频/视觉语言融合 :multimodal fusion(title);分类 cs.CV

Comments Published at NeurIPS 2021. Note this version updates numbers due to a bug in the AudioSet mAP calculation in Table 1 (last row)

详情

展开后加载摘要…

URL PDF HTML 收藏