arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 495 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 495 篇

2406.15160 2024-06-24 eess.AS eess.SP 85%

Exploring Audio-Visual Information Fusion for Sound Event Localization and Detection In Low-Resource Realistic Scenarios

Ya Jiang, Qing Wang, Jun Du, Maocheng Hu, Pengfei Hu, Zeyan Liu, Shi Cheng, Zhaoxu Nian, Yuxuan Dong, Mingqi Cai, Xin Fang, Chin-Hui Lee

专题命中 音视频/视觉语言融合 :information fusion(title,abstract);multi-modal fusion(abstract);audio-visual fusion(abstract);分类 eess.SP

Comments accepted by icme2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05964 2024-10-10 cs.CV cs.AI 83%

STNet: Deep Audio-Visual Fusion Network for Robust Speaker Tracking

Yidi Li, Hong Liu, Bing Yang

专题命中 音视频/视觉语言融合 :audio-visual fusion(title,abstract);multi-modal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14974 2024-03-25 cs.CV 83%

AVT2-DWF: Improving Deepfake Detection with Audio-Visual Fusion and Dynamic Weighting Strategies

Rui Wang, Dengpan Ye, Long Tang, Yunming Zhang, Jiacheng Deng

专题命中 音视频/视觉语言融合 :audio-visual fusion(title);multi-modal fusion(abstract);information fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01301 2023-12-19 cs.LG cs.AI cs.CE cs.CV cs.HC 83%

Churn Prediction via Multimodal Fusion Learning:Integrating Customer Financial Literacy, Voice, and Behavioral Data

David Hason Rudd, Huan Huo, Md Rafiqul Islam, Guandong Xu

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);hybrid fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.08910 2021-11-18 cs.SD cs.MM eess.AS 83%

Information Fusion in Attention Networks Using Adaptive and Multi-level Factorized Bilinear Pooling for Audio-visual Emotion Recognition

Hengshun Zhou, Jun Du, Yuanyuan Zhang, Qing Wang, Qing-Feng Liu, Chin-Hui Lee

专题命中 音视频/视觉语言融合 :information fusion(title,abstract);multimodal fusion(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.08312 2020-12-16 cs.LG cs.CL cs.SD eess.AS 82%

QUARC: Quaternion Multi-Modal Fusion Architecture For Hate Speech Classification

Deepak Kumar, Nalin Kumar, Subhankar Mishra

专题命中 音视频/视觉语言融合 :multi-modal fusion(title,abstract);image fusion(abstract)

Comments Accepted in Proc. of the 4th International Workshop on Dialog Systems (IWDS2021) in conjunction with the IEEE BigComp2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06728 2026-04-09 cs.CV cs.AI cs.MM 81%

URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection

URMF:面向多模态讽刺检测的不确定性感知鲁棒多模态融合

Zhenyu Wang, Weichen Cheng, Weijia Li, Junjie Mou, Zongyou Zhao, Guoying Zhang

机构 * School of Artificial Intelligence, China University of Mining and Technology-Beijing(中国矿业大学(北京)人工智能学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出URMF框架,通过建模模态可靠性提升多模态讽刺检测的准确性和鲁棒性,采用多头交叉注意力和自注意力机制,并结合不确定性建模和联合训练目标,在公开基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16928 2024-12-24 cs.SD cs.CV cs.MM eess.AS 81%

AV-DTEC: Self-Supervised Audio-Visual Fusion for Drone Trajectory Estimation and Classification

Zhenyuan Xiao, Yizhuo Yang, Guili Xu, Xianglong Zeng, Shenghai Yuan

专题命中 音视频/视觉语言融合 :audio-visual fusion(title,abstract);分类 cs.CV、cs.MM

Comments Submitted to ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00379 2023-10-02 eess.IV cs.CV 81%

Improved Multimodal Fusion for Small Datasets with Auxiliary Supervision

Gregory Holste, Douwe van der Wal, Hans Pinckaers, Rikiya Yamashita, Akinori Mitani, Andre Esteva

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV、eess.IV

Comments IEEE ISBI 2023 (see http://2023.biomedicalimaging.org/en/)

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.07848 2020-12-11 cs.CV cs.LG cs.MM 81%

Modality to Modality Translation: An Adversarial Representation Learning and Graph Fusion Network for Multimodal Fusion

Sijie Mai, Haifeng Hu, Songlong Xing

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by AAAI-2020; code is available at: https://github.com/TmacMai/ARGF_multimodal_fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.03414 2018-10-09 cs.CV cs.MM 81%

Dense Multimodal Fusion for Hierarchically Joint Representation

Di Hu, Feiping Nie, Xuelong Li

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV、cs.MM

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19086 2026-07-22 cs.CV 新提交 79%

Advancing Multimodal Fusion on Heterogeneous Medical Data with Hybrid Geometry Attention

利用混合几何注意力推进异构医学数据上的多模态融合

Joy Dhar, Manish Kumar Pandey, Nayyar Zaidi, Chen Chen, Maryam Haghighat, Ferdous Sohel, Puneet Goyal

机构 * Indian Institute of Technology Ropar(印度理工学院罗帕尔分校) RoentGen Health(伦琴健康公司) Deakin University(迪肯大学) University of Central Florida(中佛罗里达大学) Queensland University of Technology(昆士兰科技大学) Murdoch University(莫道克大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 针对异构医学数据多模态融合难题,提出CURE框架,通过HyFuse层及相关模块逐步整合模态,有效捕捉跨模态交互,降低计算成本,在多数据集上评估显示其性能显著提升,优于领先方法。

Comments ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07438 2026-07-09 cs.CV 新提交 79%

Two-Stage Multi-Modal Fusion with Adaptive Alignment for Action Quality Assessment

用于动作质量评估的具有自适应对齐的两阶段多模态融合

Kanglei Zhou, Ruizhi Cai, Xinning Wang, Yijian Zheng, Liyuan Wang, Jianguo Li, Xiaohui Liang

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学) Children’s Hospital, Capital Institute of Pediatrics(首都儿科研究所附属儿童医院) Zhongguancun Laboratory(中关村实验室)

专题命中 音视频/视觉语言融合 :multi-modal fusion(title,abstract);分类 cs.CV

AI总结 研究动作质量评估问题,提出两阶段多模态融合框架DualAlign,通过自适应对齐解决跨模态错位等挑战,引入MM-JDM数据集,实验表明该框架在多模态评估中表现出色,相比现有方法有显著提升且在特定条件下稳健。

Comments Accepted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02743 2026-06-01 cs.CV cs.AI 79%

Reasoning-Aware Multimodal Fusion for Hateful Video Detection

面向仇恨视频检测的推理感知多模态融合

Shuonan Yang, Tailin Chen, Jiangbei Yue, Guangliang Cheng, Jianbo Jiao, Zeyu Fu

机构 * Multimodal Intelligence Lab(多模态智能实验室) Department of Computer Science(计算机科学系) University of Exeter(埃克塞特大学) School of Computer Science(计算机科学学院) University of Leeds(利兹大学) School of Computer Science and Informatics(计算机科学与信息学学院) University of Liverpool(利物浦大学) University of Birmingham(伯明翰大学) Machine Intelligence + x Group(机器智能+X小组)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 提出推理感知多模态融合框架,通过局部-全局上下文融合和语义交叉注意力实现多模态交互,并引入对抗推理生成互补语义视角,在仇恨视频检测中提升Macro-F1和召回率3%和7%。

Comments Accepted at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21670 2026-05-26 cs.CV cs.LG 79%

Diverse via bounded Agreement: Geometric Regularization for Multimodal Fusion

通过有界一致性实现多样性:多模态融合的几何正则化

Zixuan Xia, Hao Wang, Pengcheng Weng, Yanyu Qian, Yangxin Xu, William Dan, Fei Wang

机构 * Department of Informatics University of Bern(伯尔尼大学信息学院) College of Computing and Data Science Nanyang Technological University(南洋理工大学计算机与数据科学学院) School of Software Engineering Xi’an Jiaotong University(西安交通大学软件工程学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 提出一种轻量级即插即用的几何正则化框架,通过有界一致性原则在保持模态特异多样性的同时约束跨模态漂移,提升多模态融合性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16939 2026-03-19 cs.CV 79%

Solution for 10th Competition on Ambivalence/Hesitancy (AH) Video Recognition Challenge using Divergence-Based Multimodal Fusion

第十届Ambivalence/Hesitancy(AH)视频识别挑战赛中基于分歧的多模态融合解决方案

Aislan Gabriel O. Souza, Agostinho Freire, Leandro Honorato Silva, Igor Lucas B. da Silva, João Vinícius R. de Andrade, Gabriel C. de Albuquerque, Lucas Matheus da S. Oliveira, Mário Stela Guerra, Luciana Machado

机构 * Universidade de Pernambuco(巴伊亚大学) Escola Politécnica de Pernambuco(巴伊亚理工学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 本文提出基于分歧的多模态融合方法,通过测量视觉、音频和文本通道间的跨模态冲突,提升AH识别性能,在BAH数据集上达到0.6808的宏F1分数,优于基准线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22744 2025-09-30 eess.AS cs.AI cs.MM cs.SD 79%

Index-MSR: A high-efficiency multimodal fusion framework for speech recognition

Jinming Chen, Lu Wang, Zheshu Song, Wei Deng

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.MM

Comments Submit to icassp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14592 2025-09-19 cs.MM cs.SD 79%

MMED: A Multimodal Micro-Expression Dataset based on Audio-Visual Fusion

Junbo Wang, Yan Zhao, Shuo Li, Shibo Wang, Shigang Wang, Jian Wei

机构 * College of Communication Engineering, Jilin University(吉林大学通信工程学院)

专题命中 音视频/视觉语言融合 :audio-visual fusion(title);multimodal fusion(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18322 2025-08-27 cs.CV cs.AI 79%

Structures Meet Semantics: Multimodal Fusion via Graph Contrastive Learning

Jiangfeng Sun, Sihao He, Zhonghong Ou, Meina Song

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV

Comments 9 pages,7 figures,conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06902 2025-08-12 cs.CV 79%

eMotions: A Large-Scale Dataset and Audio-Visual Fusion Network for Emotion Analysis in Short-form Videos

Xuecheng Wu, Dingkang Yang, Danlei Huang, Xinyi Yin, Yifan Wang, Jia Zhang, Jiayu Nie, Liangyu Fu, Yang Liu, Junxiao Xue, Hadi Amirpour, Wei Zhou

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) College of Intelligent Robotics and Advanced Manufacturing, Fudan University & ByteDance(智能机器人与先进制造学院,复旦大学 & 字节跳动) School of Cyber Science and Engineering, Zhengzhou University(网络科学与工程学院,郑州大学) Institute of Advanced Technology, University of Science and Technology of China(先进技术研究院,中国科学技术大学) Inspur Electronic Information Industry Co., Ltd(Inspur电子信息产业有限公司) Department of Computer Science, The University of Toronto(计算机科学系,多伦多大学) Research Center for Space Computing System, Zhejiang Lab(空间计算系统研究中心,浙江实验室) Institute of Information Technology, University of Klagenfurt(信息技术学院,克雷格福特大学) School of Computer Science and Informatics, Cardiff University(计算机科学与信息学院,卡迪夫大学)

专题命中 音视频/视觉语言融合 :audio-visual fusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06789 2025-04-07 cs.RO 79%

AV-PedAware: Self-Supervised Audio-Visual Fusion for Dynamic Pedestrian Awareness

Yizhuo Yang, Shenghai Yuan, Muqing Cao, Jianfei Yang, Lihua Xie

专题命中 音视频/视觉语言融合 :audio-visual fusion(title,abstract);分类 cs.RO

Comments This work has been accepted for publication at the 2023 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). Personal use is permitted. For other uses, permission from IEEE is required

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10523 2025-03-14 cs.CV 79%

Interactive Multimodal Fusion with Temporal Modeling

Jun Yu, Yongqi Wang, Lei Wang, Yang Zheng, Shengfan Xu

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16786 2025-03-03 cs.CV 79%

SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding

Liangtao Shi, Ting Liu, Xiantao Hu, Yue Hu, Quanjun Yin, Richang Hong

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05603 2024-11-11 cs.CV 79%

Efficient Audio-Visual Fusion for Video Classification

Mahrukh Awan, Asmar Nadeem, Armin Mustafa

专题命中 音视频/视觉语言融合 :audio-visual fusion(title,abstract);分类 cs.CV

Comments CVMP Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05760 2024-06-25 cs.CV cs.CL 79%

Similarity Guided Multimodal Fusion Transformer for Semantic Location Prediction in Social Media

Zhizhen Zhang, Ning Wang, Haojie Li, Zhihui Wang

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13260 2024-05-29 cs.CL cs.MM cs.SD eess.AS 79%

MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction

Jiajun He, Xiaohan Shi, Xingfeng Li, Tomoki Toda

专题命中 音视频/视觉语言融合 :multimodal fusion(title);multi-modal fusion(abstract);分类 cs.MM

Comments Accepted by ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15875 2024-04-25 cs.MM 79%

Simple but Effective Raw-Data Level Multimodal Fusion for Composed Image Retrieval

Haokun Wen, Xuemeng Song, Xiaolin Chen, Yinwei Wei, Liqiang Nie, Tat-Seng Chua

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.MM

Comments ACM SIGIR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17604 2024-02-09 cs.CV cs.SD eess.AS 79%

Computation and Parameter Efficient Multi-Modal Fusion Transformer for Cued Speech Recognition

Lei Liu, Li Liu, Haizhou Li

专题命中 音视频/视觉语言融合 :multi-modal fusion(title,abstract);分类 cs.CV

Comments Accepted by TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20251 2023-11-01 cs.MM 79%

An Implementation of Multimodal Fusion System for Intelligent Digital Human Generation

Yingjie Zhou, Yaodong Chen, Kaiyue Bi, Lian Xiong, Hui Liu

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15082 2023-09-27 cs.CV 79%

RPEFlow: Multimodal Fusion of RGB-PointCloud-Event for Joint Optical Flow and Scene Flow Estimation

Zhexiong Wan, Yuxin Mao, Jing Zhang, Yuchao Dai

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV

Comments ICCV 2023. Project page: https://npucvr.github.io/RPEFlow Code: https://github.com/danqu130/RPEFlow

详情

展开后加载摘要…

URL PDF HTML 收藏