arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 495 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 495 篇

2306.11309 2023-06-21 cs.SD cs.CL eess.AS eess.SP 79%

Multi-pass Training and Cross-information Fusion for Low-resource End-to-end Accented Speech Recognition

Xuefei Wang, Yanhua Long, Yijie Li, Haoran Wei

专题命中 音视频/视觉语言融合 :information fusion(title,abstract);分类 eess.SP

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.11868 2023-01-10 cs.CV cs.SD eess.AS 79%

Interpretable Multimodal Emotion Recognition using Hybrid Fusion of Speech and Image Data

Puneet Kumar, Sarthak Malik, Balasubramanian Raman

专题命中 音视频/视觉语言融合 :hybrid fusion(title,abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2208.11450

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.10916 2022-11-29 cs.CV cs.CL cs.LG 79%

Hierachical Delta-Attention Method for Multimodal Fusion

Kunjal Panchal

专题命中 音视频/视觉语言融合 :multimodal fusion(title);multi-modal fusion(abstract);分类 cs.CV

Comments Need to update the results

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.12167 2021-07-27 cs.HC cs.CV cs.LG 79%

Multimodal Fusion Using Deep Learning Applied to Driver's Referencing of Outside-Vehicle Objects

Abdul Rafey Aftab, Michael von der Beeck, Steven Rohrhirsch, Benoit Diotte, Michael Feld

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.06107 2021-05-14 cs.SD cs.RO eess.AS 79%

Multi-target DoA Estimation with an Audio-visual Fusion Mechanism

Xinyuan Qian, Maulik Madhavi, Zexu Pan, Jiadong Wang, Haizhou Li

专题命中 音视频/视觉语言融合 :audio-visual fusion(title,abstract);分类 cs.RO

Comments ICASSP 2021 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.03977 2020-07-15 cs.AI cs.CL cs.CV cs.LG 79%

Multimodal Intelligence: Representation Learning, Information Fusion, and Applications

Chao Zhang, Zichao Yang, Xiaodong He, Li Deng

专题命中 音视频/视觉语言融合 :information fusion(title);multimodal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.01728 2019-05-02 eess.AS cs.LG cs.SD eess.IV stat.ML 79%

Attention-based Audio-Visual Fusion for Robust Automatic Speech Recognition

George Sterpu, Christian Saam, Naomi Harte

专题命中 音视频/视觉语言融合 :audio-visual fusion(title,abstract);分类 eess.IV

Comments In ICMI'18, October 16-20, 2018, Boulder, CO, USA. Equation (2) corrected on this version

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.10197 2017-07-03 cs.CV 79%

Improving Speech Related Facial Action Unit Recognition by Audiovisual Information Fusion

Zibo Meng, Shizhong Han, Ping Liu, Yan Tong

专题命中 音视频/视觉语言融合 :information fusion(title);feature-level fusion(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:1706.07536

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09202 2026-08-11 cs.AI 新提交 78%

CRUISE: Vision-Language Model-Guided Uncertainty-Aware Cross-Modal Sensor Fusion for Robust Autonomous Driving

CRUISE:面向鲁棒自动驾驶的视觉语言模型引导的不确定性感知跨模态传感器融合

Junyao Wang, Yulin Xu, Yu Li, Pramod Khargonekar, Mohammad Abdullah Al Faruque

机构 * University of California, Irvine(加利福尼亚大学欧文分校)

专题命中 音视频/视觉语言融合 :sensor fusion(title,abstract)

AI总结 针对现有不确定性感知融合方法泛化性差的问题,提出CRUISE框架,结合VLM引导的UQ模块与动态自适应机制,实现鲁棒的自动驾驶跨模态传感器融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07565 2026-08-11 cs.CL cs.AI 版本更新 78%

Expert-Guided Multimodal Fusion for Unified Emotion and Sentiment Analysis

通过专家引导的多模态融合与大语言模型的统一框架实现情绪识别与情感分析

Jiaqi Qiao, Xinran Li, Yifan Lyu, Xiujuan Xu, Liu Yu

机构 * School of Software, Dalian University of Technology, China(软件学院,大连理工大学,中国)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

AI总结 本文提出EGMF框架,通过专家引导的多模态融合与大语言模型结合,实现情绪识别与情感分析的统一处理,提升跨语言鲁棒性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27289 2026-07-31 cs.LG 新提交 78%

TIER-MoE: Trust-Informed Expert Routing via Conditional Modality Risk for Multimodal Fusion in Biomedical Classification

TIER-MoE:用于生物医学分类多模态融合的、基于条件模态风险的信任感知专家路由

Yu Chang, Anzhe Cheng, Chenwei Wu, Zhuoran Wang, Jiahao Chen, Tamoghna Chattopadhyay, Sophia I. Thomopoulos, Paul M. Thompson, Liyue Shen, Paul Bogdan

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

AI总结 该研究提出TIER-MoE风险引导子空间混合专家模型,用于生物医学分类多模态融合,可提升预测性能与概率校准,在多数据集上优于现有最优方法且具备强零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12686 2026-07-15 cs.CL 新提交 78%

Segregate, Refine, Integrate: Decomposing Multimodal Fusion for Sentiment Analysis

分离、细化、整合:用于情感分析的多模态融合分解

Alexios Filippakopoulos, Elias Kallioras, Nikolaos Xiros, Efthymios Georgiou, Alexandros Potamianos

机构 * National Technical University of Athens(雅典国立技术大学) Athena Research Center(雅典娜研究中心) University of Bern(伯尔尼大学) Archimedes AI(阿基米德人工智能公司) Synaptic Bloom PBC(突触绽放有限责任公司)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

AI总结 研究情感分析中的多模态融合问题,提出SeRIn方案,通过分离特定模态与跨模态路径,各自细化演变,将跨模态交互推迟到预测步骤,在CH - SIMS和CMU - MOSEI上取得领先成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26629 2026-06-29 cs.LG 版本更新 78%

Context-specific Credibility-aware Multimodal Fusion with Conditional Probabilistic Circuits

基于条件概率电路的上下文特定可信感知多模态融合

Pranuthi Tenali, Sahil Sidheekh, Saurabh Mathur, Erik Blasch, Kristian Kersting, Sriraam Natarajan

机构 * Department of Computer Science , TU Darmstadt(德累斯顿技术大学计算机科学系) Air Force Research Lab(空军研究实验室)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

AI总结 提出C$^2$MF框架,利用条件概率电路建模实例级源可靠性,通过KL散度度量上下文特定信息可信度,在跨模态冲突下提升预测准确率高达29%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19446 2026-06-05 eess.AS 78%

Leveraging Cascaded Binary Classification and Multimodal Fusion for Dementia Detection through Spontaneous Speech

利用级联二分类和多模态融合进行自发语音中的痴呆症检测

Yin-Long Liu, Yuanchao Li, Rui Feng, Liu He, Jia-Xin Chen, Yi-Ming Wang, Yu-Ang Chen, Yan-Han Peng, Jia-Hong Yuan, Zhen-Hua Ling

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

AI总结 本文提出了一种级联二分类和多模态融合的方法,用于通过自发语音进行早期痴呆症检测,解决了类别不平衡问题,并在Mini-Mental State Examination评分回归任务中实现了优于基线方法的性能。

Comments Accepted by Interspeech 2025

Journal ref Proc. Interspeech 2025, pp. 544-548, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18462 2026-03-20 cs.AI 78%

AlignMamba-2: Enhancing Multimodal Fusion and Sentiment Analysis with Modality-Aware Mamba

AlignMamba-2:通过模态感知Mamba增强多模态融合与情感分析

Yan Li, Yifei Xing, Xiangyuan Lan, Xin Li, Haifeng Chen, Dongmei Jiang

机构 * Pengcheng Laboratory(鹏城实验室) Shaanxi University of Science & Technology(陕西科技大学) School of Computer Science(计算机科学学院) Northwestern Polytechnical University(西北工业大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

AI总结 本文提出AlignMamba-2框架,通过双对齐策略和模态感知Mamba层,提升多模态融合与情感分析的效率与效果,实验表明其在动态时间序列和静态图像任务中均达到新水平。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23862 2026-03-02 cs.HC 78%

Human-Centered Multimodal Fusion for Sexism Detection in Memes with Eye-Tracking, Heart Rate, and EEG Signals

以人类为中心的多模态融合用于表情包中性别歧视检测:结合眼动追踪、心率和EEG信号

Iván Arcos, Paolo Rosso, Elena Gomis-Vicent

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

AI总结 本文提出了一种结合眼动追踪、心率和EEG信号的多模态融合模型,用于更准确地检测表情包中的性别歧视。

Comments Accepted to appear in the Proceedings of LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15098 2026-02-04 cs.LG cs.AI 78%

How Intermodal Interaction Affects the Performance of Deep Multimodal Fusion for Mixed-Type Time Series

多模态交互如何影响深度多模态融合在混合类型时间序列中的性能

Simon Dietz, Thomas Altstidl, Dario Zanca, Björn Eskofier, An Nguyen

机构 * FAU Erlangen-Nürnberg(弗赖堡大学埃尔朗根-纽伦堡分校)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

AI总结 本文研究了多模态交互对深度多模态融合在混合类型时间序列预测中的影响,通过三种融合类型和五种融合方法的比较,揭示了交互强度和方向对融合策略选择的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04605 2025-09-08 cs.CL 78%

Spoken in Jest, Detected in Earnest: A Systematic Review of Sarcasm Recognition -- Multimodal Fusion, Challenges, and Future Prospects

Xiyuan Gao, Shekhar Nayak, Matt Coler

机构 * Campus Fryslân, University of Groningen(格罗宁根大学弗里桑校区)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

Comments 20 pages, 7 figures, Submitted to IEEE Transactions on Affective Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11064 2025-06-16 eess.AS cs.AI cs.CL cs.SD 78%

PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding

Jiajun He, Tomoki Toda

机构 * Graduate School of Informatics, Nagoya University(信息学研究科,名古屋大学) Information Technology Center, Nagoya University(信息科技中心,名古屋大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

Comments Accepted by IEEE TASLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16454 2025-03-24 cs.HC cs.AI 78%

An Audio-Visual Fusion Emotion Generation Model Based on Neuroanatomical Alignment

Haidong Wang, Qia Shan, JianHua Zhang, PengFei Xiao, Ao Liu

专题命中 音视频/视觉语言融合 :audio-visual fusion(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12004 2025-01-22 eess.AS cs.SD 78%

Speech Enhancement with Overlapped-Frame Information Fusion and Causal Self-Attention

Yuewei Zhang, Huanbin Zou, Jie Zhu

专题命中 音视频/视觉语言融合 :information fusion(title,abstract)

Comments Accepted by ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09115 2024-10-29 cs.LG cs.AI 78%

HEALNet: Multimodal Fusion for Heterogeneous Biomedical Data

Konstantin Hemker, Nikola Simidjievski, Mateja Jamnik

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00056 2024-07-02 cs.IR cs.AI cs.SI 78%

MMBee: Live Streaming Gift-Sending Recommendations via Multi-Modal Fusion and Behaviour Expansion

Jiaxin Deng, Shiyao Wang, Yuchen Wang, Jiansong Qi, Liqin Zhao, Guorui Zhou, Gaofeng Meng

专题命中 音视频/视觉语言融合 :multi-modal fusion(title,abstract)

Comments Accepted at KDD 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12987 2024-04-02 cs.CL cs.LG cs.SD eess.AS 78%

TelME: Teacher-leading Multimodal Fusion Network for Emotion Recognition in Conversation

Taeyang Yun, Hyunkuk Lim, Jeonghwan Lee, Min Song

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

Comments NAACL 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10279 2024-03-18 cs.CY 78%

Emotion-Aware Multimodal Fusion for Meme Emotion Detection

Shivam Sharma, Ramaneswaran S, Md. Shad Akhtar, Tanmoy Chakraborty

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

Comments Accepted to IEEE Transactions on Affective Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.15389 2023-06-28 cs.SD cs.LG eess.AS 78%

Multi-perspective Information Fusion Res2Net with RandomSpecmix for Fake Speech Detection

Shunbo Dong, Jun Xue, Cunhang Fan, Kang Zhu, Yujie Chen, Zhao Lv

专题命中 音视频/视觉语言融合 :information fusion(title,abstract)

Comments Accepted by DADA2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.00854 2020-02-25 eess.AS cs.SD 78%

Re-synchronization using the Hand Preceding Model for Multi-modal Fusion in Automatic Continuous Cued Speech Recognition

Li Liu, Gang Feng, Denis Beautemps, Xiao-Ping Zhang

专题命中 音视频/视觉语言融合 :multi-modal fusion(title,abstract)

Journal ref IEEE TMM-2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09155 2023-07-19 cs.CV 77%

MLF-DET: Multi-Level Fusion for Cross-Modal 3D Object Detection

Zewei Lin, Yanqing Shen, Sanping Zhou, Shitao Chen, Nanning Zheng

专题命中 音视频/视觉语言融合 :image fusion(abstract);feature-level fusion(abstract);decision-level fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.10738 2020-06-23 cs.CV 77%

Non-linear and Selective Fusion of Cross-Modal Images

Aiqing Fang, Xinbo Zhao, Jiaqi Yang, Yanning Zhang

专题命中 音视频/视觉语言融合 :image fusion(abstract);infrared and visible(abstract);multi-focus(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23755 2026-08-11 cs.CV cs.RO 交叉投稿 76%

DAP-Pose: Deep Temporal Alignment and Physics-aware Cross-modal Sensor Fusion for Robust Pose Estimation

DAP-Pose:用于鲁棒姿态估计的深度时间对齐和物理感知跨模态传感器融合

Jianhan Lin, Yuchu Qin, Jiateng Yuan, Wenbo Zhang, Shuai Gao

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) International Research Center of Big Data for Sustainable Development Goals(可持续发展大数据国际研究中心) University of Chinese Academy of Sciences(中国科学院大学) The University of Adelaide(阿德莱德大学)

专题命中 音视频/视觉语言融合 :sensor fusion(title);分类 cs.CV、cs.RO

AI总结 针对复杂环境下多模态传感器的姿态估计问题,提出DAP-Pose模型,通过双级跨模态融合模块捕捉线索,深度时间对齐模块处理异步流,结合物理感知约束,在KITTI数据集上达最优性能,平均平移误差1.31%,旋转误差0.46°,严重错位下也能准确估计。

详情

展开后加载摘要…

URL PDF HTML 收藏