Multi-pass Training and Cross-information Fusion for Low-resource End-to-end Accented Speech Recognition
专题命中 音视频/视觉语言融合 :information fusion(title,abstract);分类 eess.SP
视觉与机器人
面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。
专题命中 音视频/视觉语言融合 :information fusion(title,abstract);分类 eess.SP
专题命中 音视频/视觉语言融合 :hybrid fusion(title,abstract);分类 cs.CV
Comments arXiv admin note: text overlap with arXiv:2208.11450
专题命中 音视频/视觉语言融合 :multimodal fusion(title);multi-modal fusion(abstract);分类 cs.CV
Comments Need to update the results
专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV
专题命中 音视频/视觉语言融合 :audio-visual fusion(title,abstract);分类 cs.RO
Comments ICASSP 2021 accepted
专题命中 音视频/视觉语言融合 :information fusion(title);multimodal fusion(abstract);分类 cs.CV
专题命中 音视频/视觉语言融合 :audio-visual fusion(title,abstract);分类 eess.IV
Comments In ICMI'18, October 16-20, 2018, Boulder, CO, USA. Equation (2) corrected on this version
专题命中 音视频/视觉语言融合 :information fusion(title);feature-level fusion(abstract);分类 cs.CV
Comments arXiv admin note: text overlap with arXiv:1706.07536
CRUISE:面向鲁棒自动驾驶的视觉语言模型引导的不确定性感知跨模态传感器融合
机构 * University of California, Irvine(加利福尼亚大学欧文分校)
专题命中 音视频/视觉语言融合 :sensor fusion(title,abstract)
AI总结 针对现有不确定性感知融合方法泛化性差的问题,提出CRUISE框架,结合VLM引导的UQ模块与动态自适应机制,实现鲁棒的自动驾驶跨模态传感器融合。
通过专家引导的多模态融合与大语言模型的统一框架实现情绪识别与情感分析
机构 * School of Software, Dalian University of Technology, China(软件学院,大连理工大学,中国)
专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)
AI总结 本文提出EGMF框架,通过专家引导的多模态融合与大语言模型结合,实现情绪识别与情感分析的统一处理,提升跨语言鲁棒性。
Comments 14 pages, 6 figures
TIER-MoE:用于生物医学分类多模态融合的、基于条件模态风险的信任感知专家路由
专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)
AI总结 该研究提出TIER-MoE风险引导子空间混合专家模型,用于生物医学分类多模态融合,可提升预测性能与概率校准,在多数据集上优于现有最优方法且具备强零样本泛化能力。
分离、细化、整合:用于情感分析的多模态融合分解
机构 * National Technical University of Athens(雅典国立技术大学) ; Athena Research Center(雅典娜研究中心) ; University of Bern(伯尔尼大学) ; Archimedes AI(阿基米德人工智能公司) ; Synaptic Bloom PBC(突触绽放有限责任公司)
专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)
AI总结 研究情感分析中的多模态融合问题,提出SeRIn方案,通过分离特定模态与跨模态路径,各自细化演变,将跨模态交互推迟到预测步骤,在CH - SIMS和CMU - MOSEI上取得领先成果。
基于条件概率电路的上下文特定可信感知多模态融合
机构 * Department of Computer Science , TU Darmstadt(德累斯顿技术大学计算机科学系) ; Air Force Research Lab(空军研究实验室)
专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)
AI总结 提出C$^2$MF框架,利用条件概率电路建模实例级源可靠性,通过KL散度度量上下文特定信息可信度,在跨模态冲突下提升预测准确率高达29%。
利用级联二分类和多模态融合进行自发语音中的痴呆症检测
专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)
AI总结 本文提出了一种级联二分类和多模态融合的方法,用于通过自发语音进行早期痴呆症检测,解决了类别不平衡问题,并在Mini-Mental State Examination评分回归任务中实现了优于基线方法的性能。
Comments Accepted by Interspeech 2025
Journal ref Proc. Interspeech 2025, pp. 544-548, 2025
AlignMamba-2:通过模态感知Mamba增强多模态融合与情感分析
机构 * Pengcheng Laboratory(鹏城实验室) ; Shaanxi University of Science & Technology(陕西科技大学) ; School of Computer Science(计算机科学学院) ; Northwestern Polytechnical University(西北工业大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)
AI总结 本文提出AlignMamba-2框架,通过双对齐策略和模态感知Mamba层,提升多模态融合与情感分析的效率与效果,实验表明其在动态时间序列和静态图像任务中均达到新水平。
Comments Accepted by Pattern Recognition
以人类为中心的多模态融合用于表情包中性别歧视检测:结合眼动追踪、心率和EEG信号
专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)
AI总结 本文提出了一种结合眼动追踪、心率和EEG信号的多模态融合模型,用于更准确地检测表情包中的性别歧视。
Comments Accepted to appear in the Proceedings of LREC 2026
多模态交互如何影响深度多模态融合在混合类型时间序列中的性能
机构 * FAU Erlangen-Nürnberg(弗赖堡大学埃尔朗根-纽伦堡分校)
专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)
AI总结 本文研究了多模态交互对深度多模态融合在混合类型时间序列预测中的影响,通过三种融合类型和五种融合方法的比较,揭示了交互强度和方向对融合策略选择的关键作用。
机构 * Campus Fryslân, University of Groningen(格罗宁根大学弗里桑校区)
专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)
Comments 20 pages, 7 figures, Submitted to IEEE Transactions on Affective Computing
机构 * Graduate School of Informatics, Nagoya University(信息学研究科,名古屋大学) ; Information Technology Center, Nagoya University(信息科技中心,名古屋大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)
Comments Accepted by IEEE TASLP 2025
专题命中 音视频/视觉语言融合 :audio-visual fusion(title,abstract)
专题命中 音视频/视觉语言融合 :information fusion(title,abstract)
Comments Accepted by ICASSP 2025
专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)
Comments NeurIPS 2024
专题命中 音视频/视觉语言融合 :multi-modal fusion(title,abstract)
Comments Accepted at KDD 2024
专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)
Comments NAACL 2024 main conference
专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)
Comments Accepted to IEEE Transactions on Affective Computing
专题命中 音视频/视觉语言融合 :information fusion(title,abstract)
Comments Accepted by DADA2023
专题命中 音视频/视觉语言融合 :multi-modal fusion(title,abstract)
Journal ref IEEE TMM-2020
专题命中 音视频/视觉语言融合 :image fusion(abstract);feature-level fusion(abstract);decision-level fusion(abstract);分类 cs.CV
专题命中 音视频/视觉语言融合 :image fusion(abstract);infrared and visible(abstract);multi-focus(abstract);分类 cs.CV
DAP-Pose:用于鲁棒姿态估计的深度时间对齐和物理感知跨模态传感器融合
机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) ; International Research Center of Big Data for Sustainable Development Goals(可持续发展大数据国际研究中心) ; University of Chinese Academy of Sciences(中国科学院大学) ; The University of Adelaide(阿德莱德大学)
专题命中 音视频/视觉语言融合 :sensor fusion(title);分类 cs.CV、cs.RO
AI总结 针对复杂环境下多模态传感器的姿态估计问题,提出DAP-Pose模型,通过双级跨模态融合模块捕捉线索,深度时间对齐模块处理异步流,结合物理感知约束,在KITTI数据集上达最优性能,平均平移误差1.31%,旋转误差0.46°,严重错位下也能准确估计。