Audio-Visual Fusion for Emotion Recognition in the Valence-Arousal Space Using Joint Cross-Attention
专题命中 音视频/视觉语言融合 :audio-visual fusion(title);分类 cs.CV
Comments arXiv admin note: substantial text overlap with arXiv:2203.14779, arXiv:2111.05222
视觉与机器人
面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。
专题命中 音视频/视觉语言融合 :audio-visual fusion(title);分类 cs.CV
Comments arXiv admin note: substantial text overlap with arXiv:2203.14779, arXiv:2111.05222
专题命中 音视频/视觉语言融合 :information fusion(title);分类 cs.CV
专题命中 音视频/视觉语言融合 :information fusion(title);分类 eess.SP
专题命中 音视频/视觉语言融合 :multimodal fusion(title);分类 cs.CV
专题命中 音视频/视觉语言融合 :sensor fusion(title);分类 cs.CV
Comments Tech. report
专题命中 音视频/视觉语言融合 :sensor fusion(title);分类 cs.CV
专题命中 音视频/视觉语言融合 :information fusion(title);分类 cs.CV
Comments To appear in ECCV workshop on Computer Vision for Audio-Visual Media, 2016
专题命中 音视频/视觉语言融合 :information fusion(title);分类 cs.MM
Comments 6 Pages, 3 figures
Journal ref Proceedings of 17th International Conference on Advanced Computing and Communications (ADCOM 2009) pp. 182-187 (2009)
EAR:增强单模表示以实现弱监督音频视觉视频解析
机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(智能工程与自动化学院,北京邮电大学) ; State Grid Corporation of China(国家电网公司) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学)
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);audio-visual fusion(abstract);分类 cs.CV、cs.MM
AI总结 本文提出EAR框架,通过增强伪标签生成器和AVVP模型的单模表示,提升视频解析的时序定位性能。
跨模态二进制注意力:面向音频视觉学习的高效融合框架
机构 * Peter L. Reichertz Institute for Medical Informatics of TU Braunschweig and Hannover Medical School(图林根工业大学和汉诺威医学院医学信息学研究所) ; Lower Saxony Center for AI and Causal Methods in Medicine (CAIMed)(下萨克森人工智能与因果医学方法中心)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);audio-visual fusion(abstract);分类 cs.CV、cs.MM
AI总结 提出CMQKA和SNNergy,通过高效二进制操作实现线性复杂度的跨模态融合,显著提升音频视觉任务的能耗效率和性能
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);multi-modal fusion(abstract);分类 cs.CV、cs.MM
Comments 18 pages, 6 figures
面向缺失数据的多模态融合用于统一微服务故障管理
机构 * Zhejiang University(浙江大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(title)
AI总结 本文提出ARMOR框架,通过自监督学习解决微服务故障管理中多模态数据缺失问题,提升异常检测、故障分类和根本原因定位的性能。
Comments Accepted by the Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), 2026. This is the authors' version of the work; the definitive Version of Record is forthcoming
重新思考时间序列的多模态融合:文本模态需要受约束的融合
机构 * LG AI Research(LG人工智能研究)
专题命中 音视频/视觉语言融合 :multimodal fusion(title)
AI总结 针对多模态时间序列预测中朴素融合方法效果不佳的问题,提出受约束融合方法及受控融合适配器(CFA),通过低秩适配器过滤无关文本信息,在多种数据集和模型上验证了有效性。
Comments KDD Workshop on Mining and Learning from Time Series 2026 (Oral presentation)
聚焦关键要素:基于Fisher信息的自适应多模态融合用于漏洞检测
机构 * University of Chinese Academy of Sciences(中国科学院大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(title)
AI总结 本文提出TaCCS-DFA框架,通过Fisher信息引导的自适应多模态融合,提升漏洞检测的F1分数,同时降低推理延迟。
专题命中 音视频/视觉语言融合 :multimodal fusion(title)
Comments Proceedings of ICML 2025 Workshop on Multi-modal Foundation Proceedings of ICML 2025 Workshop on Multi-modal Foundation Proceedings of ICML 2025 Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences
机构 * Federal University of Goiás(戈亚斯联邦大学) ; Federal University of Rio Grande do Norte(北里奥格兰德联邦大学) ; Aeronautics Institute of Technology(航空技术研究所) ; Federal University of Mato Grosso(马托格罗索联邦大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(title)
专题命中 音视频/视觉语言融合 :information fusion(title)
专题命中 音视频/视觉语言融合 :audio-visual fusion(title)
专题命中 音视频/视觉语言融合 :multimodal fusion(title)
Comments Knowledge-Based Systems
Journal ref Knowledge-Based Systems (Volume: 277, October 2023)
专题命中 音视频/视觉语言融合 :multimodal fusion(title)
Comments Accepted at ICASSP 2023
专题命中 音视频/视觉语言融合 :information fusion(title)
专题命中 音视频/视觉语言融合 :information fusion(title)
专题命中 音视频/视觉语言融合 :multimodal fusion(title)
专题命中 音视频/视觉语言融合 :multi-modal fusion(title)
Journal ref Proc. Interspeech 2020, 2187-2191
少即是多:通用AIGC音频-视频检测的模态解耦
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; University of Agder(阿格德大学)
专题命中 音视频/视觉语言融合 :feature-level fusion(abstract);decision-level fusion(abstract);分类 cs.CV
AI总结 针对通用AIGC音频-视频检测,现有方法假设不总成立,本文提出DAV-Det系统,通过决策级融合独立建模各模态取证证据,视觉和音频检测器分别利用多粒度表示及门控双分支架构,在挑战赛中排名第一。
Comments First place in the General AIGC Audio-Video Detection Challenge at the IJCAI-ECAI 2026 DDL 2.0 Workshop
用于文本引导医学图像分割的定位注入视觉语言语义融合
机构 * Air Force Engineering University(空军工程大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; University of Sydney(悉尼大学) ; Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)
专题命中 音视频/视觉语言融合 :information fusion(abstract);feature-level fusion(abstract);分类 cs.CV
AI总结 研究针对文本引导医学图像分割,提出LoG框架,通过联合执行多尺度目标定位任务,实现三级定位注入语义融合,在三个基准数据集实验中表现出色,优于现有医学图像分割方法。
团队RAS在第10届ABAW竞赛中的表现:多模态valence和arousal估计方法
机构 * St. Petersburg Federal Research Center of the Russian Academy of Sciences(俄罗斯科学院圣彼得堡联邦研究中心) ; ITMO University(ITMO大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);audio-visual fusion(abstract);分类 cs.CV
AI总结 本文提出一种多模态方法,用于在真实环境中估计valence和arousal。结合面部、行为和音频模态,利用GRADA、Transformer、Qwen3-VL-4B-Instruct和Mamba等技术,实现跨模态融合,最终在Aff-Wild2数据集上达到0.658的CCC值。
Comments 8 pages, 1 figure
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);image fusion(abstract);分类 cs.CV
Comments 12 pages Accepted in the IEEE Transactions on Aerospace and Electronic Systems
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);information fusion(abstract);分类 cs.CV
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);feature-level fusion(abstract);分类 cs.CV
Comments Accepted to FG2024