Straight Through Gumbel Softmax Estimator based Bimodal Neural Architecture Search for Audio-Visual Deepfake Detection
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、cs.MM
视觉与机器人
面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、cs.MM
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、cs.MM
Comments Accepted to Findings of ACL 2024
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、eess.IV
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、cs.MM
Comments Accepted by WACV 2024; well-formatted PDF is in https://drive.google.com/file/d/1qvW52lamsvNGMCqPS7q8g8L4NaR_LlbR/view?usp=sharing. arXiv admin note: text overlap with arXiv:2401.04023
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV、cs.MM
Comments Published in TMLR 2023
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV、cs.MM
Comments Camera-ready version for WACV 2024; project page is https://jinxiang-liu.github.io/anno-free-AVS/
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV、cs.MM
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV、cs.MM
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV、cs.MM
Comments Accepted In Proceedings of the 31st ACM International Conference on Multimedia (MM' 23)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、eess.IV
Comments 12 pages, 5 figures, to be published in CICAI2023
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、cs.MM
Comments 14 pages, 5 figures, Accepted by ACL 2023
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV、cs.MM
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV、cs.MM
Comments Paper Accepted by ICASSP2023
专题命中 音视频/视觉语言融合 :information fusion(abstract);分类 cs.CV、cs.MM
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、cs.MM
专题命中 音视频/视觉语言融合 :hybrid fusion(abstract);分类 eess.IV、cs.MM
Comments Accepted by Interspeech2020
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV、cs.MM
Comments CVPR 2020. Project page: http://music-gesture.csail.mit.edu
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV、cs.MM
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV、cs.MM
Comments Accepted by SIGIR 2019 as a full paper
Journal ref SIGIR, 2019, pages 655-664
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、cs.MM
Comments Accepted for ECCV 2018
机构 * Indian Institute of Technology Indore(印度印度理工学院Indore) ; Brown University(布朗大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV;information fusion(comments)
Comments Published in Information Fusion
通过交叉注意力和门控融合进行多模态矛盾与犹豫识别
机构 * University of Paris 8(巴黎第八大学) ; LIASD Laboratory(LIASD实验室)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 为ECCV 2026的ABAW11挑战赛开发多模态框架,用预训练编码器提取多模态特征,建立单模态基线,在此基础上提出含交叉注意力和门控融合的多模态架构,验证集宏F1达0.7394,提升显著。
LAVA:分层音频视觉抗篡改水印用于鲁棒深度伪造检测与定位
机构 * School of Computer Science and Engineering(计算机科学与工程学院) ; UNSW Sydney(新南威尔士大学悉尼分校) ; School of Information and Communication Technology(信息与通信技术学院) ; Griffith University(格里菲斯大学)
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV
AI总结 LAVA通过跨模态水印融合与校准感知对齐,提升深度伪造篡改检测与定位的鲁棒性,实验表明其检测性能接近完美,抗压缩与多模态错位能力强。
Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)
描述到评分:一种用于图像复杂度评估的文本引导框架
机构 * Xi’an University of Architecture and Technology(西安建筑科技大学)
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV
AI总结 该研究针对现有图像复杂度评估方法无法捕捉高级语义的问题,提出文本引导框架D2S,仅训练阶段引入描述语义正则化,在IC9600基准达SOTA,跨任务也具竞争力。
Comments Accepted by Pattern Recognition
用于通用跨模态行人重识别的双空间模态一致性学习
机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; School of Humanities and Social Sciences, Beihang University(北京航空航天大学人文与社会科学高等研究院) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; School of Informatics, Xiamen University(厦门大学信息学院)
专题命中 音视频/视觉语言融合 :visible-infrared(abstract);分类 cs.CV
AI总结 提出DSMCL即插即用框架,联合建模空间与频域一致性,在5个数据集的17项协议上提升跨模态ReID基线性能,适配多样化异构模态场景。
用于鲁棒多模态意图识别的自适应模态可靠性诊断与恢复
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM
AI总结 提出PRIME闭环可靠性引导框架,通过诊断恢复多模态意图识别的不可靠模态,在保持干净数据性能的同时提升了多模态数据各类退化场景下的鲁棒性。
基于多模态可穿戴设备的嗅觉诱导唤醒-效价维度情感识别
专题命中 音视频/视觉语言融合 :hybrid fusion(abstract);分类 eess.SP
AI总结 针对现有嗅觉情感研究的维度失衡与多模态数据不足问题,构建多模态嗅觉情感数据集,提出STF-HFNet模型,在两个数据集上取得最优情感识别准确率。
从费舍尔信息视角理解和克服多模态异常检测中的跨模态融合偏差
机构 * Northeastern University(东北大学) ; CATL(宁德时代)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 该研究针对多模态异常检测中被忽视的跨模态融合偏差问题,提出即插即用框架UCFB,经实验验证在多种设置下均实现性能提升。
HyperClaim:用于视频虚假信息检测的细粒度跨模态超图推理
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM
AI总结 HyperClaim是一种用于视频虚假信息检测的判别式时间超图框架,通过细粒度跨模态超图推理,在FactGuard协议下的三个数据集上准确率优于基线方法。
Comments 13 pages, including supplementary material
基于配准的光谱融合用于未配准的WLI/NBI内镜病灶分割
机构 * The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院) ; School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院) ; School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 针对未配准的WLI/NBI内镜病灶分割问题,提出可靠性感知复域融合框架,通过拓扑正则化特征对应与可靠性引导的选择性融合,提升病灶分割性能。
Comments 11 pages