CMMD: Contrastive Multi-Modal Diffusion for Video-Audio Conditional Modeling
专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.AI、cs.MM、eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted in Efficient Deep Learning for Computer Vision CVPR Workshop 2024
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments 18 pages, 6 figures
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、eess.AS
Comments Accepted by EMNLP 2023's demo track; Code, Pretrained Model, and Dataset: https://github.com/DAMO-NLP-SG/Video-LLaMA
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS
专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.AI、cs.MM、eess.AS
Comments 13 pages, 8figures
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments ECCV 2020 (Spotlight)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL、eess.AS
Comments 5 pages, 1 figure, 3 tables; accepted to ICASSP 2019
听、看与跟踪:面向全模态大模型的时空视听声音事件推理
专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title);分类 cs.AI
AI总结 针对现有模型缺失的时空视听推理能力,构建ST-OmniQA基准,提出ST-Omni-R1模型,在该基准上平均语义准确率达77.83%,且空间运动表示可跨基准迁移。
CueNet:通过跨模态线索挖掘与交互实现鲁棒的音频视觉说话人提取
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(title);分类 cs.MM
AI总结 本文提出CueNet,通过跨模态线索挖掘与交互提升音频视觉说话人提取的鲁棒性,验证了模型在不同视觉退化下的优越性能。
多模态基础模型中音频推理的综述
专题命中 音频语音多模态 :multimodal(title);multimodal foundation model(title);audio-visual(abstract);分类 eess.AS
AI总结 本文综述了多模态基础模型中音频推理的研究问题,探讨了音频推理模型的架构和训练基础,并系统整理了音频到文本、音频到语音、音频视觉推理和代理音频推理等领域的最新进展,同时分析了新兴范式和评估实践,提出了未来发展方向。
Watch and Listen: 通过多模态大语言模型理解音频-视觉-语音时刻
机构 * University of Western Australia(西澳大学) ; Alibaba Group(阿里巴巴集团) ; Zhejiang Laboratory(浙江实验室) ; Monash University(墨尔本大学)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.CL
AI总结 TriSense通过整合视觉、音频和语音模态,提升视频时间理解能力,采用基于查询的连接器实现多模态鲁棒性,并通过TriSense-2M数据集推动多模态视频分析发展。
Comments Accepted by NeurIPS 2025
面向语言无关的面容-语音关联的多模态基础模型
机构 * Department of Computational Linguistics, University of Zurich(苏黎世大学计算语言学系)
专题命中 音频语音多模态 :multimodal(title);multimodal foundation model(title);cross-modal(abstract);分类 eess.AS
AI总结 本文提出了一种基于多模态基础模型的跨语言面容-语音关联方法,通过ImageBind与LoRA结合,实现了在未见过语言上的有效验证。
Comments This paper presents the system description of the UZH-CL team for the FAME2026 Challenge at ICASSP 2026. Our model achieved second place in the final ranking
机构 * College of Communication Engineering, Jilin University(吉林大学通信工程学院)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.MM
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title);分类 cs.CL
专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(title);分类 eess.AS
Comments Accepted by ICASSP 2024
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(title);分类 cs.CV
专题命中 音频语音多模态 :audio-visual(title,abstract);image-text(title);分类 eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(title);分类 cs.CV
Comments DICTA 2022
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.CV
Comments 8 pages, 4 figures
ControlFoley: 一种统一且可控的视频到音频生成方法,具有跨模态冲突处理
机构 * MiLM Plus, Xiaomi Inc.(小米MiLM Plus) ; MiLM Plus, Xiaomi Inc. Wuhan University(小米MiLM Plus 武汉大学) ; Wuhan University(武汉大学)
专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM
AI总结 ControlFoley通过联合视觉编码和时域-音域解耦提升视频到音频生成的可控性与同步性,在多种任务中表现优异。
从说话到唱歌:音视频深度伪造检测的新挑战
机构 * Center for Future Media, School of Computer Science and Engineering, University of Electronic Science and Technology of China(未来媒体中心,计算机科学与工程学院,电子科技大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.AI、cs.MM
AI总结 针对现有音视频深度伪造检测方法在唱歌场景中性能下降的问题,提出文本引导的音视频伪造检测框架(T-AVFD),通过面部真实性模式学习和多模态差异权重学习,在说话和唱歌场景中均实现鲁棒检测。
Comments Accepted by ICML 2026
面向全模态大语言模型(Omni-LLMs)的基于局部视听动态的延迟音频剪枝方法
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);omni-modal(abstract);分类 cs.AI、cs.MM
AI总结 针对全模态大语言模型的高开销问题,提出两阶段框架A-PACK,利用局部视听动态延迟音频剪枝,在Qwen2.5-Omni基准上实现性能最优,同时大幅降低预填充开销并提升解码吞吐量。
视听火烈鸟:用于长而复杂视频的开放视听智能
机构 * NVIDIA, USA(美国NVIDIA公司) ; University of Maryland, USA(美国马里兰大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CV、eess.AS
AI总结 研究提出视听火烈鸟,用于长复杂视频的联合理解与推理。贡献包括构建大规模视频集、设计三阶段课程及推理框架。实验显示其在多基准测试中表现优异,超越同类开放模型,在长复杂视听理解推理任务中竞争力强,有现实应用价值和泛化能力。
Comments Project Page: https://avflamingo.pages.dev/
AV-JEPA:将LeJEPA扩展到视听自监督学习
机构 * ELLIS Institute Finland(芬兰ELLIS研究所) ; Department of Computer Science, Aalto University, Espoo, Finland(艾尔沃斯大学计算机科学系)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.AI、cs.MM
AI总结 研究将LeJEPA扩展到视听自监督学习,核心方法是用早期融合视觉Transformer和模态丢弃作掩码训练模型对齐视图嵌入,主要贡献是实现跨模态对齐,架构简洁,在分类任务中有竞争力且支持零样本音频-视频检索。
EAR:增强单模表示以实现弱监督音频视觉视频解析
机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(智能工程与自动化学院,北京邮电大学) ; State Grid Corporation of China(国家电网公司) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
AI总结 本文提出EAR框架,通过增强伪标签生成器和AVVP模型的单模表示,提升视频解析的时序定位性能。
AVRT:通过单模态教师模型实现音频-视觉推理迁移
机构 * University of Tübingen, Germany(图宾根大学) ; MIT, Cambridge MA, USA(麻省理工学院) ; IBM Research, USA(IBM研究院) ; MIT-IBM Watson AI Lab, USA(麻省理工-IBM沃森人工智能实验室) ; Tuebingen AI Center, Germany(图宾根人工智能中心)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
AI总结 本文提出AVRT框架,通过单模态教师模型生成高质量音频-视觉推理轨迹,并利用LLM合并模型整合轨迹,从而在多模态设置中实现推理迁移,取得音视频和音频任务的最优效果。
OmniScript: 向长篇影视视频的音频-视觉脚本生成迈进
机构 * ARC Lab, Tencent(腾讯ARC实验室)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);omni-modal(abstract);分类 cs.CV、cs.MM
AI总结 本文提出视频到脚本任务,介绍OmniScript模型,通过渐进式训练在长篇叙事理解中实现高效脚本生成,优于开源模型并接近专有模型。
Comments Project Page: https://arcomniscript.github.io