A Unified Framework for Modality-Agnostic Deepfakes Detection
专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);audio-visual(abstract)
Comments This work has been submitted to the IEEE for possible publication
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);audio-visual(abstract)
Comments This work has been submitted to the IEEE for possible publication
Synaspot:一种轻量级、流式多模态框架,用于音频-文本协同的关键字检测
专题命中 音频语音多模态 :multi-modal(title,abstract);multimodal(abstract)
AI总结 Synaspot提出了一种轻量级流式多模态框架,通过减少说话人特定信息和有效融合语音文本特征,实现更高效的关键字检测。
Comments Accepted by IEEE ICASSP 2026
机构 * Worcester Polytechnic Institute(沃斯特理工学院)
专题命中 音频语音多模态 :MLLM(title);multi-modal(abstract);分类 cs.CL、cs.MM、eess.AS
Journal ref IEEE Transactions on Multimedia, 2026
通过跨模态自举学习音乐风格以实现钢琴编曲
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.AI、cs.MM、eess.AS
AI总结 本文提出跨模态框架,受BLIP-2启发用Q-Former从预训练音频LM提取风格表示,经两阶段训练实现可控风格钢琴编曲,在多项任务中提升了风格对齐与音乐质量。
Comments Accepted by ISMIR 2026
通过混合交叉注意力网络的知识蒸馏和动态 INT8 量化实现高效视听事件识别
机构 * University of Porto, Porto, Portugal(葡萄牙波尔图大学) ; ResoSight, Montreal, Canada(ResoSight公司)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract)
AI总结 研究针对视听事件识别模型在边缘设备部署的难题,提出结合架构压缩、知识蒸馏和动态 INT8 量化的框架。构建教师与学生模型,经知识蒸馏训练学生模型,再用动态量化减小模型大小。实验表明该框架有效平衡准确率与效率,利于在资源受限平台部署。
Comments 15 pages, 4 figures
音频视觉持续测试时间适应无需遗忘
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract)
AI总结 本文提出AVReCAP方法,在测试时无需源数据即可提升模型性能,通过动态检索最佳融合层参数减少灾难性遗忘。
Comments ECCV 2026 & ICML 2026 Workshop Continual Adaptation at Scale: Towards Sustainable AI
我关心的音乐:对(几乎)任何音乐的大语言模型音乐感知技能进行自动化多模态基准测试
机构 * Charles University(查尔斯大学) ; Brno University of Technology(布拉格技术大学)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract)
AI总结 针对当前音乐基准测试的局限,引入MusICA-MetaBench框架,利用结构化符号表示和预定义模板生成按需基准测试,通过ChoraleBricks数据集展示并确定规模,经与基线比较证明能测音乐感知,推动了大语言模型音乐感知跨模态评估。
Comments 9 pages, 4 figures, 4 tables
ASR无关的多模态谱时建模用于早期痴呆检测
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS
AI总结 提出一种不依赖语音识别的框架,直接从梅尔频谱图中提取谱时位移场作为数字生物标志物,结合CNN-ConvGRU声学嵌入和交叉注意力融合,在三种语言语料库上验证了多模态融合的语料依赖性。
对话到检测:用于保险欺诈检测的多模态混合 NLP 流水线
机构 * Aston University(阿斯顿大学) ; Domestic & General
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS
AI总结 提出一种合成多模态框架,结合ASR、NER、LLM-RAG和说话人嵌入,通过规则风险评分检测保险欺诈中的叙述复用、结构不一致和跨案件语音重复。
Comments 10 pages, 8 figures, 2 tables
用于集成视听视频深度伪造检测中领域适应的师生结构
机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工学院计算机工程系)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 提出EAV-DFD方法,结合师生框架的领域适应机制,提升模型在未见领域上的泛化能力,在三个数据集上AUC分别提升4.09%、17.94%和0.5%。
CMI-RewardBench: 基于组合多模态指令评估音乐奖励模型
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学) ; University of Cambridge(剑桥大学) ; University of Toronto(多伦多大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、cs.MM、eess.AS
AI总结 针对音乐生成模型缺乏有效评估机制的问题,提出CMI-RewardBench基准,包含大规模偏好数据集和参数高效奖励模型,实现多模态指令下的音乐质量评估。
Comments Accepted by ICML 2026
OmniMem: 面向流式音视频大语言模型的扰动感知记忆压缩
机构 * Tsinghua University(清华大学) ; ByteDance(字节跳动) ; Department of Engineering, University of Cambridge(剑桥大学工程系)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、eess.AS
AI总结 提出OmniMem,一种针对音视频LLM的流式记忆压缩框架,通过模态感知分配和扰动感知选择压缩KV缓存,在保持长视频理解的同时减少内存,在多个基准上提升2-4%准确率。
Comments Code: https://github.com/bytedance/SALMONN/tree/omni_mem
TalkPlayData 2:用于多模态对话式音乐推荐的智能体合成数据流水线
机构 * KAIST(韩国科学技术院)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、cs.MM、eess.AS
AI总结 提出TalkPlayData 2,一个由智能体数据流水线生成的多模态对话式音乐推荐合成数据集,通过多角色大语言模型模拟对话并覆盖多种场景,以支持生成式推荐模型训练。
Comments 2025-10-08: updating the stat table with the latest numbers. updated the abstract per the latest license terms
OmniVerifier-M1: 具有显式结构化重校准的多模态元验证器
机构 * Tsinghua University(清华大学) ; Pennsylvania State University(宾夕法尼亚州立大学) ; University of Southern California(南加州大学) ; Microcyto ; Princeton University(普林斯顿大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出OmniVerifier-M1,通过符号化元验证(如边界框)和解耦强化学习,实现多模态大模型的可靠细粒度验证与动态区域级自校正。
Comments ICML 2026. Project: https://github.com/Cominclip/OmniVerifier
超越语音情感识别:利用基于LLM和语音情感模型的政治演讲多模态Pathos分析
机构 * Democracy Intelligence gGmbH(民主智能有限责任公司)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS
AI总结 本文研究了语音情感识别模型是否能作为政治演讲分析中Pathos维度的代理,通过TRUST多智能体大语言模型(LLM)管道进行操作。使用德国议会全体会议中Felix Banaszak的演讲作为案例研究,比较了三种分析模式:(1) emotion2vec_plus_large,一个通过后验Russell Circumplex投影得到连续唤醒度和估值的语音情感识别(SER)模型;(2) Gemini 2.5 Flash,一个分析完整演讲音频及其转录文本的LLM,以开放和上下文感知的方式进行;(3) TRUST-Pathos分数,来自三个倡导者LLM监督集合。斯皮尔曼等级相关性显示,Gemini估值与TRUST-Pathos高度相关(rho = +0.664,p < 0.001),而emotion2vec估值不相关(rho = +0.097,p = 0.499)。我们进一步通过系统评估柏林情感语音数据库(EMO-DB)使用Gemini在开放注释范式下,证明标准SER基准语料库存在表演性演讲、文化偏见和类别不兼容性。我们的结果表明,基于LLM的多模态分析在捕捉语义定义的政治情感方面比单独的语音模型更有效,而语音特征仍对低层次唤醒度估计有帮助。未来的工作将扩展这种方法到视频分析中,结合面部表情和眼神。
Comments 13 pages, 1 figure
超越词语:多模态大语言模型何时说话
机构 * Department of Computer Science, Stony Brook University(石溪大学计算机科学系) ; Atmee AI
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出了一种多模态策略,通过同步视频、音频和文本线索提高对话中的响应时机意识,从而提升大语言模型在对话中的响应准确性。
Comments Project page: https://github.com/lzk901372/MM-When2Speak
IsoNet:在复杂声学环境中具有空间意识的音频视觉目标语音提取
机构 * Department of Electronics and Computer Engineering, Thapathali Campus, Institute of Engineering, Tribhuvan University(电子与计算机工程系,Thapathali校区,工程学院,塔波胡万大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract)
AI总结 IsoNet通过结合多通道STFT特征、GCC-PHAT空间线索和面部条件视觉嵌入,实现了在紧凑麦克风阵列上的目标语音提取,其在复杂声学环境中的性能优于传统方法。
Comments 8 pages
多模态情感分析中的缺失模态:一种知识迁移方法
机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) ; Singapore University of Social Sciences, Singapore(新加坡社会科学研究大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS
AI总结 本文提出知识迁移网络以重建缺失音频特征,并开发跨模态注意力机制以提升情感预测,实验表明在三个公开数据集上优于基线方法。
基于对象-属性-关系模型的自适应分层传输机制用于多模态语义通信
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract)
AI总结 本文提出基于自适应对象-属性-关系层次的多模态语义通信框架,通过融合视觉、文本和音频流构建决策导向拓扑图,在低带宽下实现90%的带宽节省和10倍的带宽减少,同时消除深度衰减信道中的悬崖效应。
Comments 13 pages,7 figures, 6 tables,56 reference
Foley-Flow:基于掩码音频-视觉对齐和动态条件流的协调视频到音频生成
机构 * CMU / MBZUAI DAMO Academy, Alibaba Group(卡内基梅隆大学 / MBZUAI 大学 DAMO 院,阿里巴巴集团) ; DAMO Academy, Alibaba Group(DAMO 院,阿里巴巴集团) ; Hupan Laboratory(虎盘实验室)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、eess.AS
AI总结 FoleyFlow通过掩码建模和动态条件流实现视频到音频的协调生成,提升语义与节奏一致性。
基于多模态大语言模型的低资源音频分类中可解释属性的自适应发现
机构 * Kyoto University(京都大学)
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract)
AI总结 本文提出利用多模态大语言模型自适应发现可解释音频属性,提升低资源音频分类的效率和准确性。
Comments 5 pages, 1 figure
在融合前净化:迈向无掩码的语音增强以实现鲁棒的音频-视觉语音识别
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Defense Innovation Institute, Academy of Military Sciences(国防科技创新研究院) ; Peking University(北京大学) ; High-tech Institute(高新技术研究所)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、cs.MM、eess.AS
AI总结 本文提出了一种端到端的噪声鲁棒音频-视觉语音识别框架,结合语音增强技术,在无需显式生成噪声掩码的情况下提升鲁棒性。
Comments Accepted by ICASSP2026
M3OOD:多模态OOD检测器的自动选择
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract)
AI总结 M3OOD通过元学习框架自动选择多模态OOD检测器,有效提升不同分布偏移下的检测性能。
何时回答:可靠音频-视觉问答的自适应置信度细化
机构 * School of Computing, KAIST, Republic of Korea(韩国釜山科学技术院计算机科学学院) ; Laval University(拉瓦尔大学) ; Mila-Quebec AI Institute(魁北克人工智能研究所)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract)
AI总结 本文提出自适应置信度细化方法,用于提升音频-视觉问答任务中可靠性的性能。
Comments Technical Report
一种用于TikTok上疑似虚假信息多模态检测的新混合智能方法
机构 * University of Castilla-La Mancha(卡斯蒂利亚-拉曼查大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM
AI总结 本研究提出一种结合深度学习与模糊逻辑的混合方法,用于检测TikTok视频中的疑似虚假信息,通过多模态特征分析与可解释性检测提升虚假信息识别的准确性与实用性。
Journal ref Multimedia Tools and Applications 85 (2026) 37
Physic-HM: 通过分层调制恢复多模态异常检测中的物理生成逻辑
机构 * Chongqing University(重庆大学)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract)
AI总结 Physic-HM通过引入物理归纳偏置,解决多模态异常检测中过程逻辑缺失的问题,实现高维与低维数据的协同建模,提升异常检测性能。
Comments Working in progress
FastAV: 面向音频视觉大语言模型推理的高效令牌修剪
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract)
AI总结 FastAV通过两阶段令牌修剪策略,针对音频视觉大语言模型实现高效推理,减少FLOPs超过40%并保持性能
探索背景噪声对听觉刺激在音频视觉eHMIs中的影响:面向听障、聋人及听力障碍人群
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract)
AI总结 研究探讨了背景噪声对聋人及听力障碍者在音频视觉eHMI中听觉刺激的影响,发现嘈杂环境会损害行人穿越体验,而增加铃声或语音提示可改善体验。
Comments This is the author's version of the paper accepted at CHI Conference on Human Factors in Computing Systems (CHI '26), April 13-17, 2026, Barcelona, Spain
与语言病理学家在亲子互动中的人机对齐多模态大语言模型
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract)
AI总结 本研究通过多模态大语言模型与语言病理学家的对齐,开发了支持亲子互动分析的系统,实现了85%的感知线索提取准确率和75%的判断精确率,并提出了行为观察-判断系统的构建指南。
Comments This is an earlier version of the work released in May 2025. The version accepted at CHI 2026 is available as a separate preprint at arXiv:2511.04366
高度沉浸式VR场景中的动态热反馈:用户体验的多模态分析
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract)
AI总结 本研究通过多模态分析探讨了高度沉浸式VR场景中动态热反馈对用户体验的影响,发现热反馈可提升沉浸感,但不同质量水平对用户体验的影响因人而异。
Comments 15 pages, 9 figures. This work has been submitted to the IEEE for possible publication