Improving Multimodal Speech Recognition by Data Augmentation and Speech Representations
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
Comments Accepted at the Multimodal Learning and Applications Workshop (MULA) from CVPR 2022
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
Comments Accepted at the Multimodal Learning and Applications Workshop (MULA) from CVPR 2022
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
Comments Accepted at CVPR 2021. Dataset, code and models are available at http://rl.uni-freiburg.de/research/multimodal-distill
Journal ref IEEE/ CVF International Conference on Computer Vision and Pattern Recognition (CVPR), pp. 11612-11621, 2021
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS;multimodal(comments)
Comments ICMI 2020 workshop on "MODELING SOCIO-EMOTIONAL AND COGNITIVE PROCESSES FROM MULTIMODAL DATA IN THE WILD"
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS
Comments multi-modal, bone/air-conducted signals, speech enhancement, fully convolutional network
Journal ref IEEE Signal Processing Letters, vol. 27, pp. 1035-1039, 2020
专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract,comments);分类 cs.CL
Comments ACL 2020 - Second Grand-Challenge and Workshop on Multimodal Language (Challenge-HML)
SceneBind:跨视觉、音频和语言绑定“什么”与“哪里”
机构 * University of Washington(华盛顿大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Hankuk University of Foreign Studies(韩国外国语大学)
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 研究提出SceneBind全模态场景表示,结合全局语义与对象中心语义空间插槽解决空间结构缺失问题,还提出匹配方案。通过构建新数据集及训练协议进行训练评估,兼容预训练编码器,实现先进检索并能零样本转移到下游任务。
Comments Project website: https://scenebind.github.io/
MEEDAV:一种用于EEG、眼动追踪和语音数据同步可视化的Web查看器
专题命中 音频语音多模态 :multi-modal(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract)
AI总结 本文提出MEEDAV,一种用于同步可视化EEG、眼动追踪和语音数据的开源Web应用,支持高密度EEG设置,并提供实时处理和交互式可视化功能,适用于心理语言学研究。
Comments Presented at ACAIN 2025 (Advanced Course & Symposium on Artificial Intelligence & Neuroscience), recipient of the Camillo Golgi Best Paper Award
SoundBreak: 对三模态模型上仅音频对抗攻击的系统研究
机构 * Department of Computer Science, Virginia Tech, USA(计算机科学系,弗吉尼亚理工大学)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI、eess.AS
AI总结 SoundBreak研究了对三模态模型的仅音频对抗攻击,发现音频扰动可导致严重多模态失败,攻击成功率高达96%,并揭示了多模态系统中被忽视的单模态攻击面。
LongCat-Flash-Omni 技术报告
机构 * Meituan LongCat Team(美团LongCat团队)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CL、cs.AI、cs.MM
AI总结 LongCat-Flash-Omni 是一个具有5600亿参数的开源多模态模型,通过课程启发式训练策略实现高效实时音频视觉交互,具备强大的多模态和单模能力。
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by ACM MM 2024
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted at CVPR 2024. Project page: https://vision.cs.utexas.edu/projects/soundingactions
专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Camera-ready Version for ACMMM 2022, Project page is https://jinxiang-liu.github.io/SSL-TIE/
ParaJSCC:一种用于可复用多模态联合信源信道编码的参数化框架
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM
AI总结 针对多模态内容重复访问的效率问题,提出ParaJSCC参数化框架,通过离线生成参数包按需传输,降低延迟与传输速率并保持重建质量。
闭合情感循环:具情感动态感知的多模态说话人-听话人共情社交机器人
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 本研究提出AffectLoop系统,在Misty II机器人上实现多模态情感动态感知的说话人-听话人共情交互,经试点研究验证可提升共情响应与用户满意度。
Comments This paper has been accepted for presentation at APSIPA ASC 2026
评估面向无障碍灾害援助的跨文本与音频模态多模态大语言模型
专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);分类 cs.AI
AI总结 本文评估了开放权重多模态大语言模型在灾害援助场景下跨文本与音频模态的响应一致性,发现其存在模态依赖的不公平性,为构建公平的灾害沟通AI工具提供了设计建议。
Comments 8 pages, 3 figures
UniSwap:用于说话视频的流音频-视觉身份交换
机构 * The Chinese University of Hong Kong(香港中文大学) ; Qwen Applications Business Group of Alibaba(阿里巴巴通义千问应用业务集团)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
AI总结 UniSwap是首个流音频-视觉身份替换框架,通过多阶段适配技术解决现有方法音视频一致性差等问题,实现高效稳定的说话视频身份替换。
跨模态表示与控制的多语言语音-文本模型生成步骤感知框架
机构 * Saarland University(萨尔兰大学) ; Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL
AI总结 本文提出一个生成步骤感知框架,用于评估多语言语音-文本模型中的跨模态计算,发现跨模态语言对齐在生成初期最强,随后转向模态特定的自回归处理。
Comments 8 pages for the main text, 9 Figures, 9 Tables
基于一致性的视听分割:第八届LSVOS挑战赛MeViS音频赛道冠军报告
机构 * National 111 Project Base of Intelligent Information Processing(智能信息处理国家111计划基地)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
AI总结 本文针对第八届LSVOS挑战赛MeViS音频赛道,提出分阶段视听分割方案,以Qwen3-ASR为基础,通过掩码一致性选择轨迹并修正查询,结合多模态得分判断目标存在性,最终取得赛道第一的成绩。
DAVE:用于真实场景语音分离的解耦式视听增强框架
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI
AI总结 本文提出用于真实场景语音分离的解耦式视听增强框架DAVE,构建含219411个混合样本的DAVE-Corpus,采用渐进式多目标优化与选择性增强链,在挑战赛中展现出良好鲁棒性。
从语音到交互:鸡尾酒会场景下多模态系统的分析
专题命中 音频语音多模态 :multimodal(title);audio-visual(abstract);分类 cs.CL
AI总结 本研究分析了CHiME-9 MCoRec任务中不同多模态系统解决鸡尾酒会场景的策略,发现最优系统实现57%相对错误减少,且高语音重叠并非性能差异的主要原因。
Comments Accepted at ICMI 2026
基于QIANGDA与VOXBLINK2-AVSE的身份保真视听目标说话人提取
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
AI总结 本文提出QIANGDA普通话AV-TSE基准与VOXBLINK2-AVSE数据集,采用含AV-HuBERT等的提取器,通过双指标评估,取得了视听目标说话人提取的良好性能。
TRU:面向高效多模态推荐去学习的定向反向更新
机构 * University of Electronic Science and Technology of China(电子科技大学) ; University of Macau(澳门大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 针对多模态推荐系统中数据删除影响不均匀的问题,提出TRU框架,通过层级化干预实现更高效的去学习,提升保留与遗忘的平衡。
Comments Author Accepted Manuscript. Accepted for publication in the Proceedings of the 34th ACM International Conference on Multimedia (ACM MM '26). This author-created manuscript is not the ACM Version of Record
预训练模型为何失效:多模态抑郁检测中的特征纠缠
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS
AI总结 本文针对预训练模型在多模态抑郁检测中性能差的问题,提出信息分离框架解纠缠混合特征,显著提升了SSL模型和LLMs的检测性能,为相关系统开发提供了新见解。
基于凸特征嵌入学习的人脸与声音跨模态关联
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV
AI总结 本文提出结合跨模态注意力机制的凸特征嵌入方法,解决人脸与声音跨模态关联中的特征异质性问题,在VoxCeleb数据集的相关任务上较现有方法有显著提升。
Journal ref Multimedia Systems, vol. 31, no. 4, pp. 296, July 2025
Digital Harf:用于普及型阿拉伯语言语和语言治疗的临床整合多模态AI系统
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 Digital Harf是专为阿拉伯语自闭症儿童设计的多模态AI治疗平台,其核心Agentic合成数据引擎解决阿拉伯语治疗内容短缺问题,获专家高接受率,为代表性语言环境构建AI治疗系统提供了思路。
SyncBreaker:面向音频驱动生成的多模态对抗攻击框架
机构 * University of Science and Technology of China(中国科学技术大学) ; Beijing University of Technology(北京工业大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 针对音频驱动生成中单模态防护不足的问题,提出SyncBreaker框架,通过多模态联合扰动提升防护效果,有效抑制唇同步和面部动态。
偏见交响曲:探索多模态大语言模型(LLMs)与乐器的性别关联
机构 * Amirkabir University of Technology(阿米尔卡比尔理工大学) ; King’s College London(伦敦国王学院) ; University of Tehran(德黑兰大学) ; Bocconi University(博科尼大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 本研究推出多模态数据集Symphony-Bias,评估多模态模型在乐器性别关联上的偏见,发现多数结果符合社会研究,契合度随文本、视觉、音频依次减弱。
Comments 32 pages, 23 figures, 21 tables
CARE:一个用于研究多种医疗状况下言语和非言语交流的多模态语料库
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
AI总结 针对多模态语音分析领域因现有数据集存在局限而发展受限的问题,引入CARE v1.0多模态英语数据集,涵盖多种医疗状况,提供丰富描述符和元数据,支持多种应用,推动该领域研究发展。
Comments Under review in npj Scientific Data
多模态说话人验证对说话人匿名化的威胁
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
AI总结 研究多话语、多模态环境下的说话人验证,通过对多个匿名话语的音频、韵律和语言信息进行聚合,比较不同聚合策略,发现多模态系统性能更优,帧级聚合EER最低,即便少量匿名话语结合音频和文本也能显著降低EER。