arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4557 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4557 篇

2607.13614 2026-07-16 cs.HC cs.MM 新提交 79%

VIP-MINGLE: A Corpus for Videoconference and In-Person Multimodal Interaction in Group Language Engagement

VIP-MINGLE:用于群体语言交流中视频会议和面对面多模态交互的语料库

Andrew Chang, Abhinay K Bodi, Wenxin Deng, Junrui Huang, Venu G Kadamba, Sumanth B H Karanam, Dhiwahar A Kennady, David Poeppel, Dustin Freeman

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 介绍VIP-MINGLE多模态数据集,含59小时录音等,有两种环境下配对会话,涵盖多种数据。分析发现不同环境多模态行为分布有变化,该数据集是跨环境群体对话模型开发的关键资源。

Comments Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06405 2026-07-16 cs.MM cs.SD 版本更新 79%

Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space

在潜在空间中通过跨模态对齐实现精确的视频到音频生成

Thanh V. T. Tran, Ngoc-Son Nguyen, Luong Tran, Long-Khanh Pham, Paarth Neekhara, Shehzeen Hussain, Van Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心) NVIDIA Corporation(NVIDIA公司)

专题命中 音频语音多模态 :cross-modal(title);audio-visual(abstract);分类 cs.MM

AI总结 研究视频到音频生成问题,提出Flowley架构,结合视觉特征与文本提示,通过渐进软掩码交叉注意力实现视听同步,无额外计算成本,还提出SoundCap字幕,该方法在多个指标及零样本音频质量上达先进水平。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15886 2026-07-16 cs.CL 版本更新 79%

Linked Multi-Modal Data on Russian Domestic and Foreign Policy Speeches

连接多模型数据:俄罗斯国内与对外政策演讲

Daria Blinova, Gayathri Emuru, Rakesh Emuru, Kushagradheer Shridheer Srivastava, Mina Rulis, Sunita Chandrasekaran, Benjamin E. Bagozzi

机构 * University of Delaware, Department of Political Science & International Relations(德克萨斯大学,政治科学与国际关系系) University of Delaware, Masters of Science in Data Science Program(德克萨斯大学,数据科学硕士项目) University of Delaware, Department of Computer & Information Sciences(德克萨斯大学,计算机与信息科学系) University of Pennsylvania, Department of Political Science(宾夕法尼亚大学,政治科学系)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 cs.CL

AI总结 本文介绍了一个连接多模态政治通讯的数据集,涵盖俄罗斯政府多个 decades 的官方演讲,提供俄语和英语文本、图像及注释,并通过 transformer 多模态模型进行主题标注,支持政治通讯的多模态分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29473 2026-07-14 cs.CV 版本更新 79%

MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control

MAVIN:具有叙事控制的多镜头视听生成

Kaiqi Liu, Yunyao Mao, Ziqi Cai, Zheng Geng, Jing Wang, Qiulin Wang, Xintao Wang, Pengfei Wan, Kun Gai, Shuchen Weng, Boxin Shi

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手团队) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Sun Yat-sen University(中山大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 提出MAVIN框架,通过边界感知注意力、ID感知传播和多智能体脚本管线,实现多镜头视听生成中的叙事控制,解决时间错位、可控性差和脚本不完整问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08714 2026-07-10 eess.AS 新提交 79%

Multimodal Digital Biomarker for Asthma: Complementary Roles of Vocal, Clinical and Demographic Factors

用于哮喘的多模态数字生物标志物:声音、临床和人口统计学因素的互补作用

Vladimir Despotovic, Milena Despotovic, Abir Elbeji, Petr V. Nazarov, Guy Fagherazzi

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 研究针对哮喘诊断依赖传统方法、声音生物标志物缺乏临床背景整合的问题,提出多模态专家混合框架,结合声学嵌入与临床人口数据,在匹配队列上评估,模型性能优,还通过分析揭示不同症状个体特征依赖差异,支持哮喘筛查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06892 2026-07-09 eess.AS 新提交 79%

UBG-Net: An Uncertainty-aware Bayesian Gating Network for Robust Audio-Visual Speech Recognition

UBG-Net:用于鲁棒视听语音识别的不确定性感知贝叶斯门控网络

Jinjie Fu, Hang Chen, Wu Guo, Zhijun Zhang, Kuiliang Li, Peng Gao

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

AI总结 针对视听语音识别系统在现实场景中的性能问题,提出UBG-Net框架,通过MUBF机制建模认知不确定性,用DUHV进行推理,实验表明其优于SOTA基线,消融研究证实相关机制增强了鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18360 2026-07-09 cs.SD cs.CL 版本更新 79%

Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval

Omni-Embed-Audio: 利用多模态大语言模型实现鲁棒的音频-文本检索

HaeJun Yoo, Yongseop Shin, Insung Lee, Myoung-Wan Koo, Du-Seong Chang

机构 * Sogang University(首尔大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 提出Omni-Embed-Audio(OEA)检索编码器,利用多模态大语言模型原生理解音频,并通过用户意图查询(UIQ)和硬负样本挖掘,在文本到音频检索中达到与M2D-CLAP相当的性能,同时在文本到文本检索和硬负样本判别上显著优于现有方法。

Comments Accepted at ACL 2026 Main Conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02799 2026-07-07 cs.CV 新提交 79%

Conversational Human Audio-visual Talking Dialogue Generation

对话式人类视听对话生成

Junhao Song, Lluis Guasch, Xilin He, Zhongyu Yang, Yingfang Yuan, Weicheng Xie, Linlin Shen, Haijun Lin, Shizhe Liu, Wei Pang, Siyang Song

机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算系) Department of Earth Science & Engineering, Imperial College London(伦敦帝国理工学院地球科学与工程系) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Department of Computer Science, Heriot-Watt University(赫瑞瓦特大学计算机科学系) School of Computer Science, Northumbria University(诺森比亚大学计算机科学学院) College of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(深圳大学广东省智能信息处理重点实验室) School of Engineering and Design, Hunan Normal University(湖南师范大学工程与设计学院) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 提出CHAT框架,统一大语言模型和说话人脸模型,通过交互音频和面部行为细化模块,从单一文本提示生成多样、配对且相互响应的语音-面部对话片段,优于现有方法,合成数据集可作预训练数据。

Comments Accepted to ECCV 2026 as a main paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00260 2026-07-03 eess.AS 新提交 79%

Do Multimodal Large Language Models Need Reasoning to Classify Dementia from Speech?

多模态大语言模型是否需要推理来从语音中分类痴呆症?

Liming Wang, Neguine Rezaii, Bradford C. Dickerson, James Glass

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 本文评估了多模态大语言模型在自动痴呆症分类中的推理能力,发现基于文本理由的策略会导致幻觉和不一致,并提出DeTAiL框架,通过非线性适配器和强化学习利用内部表示,在两个数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08711 2026-07-03 cs.CV 版本更新 79%

TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions

TimeChat-Captioner: 用时间感知和结构化的音视频字幕脚本化多场景视频

Linli Yao, Yuancheng Wei, Yaojie Zhang, Lei Li, Xinlong Chen, Feifan Song, Ziyue Wang, Kun Ouyang, Yuanxin Liu, Lingpeng Kong, Qi Liu, Pengfei Wan, Kun Gai, Yuanxing Zhang, Xu Sun

机构 * South China University of Technology(华南理工大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 提出Omni密集描述任务,通过六维结构模式生成带时间戳的类脚本描述,构建OmniDCBench基准和SodaM评估指标,训练TimeChat-Captioner-7B模型,在音视频推理和时间定位任务上超越Gemini-2.5-Pro。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12165 2026-07-02 cs.CV 版本更新 79%

Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video

利用被动场景声音和真实世界视频进行音频-视觉相机姿态估计

Daniel Adebi, Sagnik Majumder, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 本文提出一种结合方向到达谱和双耳嵌入的音频-视觉框架,用于真实世界视频中的相机姿态估计,在视觉信息受损时表现出鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31158 2026-07-01 cs.RO cs.AI 新提交 79%

LLM-Powered Interactive Robotic Action Synthesis from Multimodal Speech, Gestures, and Music

基于多模态语音、手势和音乐的LLM驱动交互式机器人动作合成

Snehasis Banerjee, Ranjan Dasgupta

机构 * TCS Research, Tata Consultancy Services(塔塔咨询服务公司TCS研究院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出利用大语言模型融合语音、手势和音乐节拍等多模态输入,合成复杂机器人动作序列的框架,实现更自然的人机交互。

Comments IROS 2025 Workshop on Action and Interaction: Humans and Robots in Collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29335 2026-06-30 cs.LG cs.AI cs.SD 79%

AMR: Adaptive Modality Routing for Multimodal Polyglot Speaker Identification

AMR: 面向多语言多模态说话人识别的自适应模态路由

Chuxiao Zuo, Yao Zhu, Minqiang Xu, Manhong Wang, Yunke Zhang, Fei Huang

机构 * Honor Device Co., Ltd(Honor设备有限公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态说话人识别中模态缺失和语言不匹配问题,提出自适应模态路由(AMR)模块,动态评估输入质量并融合音频和面部特征,在POLY-SIM 2026评测集上平均准确率达99.07%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11933 2026-06-25 cs.CL 版本更新 79%

Cross-Modal Robustness Transfer (CMRT): Training Robust Speech Translation Models Using Adversarial Text

跨模态鲁棒性迁移(CMRT):利用对抗文本训练鲁棒的语音翻译模型

Abderrahmane Issam, Yusuf Can Semerci, Jan Scholtes, Gerasimos Spanakis

机构 * Department of Advanced Computing Sciences(先进计算科学系)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL

AI总结 提出跨模态鲁棒性迁移(CMRT)框架,将文本模态的对抗鲁棒性迁移到语音模态,无需生成对抗语音数据,在四个语言对上平均提升超过3个BLEU点。

Comments A shorter version has been accepted at INTERSPEECH2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16606 2026-06-19 cs.CL 版本更新 79%

Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech

Omnilingual SONAR:跨语言与跨模态句子嵌入,连接大规模多语言文本与语音

Omnilingual SONAR Team, João Maria Janeiro, Pere-Lluís Huguet Cabot, Ioannis Tsiamas, Yen Meng, Vivek Iyer, Guillem Ramírez, Loic Barrault, Belen Alastruey, Xiang "Tony" Cao, Yu-An Chung, Marta R. Costa-Jussa, David Dale, Kevin Heffernan, Jaehyeong Jo, Artyom Kozhevnikov, Alexandre Mourachko, Christophe Ropers, Holger Schwenk, Paul-Ambroise Duquenne

机构 * FAIR at Meta(Meta的FAIR)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL

AI总结 提出OmniSONAR模型,通过渐进式训练和教师-学生蒸馏,在数千种语言上实现文本、语音、代码和数学表达式的统一语义嵌入,在跨语言检索和翻译任务上显著降低错误率,并支持零样本语音翻译。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18988 2026-06-18 cs.AI 新提交 79%

ThinkDeception: A Progressive Reinforcement Learning Framework for Interpretable Multimodal Deception Detection

ThinkDeception: 一种用于可解释多模态欺骗检测的渐进式强化学习框架

Jinhao Song, Shan Liang, Yiqun Yue, Zhuhuayang Zhang, Tianqi Gao

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出ThinkDeception框架,将多模态大语言模型引入欺骗检测,通过逐步推理和视觉-音频一致性组相对策略优化(VAC-GRPO)实现可解释的认知推理,在主流基准上达到新SOTA。

Comments 10pages,4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18893 2026-06-18 cs.CL 新提交 79%

Learning Robust Pair Confidence for Multimodal Emotion-Cause Pair Extraction

学习鲁棒的成对置信度用于多模态情感-原因对提取

Zhuangzhuang Pan, Ning Dong, Yingna Su, Yan Xia

机构 * Institute for Advanced Studies(先进研究院) Universiti Malaya(马来大学) School of Information Engineering(信息工程学院) Suqian University(宿州学院) Digitization Department(数字化部门)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 提出RPCL框架,通过置信度差异边界约束和对抗性扰动,增强多模态情感-原因对提取中成对置信度的判别性和稳定性,在三个数据集上提升Pair F1约2.6-2.8个百分点。

Comments 11 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17254 2026-06-17 eess.AS 新提交 79%

Synergizing Zero-Shot Cross-Lingual Alzheimer Detection with Language-Invariant Multimodal Bi-Geometric Adversarial Learning

协同零样本跨语言阿尔茨海默检测与语言不变多模态双几何对抗学习

Girish, Mohd Mujtaba Akhtar, Farhan Sheth, Muskaan Singh, Juliana Gerard, Paula McClean, Kongfatt Wong-Lin

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 提出ORBIT框架,通过跨注意力融合、多语言对抗和球面-双曲几何学习实现零样本跨语言阿尔茨海默病检测,多模态融合优于单模态基线。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12688 2026-06-16 cs.LG cs.AI cs.DC 新提交 79%

M*: A Modular, Extensible, Serving System for Multimodal Models

M*: 一个模块化、可扩展的多模态模型服务系统

Atindra Jha, Naomi Sagan, Keisuke Kamahori, Irmak Sivgin, Rohan Sanda, Steven Gao, Mark Horowitz, Luke Zettlemoyer, Olivia Hsu, Jure Leskovec, Baris Kasikci, Stephanie Wang

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出M*系统,通过将模型表示为数据流图并引入Walk Graph抽象,支持多模态复合模型的高效服务,在多个任务上降低延迟并提升吞吐量。

Comments The codebase is available at https://github.com/mstar-project/mstar

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01394 2026-06-16 eess.AS cs.LG cs.SD 版本更新 79%

SSNAPS: Audio-Visual Separation of Speech and Background Noise with Diffusion Inverse Sampling

SSNAPS: 基于扩散逆采样的语音与背景噪声视听分离

Yochai Yemini, Yoav Ellinson, Rami Ben-Ari, Sharon Gannot, Ethan Fetaya

机构 * Bar-Ilan University(巴伊兰大学) OriginAI

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

AI总结 提出一种无监督的视听语音分离方法,利用扩散先验和逆采样联合建模语音与噪声,在单麦克风场景下优于有监督基线,并支持离屏说话人分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16975 2026-06-16 cs.SD eess.AS 版本更新 79%

Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs

基于多模态大语言模型的链式思维差异-共性推理的可解释音频编辑评估

Yuhang Jia, Xu Zhang, Yang Chen, Hui Wang, Enzhi Wang, Yong Qin

机构 * College of Computer Science, Nankai University, Tianjin, China(南开大学计算机科学学院,天津,中国) Academy for Advanced Interdisciplinary Studies, Nankai University, Tianjin, China(南开大学先进跨学科研究学院,天津,中国)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 提出首个基于自然语言的音频编辑自动评估框架,利用Qwen2-Audio和链式思维推理策略,实现可解释且与人类判断高度一致的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13712 2026-06-15 cs.SD cs.CL 新提交 79%

Multimodal Speaker Identification in Classroom Environments

课堂环境中的多模态说话人识别

Michael L. Chrzan, Meghavarshini Krishnaswamy, Robert Gibboni, Katie Wetstone, Wei Ai, Jing Liu

机构 * University of Michigan(密歇根大学) University of Pennsylvania(宾夕法尼亚大学) University of Maryland(马里兰大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 针对课堂背景噪声和儿童语音变异性导致纯声学模型准确率低的问题,提出融合声学嵌入与LLM语义上下文的多模态框架,将学生识别准确率从39.0%提升至50.3%,长句准确率达76.9%,角色区分准确率99.3%。

Comments 9 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11602 2026-06-11 cs.CV 新提交 79%

On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning

面向音视频广义零样本学习的层次化标准化嵌入对齐

Zihan Zhang, Jie Hong, Siyuan Fan, Yanghao Zhou, Pengfei Fang

机构 * Southeast University(东南大学) The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(新一代人工智能技术及其跨学科应用重点实验室(东南大学),教育部) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 提出AHSE方法,通过Z-score标准化和层次化对齐策略(语义、类别、批次三级)解决音视频与文本模态间的分布与结构差异,在三个基准数据集上取得竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11420 2026-06-11 cs.CL cs.SI 新提交 79%

Context-Aware Multimodal Claim Verification in Spoken Dialogues

口语对话中的上下文感知多模态声明验证

Chaewan Chun, Delvin Ce Zhang, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Sheffield(谢菲尔德大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 提出MAD2基准和上下文感知多模态融合方法,验证对话音频中的声明,发现对话结构比虚假信息框架对验证更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13293 2026-06-11 cs.CL 版本更新 79%

Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models

跨模态一致性引导用于自动回归TTS模型中的鲁棒情绪控制

Yizhou Peng, Yukun Ma, Chong Zhang, Yi-Wen Chao, Chongjia Ni, Bin Ma, Eng Siong Chng

机构 * Alibaba-NTU Global e-Sustainability CorpLab(阿里-国立大学全球可持续发展公司实验室) Nanyang Technological University(南洋理工大学) College of Computing and Data Science(计算与数据科学学院) Alibaba(阿里) Alibaba Inc.(阿里公司)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于文本情绪与显式语音情绪不一致程度的动态尺度的跨模态一致性引导分类器免费引导方法(CCG-CFG),通过使用文本情绪替代dropout条件,并采用硬样本挖掘策略蒸馏CCG-CFG引导信号,从而提升TTS模型的情绪对齐能力。在五个情感语料库和两个TTS基准测试中,该方法在CosyVoice2上实现了情绪识别准确率提升12%,主观评分提升10%,优于基线模型HierSpeech++、Qwen3-TTS和原始CosyVoice2,同时保持可懂性、自然度和高质量。

Comments Accepted to Interspeech 2026, short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15294 2026-06-10 cs.SD cs.MM 版本更新 79%

MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions

MeMo: 视觉受损条件下的实时视听目标说话人提取的注意力动量

Junjie Li, Wenxuan Wu, Shuai Wang, Zexu Pan, Kong Aik Lee, Helen Meng, Haizhou Li

机构 * Department of Electrical and Electronic Engineering, Faculty of Engineering, The Hong Kong Polytechnic University(电子工程系,工程学院,香港理工大学) Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong(系统工程与工程管理系,香港中文大学) School of Artificial Intelligence (SAI), The Chinese University of Hong Kong, Shenzhen(人工智能学院(SAI),香港中文大学深圳校区) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) Tongyi Lab, Alibaba Group, Singapore(通义实验室,阿里巴巴集团,新加坡)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM

AI总结 提出MeMo框架,通过两个自适应记忆库存储注意力信息,在视觉线索缺失时维持注意力动量,实现实时目标说话人提取,SI-SNR提升至少2dB。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07259 2026-06-08 eess.AS cs.SD 新提交 79%

Assessing True Generalisability of Audio-Visual Speech Recognisers

评估音视频语音识别器的真正泛化能力

Zhaofeng Lin, Stavros Petridis, Maja Pantic, Naomi Harte

机构 * Trinity College Dublin(都柏林三一学院) Imperial College London(伦敦帝国理工学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

AI总结 通过构建与LRS3测试集严格匹配的评估集,发现当前最先进的音视频语音识别模型在未见数据上性能全面崩溃,揭示了其泛化能力不足,并分析了退化原因、词汇偏差和错误模式。

Comments Accepted to Interspeech 2026 Long paper track. 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09061 2026-06-05 cs.SD eess.AS 79%

O_O-VC: Synthetic Data-Driven One-to-One Alignment for Any-to-Any Voice Conversion

O_O-VC: 基于合成数据驱动的任意到任意语音转换一一对一对齐

Huu Tuong Tu, Huan Vu, cuong tien nguyen, Dien Hy Ngo, Nguyen Thi Thu Trang

机构 * VNPT AI, VNPT Group(VNPT AI,VNPT集团) Hanoi University of Science and Technology(河内科学技术大学) Business AI Lab, National Economics University(国家经济大学商业人工智能实验室)

专题命中 音频语音多模态 :any-to-any(title,abstract);分类 eess.AS

AI总结 本文提出了一种基于合成数据驱动的任意到任意语音转换方法,通过利用高质量预训练多说话人文本到语音模型生成的合成语音数据,学习源语音到目标语音的直接映射,从而在保留语言内容的同时捕捉说话人特定特征,并在零样本场景中提升适应性和性能。

Comments EMNLP 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19446 2026-06-05 eess.AS 79%

Leveraging Cascaded Binary Classification and Multimodal Fusion for Dementia Detection through Spontaneous Speech

利用级联二分类和多模态融合进行自发语音中的痴呆症检测

Yin-Long Liu, Yuanchao Li, Rui Feng, Liu He, Jia-Xin Chen, Yi-Ming Wang, Yu-Ang Chen, Yan-Han Peng, Jia-Hong Yuan, Zhen-Hua Ling

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 本文提出了一种级联二分类和多模态融合的方法,用于通过自发语音进行早期痴呆症检测,解决了类别不平衡问题,并在Mini-Mental State Examination评分回归任务中实现了优于基线方法的性能。

Comments Accepted by Interspeech 2025

Journal ref Proc. Interspeech 2025, pp. 544-548, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03672 2026-06-03 cs.SD cs.MM 79%

Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation

Foley-Omni:从任务级音频合成到完整视频配乐生成的统一多模态生成模型

Ye Tao, Lupeng Liu, Xuenan Xu, Jiasun Feng, Jiarui Wang, Ying Qin, Shuiyang Mao, Wei Liu, Shuai Wang

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Video Rebirth Shanghai Jiao Tong University(上海交通大学) Beijing Jiaotong University(北京交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 提出Foley-Omni统一多模态音频生成模型,通过共享潜变量生成过程联合建模语音、音效和音乐,实现从孤立任务级合成到完整视频配乐生成,并构建V2ST-Bench基准进行综合评估。

详情

展开后加载摘要…

URL PDF HTML 收藏