arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4557 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4557 篇

2605.17488 2026-05-19 cs.CV cs.MM cs.SD 81%

Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation

Omni-Customizer: 用于联合音频-视频生成的端到端多模态定制

Yuheng Chen, Qingdong He, Teng Hu, Yuji Wang, Yabiao Wang, Lizhuang Ma, Jiangning Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Omni-Customizer,一种端到端多模态定制框架,旨在实现精确的多模态身份信息绑定和无缝融合,通过引入Omni-Context Fusion模块和Masked TTS Cross-Attention机制,提升多模态定制生成的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07668 2026-05-13 cs.CV cs.AI cs.LG cs.RO 81%

Looking and Listening Inside and Outside: Multimodal Artificial Intelligence Systems for Driver Safety Assessment and Intelligent Vehicle Decision-Making

观察与聆听内外:多模态人工智能系统用于驾驶员安全评估和智能车辆决策

Ross Greer, Laura Fleig, Maitrayee Keskar, Erika Maquiling, Giovanni Tapia Lopez, Angel Martinez-Sanchez, Parthib Roy, Jake Rattigan, Mira Sur, Alejandra Vidrio, Thomas Marcotte, Mohan Trivedi

机构 * Machine Intelligence, Interaction, and Imagination (Mi3) Laboratory(机器智能、交互与想象实验室) Laboratory for Intelligent and Safe Automobiles (LISA)(智能与安全汽车实验室) Johns Hopkins University(约翰霍普金斯大学) Center for Medicinal Cannabis Research (CMCR)(医药大麻研究中心)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出L-LIO框架,通过融合音频与视觉数据提升驾驶员状态评估和环境理解,探讨音频在车辆安全中的作用,包括驾驶员语音分类、乘客指令分析及视觉不足时的音频辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24954 2026-05-12 cs.LG cs.AI cs.CV 81%

Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

Nemotron 3 Nano Omni:高效且开放的多模态智能

NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg Heinrich, Guo Chen, Lukas Voegtle, Philipp Fischer, Timo Roman, Karan Sapra, Collin McCarthy, Shaokun Zhang, Fuxiao Liu, Hanrong Ye, Yi Dong, Mingjie Liu, Yifan Peng, Piotr Zelasko, Zhehuai Chen, Nithin Rao Koluguri, Nune Tadevosyan, Lilit Grigoryan, Ehsan Hosseini Asl, Pritam Biswas, Leili Tavabi, Yuanhang Su, Zhiding Yu, Peter Jin, Alexandre Milesi, Netanel Haber, Yao Xu, Sarah Amiraslani, Nabin Mulepati, Eric Tramel, Jaehun Jung, Ximing Lu, Brandon Cui, Jin Xu, Zhiqi Li, Shihao Wang, Yuanguo Kuang, Shaokun Zhang, Huck Yang, Boyi Li, Hongxu Yin, Song Han, Bilal Kartal, Pavlo Molchanov, Adi Renduchintala, Charles Wang, David Mosallanezhad, Soumye Singhal, Luis Vega, Katherine Cheung, Sreyan Ghosh, Yian Zhang, Alexander Bukharin, Venkat Srinivasan, Johnny Greco, Andre Manoel, Maarten Van Segbroeck, Suseella Panguliri, Rohit Watve, Divyanshu Kakwani, Shubham Pachori, Jeffrey Glick, Radha Sri-Tharan, Aileen Zaman, Khanh Nguyen, Shi Chen, Jiaheng Fang, Qing Miao, Wenfei Zhou, Yu Wang, Zaid Pervaiz Bhat, Varun Praveen, Arihant Jain, Ramanathan Arunachalam, Tomasz Kornuta, Ashton Sharabiani, Amy Shen, Wei Huang, Yi-Fu Wu, Ali Roshan Ghias, Huiying Li, Brian Yu, Nima Tajbakhsh, Chen Cui, Wenwen Gao, Li Ding, Terry Kong, Manoj Kilaru, Anahita Bhiwandiwalla, Marek Wawrzos, Daniel Korzekwa, Pablo Ribalta, Grzegorz Chlebus, Besmira Nushi, Ewa Dobrowolska, Maciej Jakub Mikulski, Kunal Dhawan, Steve Huang, Jagadeesh Balam, Yongqiang Wang, Nikolay Karpov, Valentin Mendelev, George Zelenfroynd, Meline Mkrtchyan, Qing Miao, Omri Almog, Bhavesh Pawar, Rameshwar Shivbhakta, Sudeep Sabnis, Ashrton Sharabiani, Negar Habibi, Geethapriya Venkataramani, Pamela Peng, Prerit Rodney, Serge Panev, Richard Mazzarese, Nicky Liu, Michael Fukuyama, Andrii Skliar, Roger Waleffe, Duncan Riach, Yunheng Zou, Jian Hu, Hao Zhang, Binfeng Xu, Yuhao Yang, Zuhair Ahmed, Alexandre Milesi, Carlo del Mundo, Chad Voegele, Zhiyu Cheng, Nave Assaf, Andrii Skliar, Daniel Afrimi, Natan Bagrov, Ran Zilberstein, Ofri Masad, Eugene Khvedchenia, Natan Bagrov, Borys Tymchenko, Tomer Asida, Daniel Afrimi, Parth Mannan, Victor Cui, Michael Evans, Katherine Luna, Jie Lou, Pinky Xu, Guyue Huang, Negar Habibi, Michael Boone, Pradeep Thalasta, Adeola Adesoba, Dina Yared, Christopher Parisien, Leon Derczynski, Shaona Ghosh, Wes Feely, Micah Schaffer, Radha Sri-Tharan, Jeffrey Glick, Barnaby Simkin, George Zelenfroynd, Tomasz Grzegorzek, Rishabh Garg, Aastha Jhunjhunwala, Sergei Kolchenko, Farzan Memarian, Haran Kumar, Shiv Kumar, Isabel Hulseman, Anjali Shah, Kari Briski, Padmavathy Subramanian, Joey Conway, Udi Karpas, Jane Polak Scowcroft, Annie Surla, Shilpa Ammireddy, Ellie Evans, Jesse Oliver, Tom Balough, Chia-Chih Chen, Sandip Bhaskar, Alejandra Rico, Bardiya Sadeghi, Seph Mard, Katherine Cheung, Meredith Price, Laya Sleiman, Saori Kaji, Wesley Helmholz, Wendy Quan, Michael Lightstone, Jonathan Cohen, Jian Zhang, Oleksii Kuchaiev, Boris Ginsburg, Jan Kautz, Eileen Long, Mohammad Shoeybi, Mostofa Patwary, Oluwatobi Olabiyi, Andrew Tao, Bryan Catanzaro, Udi Karpas

机构 * NVIDIA

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Nemotron 3 Nano Omni是首个原生支持音频输入的多模态模型,通过架构、数据和训练方法的改进,在所有模态上均实现了更准确的性能,同时提供更低的推理延迟和更高的吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27866 2026-05-01 eess.AS cs.MM cs.SD 81%

LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition

LRS-VoxMM:面向真实场景的音频视觉语音识别基准

Doyeop Kwak, Jeongsoo Choi, Suyeon Lee, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

AI总结 本文提出LRS-VoxMM基准,基于VoxMM数据集,通过预处理生成适合AVSR管道的样本,覆盖更广泛场景和声学条件,并提供噪声、回声和带宽限制的评估集,实验表明其比LRS3更难,视觉信息在音频退化时作用更显著。

Comments Technical report for the LRS-VoxMM dataset release. Project page: https://mm.kaist.ac.kr/projects/voxmm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21298 2026-04-22 cs.CL cs.AI 81%

More Than Sum of Its Parts: Deciphering Intent Shifts in Multimodal Hate Speech Detection

不止是部分之和:解码多模态仇恨言论检测中的意图转变

Runze Sun, Yu Zheng, Zexuan Xiong, Zhongjin Qu, Lei Chen, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出H-VLI基准和ARCADE框架,通过模拟法庭辩论解码多模态仇恨言论中的隐含意图转变,提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10632 2026-04-14 cs.SD cs.LG cs.MM eess.AS 81%

Multimodal Dataset Normalization and Perceptual Validation for Music-Taste Correspondences

多模态数据集规范化与感知验证:音乐-味觉对应关系

Matteo Spanio, Valentina Frezzato, Antonio Rodà

机构 * University of Padova(帕多瓦大学)

专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);分类 cs.MM、eess.AS

AI总结 本文通过两项实验验证了合成FMA标注中存在听觉调味效果,展示了跨模态结构在不同监督下的保持以及计算目标与人类感知的显著一致性。

Comments Submitted to SMC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06901 2026-04-09 cs.CE cs.AI cs.CV cs.CY cs.ET 81%

XR-CareerAssist: An Immersive Platform for Personalised Career Guidance Leveraging Extended Reality and Multimodal AI

XR-CareerAssist:一种结合扩展现实与多模态AI的沉浸式个性化职业指导平台

N. D. Tantaroudas, A. J. McCracken, I. Karachalios, E. Papatheou, V. Pastrikakis

机构 * Institute of Communications and Computer Systems (ICCS)(通信与计算机系统研究所) DASKALOS-APPS National Technical University of Athens(雅典国家技术大学) University of Exeter(埃克塞特大学) CVCOSMOS Ltd(CVCOSMOS有限公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出XR-CareerAssist平台,结合扩展现实与多模态AI,提供沉浸式、多语言的职业指导。系统整合语音识别、神经机器翻译、对话训练助手、视觉-语言模型和3D虚拟形象,通过动态Sankey图展示职业轨迹,实验显示高准确率和用户满意度。

Comments 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05007 2026-04-08 cs.SD cs.AI eess.AS 81%

Generalizable Audio-Visual Navigation via Binaural Difference Attention and Action Transition Prediction

通过双耳差异注意力和动作转移预测实现可泛化的音频视觉导航

Jia Li, Yinfeng Yu

机构 * Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学联合具身智能研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算联合国际研究实验室) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、eess.AS

AI总结 本文提出BDATP框架,通过双耳差异注意力增强空间定位并减少对语义类别的依赖,同时引入动作转移预测任务作为正则化项,提升模型在未见环境中的泛化能力,实验表明在Replica和Matterport3D数据集上取得显著性能提升。

Comments Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02390 2026-04-06 cs.SD cs.AI eess.AS 81%

Spatial-Aware Conditioned Fusion for Audio-Visual Navigation

空间感知条件融合用于音视频导航

Shaohang Wu, Yinfeng Yu

机构 * Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语种认知计算联合国际研究实验室) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、eess.AS

AI总结 本文提出空间感知条件融合(SACF),通过离散化目标相对方向和距离,生成紧凑描述符以指导策略和状态建模,利用音频嵌入和空间描述符生成通道级缩放和偏置,调节视觉特征以生成目标导向的融合表示,提升导航效率和泛化能力。

Comments Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28757 2026-03-31 cs.CV cs.MM cs.SD 81%

SonoWorld: From One Image to a 3D Audio-Visual Scene

SonoWorld:从一张图像到一个三维音频视觉场景

Derong Jin, Xiyi Chen, Ming C. Lin, Ruohan Gao

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Image2AVScene任务,通过SonoWorld框架生成三维音频视觉场景,结合图像生成全景、三维场景构建、语言引导声音锚点和空间音频渲染,实现沉浸式体验。

Comments Accepted by CVPR 2026, project page: https://humathe.github.io/sonoworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26840 2026-03-31 eess.AS cs.AI 81%

Dual-branch Graph Domain Adaptation for Cross-scenario Multi-modal Emotion Recognition

双分支图域适应用于跨场景多模态情感识别

Yuntao Shou, Jun Zhou, Tao Meng, Wei Ai, Keqin Li

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出双分支图域适应框架DGDA,解决跨场景多模态情感识别中的域移位和标签噪声问题,通过情感交互图和双分支编码器提升模型泛化能力,实验验证其优于现有方法。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24793 2026-03-27 cs.CV cs.MM cs.SD 81%

AVControl: Efficient Framework for Training Audio-Visual Controls

AVControl: 用于音频-视觉控制训练的高效框架

Matan Ben-Yosef, Tavi Halperin, Naomi Ken Korem, Mohammad Salama, Harel Cain, Asaf Joseph, Anthony Chen, Urska Jelercic, Ofir Bibi

机构 * Lightricks

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 AVControl通过轻量级框架实现多模态控制,无需架构改动,支持多种独立训练的模态,如深度、姿态、边缘、相机轨迹等,并在多个基准测试中表现优异。

Comments Project page: https://matanby.github.io/AVControl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02768 2026-03-20 eess.AS cs.CL cs.SD 81%

DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment

DeSTA2.5-Audio:迈向通用大规模音频语言模型的自我生成跨模态对齐

Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, Chao-Han Huck Yang, Sung-Feng Huang, Chih-Kai Yang, Chee-En Yu, Chun-Wei Chen, Wei-Chih Chen, Chien-yu Huang, Yi-Cheng Lin, Yu-Xiang Lin, Chi-An Fu, Chun-Yi Kuan, Wenze Ren, Xuanjun Chen, Wei-Ping Huang, En-Pei Hu, Tzu-Quan Lin, Yuan-Kuei Wu, Kuan-Po Huang, Hsiao-Ying Huang, Huang-Cheng Chou, Kai-Wei Chang, Cheng-Han Chiang, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-yi Lee

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL、eess.AS

AI总结 本文提出DeSTA2.5-Audio,一种通用大规模音频语言模型,通过自我生成的跨模态对齐策略解决知识保留与音频感知的平衡问题,展示了在多个音频-语言基准测试中的优异性能。

Comments Published in IEEE Transactions on Audio, Speech and Language Processing (TASLP). Model and code available at: https://github.com/kehanlu/DeSTA2.5-Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10043 2026-03-12 cs.MM cs.AI cs.SD 81%

AMB-DSGDN: Adaptive Modality-Balanced Dynamic Semantic Graph Differential Network for Multimodal Emotion Recognition

AMB-DSGDN: 适应性模态平衡动态语义图差分网络用于多模态情感识别

Yunsheng Wang, Yuntao Shou, Yilong Tan, Wei Ai, Tao Meng, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(计算机与数学学院,中央南林业科技大学) Department of Computer Science, State University of New York(计算机科学系,纽约州立大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 AMB-DSGDN通过适应性模态平衡和动态语义图差分机制,提升多模态情感识别的准确性和鲁棒性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08034 2026-03-10 cs.CV cs.AI 81%

Solution to the 10th ABAW Expression Recognition Challenge: A Robust Multimodal Framework with Safe Cross-Attention and Modality Dropout

解决第10届ABAW表情识别挑战的方案:一种具有安全交叉注意力和模态dropout的鲁棒多模态框架

Jun Yu, Naixiang Zheng, Guoyuan Wang, Yunxiang Zhang, Lingsi Zhu, Jiaen Liang, Wei Huang, Shengping Liu

机构 * University of Science and Technology of China(中国科学技术大学) Unisound AI Technology Co., Ltd.(Unisound人工智能技术有限公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种鲁棒多模态框架,通过安全交叉注意力和模态dropout处理现实环境中的遮挡和缺失模态问题,提升情绪识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07090 2026-03-10 cs.CR cs.AI cs.CV 81%

mAVE: A Watermark for Joint Audio-Visual Generation Models

mAVE:联合音频-视觉生成模型的水印

Luyang Si, Leyi Pan, Lijie Wen

机构 * School of Software, Tsinghua University(清华大学软件学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI

AI总结 mAVE是一种为联合音频-视觉生成模型原生设计的水印框架,通过加密绑定音频和视频潜在向量,提供对交换攻击的强安全保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23136 2026-03-09 cs.CL cs.AI cs.LG 81%

Modality Collapse as Mismatched Decoding: Information-Theoretic Limits of Multimodal LLMs

模态崩溃作为不匹配解码:多模态大语言模型的信息论限制

Jayadev Billa

机构 * Yahoo(雅虎) Nuance BBN

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究揭示多模态大语言模型中模态崩溃现象的信息论限制,指出解码器评分规则决定了可访问信息量,通过LoRA干预验证了训练目标对情绪检测性能的提升作用。

Comments 24 pages, 11 tables, 2 figures. Code: https://github.com/jb1999/modality_collapse_paper, submitted for review COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08580 2026-03-05 cs.SD cs.AI eess.AS 81%

LadderSym: A Multimodal Interleaved Transformer for Music Practice Error Detection

LadderSym: 一种用于音乐练习错误检测的多模态交错Transformer

Benjamin Shiue-Hal Chou, Purvish Jajal, Nick John Eliopoulos, James C. Davis, George K. Thiruvathukal, Kristen Yeon-Ji Yun, Yung-Hsiang Lu

机构 * Purdue University(普渡大学) Loyola University Chicago(芝加哥洛约拉大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS

AI总结 LadderSym通过双流编码器和多模态策略提升音乐练习错误检测的F1分数,显著提高遗漏和额外音符的识别准确率。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15909 2026-03-02 eess.AS cs.AI cs.DB cs.HC cs.MA cs.SD 81%

Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis

Resp-Agent:一种基于代理的多模态呼吸声生成与疾病诊断系统

Pengfei Zhang, Tianxin Xie, Minghao Yang, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS

AI总结 Resp-Agent是一种基于代理的多模态系统,通过主动对抗课程代理和模态编织器提升呼吸声生成与疾病诊断的鲁棒性。

Comments 24 pages, 3 figures. Published as a conference paper at ICLR 2026

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05847 2026-02-17 cs.AI cs.CV 81%

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

OmniVideo-R1: 通过查询意图和模态注意力强化音频视觉推理

Zhangquan Chen, Jiale Tao, Ruihuang Li, Yihao Hu, Ruitao Chen, Zhantao Yang, Xinlei Yu, Haodong Jing, Manyuan Zhang, Shuai Shao, Biao Wang, Qinglin Lu, Ruqi Huang

机构 * tencent(腾讯)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI

AI总结 OmniVideo-R1通过查询意图和模态注意力机制,提升多模态推理能力,在多个基准上超越现有基线模型。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13263 2026-02-17 cs.CL cs.SD eess.AS 81%

Multimodal Consistency-Guided Reference-Free Data Selection for ASR Accent Adaptation

多模态一致性引导的参考自由数据选择用于ASR口音适应

Ligong Lei, Wenwen Lu, Xudong Pang, Zaokere Kadeer, Aishan Wumaier

机构 * School of Computer Science and Technology(计算机科学与技术学院) Xinjiang University(新疆大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

AI总结 本文提出一种多模态一致性引导的参考自由数据选择方法,用于提升ASR在口音适应中的性能,通过减少噪声伪标签和优化查询相关性,实现更高效的口音适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09637 2026-02-11 cs.CV cs.MM 81%

Towards Training-free Multimodal Hate Localisation with Large Language Models

无需训练的多模态仇恨定位与大型语言模型

Yueming Sun, Long Yang, Jianbo Jiao, Zeyu Fu

机构 * Hybrid Intelligence Lab, University of Durham(杜伦大学混合智能实验室) Multimodal Intelligence Lab, University of Exeter(埃克塞特大学多模态智能实验室) The MIx Group University of Birmingham(伯明翰大学MIx集团)

专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 提出无需训练的多模态仇恨视频定位框架LELA,通过多阶段提示方案和跨模态推理机制实现高精度定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01284 2026-02-03 cs.MM cs.CV cs.HC 81%

Seeing, Hearing, and Knowing Together: Multimodal Strategies in Deepfake Videos Detection

看见、听见与认知:深度伪造视频检测中的多模态策略

Chen Chen, Dion Hoe-Lian Goh

机构 * Nanyang Technological University(南洋理工大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 研究探讨了多模态策略在深度伪造视频检测中的应用,通过分析人类识别过程中的线索组合,提出了提升媒体素养的指导方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13576 2026-01-30 eess.AS cs.AI cs.SD eess.IV 81%

End-to-end audio-visual learning for cochlear implant sound coding simulations in noisy environments

端到端音频视觉学习用于在噪声环境中的人工耳蜗声音编码模拟

Meng-Ping Lin, Enoch Hsin-Ho Huang, Shao-Yi Chien, Yu Tsao

机构 * Graduate Institute of Electronics Engineering(电子工程研究所) the Department of Electrical Engineering, National Taiwan University, Taipei 106319, Taiwan(国立台湾大学电子工程系) Research Center for Information Technology Innovation Technology, Academia Sinica, Taipei 115201, Taiwan(中科院资讯科技创新研究中心) Department of Electrical Engineering, Chung Yuan Christian University, Taoyuan 320314, Taiwan(Chung Yuan Christian University 电子工程系)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、eess.AS

AI总结 本文提出了一种端到端的人工耳蜗声音编码系统,通过整合音频视觉信息提升噪声环境中的语音可懂度和信噪比。

Comments 7 pages, 2 figures

Journal ref JASA Express Lett. 6 (2026) 015202

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07253 2026-01-28 eess.AS cs.CV cs.SD 81%

Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models

Omni-AVSR:迈向基于大语言模型的统一多模态语音识别

Umberto Cappellazzo, Xubo Liu, Pingchuan Ma, Stavros Petridis, Maja Pantic

机构 * Imperial College London, UK(伦敦帝国理工学院) University of Surrey, UK(萨里大学)

专题命中 音频语音多模态 :multimodal(title);audio-visual(abstract);分类 cs.CV、eess.AS

AI总结 Omni-AVSR通过统一多模态语音识别框架,结合高效多粒度训练与参数高效适应,实现跨任务协同,降低资源消耗并提升鲁棒性。

Comments Accepted to IEEE ICASSP 2026 (camera-ready version). Project website (code and model weights): https://umbertocappellazzo.github.io/Omni-AVSR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18393 2026-01-27 cs.SD cs.CL eess.AS 81%

OCR-Enhanced Multimodal ASR Can Read While Listening

增强OCR的多模态ASR可边听边读

Junli Chen, Changli Tang, Yixuan Li, Guangzhi Sun, Chao Zhang

机构 * Department of Electrical Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国)

专题命中 音频语音多模态 :multimodal(title);audio-visual(abstract);分类 cs.CL、eess.AS

AI总结 Donut-Whisper通过结合双编码器和交叉注意力模块,利用视觉信息提升中英文语音识别性能,实现显著的WER和CER降低。

Comments 4 pages, 2 figures. Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16547 2026-01-26 cs.SD cs.AI eess.AS 81%

CORD: Bridging the Audio-Text Reasoning Gap via Weighted On-policy Cross-modal Distillation

CORD:通过加权在线跨模态蒸馏弥合音频-文本推理差距

Jing Hu, Danxiang Zhu, Xianlong Luo, Dan Zhang, Shuwei He, Yishu Lei, Haitao Zheng, Shikun Feng, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

机构 * ERNIE Team, Baidu(百度ERNIE团队) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.AI、eess.AS

AI总结 CORD通过加权在线跨模态蒸馏方法,有效弥合音频与文本推理之间的差距,提升音频条件推理能力。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14651 2026-01-22 cs.CV cs.MM cs.SD 81%

READ-Net: Clarifying Emotional Ambiguity via Adaptive Feature Recalibration for Audio-Visual Depression Detection

READ-Net:通过自适应特征重校准澄清情绪歧义以实现音频-视觉抑郁症检测

Chenglizhao Chen, Boze Li, Mengke Song, Dehao Feng, Xinyu Liu, Shanchen Pang, Jufeng Yang, Hui Yu

机构 * College of Computer Science and Technology, China University of Petroleum (East China)(中国石油大学(华东)计算机科学与技术学院) College of Computer Science, Nankai University(南开大学计算机科学学院) School of Computing Science, University of Glasgow(格拉斯哥大学计算科学学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 READ-Net通过自适应特征重校准解决音频-视觉抑郁症检测中的情绪歧义问题,提升检测准确率与F1分数。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11968 2026-01-21 cs.MM cs.SD eess.AS 81%

MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio

MuseAgent-1: 交互式 grounded 多模态理解音乐谱面与表演音频

Qihao Zhao, Yunqi Cao, Yangyu Huang, Hui Yi Leong, Fan Zhang, Kim-Hui Yap, Wei Hu

机构 * Nanyang Technological University(南洋理工大学) Beijing University of Chemical Technology(北京化工大学) Microsoft(微软公司) University of Chicago(芝加哥大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM、eess.AS

AI总结 MuseAgent-1 是一个专注于音乐的多模态代理,通过结构化符号表示和多步骤推理,提升对音乐谱面和表演音频的交互式理解能力。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05436 2026-01-06 cs.SD cs.MM eess.AS 81%

pyAMPACT: A Score-Audio Alignment Toolkit for Performance Data Estimation and Multi-modal Processing

pyAMPACT:一种用于表演数据估计和多模态处理的评分-音频对齐工具包

Johanna Devaney, Daniel McKemie, Alex Morgan

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.MM、eess.AS

AI总结 pyAMPACT是一种用于表演数据估计和多模态处理的工具,通过符号与音频的对齐实现性能数据的估计及多模态分析

Comments Proceedings of the 2025 International Computer Music Conference

详情

展开后加载摘要…

URL PDF HTML 收藏