arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-25 至 2026-03-25 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 8 篇

2603.22732 2026-03-25 cs.CV 85%

SOUPLE: Enhancing Audio-Visual Localization and Segmentation with Learnable Prompt Contexts

SOUPLE: 通过可学习的提示上下文增强音频-视觉定位与分割

Khanh Binh Nguyen, Chae Jung Park

机构 * Deakin University(德克萨斯大学) National Cancer Center(国立癌症中心)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 SOUPLE通过可学习的上下文标记提升音频-视觉定位与分割性能,利用视觉特征生成条件上下文以连接音频与视觉输入。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17181 2026-03-25 cs.CV cs.LG cs.SD 85%

Investigating self-supervised representations for audio-visual deepfake detection

探究用于音频-视觉深度伪造检测的自监督表示

Dragos-Alexandru Boldisor, Stefan Smeu, Dan Oneata, Elisabeta Oneata

机构 * Bitdefender Politehnica Bucharest(巴蒂亚努大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文系统评估了自监督表示在多模态和多领域中的检测效果、信息可解释性和跨模态互补性,发现音频引导的表示在深度伪造检测中表现最佳。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22985 2026-03-25 cs.CL cs.CY 79%

Beyond Hate: Differentiating Uncivil and Intolerant Speech in Multimodal Content Moderation

超越仇恨:区分多模态内容审核中的不文明与不宽容言论

Nils A. Herrmann, Tobias Eder, Jingyi He, Georg Groh

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出细粒度标注方案区分不文明与不宽容言论,通过2030个仇恨漫画数据验证,细粒度标注提升模型性能,减少有害内容误判。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14203 2026-03-25 cs.CV 79%

Selective Noise Suppression and Discriminative Mutual Interaction for Robust Audio-Visual Segmentation

选择性噪声抑制与判别互作用用于鲁棒音频视觉分割

Kai Peng, Yunzhe Shen, Miao Zhang, Leiye Liu, Yidong Han, Wei Ji, Jingjing Li, Yongri Piao, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) Yale University(耶鲁大学) University of Alberta(阿尔伯塔大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 本文提出SDAVS方法,通过选择性噪声抑制处理器和判别音频视觉互融合策略,提升动态场景中音频视觉分割的鲁棒性与准确性。

Comments Accepted to IEEE Transactions on Multimedia (TMM) 2026. Code: https://github.com/happylife-pk/SDAVS

Journal ref IEEE Transactions on Multimedia (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22306 2026-03-25 cs.AI 79%

Memory Bear AI Memory Science Engine for Multimodal Affective Intelligence: A Technical Report

Memory Bear AI记忆科学引擎:多模态情感智能的技术报告

Deliang Wen, Ke Sun, Yu Wang

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Memory Bear AI框架,通过结构化记忆处理提升多模态情感智能,实现持续、鲁棒的情感识别与应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20476 2026-03-25 cs.CV cs.MM eess.AS eess.IV 67%

Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio

迈向包容性沟通:一种统一框架,用于从手语、唇形和音频生成口语语言

Jeong Hun Yeo, Hyeongseop Rha, Sungjune Park, Junil Won, Yong Man Ro

机构 * Integrated Vision Language Laboratory, School of Electrical Engineering, Korea Advanced Institue of Science and Technology (KAIST)(整合视觉语言实验室,电气工程学院,韩国科学技术院(KAIST))

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

AI总结 本文提出首个统一框架,整合手语、唇形和音频生成口语文本,探索多模态协同作用,提升手语翻译性能。

Comments Updated the professional title of the corresponding author. Added an Acknowledgement section

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22728 2026-03-25 cs.SD eess.AS 57%

The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models

2026年国际语音处理大会大型音频语言模型音频编码能力挑战

Heinrich Dinkel, Jiahao Zhou, Guanbo Wang, Yadong Niu, Junbo Zhang, Yufeng Hao, Ying Liu, Ke Li, Wenwu Wang, Zhiyong Wu, Jian Luan

机构 * MiLM Plus, Xiaomi Inc., Beijing, China(小米公司,北京) DataoceanAI Inc., USA(DataoceanAI公司,美国) Centre for Vision Speech and Signal Processing, University of Surrey, Guildford, UK(视觉语音与信号处理中心, Surrey大学, Guildford,英国) Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(深圳国际研究生院,清华大学,深圳,中国)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出Interspeech 2026音频编码能力挑战,旨在评估和提升预训练音频编码器在大型音频语言模型中的性能,通过统一的生成评估框架XARES-LLM,评估编码器在多种下游任务中的表现。

Comments Interspeech 2026 Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23415 2026-03-25 cs.CY 50%

Integrating GenAI in Filmmaking: From Co-Creativity to Distributed Creativity

将生成式AI融入影视创作:从协同创作到分布式创作

Pierluigi Masai, Lorenzo Carta, Mateusz Miroslaw Lis

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文从社会技术史视角探讨生成式AI在影视创作中的作用,提出影视创作是分布式过程,技术革新重塑了传统创作流程与美学。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏