arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-24 至 2026-06-24 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2606.24286 2026-06-24 cs.CL cs.CV 新提交 84%

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

AVOC:通过检索启发的令牌压缩增强全模态大语言模型中的小时级音视频理解

Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng, Kaisi Guan, Hao Jiang, Xiangyang Li, Guojie Zhu, Ruihua Song

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Huawei Inc.(华为技术有限公司)

专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出AVOC框架,通过检索启发的令牌压缩模块,将多模态令牌压缩视为top-K检索问题,结合相关性、重要性和多样性三个标准,实现长时音视频理解,在小时级基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23712 2026-06-24 eess.SP cs.AI 新提交 83%

Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement

基于扩散的视觉条件语音增强中的音视频对比对齐

Colombe Mboungou, Mostafa Sadeghi, Jean-Eudes Ayilo, Romain Serizel

机构 * Université de Lorraine, CNRS, Inria, Loria, Nancy, France(洛林大学、法国国家科学研究中心、法国国家信息与自动化研究所、Loria研究所、法国南希)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出在扩散训练目标中加入对比音视频损失,增强视觉信息利用,提升语音增强性能,尤其在低信噪比下改善显著。

Journal ref INTERSPEECH, Sep 2026, Sydney, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04840 2026-06-24 eess.AS cs.AI cs.CL 版本更新 67%

An Approach to Simultaneous Acquisition of Real-Time MRI Video, EEG, and Surface EMG for Articulatory, Brain, and Muscle Activity During Speech Production

一种用于言语产生过程中发音、大脑和肌肉活动的实时MRI视频、脑电图和表面肌电图同步采集方法

Jihwan Lee, Parsa Razmara, Kevin Huang, Sean Foley, Aditya Kommineni, Haley Hsu, Woojae Jeong, Prakash Kumar, Xuan Shi, Yoonjeong Lee, Tiantian Feng, Takfarinas Medani, Ye Tian, Sudarsana Reddy Kadiri, Krishna S. Nayak, Dani Byrd, Louis Goldstein, Richard M. Leahy, Shrikanth Narayanan

机构 * Signal Analysis and Interpretation Laboratory, University of Southern California(南加州大学信号分析与解释实验室) Ming Hsieh Dept. of Electrical and Computer Engineering, University of Southern California(南加州大学明希斯电气与计算机工程系) Dept. of Linguistics, University of Southern California(南加州大学语言学系)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文首次实现了言语产生过程中实时MRI、EEG和表面EMG的同步采集,并提出了针对三模态设置的伪影抑制流程,为言语神经科学和脑机接口提供新视角。

Comments Accepted for Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24523 2026-06-24 cs.CL cs.AI 新提交 62%

Poster: Exploring the Limits of Audio-Based Detection of Turkish Phone Call Scams

海报:探索基于音频的土耳其电话诈骗检测的极限

Arda Eren, Micheal Cheung, Youqian Zhang, Grace Ngai, Eugene Yujun Fu

机构 * The Hong Kong Polytechnic University(香港理工大学) The Education University of Hong Kong(香港教育大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 针对土耳其语电话诈骗,构建首个多模态数据集(100对音频-文本),评估7个LLM在三种输入条件下的检测性能,发现基于文本的输入优于直接音频处理。

Comments Poster paper accepted at 47th IEEE Security & Privacy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏