arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-11 至 2026-03-11 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 7 篇

2603.08967 2026-03-11 cs.CV eess.AS 86%

Can You Hear, Localize, and Segment Continually? An Exemplar-Free Continual Learning Benchmark for Audio-Visual Segmentation

你能持续地听、定位和分割吗?面向音频视频分割的无示例持续学习基准

Siddeshwar Raghavan, Gautham Vinod, Bruce Coburn, Fengqing Zhu

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、eess.AS

AI总结 本文提出无示例持续学习基准和ATLAS模型,通过低秩锚定缓解灾难性遗忘,验证了在动态环境下音频视频分割的持续学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08483 2026-03-11 cs.CV cs.AI cs.LG 84%

X-AVDT: Audio-Visual Cross-Attention for Robust Deepfake Detection

X-AVDT:用于鲁棒深度伪造检测的音频视觉交叉注意力

Youngseo Kim, Kwan Yun, Seokhyeon Hong, Sihun Cha, Colette Suhjung Koo, Junyong Noh

机构 * Visual Media Lab, KAIST(韩国科学技术院视觉媒体实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 X-AVDT通过利用生成器内部的音频视觉一致性线索,提出了一种鲁棒且具有通用性的深度伪造检测方法,有效提升了检测性能。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09809 2026-03-11 cs.CV 83%

RA-SSU: Towards Fine-Grained Audio-Visual Learning with Region-Aware Sound Source Understanding

RA-SSU:迈向细粒度音频视觉学习的区域感知声音源理解

Muyi Sun, Yixuan Wang, Hong Wang, Chen Su, Man Zhang, Xingqun Qi, Qi Li, Zhenan Sun

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(香港科技大学跨学科研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 RA-SSU通过构建细粒度音频视觉数据集和SSUFormer模型,实现区域感知的声音源理解,提升音频视觉学习的细粒度表现。

Comments Accepted by IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09084 2026-03-11 cs.CV 83%

OmniEdit: A Training-free framework for Lip Synchronization and Audio-Visual Editing

OmniEdit: 一种无需训练的唇同步与音频视觉编辑框架

Lixiang Lin, Siyuan Jin, Jinshan Zhang

机构 * HiThink Research(HiThink研究机构) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 OmniEdit提出一种无需训练的框架,通过替换编辑序列和去除随机元素,实现唇同步与音频视觉编辑的高效稳定处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09212 2026-03-11 eess.AS 70%

Acoustic and Semantic Modeling of Emotion in Spoken Language

语音中情感的声学与语义建模

Soumya Dutta

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 本研究通过联合建模声学与语义信息,提升语音中情感的理解与合成能力,提出情感意识的预训练框架和对话场景下的情感识别方法,以及无文本的语音情感风格转换技术。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06195 2026-03-11 cs.CL cs.AI cs.LG eess.AS 67%

Latent Speech-Text Transformer

潜在语音-文本变换器

Yen-Ju Lu, Yashesh Gaur, Wei Zhou, Benjamin Muller, Jesus Villalba, Najim Dehak, Luke Zettlemoyer, Gargi Ghosh, Mike Lewis, Srinivasan Iyer, Duc Le

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 潜在语音-文本变换器通过聚合语音标记为潜在块,提升计算效率并改善跨模态对齐,实现语音和文本性能的双重提升。

Comments Accepted to ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09627 2026-03-11 eess.AS 57%

Speech-Omni-Lite: Portable Speech Interfaces for Vision-Language Models

Speech-Omni-Lite: 用于视觉-语言模型的便携式语音接口

Dehua Tao, Xuan Luo, Daxin Tan, Kai Chen, Lanqing Hong, Jing Li, Ruifeng Xu, Xiao Chen

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 Speech-Omni-Lite通过轻量模块扩展视觉-语言模型,实现低成本语音理解和生成,同时保持原有性能,实验显示其在少量语音数据下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏