arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-01 至 2026-06-01 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 6 篇

2605.30965 2026-06-01 eess.AS cs.AI cs.CL 85%

ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment

ImmersiveTTS:基于多模态扩散Transformer和领域特定表示对齐的环境感知文本转语音

Jun-Hak Yun, Seung-Bin Kim, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 提出ImmersiveTTS模型,通过多模态扩散Transformer和领域特定表示对齐,实现与环境音频自然融合的文本到语音生成。

Comments Accepted to ACL 2026 main conference. Code is available at https://github.com/jjunak-yun/ImmersiveTTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30472 2026-06-01 cs.CL 83%

Your Multimodal Speech Model Says I Have a Face for Radio

你的多模态语音模型说我有张适合电台的脸

Maya K. Nachesa, Vlad Niculae, Vagrant Gautam

机构 * Language Technology Lab University of Amsterdam(语言技术实验室 阿姆斯特丹大学) Heidelberg Institute for Theoretical Studies(海德堡理论研究所)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL

AI总结 通过配对不同人脸与相同音频的视频,评估多模态语音识别模型在性别、种族及其交叉属性上的偏差,发现质量差异显著,提示多模态并非必然更好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25193 2026-06-01 cs.CV 83%

SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing

SpongeBob:同步感知的和谐视听生成式编辑

Sen Liang, Cong Wang, Fengbin Guan, Zhentao Yu, Yiting Lu, Yuanzhi Wang, Yuan Zhou, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(科学技术大学) Tencent Hunyuan(腾讯文生)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出首个端到端视听联合编辑框架SpongeBob,通过双向跨模态交互的同步感知机制和上下文感知模块,解决视频编辑中的音画不同步和语义冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31432 2026-06-01 cs.CL cs.AI cs.SD 73%

DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs

DOA:面向语音大语言模型的长形式同声传译的无训练解码器仅注意力策略

Sara Papi, Luisa Bentivogli

机构 * Fondazione Bruno Kessler(布鲁诺·克塞塞基金会)

专题命中 音频语音多模态 :multimodal(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出DOA策略,利用解码器自注意力导出代理对齐,无需训练即可实现语音大语言模型在长形式同声传译中的流式决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31580 2026-06-01 cs.LG 71%

Giving Sensors a Voice: Multimodal JEPA for Semantic Time-Series Embeddings

赋予传感器声音:用于语义时间序列嵌入的多模态JEPA

Utsav Dutta, Gerardo Pastrana, Sina Khoshfetrat Pakazad, Henrik Ohlsson

机构 * C3 AI

专题命中 音频语音多模态 :multimodal(title)

AI总结 提出CHARM模型,通过通道级文本描述与Transformer编码器结合,利用联合嵌入预测架构(JEPA)学习语义时间序列嵌入,在异常检测、分类和预测任务中仅用线性探针即取得强性能。

Comments 9 pages, 5 figures, accepted at ICML 2026. arXiv admin note: substantial text overlap with arXiv:2505.14543

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML), PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31294 2026-06-01 cs.CV 57%

TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens

TokTalk: 基于音频-大语言模型令牌的富有表现力的实时面部动画

Qingcheng Zhao, Yifang Pan, Karan Singh

机构 * University of Toronto(多伦多大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 提出TokTalk系统,利用音频-大语言模型产生的音频令牌直接实时生成富有表现力的3D面部动画,通过分块条件流匹配模型和轻量级适配策略实现低延迟和高品质。

详情

展开后加载摘要…

URL PDF HTML 收藏