arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-21 至 2026-05-21 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2605.21008 2026-05-21 eess.AS 86%

A Survey of Audio Reasoning in Multimodal Foundation Models

多模态基础模型中音频推理的综述

Zhihan Guo, Wenqian Cui, Guan-Ting Lin, Daxin Tan, Jingyao Li, Qiyong Zheng, Dingdong Wang, Jing Xiong, Han Shi, Jiaya Jia, Irwin King

专题命中 音频语音多模态 :multimodal(title);multimodal foundation model(title);audio-visual(abstract);分类 eess.AS

AI总结 本文综述了多模态基础模型中音频推理的研究问题,探讨了音频推理模型的架构和训练基础,并系统整理了音频到文本、音频到语音、音频视觉推理和代理音频推理等领域的最新进展,同时分析了新兴范式和评估实践,提出了未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14654 2026-05-21 cs.CV cs.AI cs.CL 82%

Beyond Words: Multimodal LLM Knows When to Speak

超越词语:多模态大语言模型何时说话

Zikai Liao, Yi Ouyang, Yi-Lun Lee, Chen-Ping Yu, Yi-Hsuan Tsai, Zhaozheng Yin

机构 * Department of Computer Science, Stony Brook University(石溪大学计算机科学系) Atmee AI

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出了一种多模态策略,通过同步视频、音频和文本线索提高对话中的响应时机意识,从而提升大语言模型在对话中的响应准确性。

Comments Project page: https://github.com/lzk901372/MM-When2Speak

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12081 2026-05-21 eess.AS 79%

VoxATtack: A Multimodal Attack on Voice Anonymization Systems

VoxATtack: 一种多模态攻击 Voice Anonymization 系统

Ahmad Aloradi, Ünal Ege Gaznepoglu, Emanuël A. P. Habets, Daniel Tenbrinck

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 本文提出 VoxATtack 模型,通过结合语音和文本信息,攻击语音匿名化系统,展示了文本信息和选择性数据增强对当前语音匿名化方法的漏洞暴露。

Comments 5 pages, 3 figures, 3 tables, accepted at WASPAA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04999 2026-05-21 cs.LG 78%

Disentangling Bias by Modeling Intra- and Inter-modal Causal Attention for Multimodal Sentiment Analysis

通过建模内模和跨模态因果注意力来解构偏见以进行多模态情感分析

Menghua Jiang, Yuxia Lin, Baoliang Chen, Haifeng Hu, Yuncheng Jiang, Sijie Mai

机构 * School of Computer Science, South China Normal University(华南师范大学计算机学院) School of Electronics and Information Technology, Sun Yat-sen University(中山大学电子与信息学院)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文提出了一种多关系多模态因果干预(MMCI)框架,通过因果理论的后门调整来解决多模态情感分析中因统计捷径导致的偏见问题,通过建模多模态输入为多关系图并应用注意力机制分离因果特征和捷径特征,从而提升模型在分布偏移下的稳定性。

Comments Corrected several hyperparameter settings. Updated some experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15104 2026-05-21 cs.CL 57%

From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents

从文本到声音:一个可重复和可验证的评估工具调用LLM代理的框架

Md Tahmid Rahman Laskar, Xue-Yong Fu, Seyyed Saeed Sarfjoo, Quinten McNamara, Jonas Robertson, Shashi Bhushan TN

机构 * Dialpad Inc.(Dialpad公司)

专题命中 音频语音多模态 :omni-modal(abstract);分类 cs.CL

AI总结 本文提出了一种可重复和可验证的框架,用于评估基于语音的工具调用LLM代理,通过文本到语音转换和环境噪声模拟,无需重新标注工具模式和黄金标签,从而在不重新标注的情况下评估工具调用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏