arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-20 至 2026-08-20 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 6 篇

2604.09110 2026-08-20 cs.MM 版本更新 83%

Generalizing Video DeepFake Detection by Self-generated Audio-Visual Pseudo-Fakes

通过自动生成的音频视觉伪假来泛化视频深度伪造检测

Zihe Wei, Yuezun Li

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出AVPF方法,通过自动生成多样化的音频视觉伪假样本提升模型泛化能力,实验显示在多个标准数据集上平均性能提升达7.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18401 2026-08-20 cs.HC cs.CL cs.RO 新提交 80%

Multimodal Rapport Estimation in Real-World HRI

现实世界人机交互(HRI)中的多模态融洽度估计

Akihiro Sakuramoto, Takato Hayashi, Ryo Miyoshi, Yuki Okafuji, Shogo Okada

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究针对现实世界人机交互的融洽度估计问题,采用日本药店的62个多模态会话,对比零样本LLMs等模型,发现Gemini融合模型表现最优,且性能随互动时长、群体规模变化。

Comments 9 pages, 4 figures, 3 tables. Accepted at the 28th ACM International Conference on Multimodal Interaction (ICMI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00735 2026-08-20 cs.CR cs.AI cs.SE 版本更新 79%

`From Prompt to Perturbation': An Adaptive Framework for Voice-Based Jailbreaks on Audio LLMs

从提示到扰动:针对音频大语言模型的自适应语音越狱框架

Linghan Huang, Bo Li, Huaming Chen, Kim-Kwang Raymond Choo

机构 * School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院) University of Chicago(芝加哥大学) University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 针对现有音频越狱攻击研究仅聚焦单一范式的不足,提出自适应越狱框架,可在统一设置下评估级联流水线和LALM,实验显示其攻击成功率优于现有方法。

Comments Accepted at the IEEE International Conference on Data Mining (ICDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02782 2026-08-20 cs.AI cs.CL eess.AS 版本更新 78%

When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition

音频-语言模型在利用多模态上下文进行构音障碍语音识别时的失效问题

Pehuén Moure, Niclas Pokel, Bilal Bounajma, Yingqiang Gao, Roman Boehringer, Longbiao Cheng, Shih-Chii Liu

专题命中 音频语音多模态 :multimodal(title);分类 cs.CL、cs.AI、eess.AS

AI总结 该研究构建基于SAP数据集的基准,发现现有音频-语言模型无法有效利用构音障碍语音的临床上下文,而LoRA适配方法可将WER降低52%,为包容性ASR提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18080 2026-08-20 cs.AI 新提交 61%

Large Language Models in Mental Health: A Systematic Review of Applications, Innovations, and Ethical Challenges

心理健康领域的大语言模型:应用、创新与伦理挑战的系统综述

Yisong Chen, Yifan Gao, Sijing Yu, Chuqing Zhao, Yang Lu

专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.AI

AI总结 该系统综述梳理了大语言模型在心理健康领域的多类应用、技术创新,同时探讨了其面临的伦理与监管挑战,并倡导建立保障其安全公平部署的框架。

Comments Systematic review. Published in Journal of Industrial Integration and Management (2025). Applications of large language models in mental health, including social media analysis, clinical conversational agents, therapy support tools, multimodal learning, and ethical considerations

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18226 2026-08-20 cs.SD 新提交 50%

FM Synthesizer Audio-Parameter Shared Embeddings

FM合成器音频参数共享嵌入

David Braun, Adam Finkelstein

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 针对合成器预设检索问题,本文设计模仿FM信号处理的图神经网络学习含信号路由的参数表征,结合SLAP多模态目标学习音频与FM合成器参数的联合嵌入,在Yamaha DX7数据集上验证了方法的有效性与泛化性。

Comments Accepted to DAFx 2026

详情

展开后加载摘要…

URL PDF HTML 收藏