arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-11 至 2026-06-11 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 8 篇

2405.06995 2026-06-11 cs.SD cs.CV cs.MM eess.AS 版本更新 85%

Benchmarking Cross-Domain Audio-Visual Deception Detection

跨域音视频欺骗检测基准测试

Xiaobao Guo, Zitong Yu, Nithish Muthuchamy Selvaraj, Bingquan Shen, Adams Wai-Kin Kong, Alex C. Kot

机构 * Rapid-Rich Object Search (ROSE) Lab and the College of Computing and Data Science, Nanyang Technological University (NTU)(快速丰富对象搜索(ROSE)实验室和南洋理工大学计算与数据科学学院) School of Computing and Information Technology and Dongguan Key Laboratory for Intelligence and Information Technology, Great Bay University(计算与信息科技学院和东莞智能与信息技术重点实验室,大湾大学) DSO National Laboratories(国防科学实验室) College of Computing and Data Science, Nanyang Technological University (NTU)(计算与数据科学学院,南洋理工大学) SMBU, Shenzhen 518172, China(深圳SMBU,越南河内VinUniversity,和新加坡NTU) VinUniversity, Hanoi 100000, Vietnam and NTU, Singapore

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

AI总结 提出首个跨域音视频欺骗检测基准,评估不同场景下的泛化能力,并设计MM-IDGM算法和Attention-Mixer融合方法提升性能。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11602 2026-06-11 cs.CV 新提交 79%

On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning

面向音视频广义零样本学习的层次化标准化嵌入对齐

Zihan Zhang, Jie Hong, Siyuan Fan, Yanghao Zhou, Pengfei Fang

机构 * Southeast University(东南大学) The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(新一代人工智能技术及其跨学科应用重点实验室(东南大学),教育部) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 提出AHSE方法,通过Z-score标准化和层次化对齐策略(语义、类别、批次三级)解决音视频与文本模态间的分布与结构差异,在三个基准数据集上取得竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11420 2026-06-11 cs.CL cs.SI 新提交 79%

Context-Aware Multimodal Claim Verification in Spoken Dialogues

口语对话中的上下文感知多模态声明验证

Chaewan Chun, Delvin Ce Zhang, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Sheffield(谢菲尔德大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 提出MAD2基准和上下文感知多模态融合方法,验证对话音频中的声明,发现对话结构比虚假信息框架对验证更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13293 2026-06-11 cs.CL 版本更新 79%

Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models

跨模态一致性引导用于自动回归TTS模型中的鲁棒情绪控制

Yizhou Peng, Yukun Ma, Chong Zhang, Yi-Wen Chao, Chongjia Ni, Bin Ma, Eng Siong Chng

机构 * Alibaba-NTU Global e-Sustainability CorpLab(阿里-国立大学全球可持续发展公司实验室) Nanyang Technological University(南洋理工大学) College of Computing and Data Science(计算与数据科学学院) Alibaba(阿里) Alibaba Inc.(阿里公司)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于文本情绪与显式语音情绪不一致程度的动态尺度的跨模态一致性引导分类器免费引导方法(CCG-CFG),通过使用文本情绪替代dropout条件,并采用硬样本挖掘策略蒸馏CCG-CFG引导信号,从而提升TTS模型的情绪对齐能力。在五个情感语料库和两个TTS基准测试中,该方法在CosyVoice2上实现了情绪识别准确率提升12%,主观评分提升10%,优于基线模型HierSpeech++、Qwen3-TTS和原始CosyVoice2,同时保持可懂性、自然度和高质量。

Comments Accepted to Interspeech 2026, short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11875 2026-06-11 cs.CL cs.SD 新提交 57%

I Understand How You Feel: Enhancing Deeper Emotional Support Through Multilingual Emotional Validation in Dialogue System

我理解你的感受:通过对话系统中的多语言情感验证增强深层情感支持

Zi Haur Pang, Yahui Fu, Koji Inoue, Tatsuya Kawahara

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究科)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 提出情感验证在对话系统中的应用,构建多语言语料库M-EDESConv和测试集M-TESC,设计多语言情感感知门控单元MEGUMI进行时机检测,并评估当前LLM在情感验证响应生成中的表现。

Comments This paper has been accepted for presentation at SIGdial Meeting on Discourse and Dialogue 2026 (SIGDIAL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01157 2026-06-11 cs.CL cs.CR cs.SD 版本更新 57%

Where Do Backdoors Live? A Component-Level Analysis of Backdoor Propagation in Speech Language Models

后门藏身何处?语音语言模型中后门传播的组件级分析

Alexandrine Fortier, Thomas Thebaud, Jesús Villalba, Najim Dehak, Patrick Cardinal, Peter West

机构 * University of British Columbia(不列颠哥伦比亚大学) École de technologie supérieure(高等技术学院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文通过后门攻击视角,对语音语言模型进行组件级分析,揭示后门在不同组件中的传播机制,发现后门持久性高度依赖目标组件,且中毒样本与良性样本在共享嵌入中不可直接分离。

Comments Interspeech 2026 (long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11818 2026-06-11 cs.RO 新提交 50%

Human-Guided Co-Manipulation of Carbon Fiber Plies

碳纤维铺层的人机协同操作

Rami Ojanen, James Fant-Male, Roel Pieters

机构 * Automation Technology and Mechanical Engineering, Tampere University(坦佩雷大学自动化技术与机械工程系)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 针对柔性材料自动化处理困难的问题,本文提出结合语音指令、视觉腕部跟踪和力/柔顺控制的多模态方法,实现碳纤维铺层的高效人机协同操作。

Comments Accepted to the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06911 2026-06-11 cs.HC 50%

Physics-driven Sonification for Improving Multisensory Needle Guidance in Percutaneous Epicardial Access

物理驱动声化改善经皮心外膜入路中的多感官针引导

Veronica Ruozzi, Sasan Matinfar, Pasquale Vergara, Alessandro Albanesi, Serena Dell'Aversana, Stefano Carugo, Gianluigi Buccoliero, Nassir Navab, Alberto Redaelli, Emiliano Votta

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 针对透视下跳动心脏的经皮心外膜入路中针尖定位难题,提出基于物理驱动声化的扩展现实多感官导航方法,通过4D CTA动态心脏解剖重建与实时针追踪,结合多层物理膜模型听觉编码,显著提升导航安全性、准确性和降低认知负荷。

Comments This work has been submitted to the IEEE for possible publication

Journal ref in IEEE Access, vol. 14, pp. 80371-80385, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏