arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-13 至 2026-03-13 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2603.11095 2026-03-13 cs.MM cs.SD eess.SP 89%

Multimodal Self-Attention Network with Temporal Alignment for Audio-Visual Emotion Recognition

多模态自注意力网络与时间对齐用于音频-视觉情感识别

Inyong Koo, yeeun Seong, Minseok Son, Jaehyuk Jang, Changick Kim

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出基于Transformer的多模态自注意力网络,通过时间对齐旋转位置嵌入和跨时间匹配损失,解决音频-视觉情感识别中的跨模态帧率不匹配问题,提升时间线索保留和跨模态融合效果。

Comments 5 pages, 3 figures, accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11468 2026-03-13 cs.MM cs.AI cs.SD 79%

Stage-Adaptive Reliability Modeling for Continuous Valence-Arousal Estimation

面向连续情感估值的阶段自适应可靠性建模

Yubeen Lee, Sangeun Lee, Junyeop Cha, Eunil Park

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.AI、cs.MM

AI总结 本文提出SAGE框架,通过阶段自适应可靠性建模提升多模态环境下连续情感估值的稳定性与准确性。

Comments 8 pages, 3 figures, 2 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12149 2026-03-13 cs.CV cs.CL 62%

Linking Perception, Confidence and Accuracy in MLLMs

将感知、信心与准确性联系起来在多模态大语言模型中

Yuetian Du, Yucheng Wang, Rongyu Zhang, Zhijie Xu, Boyu Yang, Ming Kong, Jie Liu, Qiang Zhu

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出信心驱动强化学习和信心感知测试时扩展,通过校准模型信心提升感知灵敏度和测试效果,实现多模态大语言模型的性能提升。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20900 2026-03-13 cs.SD cs.CL cs.LG eess.AS 62%

Text-only adaptation in LLM-based ASR through text denoising

基于文本去噪的LLM语音识别领域适应

Andrés Carofilis, Sergio Burdisso, Esaú Villatoro-Tello, Shashi Kumar, Kadri Hacioglu, Srikanth Madikeri, Pradeep Rangappa, Manjunath K E, Petr Motlicek, Shankar Venkatesan, Andreas Stolcke

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出通过文本去噪方法实现LLM语音识别领域适应,有效保持跨模态对齐并提升性能,实测在两个数据集上达到22.1%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11303 2026-03-13 cs.HC 50%

Bridging the Cognitive Gap: Co-Designing and Evaluating a Voice-Enabled Community Chatbot for Older Adults

弥合认知鸿沟:为老年人设计和评估一个语音启用的社区聊天机器人

Feng Chen, Luna Xingyu Li, Ray-Yuan Chung, Wenyu Zeng, Yein Jeon, Yizhou Hu, Oleg Zaslavsky

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出了一种语音启用的社区聊天机器人,通过共设计和教育工作坊,提升老年人对AI的认知和透明度,同时探索零触控导航对年龄包容性AI的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏