arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-17 至 2026-03-17 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 12 篇

2603.14992 2026-03-17 cs.AI cs.MM 84%

Exposing Cross-Modal Consistency for Fake News Detection in Short-Form Videos

揭示短视频中跨模态一致性以检测虚假新闻

Chong Tian, Yu Wang, Chenxu Yang, Junyi Guan, Zheng Lin, Yuhan Liu, Xiuying Chen, Qirong Ho

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽亚德人工智能大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出MAGIC3模型,通过多粒度跨模态一致性建模提升虚假新闻检测性能,实现高准确率与低成本的平衡。

Comments 16 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13340 2026-03-17 cs.CV 83%

Complementarity-Supervised Spectral-Band Routing for Multimodal Emotion Recognition

互补监督的频带路由用于多模态情感识别

Zhexian Huang, Bo Zhao, Hui Ma, Zhishu Liu, Jie Zhang, Ruixin Zhang, Shouhong Ding, Zitong Yu

机构 * Great Bay University(大湾大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Tencent Youtu Lab(腾讯优图实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出互补监督多频带专家网络Atsuko,通过多尺度频带分解和专家协作,解决多模态情感识别中模态间互补性不足和粗粒融合的问题,提升情感任务的细粒表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13760 2026-03-17 cs.AI cs.SD 79%

Multimodal Emotion Regression with Multi-Objective Optimization and VAD-Aware Audio Modeling for the 10th ABAW EMI Track

多模态情感回归:基于多目标优化和VAD感知音频建模的第10届ABAW EMI任务

Jiawen Huang, Chenxi Huang, Zhuofan Wen, Hailiang Yao, Shun Chen, Longjiang Yang, Cong Yu, Fengyu Zhang, Ran Liu, Bin Liu

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出多目标优化和VAD感知音频建模方法,用于改进Hume-Vidmimic2数据集上的情感模仿强度估计任务,通过多模态融合和共享回归头提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14662 2026-03-17 cs.HC 78%

ViDscribe: Multimodal AI for Customizing Audio Description and Question Answering in Online Videos

ViDscribe:多模态AI用于定制在线视频的音频描述和问答

Maryam Cheema, Sina Elahimanesh, Pooyan Fazli, Hasti Seifi

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 ViDscribe通过整合AI生成的音频描述和六种用户自定义选项,提升视障和低视力用户在YouTube视频中的交互体验,研究显示定制化描述提高了效果和沉浸感。

Comments CHI EA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14636 2026-03-17 cs.SD cs.AI cs.CL eess.AS 67%

Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models

引导隐藏状态:用于大音频-语言模型链式推理的无训练模型引导

Lok-Lam Ieong, Chia-Chien Chen, Chih-Kai Yang, Yu-Han Huang, An-Yu Cheng, Hung-yi Lee

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 研究通过无训练的模型引导方法提升大音频-语言模型的推理能力,采用多种信息源策略在四个模型和四个基准上进行评估,结果显示推理准确率提升达4.4%,并发现跨模态迁移效应。

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16917 2026-03-17 cs.SD cs.AI cs.CL eess.AS 67%

SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models

SAKE:迈向大型音频-语言模型的听觉属性知识编辑

Chih-Kai Yang, Yen-Ting Piao, Tzu-Wen Hsu, Szu-Wei Fu, Zhehuai Chen, Ke-Han Lu, Sung-Feng Huang, Chao-Han Huck Yang, Yu-Chiang Frank Wang, Yun-Nung Chen, Hung-yi Lee

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文提出SAKE基准,用于评估大型音频-语言模型中听觉属性知识的编辑方法,发现多数方法在可靠性上表现良好,但在听觉泛化和多模态知识传播方面存在不足,细调模态连接器比直接编辑LLM更稳健。

Comments Work in progress. Resources: https://github.com/ckyang1124/SAKE

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07323 2026-03-17 cs.SD cs.AI eess.AS 62%

Speech Recognition on TV Series with Video-guided Post-ASR Correction

电视剧中基于视频引导的后ASR校正

Haoyuan Yang, Yue Zhang, Liqiang Jing, John H. L. Hansen

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出视频引导后ASR校正框架,利用视频大模态模型捕捉视频上下文以提升ASR在电视剧等复杂环境中的转录准确性。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13824 2026-03-17 cs.SD cs.AI 57%

Evaluating Semantic Fragility in Text-to-Audio Generation Systems Under Controlled Prompt Perturbations

在受控提示扰动下评估文本到音频生成系统中的语义脆弱性

Jiahui Wu

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文评估文本到音频生成系统在受控提示扰动下的语义脆弱性,通过三种扰动方法测试不同模型的鲁棒性,发现大模型在语义一致性上表现更好,但音频和时间分析显示存在持续差异。

Comments 8 pages, 4 figures, Under ICCC'26 review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13262 2026-03-17 cs.SD cs.AI 57%

Evaluation of Audio Language Models for Fairness, Safety, and Security

音频语言模型的公平性、安全性和安全性评估

Ranya Aloufi, Srishti Gupta, Soumya Shaw, Battista Biggio, Lea Schönherr

机构 * Computer Science, Taibah University, Saudi Arabia(塔布大学计算机科学系,沙特阿拉伯) La Sapienza, University of Rome, Rome, Italy(罗马大学拉·萨皮恩扎分校,意大利) CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(信息安全赫尔姆霍茨研究中心,德国萨尔布吕肯) University of Cagliari, Cagliari, Italy(卡利亚里大学,意大利卡利亚里)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种结构化分类方法,评估音频语言模型在公平性、安全性和安全性方面的表现,揭示音频信息整合对语义推理的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15668 2026-03-17 cs.SD 50%

EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

EmotionThinker: 基于语调感知的强化学习用于可解释的语音情绪推理

Dingdong Wang, Shujie Liu, Tianhua Zhang, Youjun Chen, Jinyu Li, Helen Meng

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出EmotionThinker,通过强化学习将语音情绪识别转化为深度推理问题,利用细粒度声学线索生成可解释的情绪预测,改进了语音大语言模型的语调感知能力。

Comments ICLR 2026 (Oral). Project page: https://github.com/dingdongwang/EmotionThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15206 2026-03-17 cs.LG 50%

Chorus: Harmonizing Context and Sensing Signals for Data-Free Model Customization in IoT

Chorus:谐音上下文和传感信号以实现物联网中的无数据模型定制

Liyu Zhang, Yejia Liu, Kwun Ho Liu, Runxi Huang, Xiaomin Ouyang

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 Chorus通过学习上下文表示,在无需目标域数据的情况下,实现对未知部署条件的模型自适应,实验显示其在多种传感任务中性能优于现有方法,且推理延迟接近传感器部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13313 2026-03-17 cs.RO 50%

MRPoS: Mixed Reality-Based Robot Navigation Interface Using Spatial Pointing and Speech with Large Language Model

基于混合现实的机器人导航接口:结合空间指针与语音及大语言模型

Eduardo Iglesius, Masato Kobayashi, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Kobe University(Kobe大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出MRPoS接口,利用空间指针和语音交互替代传统手势,提升机器人导航的直观性和效率,实验表明任务完成时间与工作负荷显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏