arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-24 至 2026-03-24 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 11 篇

2603.21948 2026-03-24 cs.MM 83%

Look, Listen and Segment: Towards Weakly Supervised Audio-visual Semantic Segmentation

注视、倾听与分割:迈向弱监督音频视觉语义分割

Chengzhi Li, Heyan Huang, Ping Jian, Yanghao Zhou

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出弱监督音频视觉语义分割方法,通过分解为注视、倾听和分割三个阶段,结合渐进跨模态对齐模块,实现基于视频级标签的帧级语义分割,实验表明其在弱监督方法中表现优异。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21803 2026-03-24 cs.CV 79%

Timing In stand-up Comedy: Text, Audio, Laughter, Kinesics (TIC-TALK): Pipeline and Database for the Multimodal Study of Comedic Timing

喜剧表演中的时间:文本、音频、笑声、身体语言(TIC-TALK):用于喜剧时间多模态研究的管道和数据库

Yaelle Zribi, Florian Cafiero, Vincent Lépinay, Chahan Vidal-Gorène

机构 * Centre Jean-Mabillon, École nationale des chartes, PSL, Paris, France(中心 Jean-Mabillon,国家档案学院,PSL,巴黎,法国) Laboratoire de Recherche, EPITA, Paris, France(研究实验室,EPITA,巴黎,法国) médialab, Sciences Po, Paris, France(媒体实验室,社会科学高等学院,巴黎,法国)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文介绍TIC-TALK数据库,通过5400多个时间对齐的主题片段,结合BERTopic、Whisper-AT、YOLOv8等技术,研究喜剧表演中的时间动态及观众反应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21013 2026-03-24 cs.AI cs.LG cs.RO 79%

A Framework for Low-Latency, LLM-driven Multimodal Interaction on the Pepper Robot

一种用于Pepper机器人低延迟LLM驱动多模态交互的框架

Erich Studerus, Vivienne Jia Zhong, Stephan Vonschallen

机构 * Institute for Information Systems(信息系统研究所) University of Applied Sciences and Arts Northwestern Switzerland(西北瑞士应用科学与艺术大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一个开源Android框架,通过端到端语音模型和功能调用能力,实现低延迟多模态交互,提升Pepper机器人的人机交互性能。

Comments 4 pages, 2 figures. To appear in Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (HRI '26), Edinburgh, Scotland, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20894 2026-03-24 cs.MM 70%

AcoustEmo: Open-Vocabulary Emotion Reasoning via Utterance-Aware Acoustic Q-Former

AcoustEmo:通过语句感知的声学Q-Former实现开放词汇情绪推理

Liyun Zhang, Xuanmeng Sha, Shuqiong Wu, Fengkai Liu

专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract);分类 cs.MM

AI总结 AcoustEmo通过引入语句感知的声学Q-Former,利用时间同步滑动窗口提取段级音频token,提升复杂情绪推理能力,在EMER任务中优于基线模型。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14922 2026-03-24 cs.AI cs.CL cs.LG eess.AS eess.SP 67%

TRI-DEP: A Trimodal Comparative Study for Depression Detection Using Speech, Text, and EEG

TRI-DEP:一种利用语音、文本和EEG进行抑郁症检测的三模态比较研究

Annisaa Fitri Nurfidausi, Eleonora Mancini, Paolo Torroni

机构 * DISI, University of Bologna, Italy(博洛尼亚大学DISI学院,意大利)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文通过系统比较语音、文本和EEG的三模态方法,验证了多模态检测的有效性,发现预训练嵌入优于手工特征,三模态模型达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20433 2026-03-24 cs.SD cs.AI cs.CL eess.AS 67%

ALICE: A Multifaceted Evaluation Framework of Large Audio-Language Models' In-Context Learning Ability

ALICE:大型音频-语言模型上下文学习能力的多维评估框架

Yen-Ting Piao, Jay Chiehen Liao, Wei-Tang Chien, Toshiki Ogimoto, Shang-Tse Chen, Yun-Nung Chen, Chun-Yi Lee, Shao-Yuan Lo

机构 * National Taiwan University, Taiwan(台湾国立成功大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文提出ALICE框架,通过三阶段评估六个LALMs在音频条件下的上下文学习能力,发现上下文示例虽能提升格式合规性,但难以改善核心任务表现,揭示了跨模态整合的潜在局限。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21571 2026-03-24 cs.CL 57%

DATASHI: A Parallel English-Tashlhiyt Corpus for Orthography Normalization and Low-Resource Language Processing

DATASHI:一个平行的英语-塔希利耶特语语料库用于正字法规范化和低资源语言处理

Nasser-Eddine Monir, Zakaria Baou

机构 * Université de Lorraine, CNRS, Inria, LORIA(洛林大学、法国国家科学研究中心、法国国家信息与自动化技术研究院、LORIA实验室) ISIMA, Université Clermont Auvergne(克莱蒙特奥弗涅大学ISIMA)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 DATASHI提供了一个包含5000对句子的平行语料库,包含1500个经过专家标准化和非标准用户生成的句子,用于研究正字法多样性及规范化,支持NLP任务并为多模态对齐提供基础。

Comments This paper has been accepted for presentation at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21233 2026-03-24 cs.LG cs.AI 57%

AngelSlim: A more accessible, comprehensive, and efficient toolkit for large model compression

AngelSlim:一个更易用、更全面且更高效的大型模型压缩工具包

Rui Cen, QiangQiang Hu, Hong Huang, Hong Liu, Song Liu, Xin Luo, Lin Niu, Yifan Tan, Decheng Wu, Linchuan Xie, Rubing Yang, Guanghua Yu, Jianchen Zhu

机构 * Hunyuan AI Infra Team(文心一言AI基础设施团队)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 AngelSlim 提供统一流程,整合量化、推测解码等算法,实现从模型压缩到工业部署的高效加速,同时提出训练对齐的推测解码框架和训练无关的稀疏注意力框架,提升吞吐量并优化多模态模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05911 2026-03-24 cs.CL 57%

Pantagruel: Unified Self-Supervised Encoders for French Text and Speech

Pantagruel:面向法语文本和语音的统一自监督编码器

Phuong-Hang Le, Valentin Pelloin, Arnault Chatelain, Maryem Bouziane, Mohammed Ghennai, Qianwen Guan, Kirill Milintsevich, Salima Mdhaffar, Aidan Mannion, Nils Defauw, Shuyue Gu, Alexandre Audibert, Marco Dinarelli, Yannick Estève, Lorraine Goeuriot, Steffen Lalande, Nicolas Hervé, Maximin Coavoux, François Portet, Étienne Ollion, Marie Candito, Maxime Peyrard, Solange Rossato, Benjamin Lecouteux, Aurélie Nardy, Gilles Sérasset, Vincent Segonne, Solène Evain, Diandra Fabre, Didier Schwab

机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学,CNRS,格勒诺布尔INP,LIG) INA (Institut National de l'Audiovisuel)(国家视听研究院) Avignon Université, LIA(阿维尼翁大学,LIA) CREST (École Polytechnique, ENSAE, CNRS)(CREST(巴黎政治学院、ENSAE、CNRS)) LLF (Université Paris Cité and CNRS)(LLF(巴黎城市大学和CNRS)) Univ. Grenoble Alpes, EFELIA-MIAI, IUT2 Grenoble, LIG(格勒诺布尔阿尔卑斯大学,EFELIA-MIAI,格勒诺布尔IUT2,LIG) Univ. Grenoble Alpes, Lidilem(格勒诺布尔阿尔卑斯大学,Lidilem) Université Bretagne Sud, CNRS, IRISA(布列塔尼南部大学,CNRS,IRISA) Saclay AI(萨克莱AI) IRIT, Université de Toulouse, CNRS, Toulouse INP, UT3(IRIT,图卢兹大学,CNRS,图卢兹INP,UT3)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 Pantagruel通过在特征空间中学习上下文化的目标表示,提升法语文本和语音的多模态理解能力,在多个下游任务中表现优异,优于现有基线模型。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07077 2026-03-24 cs.SD cs.AI 57%

CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models

CALM:用于大音频-语言模型的类条件稀疏注意力向量

Videet Mehta, Liming Wang, Hilde Kuehne, Rogerio Feris, James R. Glass, M. Jehanzeb Mirza

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Tuebingen AI Center(图宾根人工智能中心) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI

AI总结 本文提出CALM,一种用于小样本分类的类条件稀疏注意力向量方法,通过学习类依赖的重要性权重提升音频和音频视觉分类性能,实验显示在多个基准上优于传统投票方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07010 2026-03-24 cs.LG 50%

Always Keep Your Promises: A Model-Agnostic Attribution Algorithm for Neural Networks

始终信守承诺:一种针对神经网络的模型无关属性算法

Kevin Lee, Duncan Smith-Halverson, Pablo Millan Arias

机构 * David R. Cheriton School of Computer Science, University of Waterloo, ON, Canada(滑铁卢大学戴维·R·切里顿计算机科学学院) Scotiabank AML AI Research, Toronto, ON, Canada(多伦多加拿大Scotiabank反洗钱AI研究)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出DynamicLRP,一种在张量操作层面运行的模型无关LRP框架,通过分解计算图中的属性并引入新的延迟激活解决机制,实现了真正的架构无关性,同时保持了LRP的理论保证,并在多个模型上展示了高准确性与效率。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏