arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-14 至 2026-04-14 共收录 18 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 18 篇

2604.11102 2026-04-14 cs.CV cs.MM 86%

OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video

OmniScript: 向长篇影视视频的音频-视觉脚本生成迈进

Junfu Pu, Yuxin Chen, Teng Wang, Ying Shan

机构 * ARC Lab, Tencent(腾讯ARC实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);omni-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出视频到脚本任务,介绍OmniScript模型,通过渐进式训练在长篇叙事理解中实现高效脚本生成,优于开源模型并接近专有模型。

Comments Project Page: https://arcomniscript.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14170 2026-04-14 cs.CV cs.AI cs.ET 84%

Progressive Multimodal Interaction Network for Reliable Quantification of Fish Feeding Intensity in Aquaculture

渐进多模态交互网络用于水产养殖中鱼摄食强度的可靠量化

Shulong Zhang, Mingyuan Yao, Jiayin Zhao, Daoliang Li, Yingyi Chen, Haihua Wang

机构 * National Innovation Center for Digital Fishery(国家数字渔业创新中心) Key Laboratory of Smart Farming Technologies for Aquatic Animal and Livestock, Ministry of Agriculture and Rural Affairs(农业农村部水产动物与畜禽智慧养殖技术重点实验室) State Key Laboratory of Efficient Utilization of Agricultural Water Resources(农业水资源高效利用全国重点实验室) Beijing Engineering and Technology Research Center for Internet of Things in Agriculture(北京市农业物联网工程技术研究中心) Key Laboratory of Digital Fisheries of Shandong Province(山东省数字渔业重点实验室) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出渐进多模态交互网络PMIN,通过整合图像、音频和水波数据,有效解决多模态数据不一致性和决策冲突问题,提升鱼摄食强度量化可靠性,实验表明其在精度、参数和计算成本上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10632 2026-04-14 cs.SD cs.LG cs.MM eess.AS 81%

Multimodal Dataset Normalization and Perceptual Validation for Music-Taste Correspondences

多模态数据集规范化与感知验证:音乐-味觉对应关系

Matteo Spanio, Valentina Frezzato, Antonio Rodà

机构 * University of Padova(帕多瓦大学)

专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);分类 cs.MM、eess.AS

AI总结 本文通过两项实验验证了合成FMA标注中存在听觉调味效果,展示了跨模态结构在不同监督下的保持以及计算目标与人类感知的显著一致性。

Comments Submitted to SMC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11570 2026-04-14 cs.HC cs.MM 79%

From Multimodal Signals to Adaptive XR Experiences for De-escalation Training

从多模态信号到自适应XR体验的降级训练

Birgit Nierula, Karam Tomotaki-Dawoud, Daniel Johannes Meyer, Iryna Ignatieva, Mina Mottahedin, Thomas Koch, Sebastian Bosse

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出了一种多模态实时通信分析系统,用于自适应VR训练的基础交互层,整合了语音、手势、情感分析、脑电波和生理信号,通过同步技术实现用户意识和无意识沟通线索的连续评估,结合社会符号学和象征互动理论,构建了连接低层信号到冲突缓解的解释层。

Comments 16 pages, 5 figures, ACM Intelligent User Interfaces (IUI) Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08701 2026-04-14 cs.CV cs.LG 79%

Unified Multimodal Uncertain Inference

多模态不确定推断的统一框架

Dengjia Zhang, Alexander Martin, William Jurayj, Kenton Murray, Benjamin Van Durme, Reno Kriz

机构 * Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(人类语言技术卓越中心)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出UMUI框架,通过多模态数据生成校准的概率估计,引入CLUE模型实现跨模态细粒度概率推理,实验表明其在多种模态上表现优于基线模型。

Comments Update citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10283 2026-04-14 cs.SD cs.LG 78%

Descriptor-Injected Cross-Modal Learning: A Systematic Exploration of Audio-MIDI Alignment via Spectral and Melodic Features

描述符注入的跨模态学习:通过频谱和旋律特征系统探索音频- MIDI对齐

Mariano Fernández Méndez

机构 * Asociación Civil AlterMundi(AlterMundi民间协会)

专题命中 音频语音多模态 :cross-modal(title,abstract)

AI总结 本文研究了通过频谱和旋律特征提升音频与MIDI之间跨模态检索性能的方法,通过描述符注入技术提高了模型表现,揭示了音频与MIDI特征对齐的机制。

Comments 26 pages, 11 figures, 20 tables. Companion paper to "Harmonic Information Theory: Foundations" (2026). Code: https://github.com/AlterMundi/Phideus

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10181 2026-04-14 cs.SD 78%

Learning to Attend to Depression-Related Patterns: An Adaptive Cross-Modal Gating Network for Depression Detection

学习关注抑郁症相关模式:一种自适应跨模态门控网络用于抑郁症检测

Hangbin Yu, Yudong Yang, Rongfeng Su, Nan Yan, Lan Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences(中国科学院生物医学成像科学与系统重点实验室)

专题命中 音频语音多模态 :cross-modal(title,abstract)

AI总结 本文提出自适应跨模态门控网络,通过动态分配帧权重来关注抑郁症相关段落,提升语音信号中抑郁症检测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11154 2026-04-14 cs.AI 70%

Environmental Footprint of GenAI Research: Insights from the Moshi Foundation Model

生成式AI研究的环境足迹:来自Moshi基金会模型的洞察

Marta López-Rauhut, Loic Landrieu, Mathieu Aubry, Anne-Laure Ligozat

机构 * LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris(LIGM, CNRS, 古斯塔夫·埃菲尔大学, ENPC, 巴黎综合理工学院) Université Paris-Saclay, CNRS, LISN(巴黎-萨克雷大学, CNRS, LISN) Université Paris-Saclay, CNRS, ENSIIE, LISN(巴黎-萨克雷大学, CNRS, ENSIIE, LISN) Kyutai

专题命中 音频语音多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文通过细粒度分析Moshi模型的计算消耗,首次量化了生成式多模态大语言模型(MLLM)研究的环境影响,揭示了计算密集型研究的能耗与环境成本,为可持续AI研究提供指导。

Comments 28 pages, 12 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11096 2026-04-14 cs.CL cs.AI cs.SD 62%

Efficient Training for Cross-lingual Speech Language Models

多语言语音语言模型的高效训练

Yan Zhou, Qingkai Fang, Yun Hong, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(中国科学院计算技术研究所智能信息处理重点实验室) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CSLM,通过离散语音标记实现多语言语音大模型的高效训练,采用持续预训练策略提升模态对齐质量,减少延迟,展现良好的语言扩展能力。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12221 2026-04-14 cs.CV 57%

A Two-Stage Dual-Modality Model for Facial Emotional Expression Recognition

一种两阶段双模态模型用于面部情绪表达识别

Jiajun Sun, Zhe Gao

机构 * Shanghai Normal University(上海师范大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 本文提出一种两阶段双模态模型,通过预训练DINOv2编码器提取鲁棒视觉特征,并结合Wav2Vec 2.0音频特征进行融合,提升面部情绪识别性能。

Comments Camera-ready version. 14 pages, 5 figures in total: 8 pages main text with 4 figures, 3 pages references, and 3 pages appendix with 1 figure. Accepted at the 10th ABAW Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09270 2026-04-14 cs.CL 57%

MCGA: A Multi-task Classical Chinese Literary Genre Audio Corpus

MCGA:多任务古典中文文学体裁音频语料库

Yexing Du, Kaiyuan Liu, Bihe Zhang, Youcheng Pan, Bo Yang, Liangyu Huo, Xiyuan Zhang, Jian Xie, Daojing He, Yang Xiang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) South China University of Technology(华南理工大学) Du xiaoman(杜小满)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出MCGA语料库,包含22000个音频样本,涵盖六个任务:ASR、S2TT、SEC、SQA、SU和SR,评估十种MLLM发现其在MCGA测试集上仍面临显著挑战,并引入领域特定的SEC指标和语音与文本一致性度量。

Comments Accepted in ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01512 2026-04-14 cs.CL 57%

MCAT: Scaling Many-to-Many Speech-to-Text Translation with MLLMs to 70 Languages

MCAT: 通过MLLMs扩展多对多语音到文本翻译至70种语言

Yexing Du, Kaiyuan Liu, Youcheng Pan, Bo Yang, Keqi Deng, Xie Chen, Yang Xiang, Ming Liu, Bing Qin, YaoWei Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Harbin Institute of Technology, Harbin(哈尔滨工业大学(哈尔滨)) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 MCAT框架通过课程学习和数据平衡策略扩展MLLMs支持70种语言并实现互译,同时优化语音适配模块将语音序列长度缩减至30个token,提升翻译效率。

Comments Accepted in IEEE TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14493 2026-04-14 cs.CL cs.CR 57%

LingoLoop Attack: Trapping MLLMs via Linguistic Context and State Entrapment into Endless Loops

LingoLoop攻击:通过语言上下文和状态陷阱使大语言模型陷入无限循环

Jiyuan Fu, Kaixun Jiang, Lingyi Hong, Jinglun Li, Haijing Guo, Dingkang Yang, Zhaoyu Chen, Wenqiang Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Jiiov Technology(极奥科技)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出LingoLoop攻击,通过调整词性标注和隐藏状态限制,使多模态大语言模型生成冗长重复内容,导致资源耗尽和服务降级。

Comments Accepted to ICLR 2026. Code is available at: https://github.com/fuhaha824/LingoLoop-Attack

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10542 2026-04-14 cs.SD cs.AI 57%

VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories

VidAudio-Bench:跨四个音频类别的V2A和VT2A生成基准测试

Qian Zhang, Yuqin Cao, Yixuan Gao, Xiongkuo Min

机构 * Shanghai Jiaotong University(上海交通大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出VidAudio-Bench,通过四个音频类别评估V2A和VT2A生成,包含1634个视频文本对和11种先进模型,引入13种参考自由指标,揭示当前模型在语音和歌唱生成上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09881 2026-04-14 eess.AS cs.HC 57%

Toward using Speech to Sense Student Emotion in Remote Learning Environments

迈向利用语音感知远程学习环境中学生情绪的研究

Sargam Vyas, Bogdan Vlasenko, André Mayoraz, Egon Werlen, Per Bergamin, Mathew Magimai. -Doss

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文通过构建基于语音的自我控制任务数据集,研究语音在远程学习中感知学生情绪的可行性,探讨语音在情感维度上的变化及自动预测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00793 2026-04-14 cs.HC cs.CL cs.ET cs.IR 57%

SpeechLess: Micro-utterance with Personalized Spatial Memory-aware Assistant in Everyday Augmented Reality

SpeechLess:日常增强现实中的个性化空间记忆-aware助理的微 utterance

Yoonsang Kim, Devshree Jadeja, Divyansh Pradhan, Yalong Yang, Arie Kaufman

机构 * Stony Brook University(石溪大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 SpeechLess通过个性化空间记忆实现语音意图粒度控制,减少公共场合说话的不适,提升日常信息获取效率。

Comments 11 pages, 9 figures. This is the author's version of the article that appeared at the IEEE Conference on Virtual Reality and 3D User Interfaces (IEEE VR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09282 2026-04-14 cs.SD cs.CL 57%

End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering

端到端对比语言-语音预训练模型用于长形式语音问答

Jiliang Hu, Zuchao Li, Baoyuan Qi, Liu Guoming, Ping Wang

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出CLSR模型,通过将音频特征转换为文本表示,提升长音频问答任务的性能,实验表明其优于现有方法。

Comments 12 pages, 7 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10413 2026-04-14 cs.SD 50%

Sign-to-Speech Prosody Transfer via Sign Reconstruction-based GAN

通过手语重建的生成对抗网络实现手语到语音语调转换

Toranosuke Manabe, Yuto Shibata, Shinnosuke Takamichi, Yoshimitsu Aoki

机构 * Keio University(庆应义塾大学)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文提出手语到语音语调转换任务,通过SignRecGAN和S2PFormer模型,在无需跨模态标注的情况下实现手语语调信息的直接整合,提升语音合成的情感表达。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏