arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4562 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4562 篇

2603.25120 2026-05-20 cs.DC 78%

DFLOP: A Data-driven Framework for Multimodal LLM Training Pipeline Optimization

DFLOP: 一种基于数据的多模态大语言模型训练流水线优化框架

Hyeonjun An, Sihyun Kim, Chaerim Lim, Hyunjoon Kim, Rathijit Sen, Sangmin Jung, Hyeonsoo Lee, Dongwook Kim, Takki Yu, Jinkyu Jeong, Youngsok Kim, Kwanghyun Park

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文提出DFLOP框架,通过数据驱动的方法优化多模态大语言模型的训练流水线,提升GPU利用率和训练效率,实验证明其比现有框架快3.6倍。

Comments Accepted to Proceedings of the ACM on Management of Data (SIGMOD 2026)

Journal ref Proc. ACM Manag. Data 4, 3, Article 160 (June 2026), 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16492 2026-05-19 cs.HC cs.RO 78%

FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech

FAM-HRI: 基于基础模型的多模态人机交互框架,结合目光和语音

Yuzhi Lai, Shenghai Yuan, Peizheng Li, Boya Zhang, Benjamin Kiefer, Tianchen Deng, Andreas Zell

机构 * University of Tuebingen(图宾根大学) Nanyang Technological University(南洋理工大学) Mercedes-Benz(梅赛德斯-奔驰)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract)

AI总结 本文提出FAM-HRI,一种结合目光和语音的多模态人机交互框架,利用基础模型融合语言和目光输入,以提高任务执行的成功率和交互效率,为肢体障碍者提供实用解决方案。

Comments This work has been accepted for publication in IEEE Transactions on Automation Science and Engineering @ 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11700 2026-05-13 cs.HC 78%

MindMirror: A Local-First Multimodal State-Aware Support System for Digital Workers

MindMirror: 一种面向数字工作者的本地优先多模态状态感知支持系统

Wenqi Luo, Changbo Wang, Yan Wang

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 MindMirror通过整合面部表情、文本输入和语音交互等多模态数据,为数字工作者提供本地优先的状态感知支持,通过本地大语言模型生成响应,提升工作效率与状态监控能力。

Comments 10 pages, 4 figures, 12 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27517 2026-05-01 cs.HC 78%

I'm Fine, But My Voice Isn't: Cross-Modal Affective Dissonance Detection for Reflective Journaling

我很好,但我的声音不是:面向反思日记的跨模态情感不一致检测

Sumin Lee

专题命中 音频语音多模态 :cross-modal(title,abstract)

AI总结 本文提出跨模态情感不一致检测(CADD),通过区分掩蔽、应对和一致三种状态,解决数字日记中情感与语音不匹配的问题,并提出CADD-Journal数据集、DACM模型及领域差距量化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13380 2026-04-16 cs.HC 78%

Does the TalkMoves Codebook Generalize to One-on-One Tutoring and Multimodal Interaction?

对话移动代码本是否能推广到一对一辅导和多模态交互?

Corina Luca Focsan, Marie Cynthia Abijuru Kamikazi, Tamisha Thompson, Jennifer St. John, Kirk Vanacore, Danielle R. Thomas, Kenneth R. Koedinger, René F. Kizilcec

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 研究探讨TalkMoves代码本在一对一辅导中的一致性、实用性及可解释性,对比AI-人类混合代码本,发现前者在可靠性上更优,但后者在多模态覆盖和可用性上更胜一筹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10283 2026-04-14 cs.SD cs.LG 78%

Descriptor-Injected Cross-Modal Learning: A Systematic Exploration of Audio-MIDI Alignment via Spectral and Melodic Features

描述符注入的跨模态学习:通过频谱和旋律特征系统探索音频- MIDI对齐

Mariano Fernández Méndez

机构 * Asociación Civil AlterMundi(AlterMundi民间协会)

专题命中 音频语音多模态 :cross-modal(title,abstract)

AI总结 本文研究了通过频谱和旋律特征提升音频与MIDI之间跨模态检索性能的方法,通过描述符注入技术提高了模型表现,揭示了音频与MIDI特征对齐的机制。

Comments 26 pages, 11 figures, 20 tables. Companion paper to "Harmonic Information Theory: Foundations" (2026). Code: https://github.com/AlterMundi/Phideus

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10181 2026-04-14 cs.SD 78%

Learning to Attend to Depression-Related Patterns: An Adaptive Cross-Modal Gating Network for Depression Detection

学习关注抑郁症相关模式:一种自适应跨模态门控网络用于抑郁症检测

Hangbin Yu, Yudong Yang, Rongfeng Su, Nan Yan, Lan Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences(中国科学院生物医学成像科学与系统重点实验室)

专题命中 音频语音多模态 :cross-modal(title,abstract)

AI总结 本文提出自适应跨模态门控网络,通过动态分配帧权重来关注抑郁症相关段落,提升语音信号中抑郁症检测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12817 2026-04-10 eess.SP cs.SD 78%

An Attention-Assisted Multi-Modal Data Fusion Model for Real-Time Estimation of Underwater Sound Velocity

一种结合注意力机制的多模态数据融合模型用于实时估计水下声速

Pengfei Wu, Wei Huang, Yujie Shi, Hao Zhang

机构 * Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学部) School of Environmental Science and Engineering, Ocean University of China(中国海洋大学环境科学与工程学院)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract)

AI总结 本文提出一种结合注意力机制的多模态数据融合卷积神经网络,用于实时估计水下声速剖面,通过提取远程感应海面温度数据与历史声速剖面特征之间的关系,提升估计精度和鲁棒性。

Journal ref IEEE Transactions on Neural Networks and Learning Systems,2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00968 2026-04-02 cs.HC 78%

FlexAI: A Multi-modal Solution for Delivering Personalized and Adaptive Fitness Interventions

FlexAI: 一种多模态解决方案,用于提供个性化和自适应的健身干预

Shivangi Agarwal, Zoya Ghoshal, Bharat Jain, Siddharth Siddharth

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 FlexAI通过整合计算机视觉、生理传感器和大语言模型,提供实时个性化健身指导,显著提升用户参与度和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23418 2026-04-02 cs.CR 78%

Beyond Metadata: Multimodal, Policy-Aware Detection of YouTube Scam Videos

超越元数据:多模态、政策感知的YouTube诈骗视频检测

Ummay Kulsum, Aafaq Sabir, Abhinaya S. B., Anupam Das

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文提出多模态、政策感知的YouTube诈骗视频检测方法,通过结合文本、音频和视频信息,提升检测性能和鲁棒性,同时提供可解释的政策依据。

Comments Accepted at AAAI ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06686 2026-04-01 cs.LG 78%

Balancing Multi-modal Sensor Learning via Multi-objective Optimization

通过多目标优化平衡多模态传感器学习

Heshan Fernando, Quan Xiao, Parikshit Ram, Yi Zhou, Horst Samulowitz, Nathalie Baracaldo, Tianyi Chen

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM Research(IBM研究院) Cornell University(康奈尔大学)

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 本文提出MIMO方法,通过多目标优化平衡多模态传感器学习,提升系统可靠性并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14662 2026-03-17 cs.HC 78%

ViDscribe: Multimodal AI for Customizing Audio Description and Question Answering in Online Videos

ViDscribe:多模态AI用于定制在线视频的音频描述和问答

Maryam Cheema, Sina Elahimanesh, Pooyan Fazli, Hasti Seifi

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 ViDscribe通过整合AI生成的音频描述和六种用户自定义选项,提升视障和低视力用户在YouTube视频中的交互体验,研究显示定制化描述提高了效果和沉浸感。

Comments CHI EA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11536 2026-03-04 physics.flu-dyn 78%

Multimodal nonlinear acoustics in two- and three-dimensional curved ducts

二维和三维弯曲管道中的多模非线性声学

Freddie Jensen, Edward James Brambley

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract)

AI总结 本文提出了一种用于二维和三维弯曲管道中弱非线性声学的模型,通过多模方法和张量卷积提高了数值效率,并展示了多种声学特性及应用潜力。

Comments 55 pages, 17 figures, supplementary material available from https://ejbrambley.warwick.ac.uk/publications.html

Journal ref J. Fluid Mech. 1030 (2026) A19

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22286 2026-03-03 cs.LG cs.IT math.IT 78%

OmniZip: Learning a Unified and Lightweight Lossless Compressor for Multi-Modal Data

OmniZip: 一种用于多模态数据的统一且轻量级无损压缩器

Yan Zhao, Zhengxue Cheng, Junxuan Zhang, Dajiang Zhou, Qunshan Gu, Qi Wang, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 OmniZip是一种用于多模态数据的统一且轻量级无损压缩器,通过三种关键组件实现高效压缩,并在多个数据集上实现了更高的压缩效率。

Comments 8 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09658 2026-03-02 cs.HC 78%

Co-Designing Multimodal Systems for Accessible Asynchronous Dance Instruction

为无障碍异步舞蹈教学设计多模态系统

Ujjaini Das, Shreya Kappala, Meng Chen, Mina Huh, Amy Pavel

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文通过协同设计研讨会,探讨了如何通过多模态系统为盲人和低视力学习者提供无障碍异步舞蹈教学。

Comments Accepted to CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19243 2026-02-24 cs.HC 78%

As Content and Layout Co-Evolve: TangibleSite for Scaffolding Blind People's Webpage Design through Multimodal Interaction

内容与布局共进化:通过多模态交互的TangibleSite用于辅助视障人士网页设计

Jiasheng Li, Zining Zhang, Zeyu Yan, Matthew Wong, Arnav Mittal, Ge Gao, Huaishu Peng

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 TangibleSite通过多模态交互帮助视障人士共同进化内容与布局,实现独立网页设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12597 2026-02-16 cs.RO cs.HC 78%

PISHYAR: A Socially Intelligent Smart Cane for Indoor Social Navigation and Multimodal Human-Robot Interaction for Visually Impaired People

PISHYAR:一种具有社会智能的智能拐杖,用于室内社交导航和多模态人机交互,以支持视障人士

Mahdi Haghighat Joo, Maryam Karimi Jafari, Alireza Taheri

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 PISHYAR是一款结合社会智能导航与多模态交互的智能拐杖,通过多模态技术提升视障人士的移动辅助与社交互动能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11025 2026-02-12 cs.HC 78%

Reality Copilot: Voice-First Human-AI Collaboration in Mixed Reality Using Large Multimodal Models

Reality Copilot:基于大多模态模型的混合现实中的语音优先人机协作

Liuchuan Yu, Yongqi Zhang, Lap-Fai Yu

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 Reality Copilot通过大模型实现混合现实中的语音优先人机协作,支持环境理解、3D生成和实时检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18268 2026-02-10 cs.LG 78%

Reducing Aleatoric and Epistemic Uncertainty through Multi-modal Data Acquisition

通过多模态数据采集减少偶然性和epistemic不确定性

Arthur Hoarau, Benjamin Quost, Sébastien Destercke, Willem Waegeman

机构 * Université de Lorraine, CentraleSupélec CNRS, LORIA, Metz, France(洛林大学、中央超导电子学学院 CNRS、LORIA、法国梅茨) Université de technologie de Compiègne UMR CNRS 7253 Heudiasyc, France(图卢兹理工学院 UMR CNRS 7253 Heudiasyc、法国) CNRS, Université de technologie de Compiègne UMR CNRS 7253 Heudiasyc, France(CNRS、图卢兹理工学院 UMR CNRS 7253 Heudiasyc、法国) University of Ghent Ghent, Belgium(根特大学、比利时根特)

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 本文提出一种多模态数据采集框架,通过增加模态数量和收集更多观测来减少偶然性和epistemic不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19611 2026-02-10 cs.HC 78%

Scene2Hap: Generating Scene-Wide Haptics for VR from Scene Context with Multimodal LLMs

Scene2Hap: 从场景上下文生成VR场景中的全域触觉反馈

Arata Jingu, Easa AliAbbasi, Sara Safaee, Paul Strohmeier, Jürgen Steimle

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 Scene2Hap通过多模态大语言模型生成VR场景中的触觉反馈,提升沉浸感与真实感。

Comments Accepted at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17638 2026-01-27 cs.CR 78%

FOCA: Multimodal Malware Classification via Hyperbolic Cross-Attention

FOCA:基于双模态的恶意软件分类方法

Nitin Choudhury, Bikrant Bikram Pratap Maurya, Orchid Chetia Phukan, Arun Balaji Buduru

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 FOCA通过双曲空间中的交叉注意力机制和双曲投影模块,实现音频和视觉模态的恶意软件分类,展现出优越的分类性能。

Comments Accepted to the International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14227 2026-01-21 cs.SD 78%

Transformer Architectures for Respiratory Sound Analysis and Multimodal Diagnosis

用于呼吸声分析和多模态诊断的Transformer架构

Theodore Aptekarev, Vladimir Sokolovsky, Gregory Furman

机构 * Ben Gurion University of the Negev(本· Gurion 农业大学)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文提出基于Transformer的AST和VLM模型,用于呼吸声分析和多模态诊断,AST在哮喘检测中达到97%准确率,VLM整合临床信息提升诊断能力。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01166 2026-01-19 cs.SD 78%

Hearing More with Less: Multi-Modal Retrieval-and-Selection Augmented Conversational LLM-Based ASR

听更清晰,用更少:多模态检索与选择增强的对话式LLM基于ASR

Bingshen Mu, Hexin Liu, Hongfei Xue, Kun Wei, Lei Xie

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 本文提出MARS方法,通过多模态检索与选择提升对话式LLM-ASR的准确性,仅用1.5K小时数据即可超越训练于179K小时数据的顶级系统。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07808 2026-01-15 cs.RO 78%

AcoustoBots: A swarm of robots for acoustophoretic multimodal interactions

AcoustoBots:用于声学电势多模交互的机器人群

Narsimlu Kemsaram, James Hardwick, Jincheng Wang, Bonot Gautam, Ceylan Besevli, Giorgos Christopoulos, Sourabh Dogra, Lei Gao, Akin Delibasi, Diego Martinez Plasencia, Orestis Georgiou, Marianna Obrist, Ryuji Hirayama, Sriram Subramanian

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 AcoustoBots通过可移动相位阵列和BeadDispenserBot实现声学电势多模交互,提升机器人群的灵活性和交互能力。

Journal ref Frontiers in Robotics and AI, 12:1537101, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07741 2025-12-19 cs.LG cs.SD 78%

A multimodal Bayesian Network for symptom-level depression and anxiety prediction from voice and speech data

一种多模态贝叶斯网络用于从语音和语音数据中预测症状层面的抑郁和焦虑

Agnes Norbury, George Fairs, Alexandra L. Georgescu, Matthew M. Nour, Emilia Molimpakis, Stefano Goria

机构 * thymia Limited(thymia有限公司) Institute of Psychiatry, Psychology & Neuroscience, King’s College London(心理学与神经科学研究院,伦敦国王学院) Department of Psychiatry, University of Oxford(牛津大学精神病学系) Max Planck UCL Centre for Computational Psychiatry and Ageing, University College London(Max Planck大学学院计算精神病学与衰老中心,伦敦大学学院)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文提出了一种多模态贝叶斯网络模型,用于从语音和语音数据中预测抑郁和焦虑症状,通过评估模型性能和公平性,展示了其在临床应用中的潜力。

Journal ref Scientific Reports (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21429 2025-12-12 cs.LG 78%

Deception Detection in Dyadic Exchanges Using Multimodal Machine Learning: A Study on a Swedish Cohort

利用多模态机器学习检测双人交流中的欺骗:一项针对瑞典群体的研究

Thomas Jack Samuels, Franco Rugolon, Stephan Hau, Lennart Högman

机构 * Department of Psychology(心理学系) Department of Computer and Systems Sciences(计算机与系统科学系) Stockholm University(斯德哥尔摩大学)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本研究利用多模态机器学习分析双人互动中的欺骗检测,发现结合语音和面部信息及双方数据可提高检测准确率至71%。

Comments 40 pages, 2 figures, 2 tables. To be submitted in Behavior Research Methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09504 2025-12-11 cs.SD 78%

DMP-TTS: Disentangled multi-modal Prompting for Controllable Text-to-Speech with Chained Guidance

DMP-TTS: 解耦多模态提示的可控文本到语音系统 with 链式引导

Kang Yin, Chunyu Qiang, Sirui Zhao, Xiaopeng Wang, Yuzhe Liang, Pengfei Cai, Tong Xu, Chen Zhang, Enhong Chen

机构 * University of Science and Technology of China(科学技术大学)

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 DMP-TTS通过解耦多模态提示和链式引导技术,实现了更强的文本到语音风格可控性,同时保持良好的可懂度和自然度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04275 2025-12-01 cs.DC 78%

DistTrain: Addressing Model and Data Heterogeneity with Disaggregated Training for Multimodal Large Language Models

DistTrain: 通过解耦训练解决多模态大语言模型中的模型与数据异质性

Zili Zhang, Yinmin Zhong, Yimin Jiang, Hanpeng Hu, Jianjian Sun, Zheng Ge, Yibo Zhu, Daxin Jiang, Xin Jin

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 DistTrain通过解耦模型编排和数据预处理,提升多模态大语言模型的训练效率和资源利用率。

Comments SIGCOMM 2025 (https://dl.acm.org/doi/10.1145/3718958.3750472)

Journal ref SIGCOMM'25: Proceedings of the ACM SIGCOMM 2025 Conference Pages 24-38

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16225 2025-11-21 cs.LG 78%

Real-Time Inference for Distributed Multimodal Systems under Communication Delay Uncertainty

在通信延迟不确定性下的分布式多模态系统实时推理

Victor Croisfelt, João Henrique Inacio de Souza, Shashi Raj Pandey, Beatriz Soret, Petar Popovski

机构 * SNS JU project 6G-GOALS under the EU’s Horizon Europe program(欧盟地平线欧洲计划下的SNS JU项目6G-GOALS)

专题命中 音频语音多模态 :multimodal(title);audio-visual(abstract)

AI总结 本文提出了一种基于自适应时间窗口整合的非阻塞推理方法,以应对通信延迟不确定性,提升分布式多模态系统的实时推理性能。

Comments 6 pages, 3 figures, submitted to IEEE ICC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10011 2025-11-18 cs.CY 78%

Reinforcing Trustworthiness in Multimodal Emotional Support Systems

Huy M. Le, Dat Tien Nguyen, Ngan T. T. Vo, Tuan D. Q. Nguyen, Nguyen Binh Le, Duy Minh Ho Nguyen, Daniel Sonntag, Lizi Liao, Binh T. Nguyen

专题命中 音频语音多模态 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏