arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 1439 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 122 篇

2608.05543 2026-08-14 cs.IR 版本更新 71%

omni-macos: On-Device Omni-Modal Search on Apple Silicon

omni-macos:在Apple Silicon上运行的端侧全模态搜索系统

Han Xiao

专题命中 音频语音多模态 :omni-modal(title)

AI总结 omni-macos是一款在Apple Silicon端侧运行的全模态搜索系统,可在用户Mac设备上处理多模态数据搜索,数据不离开设备,适配不同硬件规格的Mac并优化内存使用。

Comments 18 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22085 2026-07-27 cs.HC 版本更新 71%

SocialPulse: On-Device Detection of Social Interactions in Naturalistic Settings Using Smartwatch Sensing

SocialPulse: 使用智能手表多模态感知在自然环境中检测社交互动

Md Sabbir Ahmed, Kaitlyn Dorothy Petz, Noah French, Tanvi Lakhtakia, Aayushi Sangani, Mark Rucker, Xinyu Chen, Bethany A. Teachman, Laura E. Barnes

专题命中 音频语音多模态 :multimodal(title)

AI总结 本文提出了一种在设备上检测自然环境中社交互动的方法,通过智能手表的多模态感知技术,实现了对多种社交互动的准确识别,并在真实场景中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20918 2026-08-05 cs.AI 版本更新 70%

OPOD: On-Policy Omni Distillation

OPOD:基于策略的全模态蒸馏

Tong Zhao, Yuyang Hu, Yutao Zhu, Reed Li, Haijin Liang, Haibo Shi, Yu Lu, Zhicheng Dou

机构 * Tencent(腾讯)

专题命中 音频语音多模态 :multimodal(abstract);omni-modal(abstract);分类 cs.AI

AI总结 研究旨在提升全模态模型能力,提出基于策略的全模态蒸馏(OPOD)方法,将学生响应路由到对应模态教师,调整教师影响,训练后仅留可部署的全模态模型,在多基准测试和多种骨干网络规模下取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03762 2026-06-26 eess.AS cs.LG 版本更新 70%

Conditional Flow Matching for Visually-Guided Acoustic Highlighting

基于条件流匹配的视觉引导声学增强

Hugo Malard, Gael Le Lan, Daniel Wong, David Lou Alon, Yi-Chiao Wu, Sanjeel Parekh

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院) Meta

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 eess.AS

AI总结 提出条件流匹配生成框架解决视觉引导音频重混中的多对多映射问题,通过滚动损失和跨模态融合模块实现优于判别方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28378 2026-06-17 cs.SD cs.AI 版本更新 70%

Membership Inference Attacks against Large Audio Language Models

针对大型音频语言的成员推断攻击

Jia-Kai Dong, Yu-Xiang Lin, Hung-Yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence(国立成功大学人工智能卓越研究中心)

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 首次系统评估大型音频语言模型的成员推断攻击,提出盲基线协议控制分布偏移,发现跨模态记忆仅源于说话人声纹与文本绑定。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19192 2026-08-05 cs.DC 版本更新 67%

MUSE: A Heterogeneity-Aware Multimedia Search Engine for Mobile SoCs

AME:一种高效的异构代理记忆引擎用于智能手机

Xinkui Zhao, Qingyu Ma, Yifan Zhang, Hengxuan Lou, Sai Liu, Chang Liu, Guanjie Cheng, Naibo Wang, Yueshen Xu

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 AME是一种为智能手机设计的高效异构代理记忆引擎,通过硬件感知的矩阵流水线和调度方案提升内存处理效率,实现更高吞吐量和更低延迟。

Comments Accepted by the 34th ACM International Conference on Multimedia (MM '26). 9 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20266 2026-08-04 cs.SD 版本更新 67%

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook

大型音频语言模型综述:通用性、可信度与展望

Kaiwen Luo, Zhenhong Zhou, Leyan Wang, Liang Lin, Tianyu Shao, Yuanhe Zhang, Yang Xiao, Yuxuan Li, Miao Yu, Kailin Lyu, Jiaming Zhang, Li Sun, Songze Li, Yueming Wu, Ting Dang, Xiaojun Jia, Dongrui Liu, Kai Li, Rohan Kumar Das, Siyuan Liang, Xinfeng Li, Qiankun Li, Jing Chen, Xingjun Ma, Kun Wang, Junhao Dong, Deqing Zou, Yu Cheng, Xia Hu, Zhigang Zeng, Sen Su, Yang Liu, Yu-Gang Jiang, Philip S. Yu, Yew-Soon Ong

机构 * Nanyang Technological University(南洋理工大学) Independent Researcher(独立研究者) The University of Melbourne(墨尔本大学) North China Electric Power University(华北电力大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Fortemedia Singapore(富媒体新加坡) Tencent(腾讯) Fudan University(复旦大学) Wuhan University(武汉大学) Chinese University of Hong Kong(香港中文大学) Chongqing University of Posts and Telecommunications(重庆邮电大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 本文综述了大型音频语言模型的通用性、可信度及未来发展方向,探讨了其架构创新、对齐算法及安全风险,并提出了防御深入、因果音频世界建模等策略以提升音频智能的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09803 2026-07-01 cs.SD 版本更新 67%

MAGE: Modality-Agnostic Music Generation and Target-Source Extraction

MAGE:模态无关的音乐生成与编辑

Muhammad Usama Saleem, Tejasvi Ravi, Tianyu Xu, Rajeev Nongpiur, Ishan Chatterjee, Mayur Jagdishbhai Patel, Pu Wang

机构 * Google(谷歌) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract)

AI总结 MAGE提出了一种模态无关框架,统一了多模态音乐生成与混合编辑,通过可控多模态FluxFormer和音频视觉 nexus 对齐机制,实现灵活且高效的音乐生成与编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04840 2026-06-24 eess.AS cs.AI cs.CL 版本更新 67%

An Approach to Simultaneous Acquisition of Real-Time MRI Video, EEG, and Surface EMG for Articulatory, Brain, and Muscle Activity During Speech Production

一种用于言语产生过程中发音、大脑和肌肉活动的实时MRI视频、脑电图和表面肌电图同步采集方法

Jihwan Lee, Parsa Razmara, Kevin Huang, Sean Foley, Aditya Kommineni, Haley Hsu, Woojae Jeong, Prakash Kumar, Xuan Shi, Yoonjeong Lee, Tiantian Feng, Takfarinas Medani, Ye Tian, Sudarsana Reddy Kadiri, Krishna S. Nayak, Dani Byrd, Louis Goldstein, Richard M. Leahy, Shrikanth Narayanan

机构 * Signal Analysis and Interpretation Laboratory, University of Southern California(南加州大学信号分析与解释实验室) Ming Hsieh Dept. of Electrical and Computer Engineering, University of Southern California(南加州大学明希斯电气与计算机工程系) Dept. of Linguistics, University of Southern California(南加州大学语言学系)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文首次实现了言语产生过程中实时MRI、EEG和表面EMG的同步采集,并提出了针对三模态设置的伪影抑制流程,为言语神经科学和脑机接口提供新视角。

Comments Accepted for Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06191 2026-06-23 eess.AS cs.AI cs.CL cs.SD 版本更新 67%

Harf-Speech: A Clinically Aligned Framework for Arabic Phoneme-Level Speech Assessment

Harf-Speech:面向阿拉伯语音素级语音评估的临床对齐框架

Asif Azad, MD Sadik Hossain Shanto, Mohammad Sadat Hossain, Bdour Alwuqaysi, Sabri Boughorbel, Yahya Bokhari, Abdulrhman Aljouie, Ayah Othman Sindi, Ehsan Hoque

机构 * Ministry of Defense, Saudi Arabia(沙特阿拉伯国防部) Ability Center, Saudi Arabia(沙特阿拉伯能力中心) University of Rochester, USA(罗切斯特大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 提出Harf-Speech模块化系统,结合MSA音素化器、微调语音到音素模型、Levenshtein对齐及混合评分器,在阿拉伯语音素级发音评估中达到0.791 Pearson相关和0.659 ICC,优于现有端到端方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21182 2026-06-15 cs.CL cs.AI cs.CV 版本更新 67%

Manga109-v2026: Revisiting Manga109 Annotations for Modern Manga Understanding

Manga109-v2026: 重新审视Manga109标注以适应现代漫画理解

Jeonghun Baek, Atsuyuki Miyai, Shota Onohara, Hikaru Ikuta, Kiyoharu Aizawa

机构 * University of Tokyo(东京大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文重新审视Manga109的对话文本标注,识别出五类标注问题,包括转录错误、缺失文本区域、对话与拟声词重叠以及未分割的对话气泡,并通过结合OCR基于的问题检测和人工修订构建Manga109-v2026,修订了约29,000个对话标注,使Manga109更好地适应现代OCR和多模态漫画理解系统,同时保留漫画特有的表达结构。

Comments Accepted to the Culture x AI Workshop at ICML 2026. Project page: https://manga109.github.io/manga109-project-website/en/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06165 2026-08-10 cs.SD cs.AI cs.MM 版本更新 62%

Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset

基于预训练特征、数据增强及新SheetSage-A2S数据集的音频转乐谱转录

Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo, Yaolong Ju

机构 * University College Dublin(都柏林大学学院) Guangxi Normal University(广西师范大学) Great Bay University(大湾区大学) Shenzhen University(深圳大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 该研究针对流行音乐音频转乐谱研究不足的问题,构建了SheetSage-A2S数据集,结合预训练模型MuQ与数据增强改进A2S方法,在古典与流行音乐基准上均取得优于现有技术的性能。

Comments Accepted at the 34th ACM International Conference on Multimedia (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04111 2026-08-10 cs.CV cs.CL cs.LO 版本更新 62%

GEB-Bench: Abstract Structures Told in Many Voices

GEB-Bench:多视角呈现的抽象结构

Tong Zhang, Zhiyuan Shi, Yun Peng, Tao Xie

机构 * Fudan University(复旦大学) Peking University(北京大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本研究推出GEB-Bench基准,评估12种模型发现其在结构识别与跨视角映射间存在差距,仅前沿模型能缩小该差距,且表面复杂性会增加模型负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18904 2026-08-10 cs.SD cs.AI cs.CL 版本更新 62%

MetaSICL: Globalizing Auditory LLMs for Underserved Speakers and Languages via Meta Speech In-Context Learning

MetaSICL: 通过元语音上下文学习适应听觉大语言模型

Haolong Zheng, Siyin Wang, Zengrui Jin, Mark Hasegawa-Johnson

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出MetaSICL方法,利用高资源语音数据通过元学习增强听觉大语言模型的上下文学习能力,在低资源场景下优于直接微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04586 2026-08-07 cs.CL cs.AI 版本更新 62%

Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders

通过资源感知型语音编码器混合模型打破多对多语音到文本翻译中的多语言性诅咒

Yexing Du, Kaiyuan Liu, Youcheng Pan, Bo Yang, Chengpeng Fu, Yu Wang, Ming Liu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对多对多语音到文本翻译中的多语言性诅咒问题,提出资源感知型MoSE框架与五阶段课程学习策略,其4B参数模型在45种语言的全方向翻译任务上实现最优性能,显著提升低资源语言表现且不损害高资源性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03942 2026-08-05 cs.SD cs.CL cs.MM 版本更新 62%

MIDI-LLM: Improving Text-to-MIDI Music Generation via Adapting Large Language Models

MIDI-LLM:通过适配大语言模型改进文本到MIDI的音乐生成

Shih-Lun Wu, Dave Carlton, Ryan Miyakawa, Yoon Kim, Chris Donahue, Cheng-Zhi Anna Huang

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.MM

AI总结 该研究提出MIDI-LLM,通过适配Llama 3.2(1B)采用两阶段训练改进文本到MIDI生成,在用户研究中证实其在人机音乐协同创作中的有效性。

Comments Accepted to International Society for Music Information Retrieval (ISMIR) Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02770 2026-07-27 cs.CL cs.AI 版本更新 62%

Gemma 4 Technical Report

Gemma 4技术报告

Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Aditya Chawla, Victor Cotruta, Alice Coucke, Phil Culliton, Robert Dadashi, Lucas Dixon, Mohamed Elhawaty, Utku Evci, Clément Farabet, Johan Ferret, Filippo Galgani, Sertan Girgin, Jean-Bastien Grill, Maarten Grootendorst, Jiaxian Guo, Cassidy Hardin, Yanzhang He, Steven M. Hernandez, Omri Homburger, Léonard Hussenot, Juyeong Ji, Armand Joulin, Aishwarya Kamath, Parnian Kassraie, Olivier Lacombe, Preethi Lahoti, Gaël Liu, Gus Martins, Luciano Martins, Tatiana Matejovicova, Ramona Merhej, Nikola Momchev, Sneha Mondal, Ryan Mullins, Sindhu Raghuram Panyam, Shreya Pathak, Sarah Perrin, André Susano Pinto, Etienne Pot, Angéline Pouget, Alexandre Ramé, Sabela Ramos, Douglas Reid, David Rim, Morgane Rivière, Karsten Roth, Louis Rouillard, Omar Sanseviero, Pier Giuseppe Sessa, Shane Settle, Danila Sinopalnikov, Sara Smoot, Piotr Stanczyk, Andreas Steiner, Lawrence Stewart, Ilya Tolstikhin, Michael Tschannen, Anton Tsitsulin, Nino Vieillard, Renjie Wu, Pingmei Xu, Haichuan Yang, Edouard Yvinec, Biao Zhang, Li Zhang, Joe Zou, Nicolas Aagnes, Abdelrahman Abdelhamed, Jakub Adamek, Shivani Agrawal, Shubham Agrawal, Ibrahim Alabdulmohsin, Jean Baptiste Alayrac, Uri Alon, Chandramouli Amarnath, Ankesh Anand, Chrysovalantis Anastasiou, Setareh Ariafar, François-Xavier Aubet, Kyriakos Axiotis, Federico Barbero, Joelle Barral, Alexei Bendebury, Urs Bergmann, Stanley Bileschi, Kat Black, Mathieu Blondel, Sebastian Borgeaud, Arthur Bražinskas, Ryan Burnell, Robert Busa-Fekete, Mu Cai, Daniele Calandriello, Glenn Cameron, Charlotte Caucheteux, Rahma Chaabouni, Garima Chadha, Jetha Chan, Blake Jianhang Chen, Jesse Chen, Lin Chen, Xu Chen, Derek Cheng, Tzu-hsiang Chien, Nikolai Chinaev, Yi Chou, Zhaohui Chu, Benjamin Coleman, Pooja Consul, Sam Conway-Rahman, Scott Crowell, Dylan Cutler, Vivek Dani, Samira Daruki, Anil Das, Daniel Deutsch, Nishanth Dikkala, Li Ding, Qiuhan Ding, Shenil Dodhia, Konstantin Donhauser, Tulsee Doshi, Anca Dragan, Alex Druinsky, Sahil Dua, Zoltan Egyed, Danielle Eisenbud, Daniel Eppens, Cindy Fan, Bahare Fatemi, Yassir Fathullah, Vlad Feinberg, Milen Ferev, Sebastian Flennerhag, Takumi Fujimoto, João Gabriel Oliveira, Isaac Galatzer-Levy, João Gante, Simon Geisler, Soham Ghosal, Antonious M. Girgis, Tamara von Glehn, Alec Go, Alhaad Gokhale, Alex Grills, Yiming Gu, Mayank Gupta, Pramod Gupta, Guru Guruganesh, Raia Hadsell, Hamza Harkous, Jitendra Harlalka, Demis Hassabis, Anja Hauth, Joe Heyward, Arian Hosseini, Chih-Yang Hsia, I-Hung Hsu, Xiaopeng Huang, Yangsibo Huang, Kevin Hui, Adrian Hutter, Te I, Fotis Iliopoulos, Advait Jain, Ganesh Jawahar, Ziwei Ji, Qilin Jin, Melvin Johnson, Kandarp Joshi, Arun Kandoor, Wang-Cheng Kang, Koray Kavukcuoglu, Mehran Kazemi, Kathleen Kenealy, Amr Khalifa, Phoebe Kirk, Ivan Korotkov, Suraj Kothawade, Vitaly Kovalev, Neel Kovelamudi, Adam Kraft, Ravin Kumar, Vivek Kumar, Harish Kuppam, Justin Lannin, Chen-Yu Lee, Seungji Lee, Dmitry Lepikhin, Alon Levkovitch, Dongdong Li, Qiujia Li, Valentin Liévin, Ethan Lin, Ziqian Lin, Casper Liu, Tianlin Liu, Tianqi Liu, Xin Liu, Ivan Lobov, Mayank Lunayach, Min Ma, Gagan Madan, Andrii Maksai, Eric Malmi, Michal Matuszak, Daniel McDuff, Gaurav Menghani, Maciej Mikuła, Daniil Mirylenka, Karolis Misiunas, Vedant Misra, Andreea Mitran, Kareem Mohamed, Maksim Mukha, Eric Noland, James O'Donnell, Brendan O'Donoghue, Kate Olszewska, Bernett Orlando, Wanqiong Pan, Rina Panigrahy, Unnati Parekh, Nicolas Perez-Nieves, Chunjong Park, Eric Paskie, Liqian Peng, Bryce Petrini, Slav Petrov, Jonas Pfeiffer, Bilal Piot, Martyna Plomecka, Siim Poder, Octavio Ponce, Arijit Pramanik, David Racz, Anish Rajan, Michelle Ramanovich, Anand Rao, Marvin Ritter, Vitor Rodrigues, Evan Rosen, Mikołaj Rybiński, Noveen Sachdeva, Michaël E. Sander, Rohit Sathyanarayana, Sagar Savla, Samuel Schmidgall, Tal Schuster, George Scrivener, Benoit Seguin, Andrew Sellergren, Aliaksei Severyn, Izhak Shafran, Dhruv Shah, Bobak Shahriari, Yuan Shangguan, Ashish Shenoy, Pradeep Shenoy, Rakesh Shivanna, Pauline Sho, Lucas Spangher, Wojciech Stokowiec, Tim Strother, Yao Su, Yinghao Sun, Mukund Sundararajan, Andrea Tacchetti, Mor Hazan Taege, Pouya Tafti, Jean Tarbouriech, Chetan Tekur, Shantanu Thakoor, Rahul Thapa, Madeleine Traverse, Lenart Treven, Tao Tu, Chien Te Tung, Çağlar Ünlü, Petar Veličković, Malini Pooni Venkat, Sagar Gubbi Venkatesh, Vidya Venkiteswaran, Francesco Visin, Alex Vitvitskyi, Kiran Vodrahalli, Weiyi Wang, Xin Wang, Tris Warkentin, Jan Wassenberg, John Wieting, Cindy Wu, Lechao Xiao, Hao Xu, Yuhui Xu, Fuzhao Xue, Arun Yadav, Jun Yan, Antoine Yang, Lin Yang, Ming-Hsuan Yang, Ziyu Ying, Jae Hyeon Yoo, Morteza Zadimoghaddam, Sajjad Zafar, Fred Zhang, Jiageng Zhang, Jianyi Zhang, Xiaofan Zhang, Chao Zhao, David Zhou, Chen Zou

机构 * Google DeepMind(谷歌DeepMind)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 介绍新一代Gemma 4开源多模态语言模型,通过密集和专家混合架构提升计算效率与推理能力,提出统一无编码器架构,集成思考模式,改进多方面性能,在多基准测试中有显著提升。

Comments 17 pages, 2 figures, technical report, updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28445 2026-07-23 cs.SD cs.AI cs.CL cs.LG 版本更新 62%

LoRA-Tuned Large Language Models for Dementia Detection via Multi-View Speech-Derived Features

基于多视角语音特征的LoRA微调大语言模型用于痴呆检测

Jonghyeon Park, Olivier Jiyoun Jung, Myungwoo Oh

机构 * NAVER Cloud(NAVER云) Division of Communication and Media, Ewha Womans University(通信与媒体系,成均馆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出LoRA微调LLM,通过统一提示整合ASR转录、话语主题、时间流畅度和音韵序列四种语音特征,实现多视角推理,在ADReSSo上F1达90.14%。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15177 2026-07-07 cs.SD cs.MM eess.AS 版本更新 62%

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

用于以音频为中心任务的音频-语言模型:系统综述

Yi Su, Jisheng Bai, Qisheng Xu, Kele Xu, Yong Dou

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) School of Communications and Information Engineering, Xi’an University of Posts and Telecommunications(通信与信息工程学院,西安邮电大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM、eess.AS

AI总结 对基于配对音频-文本数据训练的音频-语言模型进行系统综述,涵盖语音、音乐和声音,给出统一分类法,建立研究框架,助研究者了解技术发展与趋势,为应用提供参考。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10371 2026-06-25 eess.AS cs.CL 版本更新 62%

Speech Codec Probing from Semantic and Phonetic Perspectives

从语义和语音角度探测语音编解码器

Xuan Shi, Chang Zeng, Tiantian Feng, Shih-Heng Wang, Jianbo Ma, Shrikanth Narayanan

机构 * University of Southern California(南加州大学) Dolby Laboratories(杜比实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 本文通过三项任务系统分析多种语音分词器编码的信息,发现当前分词器主要捕获语音结构而非词汇语义,为下一代语音分词方法设计提供指导。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19937 2026-06-17 cs.CL cs.SD eess.AS 版本更新 62%

ALAS: An Automatic Latent Alignment Score for Audio Language Models

ALAS:音频语言模型的自动潜在对齐分数

Pooneh Mousavi, Yingzhi Wang, Mirco Ravanelli, Cem Subakan

机构 * Concordia University(Concordia 大学) Mila-Quebec AI Institute(Mila-Quebec 人工智能研究所) Centrale Supelec(Centrale Supelec 研究院) Laval University(Laval 大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 提出ALAS指标,通过计算音频与文本表示的跨模态余弦相似度,无需训练即可评估语音-LLM的音频-文本对齐质量,揭示模型对齐深度与任务需求的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10441 2026-08-17 cs.CL 版本更新 57%

Decoding Student Minds: Leveraging Conversational Agents for Psychological and Learning Analysis

解码学生心智:利用对话代理进行心理和学习分析

Nour El Houda Ben Chaabene, Hamza Hammami, Laid Kahloul

机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) LIPAH-LR11ES14, National Engineering School of Tunis(突尼斯国家工程学院LIPAH-LR11ES14) Faculty of Sciences of Tunis(突尼斯科学学院) LINFI Laboratory(LINFI实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出一种结合多模态数据和语义推理的对话代理,用于实时分析学生认知和情感状态,提升学习表现和情感福祉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08235 2026-08-14 eess.AS 版本更新 57%

SraVaani 1.0: Scaling Inclusive Speech Recognition for Indic Languages

SraVaani 1.0:面向印度语言的包容性自动语音识别规模化模型

Sujith Pulikodan, Agneedh Basu, Pavan Kumar J, Pranav D Bhat, Suryansh Shukla, Nihar Desai, Prasanta Kumar Ghosh

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出SraVaani 1.0,一款基于FastConformer架构的多语言ASR模型,覆盖65种印度语言,经三阶段训练后在8个基准上表现优异,是唯一支持多种低资源及部落印度语言转录的开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08874 2026-08-14 cs.CV 版本更新 57%

AeroReformer2: Spoken-Query Referring Segmentation for Aerial Images

AeroReformer2:面向航拍图像的语音查询指称分割

Rui Li, Chenxi Duan, Haoyang Yang

机构 * Massachusetts Institute of Technology(麻省理工学院) The University of Manchester(曼彻斯特大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文针对现有指称遥感图像分割基准仅支持书面表达的问题,构建了首个语音查询指称分割基准RISBench-S,并提出高效双边网络模型AeroReformer2,在相关任务上取得优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01982 2026-08-12 cs.HC cs.AI 版本更新 57%

Music Interpretation and Emotion Perception: A Computational and Neurophysiological Investigation

音乐诠释与情感感知:计算与神经生理学调查

Vassilis Lyberatos, Spyridon Kantarelis, Ioanna Zioga, Christina Anagnostopoulou, Giorgos Stamou, Anastasia Georgaki

机构 * School of Electrical and Computer Engineering, National Technical University of Athens(电气与计算机工程学院,国家技术大学雅典) Department of Music Studies, National and Kapodistrian University of Athens(音乐研究系,国家与卡波迪斯特里亚大学雅典)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究利用计算和神经生理学方法,探究不同演奏情境(如曲目、调式练习曲和即兴演奏)及表现力水平对表演者情感传达和听众反应的影响,发现表现力和即兴演奏具有独特声学特征并引发更强情感反应,且即兴演奏带来更大的神经生理放松。

Comments Accepted at SMC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22790 2026-08-11 cs.SD cs.AI 版本更新 57%

Scaling Audio Models Efficiently: A Joint Study of Compute Constraints and Optimization Behavior

高效扩展音频模型:计算约束与优化行为的联合研究

Vyom Agarwal, Mokshda Gangrade, Siddharth Pal, Jerry Wu

机构 * University of Maryland(马里兰大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对ASR和SER任务,提出统一框架分析模型大小、输入长度和表示分辨率三个计算维度,在固定预算下优化资源分配,发现非线性缩放行为并确定最优操作点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05550 2026-08-11 cs.SD cs.CL cs.LG 版本更新 57%

Assessing Factual Music Comprehension in Large Audio Language Models

评估大型音频语言模型中的事实音乐理解能力

Daniel Chenyu Lin, Michael Freeman, John Thickstun

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对现有MusicQA数据集无法衡量模型回答事实正确性的问题,提出基于可验证信息的评估协议,通过精确率、召回率和F1分数客观评估模型,并在三个数据集上定义六项事实检索任务,对九个最新LALM进行基准测试。

Comments 17 pages; ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31589 2026-08-10 cs.CV 版本更新 57%

Recognizing Co-Speech Gestures in-the-Wild

识别野外伴随语音的手势

Sindhu B Hegde, K R Prajwal, Andrew Zisserman

机构 * Visual Geometry Group, Dept. of Engineering Science, University of Oxford(视觉几何组,工程科学系,牛津大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对当前多模态模型难以捕捉语义性伴随手势的问题,构建了首个大规模基准数据集GRW,用于训练视频模型进行手势语义分类、对应词汇识别和时序定位。

Journal ref European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06612 2026-08-07 cs.CV 版本更新 57%

A Bridge from Audio to Video: Phoneme-Viseme Alignment Allows Every Face to Speak Multiple Languages

从音频到视频的桥梁:音素-视素对齐让任意人脸可说多种语言

Zibo Su, Kun Wei, Jiahua Li, Jing Kong, Xu Yang, Cheng Deng

机构 * Xidian University(西安电子科技大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 该研究提出MuEx框架,通过PG-MoE架构和PV-Align机制,结合含12种语言的MTFD数据集,实现多语言语音驱动说话人脸合成,在MTFD全语言表现优异且可零样本泛化到未见语言。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15755 2026-08-03 cs.SD cs.AI 版本更新 57%

AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis

AuEmoChat:用于对话语音合成的真实情感理解与呈现

Zhenqi Jia, Yuan Zhao, Aruukhan, Rui Liu, Haizhou Li

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对对话语音合成中情感表达不真实及多模态令牌干扰问题,提出AuEmoChat框架,通过AuEmoCodec学习情感令牌空间、AuEmoToMe合并冗余令牌,集成到模型并结合情感流匹配渲染语音,实验证明其性能优于现有基线。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏