CommentsThis paper has been accepted for presentation at INTERSPEECH 2026 and as non-archival paper at ICML 2026 Workshop on Machine Learning for Audio
机构
*
Massachusetts Institute of Technology, USA(麻省理工学院)
;
National Taiwan University, Taipei, Taiwan(国立台湾大学)
;
National Taiwan University Artificial Intelligence Center of Research Excellence, Taipei, Taiwan(国立台湾大学人工智能研究中心)
;
Academia Sinica, Taiwan(台湾“中央”研究院)
;
National Yang Ming Chiao Tung University, Taiwan(阳明交通大学)
;
Signal Analysis and Interpretation Laboratory (SAIL), University of Southern California, USA(信号分析与解释实验室(SAIL),南加州大学)
A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
大型音频语言模型综述:通用性、可信度与展望
Kaiwen Luo, Zhenhong Zhou, Leyan Wang, Liang Lin, Tianyu Shao, Yuanhe Zhang, Yang Xiao, Yuxuan Li, Miao Yu, Kailin Lyu, Jiaming Zhang, Li Sun, Songze Li, Yueming Wu, Ting Dang, Xiaojun Jia, Dongrui Liu, Kai Li, Rohan Kumar Das, Siyuan Liang, Xinfeng Li, Qiankun Li, Jing Chen, Xingjun Ma, Kun Wang, Junhao Dong, Deqing Zou, Yu Cheng, Xia Hu, Zhigang Zeng, Sen Su, Yang Liu, Yu-Gang Jiang, Philip S. Yu, Yew-Soon Ong
机构
*
Nanyang Technological University(南洋理工大学)
;
Independent Researcher(独立研究者)
;
The University of Melbourne(墨尔本大学)
;
North China Electric Power University(华北电力大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Huazhong University of Science and Technology(华中科技大学)
;
Tsinghua University(清华大学)
;
Fortemedia Singapore(富媒体新加坡)
;
Tencent(腾讯)
;
Fudan University(复旦大学)
;
Wuhan University(武汉大学)
;
Chinese University of Hong Kong(香港中文大学)
;
Chongqing University of Posts and Telecommunications(重庆邮电大学)
;
University of Illinois Chicago(伊利诺伊大学芝加哥分校)
An Approach to Simultaneous Acquisition of Real-Time MRI Video, EEG, and Surface EMG for Articulatory, Brain, and Muscle Activity During Speech Production
一种用于言语产生过程中发音、大脑和肌肉活动的实时MRI视频、脑电图和表面肌电图同步采集方法
Jihwan Lee, Parsa Razmara, Kevin Huang, Sean Foley, Aditya Kommineni, Haley Hsu, Woojae Jeong, Prakash Kumar, Xuan Shi, Yoonjeong Lee, Tiantian Feng, Takfarinas Medani, Ye Tian, Sudarsana Reddy Kadiri, Krishna S. Nayak, Dani Byrd, Louis Goldstein, Richard M. Leahy, Shrikanth Narayanan
机构
*
Signal Analysis and Interpretation Laboratory, University of Southern California(南加州大学信号分析与解释实验室)
;
Ming Hsieh Dept. of Electrical and Computer Engineering, University of Southern California(南加州大学明希斯电气与计算机工程系)
;
Dept. of Linguistics, University of Southern California(南加州大学语言学系)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
用于以音频为中心任务的音频-语言模型:系统综述
Yi Su, Jisheng Bai, Qisheng Xu, Kele Xu, Yong Dou
机构
*
College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学)
;
School of Communications and Information Engineering, Xi’an University of Posts and Telecommunications(通信与信息工程学院,西安邮电大学)
Decoding Student Minds: Leveraging Conversational Agents for Psychological and Learning Analysis
解码学生心智:利用对话代理进行心理和学习分析
Nour El Houda Ben Chaabene, Hamza Hammami, Laid Kahloul
机构
*
STIH Laboratory, Sorbonne University(索邦大学STIH实验室)
;
LIPAH-LR11ES14, National Engineering School of Tunis(突尼斯国家工程学院LIPAH-LR11ES14)
;
Faculty of Sciences of Tunis(突尼斯科学学院)
;
LINFI Laboratory(LINFI实验室)