M3-SLU: Evaluating Speaker-Attributed Reasoning in Multimodal Large Language Models
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI
Comments Submitted to LREC 2026. 11 pages, 5 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI
Comments Submitted to LREC 2026. 11 pages, 5 figures
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
Comments Accepted to AAAI 2025
机构 * Tsinghua University(清华大学) ; ByteDance(字节跳动) ; Zhejiang University(浙江大学) ; Ping An Technology (Shenzhen) Co., Ltd(平安科技(深圳)有限公司)
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI
Comments NeurIPS 2025 Main Track
机构 * Xinjiang Multimodal Intelligent Processing and Information Security Engineering Technology Research Center, School of Computer Science and Technology, Xinjiang University(新疆多模态智能处理与信息安全工程技术创新中心,计算机科学与技术学院,新疆大学) ; Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) ; School of Electrical Engineering and Automation, Tianjin University of Technology(电气工程与自动化学院,天津工业大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM
Comments Accepted for publication by IEEE International Conference on Systems, Man, and Cybernetics 2025
机构 * Santa Clara, CA, USA(美国圣克拉拉) ; Carnegie Mellon University(卡内基梅隆大学) ; Huazhong University of Science and Technology(华中科技大学) ; Nanjing University of Information Science and Technology(南京信息工程大学)
专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CL、eess.AS
Comments Accepted by Interspeech
Journal ref Proc. of Interspeech2025
机构 * Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; OpenRL ; Chongqing University(重庆大学)
专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM
机构 * EPFL(苏黎世联邦理工学院) ; Idiap Research Institute(日内瓦研究所)
专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM
Comments Accepted at ACM Multimedia 2025
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.MM、eess.AS
Comments aceepted by IEEE TC
专题命中 音频语音多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.MM、eess.AS
机构 * Samsung SAIL Montréal(三星SAIL蒙特利尔)
专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(abstract);分类 cs.AI、cs.MM
机构 * Hangzhou Dianzi University(杭州电子科技大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Xi’an Jiaotong University(西安交通大学) ; Macao Polytechnic University(澳门 polytechnic university)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted by ICCV 2025
机构 * Xidian University(西安电子科技大学)
专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM
Comments Accepted to ACM MM 2025 (The 33rd ACM International Conference on Multimedia)
机构 * Defense Innovation Institute, Academy of Military Sciences, Beijing, China(国防科技研究院,军事科学院,北京,中国) ; Tianjin Artificial Intelligence Innovation Center, Tianjin, China(天津人工智能创新中心,天津,中国) ; Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学,深圳,中国) ; Tianjin University, Tianjin, China(天津大学,天津,中国)
专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.MM、eess.AS
Comments The paper has been accepted by IEEE Transactions on Human-Machine Systems
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.MM、eess.AS
Comments Accepted at INTERSPEECH 2025
机构 * Hokkaido Denshikiki Co., Ltd.(Hokkaido Denshikiki公司)
专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI、eess.AS
Comments 3 pages
机构 * Harvard University(哈佛大学) ; Bytedance(字节跳动) ; University of Southern California(南加州大学)
专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、eess.AS
机构 * Meta AIUK(Meta AI英国分公司) ; Imperial College London(伦敦帝国学院)
专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.AI、eess.AS
Comments Interspeech 2025
机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、eess.AS
机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所) ; NVIDIA, Taiwan(台湾NVIDIA公司) ; Mitsubishi Electric Research Labs (MERL)(三菱电机研究实验室)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、eess.AS
Comments CVPR 2025
机构 * MIT(麻省理工学院) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) ; University of Tuebingen(图宾根大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、eess.AS
Comments Accepted in Signal Processing Letters. Code at https://github.com/roudimit/whisper-flamingo
机构 * Pattern Recognition and Human Language Technology research center, Universitat Politècnica de València, Spain(模式识别与人类语言技术研究中心,西班牙巴塞罗那理工大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments Accepted in Computer Speech & Language journal of Elsevier
机构 * Kim Jaechul Graduate School of AI, KAIST(金jaechul人工智能研究生院,韩国科学技术院) ; School of Electrical Engineering, KAIST(电气工程学院,韩国科学技术院)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM、eess.AS
Comments ICLR 2025; 22 pages, 6 figures, 14 tables
机构 * College of Computer Science, Nankai University, Tianjin, China(南开大学计算机科学学院)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM
Comments 6 pages, 7 figures
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、eess.AS
Comments Accepted to CVPR 2025. Project page: https://hkchengrex.github.io/MMAudio
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、eess.AS
专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CV、eess.AS
Comments 11 pages, 5 figures
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM
Comments accepted by CVPR 2025; Project page: https://github.com/jasongief/OV-AVEL
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI