Mixed Signals: Understanding Model Disagreement in Multimodal Empathy Detection
机构 * Columbia University(哥伦比亚大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
Comments To appear in Findings of IJCNLP-AACL 2025
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Columbia University(哥伦比亚大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
Comments To appear in Findings of IJCNLP-AACL 2025
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
机构 * PwC US(普华永道美国)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
Comments 15 pages, 4 figures
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.MM
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
专题命中 音频语音多模态 :multi-modal(title);分类 cs.CV、cs.CL、cs.MM
Journal ref IEEE International Conference on Multimedia and Expo (ICME), Nantes, France, 2025, pp. 1-6
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
机构 * Microsoft Azure Research(微软Azure研究) ; Microsoft Research India(微软印度研究) ; University of Virginia(弗吉尼亚大学) ; Microsoft M365 Research(微软M365研究)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
Comments Published at ACM SoCC 2025; 14 pages, 20 figures
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
机构 * Computational Linguistics \& Text Mining Lab Vrije Universiteit Amsterdam
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
Comments 8 pages, 9 figures, submitted to LREC 2026
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
Comments Submitted to ICASSP 2026
机构 * National Taiwan University(国立台湾大学) ; ASUS Open Cloud Infrastructure Software Center(ASUS开放云基础设施软件中心)
专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);分类 eess.AS
Comments Note: This preprint is a version of the paper submitted to ICASSP 2026. The author list here includes contributors who provided additional supervision and guidance. The official ICASSP submission may differ slightly in author composition
机构 * School of Computer Technology and Application(计算机技术与应用学院) ; Intelligent Computing and Application Laboratory of Qinghai Province(青海省智能计算与应用实验室) ; Department of Computer Science and Technology(计算机科学与技术系) ; Institute for AI(人工智能研究院) ; Tsinghua Laboratory of Brain and Intelligence (THBI)(清华大学脑与智能实验室) ; IDG/McGovern Institute for Brain Research(IDG/麦克戈维脑研究学院) ; Tsinghua University(清华大学) ; Chinese Institute for Brain Research (CIBR)(中国脑科学研究院)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
Comments Accepted by ECAI 2025
机构 * University of Michigan(密歇根大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Toronto(多伦多大学) ; University of Toronto Mississauga(多伦多大学滑铁卢分校)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
Comments 7 pages, accepted to SIGCSE2026
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
机构 * Academia Sinica(台湾“中央研究院)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
Comments Accepted to Interspeech 2025 Workshop
机构 * Xinjiang Multimodal Intelligent Processing and Information Security Engineering Technology Research Center(新疆多模态智能处理与信息安全工程技术研究中心) ; School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; School of Electrical Engineering and Automation, Tianjin University of Technology(天津理工大学电气工程与自动化学院)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI
Comments Main paper (15 pages). Accepted for publication by ICONIP( International Conference on Neural Information Processing) 2025
机构 * University of Southern California(南加州大学) ; University of Queensland(昆士兰大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; University of Buffalo(布法罗大学) ; University of California, Merced(加州大学默塞德分校)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
Comments 23 pages, 2 figures, 2 tables
机构 * Bose Corporation(博世公司) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
Comments Accepted into WASPAA 2025 demo session
机构 * Wuhan University of Science and Technology(武汉科技大学)
专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 eess.AS
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
Comments Conference on Robot Learning 2025
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
Comments Accepted into Automatic Speech Recognition and Understanding- ASRU 2025
机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨) ; Human-centered AI Group, AI Lab, Linz Institute of Technology(以人为本的人工智能小组、人工智能实验室、林茨技术研究所)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM
Comments 7 pages, 6 tables, IEEE International Conference on Content-Based Multimedia Indexing (IEEE CBMI)
机构 * Faculty of Engineering, Bar-Ilan University(巴伊兰大学工程学院) ; OriginAI
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
机构 * École Polytechnique Fédérale de Lausanne (EPFL), Switzerland(瑞士联邦理工学院洛桑校区) ; ETH Zürich, Switzerland(瑞士苏黎世联邦理工学院) ; T.H. Chan School of Public Health, Harvard University, USA(哈佛大学T.H. Chan公共卫生学院)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
Comments This paper was originally submitted to the CODEML workshop for ICML 2025. 9 pages (including references and appendices)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
Comments Accepted at Large Language Models for Music & Audio Workshop (LLM4MA) 2025
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Tencent(腾讯)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
Comments Accepted by ACMMM 2025
机构 * Peraton Labs(珀顿实验室)
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV
Comments 11 pages, 11 figures