VAPO: End-to-end Slide-Enhanced Speech Recognition with Omni-modal Large Language Models
VAPO:基于多模态大语言模型的端到端幻灯片增强语音识别
Rui Hu, Delai Qiu, Yining Wang, Shengping Liu, Jitao Sang
机构
*
Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室)
;
Unisound AI Technology Co., Ltd.(Unisound人工智能技术有限公司)
;
State Key Laboratory of AI Safety, Beijing(人工智能安全国家重点实验室)
机构
*
National Innovation Center for Digital Fishery(国家数字渔业创新中心)
;
Key Laboratory of Smart Farming Technologies for Aquatic Animal and Livestock, Ministry of Agriculture and Rural Affairs(农业农村部水产动物与畜禽智慧养殖技术重点实验室)
;
State Key Laboratory of Efficient Utilization of Agricultural Water Resources(农业水资源高效利用全国重点实验室)
;
Beijing Engineering and Technology Research Center for Internet of Things in Agriculture(北京市农业物联网工程技术研究中心)
;
Key Laboratory of Digital Fisheries of Shandong Province(山东省数字渔业重点实验室)
;
College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)
Reliability-Aware Geometric Fusion for Robust Audio-Visual Navigation
可靠性感知的几何融合用于鲁棒的音频视觉导航
Teng Liu, Yinfeng Yu
机构
*
Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学联合具身智能研究实验室)
;
Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语种认知计算联合国际研究实验室)
;
School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)
Audio Spatially-Guided Fusion for Audio-Visual Navigation
音频空间引导融合用于音频视觉导航
Xinyu Zhou, Yinfeng Yu
机构
*
Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学联合研究实验室,具身智能)
;
Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室)
;
School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)
机构
*
Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽亚德人工智能大学)
;
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
机构
*
Speech Technology Lab, University of Groningen, The Netherlands(格罗宁根大学语音技术实验室,荷兰)
;
Center for Language and Cognition, University of Groningen, The Netherlands(格罗宁根大学语言与认知中心,荷兰)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
鲁棒的基于大语言模型的音频视觉语音识别与稀疏模态对齐和视觉单元引导的细化
Fei Su, Cancan Li, Juan Liu, Wei Ju, Hongbin Suo, Ming Li
机构
*
School of Computer Science, Wuhan University, China(武汉大学计算机学院)
;
School of Artificial Intelligence, Wuhan University, China(武汉大学人工智能学院)
;
School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院)
;
AI Center, OPPO, China(OPPO人工智能中心)
;
Digital Innovation Research Center, Duke Kunshan University, China(杜克大学昆山数字创新研究中心)
机构
*
College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
;
School of Information Science and Engineering, Shandong Normal University(信息科学与工程学院,山东师范大学)
;
Institute of Information Science, Beijing Jiao Tong University(信息科学研究院,北京交通大学)
;
YouTube Media Algorithms team, Google Inc.(YouTube媒体算法团队,谷歌公司)
机构
*
University of Bari Aldo Moro(巴里大学阿尔多·莫罗大学)
;
Catalonia's Telecommunications Technology Centre(加泰罗尼亚电信技术中心)
;
University of Picardie Jules Verne(皮卡第大学朱利·瓦内大学)
机构
*
X-LANCE Lab, School of Computer Science, MoE Key Lab of Artificial Intelligence Shanghai Jiao Tong University(X-LANCE实验室,计算机科学学院,人工智能教育部重点实验室,上海交通大学)
;
Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
;
Peng Cheng Laboratory(鹏城实验室)
;
University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
Tianjin University(天津大学)
;
Hong Kong University of Science and Technology(香港科学大学)
;
Queen Mary University of London(伦敦玛丽女王大学)
;
Nanyang Technological University(南洋理工大学)
;
Shanghai Innovation Institute(上海创新研究院)
Versatile audio-visual learning for emotion recognition
多功能音频视觉学习用于情绪识别
Lucas Goncalves, Seong-Gyun Leem, Wei-Cheng Lin, Berrak Sisman, Carlos Busso
机构
*
Multimodal Signal Processing (MSP) Lab(多模态信号处理实验室)
;
Erik Jonsson School of Engineering and Computer Science(埃里克·乔纳森工程与计算机科学学院)
;
The University of Texas at Dallas(德克萨斯大学达拉斯分校)