arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4549 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4549 篇

2601.21740 2026-01-30 cs.MM cs.SD 83%

MIDI-LLaMA: An Instruction-Following Multimodal LLM for Symbolic Music Understanding

MIDI-LLaMA:一种用于符号音乐理解的指令遵循多模态大语言模型

Meng Yang, Jon McCormack, Maria Teresa Llano, Wanchao Su, Chao Lei

机构 * SensiLab, Monash University, Australia(Monash大学) University of Sussex, Brighton, United Kingdom(Sussex大学) School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系统学院)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.MM

AI总结 MIDI-LLaMA通过结合MusicBERT和Llama-3-8B,实现了对符号音乐的指令遵循理解,显著提升了音乐描述和语义对齐能力。

Comments Accepted for publication at International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17530 2026-01-27 cs.CL 83%

Revealing the Truth with ConLLM for Detecting Multi-Modal Deepfakes

用ConLLM揭示真相以检测多模态深度伪造

Gautam Siddharth Kashyap, Harsh Joshi, Niharika Jain, Ebad Shabbir, Jiechao Gao, Nipun Joshi, Usman Naseem

机构 * Macquarie University(麦考瑞大学) Bharati Vidyapeeth’s College Of Engineering(巴里蒂大学工程学院) Vivekananda Institute of Professional Studies (VIPS)(维维kananda专业研究学院) DSEU-Okhla Center for SDGC(SDGC研究中心) Stanford University(斯坦福大学) Cornell University(康奈尔大学)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);audio-visual(abstract);分类 cs.CL

AI总结 ConLLM通过对比学习和大语言模型推理,有效提升多模态深度伪造检测的准确率和泛化能力。

Comments Accepted at EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15278 2026-01-22 cs.MM 83%

Interpreting Multimodal Communication at Scale in Short-Form Video: Visual, Audio, and Textual Mental Health Discourse on TikTok

在短视频中大规模解读多模态交流:TikTok上的视觉、音频和文本心理健康 discourse

Mingyue Zha, Ho-Chun Herbert Chang

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本研究提出了一种结合自动多模态特征提取与Shapley值的框架,分析TikTok上关于社交焦虑障碍的视频中视觉、音频和文本如何共同影响观众参与度,揭示了跨模态协同效应的阈值依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01568 2026-01-09 cs.SD cs.AI cs.CV cs.MM eess.AS 83%

MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning

MM-Sonate: 多模态可控音频视频生成与零样本语音克隆

Chunyu Qiang, Jun Wang, Xiaopeng Wang, Kang Yin, Yuxin Guo

机构 * Kuaishou Technology(快手科技)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 MM-Sonate通过统一的指令-音素输入实现可控的音频视频联合生成与零样本语音克隆,显著提升唇形同步和语音可懂度,同时保持与专门文本到语音系统的语音克隆保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13507 2025-12-24 cs.CV 83%

Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model

Seedance 1.5 pro: 一种原生音频视频联合生成基础模型

Team Seedance, Heyi Chen, Siyan Chen, Xin Chen, Yanfei Chen, Ying Chen, Zhuo Chen, Feng Cheng, Tianheng Cheng, Xinqi Cheng, Xuyan Chi, Jian Cong, Jing Cui, Qinpeng Cui, Qide Dong, Junliang Fan, Jing Fang, Zetao Fang, Chengjian Feng, Han Feng, Mingyuan Gao, Yu Gao, Dong Guo, Qiushan Guo, Boyang Hao, Qingkai Hao, Bibo He, Qian He, Tuyen Hoang, Ruoqing Hu, Xi Hu, Weilin Huang, Zhaoyang Huang, Zhongyi Huang, Donglei Ji, Siqi Jiang, Wei Jiang, Yunpu Jiang, Zhuo Jiang, Ashley Kim, Jianan Kong, Zhichao Lai, Shanshan Lao, Yichong Leng, Ai Li, Feiya Li, Gen Li, Huixia Li, JiaShi Li, Liang Li, Ming Li, Shanshan Li, Tao Li, Xian Li, Xiaojie Li, Xiaoyang Li, Xingxing Li, Yameng Li, Yifu Li, Yiying Li, Chao Liang, Han Liang, Jianzhong Liang, Ying Liang, Zhiqiang Liang, Wang Liao, Yalin Liao, Heng Lin, Kengyu Lin, Shanchuan Lin, Xi Lin, Zhijie Lin, Feng Ling, Fangfang Liu, Gaohong Liu, Jiawei Liu, Jie Liu, Jihao Liu, Shouda Liu, Shu Liu, Sichao Liu, Songwei Liu, Xin Liu, Xue Liu, Yibo Liu, Zikun Liu, Zuxi Liu, Junlin Lyu, Lecheng Lyu, Qian Lyu, Han Mu, Xiaonan Nie, Jingzhe Ning, Xitong Pan, Yanghua Peng, Lianke Qin, Xueqiong Qu, Yuxi Ren, Kai Shen, Guang Shi, Lei Shi, Yan Song, Yinglong Song, Fan Sun, Li Sun, Renfei Sun, Yan Sun, Zeyu Sun, Wenjing Tang, Yaxue Tang, Zirui Tao, Feng Wang, Furui Wang, Jinran Wang, Junkai Wang, Ke Wang, Kexin Wang, Qingyi Wang, Rui Wang, Sen Wang, Shuai Wang, Tingru Wang, Weichen Wang, Xin Wang, Yanhui Wang, Yue Wang, Yuping Wang, Yuxuan Wang, Ziyu Wang, Guoqiang Wei, Wanru Wei, Di Wu, Guohong Wu, Hanjie Wu, Jian Wu, Jie Wu, Ruolan Wu, Xinglong Wu, Yonghui Wu, Ruiqi Xia, Liang Xiang, Fei Xiao, XueFeng Xiao, Pan Xie, Shuangyi Xie, Shuang Xu, Jinlan Xue, Shen Yan, Bangbang Yang, Ceyuan Yang, Jiaqi Yang, Runkai Yang, Tao Yang, Yang Yang, Yihang Yang, ZhiXian Yang, Ziyan Yang, Songting Yao, Yifan Yao, Zilyu Ye, Bowen Yu, Jian Yu, Chujie Yuan, Linxiao Yuan, Sichun Zeng, Weihong Zeng, Xuejiao Zeng, Yan Zeng, Chuntao Zhang, Heng Zhang, Jingjie Zhang, Kuo Zhang, Liang Zhang, Liying Zhang, Manlin Zhang, Ting Zhang, Weida Zhang, Xiaohe Zhang, Xinyan Zhang, Yan Zhang, Yuan Zhang, Zixiang Zhang, Fengxuan Zhao, Huating Zhao, Yang Zhao, Hao Zheng, Jianbin Zheng, Xiaozheng Zheng, Yangyang Zheng, Yijie Zheng, Jiexin Zhou, Jiahui Zhu, Kuan Zhu, Shenhan Zhu, Wenjia Zhu, Benhui Zou, Feilong Zuo

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 Seedance 1.5 pro是一款专为原生音频视频联合生成设计的基础模型,通过双分支扩散变压器架构实现高质量生成,支持多语言唇形同步和动态摄像机控制,提升专业内容创作效率。

Comments Seedance 1.5 pro Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18575 2025-12-23 cs.LG cs.AI cs.NE 83%

Modality-Dependent Memory Mechanisms in Cross-Modal Neuromorphic Computing

跨模态类脑计算中的模态依赖性记忆机制

Effiong Blessing, Chiung-Yi Tseng, Somshubhra Roy, Junaid Rehman, Isaac Nkrumah

机构 * 1 Department of Computer Science, Saint Louis University, St. Louis, MO, USA 2 Luxmuse AI, USA 3 Department of Electrical Computer Engineering, North Carolina State University, Raleigh, NC, USA 4 Independent Researcher 5 Department of Computer Science, Saint Louis University, St. Louis, MO, USA Email

专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文首次探讨了跨模态类脑计算中记忆机制的模态依赖性,通过实验揭示了不同架构在视觉与听觉任务中的性能差异,并验证了并行架构在能效提升方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17474 2025-12-22 eess.AS cs.SD 83%

Zero-Shot Recognition of Dysarthric Speech Using Commercial Automatic Speech Recognition and Multimodal Large Language Models

基于商业自动语音识别和多模态大语言模型的口吃语音零样本识别

Ali Alsayegh, Tariq Masood

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 eess.AS

AI总结 本研究评估了商业ASR和MLLM在口吃语音识别中的性能,发现GPT-4o在重度口吃情况下显著降低WER,而Gemini变体表现下降,为辅助语音接口技术选择提供实证依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16250 2025-12-19 cs.AI cs.MA 83%

AMUSE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding

AMUSE:面向代理多说话者理解的音频-视觉基准与对齐框架

Sanjoy Chowdhury, Karren D. Yang, Xudong Liu, Fartash Faghri, Pavan Kumar Anasosalu Vasu, Oncel Tuzel, Dinesh Manocha, Chun-Liang Li, Raviteja Vemulapalli

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Apple(苹果公司)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 AMUSE提出一个面向多说话人理解的音频-视觉基准与对齐框架RAFT,通过代理推理提升多模态模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22447 2025-12-16 cs.MM 83%

Angle-Optimized Partial Disentanglement for Multimodal Emotion Recognition in Conversation

对话中多模态情感识别的视角优化部分解耦

Xinyi Che, Wenbo Wang, Yuanbo Hou, Mingjie Xie, Qijun Zhao, Jian Guan

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出AO-FL框架,通过自适应角度优化实现对话中多模态情感识别的共享与特定特征部分解耦,提升情感识别性能。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05745 2025-12-08 cs.CR cs.MM 83%

ARGUS: Defending Against Multimodal Indirect Prompt Injection via Steering Instruction-Following Behavior

ARGUS: 通过引导指令遵循行为防御多模态间接提示注入攻击

Weikai Lu, Ziqian Zeng, Kehua Zhang, Haoran Li, Huiping Zhuang, Ruidong Wang, Cen Chen, Hao Peng

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.MM

AI总结 ARGUS通过引导指令遵循行为,在表示空间中寻找最优防御方向,实现对多模态间接提示注入攻击的有效防御,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06434 2025-12-02 cs.CL cs.AI cs.MM cs.SD eess.AS 83%

Whispering LLaMA: A Cross-Modal Generative Error Correction Framework for Speech Recognition

Whispering LLaMA: 一种用于语音识别的跨模态生成性错误校正框架

Srijith Radhakrishnan, Chao-Han Huck Yang, Sumeer Ahmad Khan, Rohit Kumar, Narsis A. Kiani, David Gomez-Cabrero, Jesper N. Tegner

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 Whispering LLaMA通过跨模态融合技术提升语音识别的生成性错误校正性能,相较n-best假设提升37.66%的词错误率。

Comments Accepted to EMNLP 2023 as main paper. 10 pages. Revised math notations. GitHub: https://github.com/Srijith-rkr/Whispering-LLaMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16901 2025-12-01 cs.CV 83%

R-AVST: Empowering Video-LLMs with Fine-Grained Spatio-Temporal Reasoning in Complex Audio-Visual Scenarios

R-AVST:通过细粒度时空推理增强视频大语言模型以应对复杂音频视觉场景

Lu Zhu, Tiantian Geng, Yangye Chen, Teng Wang, Ping Lu, Feng Zheng

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 R-AVST通过细粒度时空推理提升视频大语言模型,构建首个真实世界音频视觉时空推理数据集,并提出AVST-Zero模型增强推理能力。

Comments Accepted by AAAI 2026. Project page: https://github.com/zhlllau/R-AVST

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18993 2025-11-25 cs.CV 83%

AuViRe: Audio-visual Speech Representation Reconstruction for Deepfake Temporal Localization

AuViRe:用于深度伪造时间定位的音频视觉语音表示重建

Christos Koutlis, Symeon Papadopoulos

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 AuViRe 通过音频视觉语音表示重建技术,提升深度伪造时间定位的准确性,实验结果显示在多个数据集上均优于现有方法。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08642 2025-11-13 eess.IV cs.MM cs.SD 83%

Robust Multi-modal Task-oriented Communications with Redundancy-aware Representations

Jingwen Fu, Ming Xiao, Zhonghao Lyu, Mikael Skoglund, Celimuge Wu

机构 * School of Electrical Engineering and Computer Science (EECS), KTH Royal Institute of Technology(电气工程与计算机科学学院(EECS),皇家理工学院) Department of Computer and Network Engineering, The University of Electro-Communications(计算机与网络工程系,东京电讯大学)

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19549 2025-10-28 cs.CV 83%

DEEMO: De-identity Multimodal Emotion Recognition and Reasoning

Deng Li, Bohao Xing, Xin Liu, Baiqiang Xia, Bihan Wen, Heikki Kälviäinen

机构 * Lappeenranta-Lahti University of Technology LUT(拉普兰塔-拉赫蒂技术大学) Nanyang Technological University(南洋理工大学) Brno University of Technology(布拉格技术大学)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ACMMM 2025

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12995 2025-10-27 eess.AS cs.SD 83%

Continuous-Token Diffusion for Speaker-Referenced TTS in Multimodal LLMs

Xinlu He, Swayambhu Nath Ray, Harish Mallidi, Jia-Hong Huang, Ashwin Bellur, Chander Chandak, M. Maruf, Venkatesh Ravichandran

机构 * Worcester Polytechnic Institute(沃斯特理工大学) Amazon AGI(亚马逊人工智能实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20223 2025-10-24 cs.CR cs.MM 83%

Beyond Text: Multimodal Jailbreaking of Vision-Language and Audio Models through Perceptually Simple Transformations

Divyanshu Kumar, Shreyas Jena, Nitin Aravind Birur, Tanay Baswa, Sahil Agarwal, Prashanth Harshangi

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23155 2025-10-24 cs.CV 83%

PreFM: Online Audio-Visual Event Parsing via Predictive Future Modeling

Xiao Yu, Yan Fang, Xiaojie Jin, Yao Zhao, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(信息科学学院,北京交通大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV

Comments This paper is accepted by 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16122 2025-10-22 cs.CL 83%

Text Takes Over: A Study of Modality Bias in Multimodal Intent Detection

Ankan Mullick, Saransh Sharma, Abhik Jana, Pawan Goyal

机构 * IIT Kharagpur, India(印度理工学院Kharagpur) Adobe Research, India(Adobe研究) IIT Bhubaneswar, India(印度理工学院Bhubaneswar)

专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CL

Comments EMNLP 2025 Main Conference Full Paper

Journal ref EMNLP 2025 Main Conference Full Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01181 2025-10-14 cs.AI cs.CV cs.MM cs.SD eess.AS 83%

Benchmarking and Bridging Emotion Conflicts for Multimodal Emotion Reasoning

Zhiyuan Han, Beier Zhu, Yanlong Xu, Peipei Song, Xun Yang

机构 * University of Science and Technology of China(科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

Comments ACM Multimedia 2025 Oral Code: https://github.com/ZhiyuanHan-Aaron/MoSEAR Project Page: https://zhiyuanhan-aaron.github.io/MoSEAR-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08492 2025-10-10 cs.LG cs.CV 83%

Better Together: Leveraging Unpaired Multimodal Data for Stronger Unimodal Models

Sharut Gupta, Shobhita Sundaram, Chenyu Wang, Stefanie Jegelka, Phillip Isola

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) TU Munich(慕尼黑技术大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments 63 pages, 29 tables, and 47 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16296 2025-10-07 cs.AI 83%

Cross-Modal Distillation For Widely Differing Modalities

Cairong Zhao, Yufeng Jin, Zifan Song, Haonan Chen, Duoqian Miao, Guosheng Hu

机构 * Department of Computer Science & Technology, Tongji University(计算机科学与技术系,同济大学) Alibaba Group(阿里巴巴集团) Oosto

专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.AI

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00050 2025-10-02 cs.MM cs.AI cs.CV cs.SD eess.AS 83%

Object-AVEdit: An Object-level Audio-Visual Editing Model

Youquan Fu, Ruiyang Si, Hongfa Wang, Dongzhan Zhou, Jiacheng Sun, Ping Luo, Di Hu, Hongyuan Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究院) China Telecom(中国电信) Gaoling School of Artificial Intelligence(东城区人工智能学院) Renmin University of China(中国人民大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tencent Data Platform(腾讯数据平台) Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Huawei Noah’s Ark Lab(华为诺亚实验室) The University of Hong Kong(香港大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24322 2025-09-30 cs.CL 83%

Multimodal Large Language Models Meet Multimodal Emotion Recognition and Reasoning: A Survey

Yuntao Shou, Tao Meng, Wei Ai, Keqin Li

机构 * Central South University of Forestry and Technology(林业科技大学) State University of New York(纽约州立大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

Comments 35 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23251 2025-09-30 cs.MM cs.SD 83%

XGC-AVis: Towards Audio-Visual Content Understanding with a Multi-Agent Collaborative System

Yuqin Cao, Xiongkuo Min, Yixuan Gao, Wei Sun, Zicheng Zhang, Jinliang Han, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02247 2025-09-30 cs.CV 83%

EgoVIS@CVPR: PAIR-Net: Enhancing Egocentric Speaker Detection via Pretrained Audio-Visual Fusion and Alignment Loss

Yu Wang, Juhyung Ha, David J. Crandall

机构 * Indiana University(印第安纳大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

Comments 4 pages, 1 figure, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20140 2025-09-25 cs.MM cs.SD 83%

InconVAD: A Two-Stage Dual-Tower Framework for Multimodal Emotion Inconsistency Detection

Zongyi Li, Junchuan Zhao, Francis Bu Sung Lee, Andrew Zi Han Yee

机构 * Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学交叉学科研究生项目) School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) Wee Kim Wee School of Communication and Information, Nanyang Technological University, Singapore(南洋理工大学魏克伟通信与信息学院)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

Comments 5 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17711 2025-09-23 cs.AI 83%

DA-Mamba: Dialogue-aware selective state-space model for multimodal engagement estimation

Shenwei Kang, Xin Zhang, Wen Liu, Bin Li, Yujie Liu, Bo Gao

机构 * Communication University of China(中国通信大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院) School of Information Engineering, Beijing Institute of Graphic Communication(北京印刷学院信息工程学院)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16924 2025-09-23 cs.AI cs.SD 83%

Audio-Guided Dynamic Modality Fusion with Stereo-Aware Attention for Audio-Visual Navigation

Jia Li, Yinfeng Yu, Liejun Wang, Fuchun Sun, Wendong Zheng

机构 * Xinjiang Multimodal Intelligent Processing and Information Security Engineering Technology Research Center(新疆多模态智能处理与信息安全工程技术创新中心) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Electrical Engineering and Automation, Tianjin University of Technology(天津理工大学电气工程与自动化学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.AI

Comments Main paper (14 pages). Accepted for publication by ICONIP( International Conference on Neural Information Processing) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13395 2025-09-18 eess.AS cs.AI cs.CL cs.LG cs.MM 83%

TICL: Text-Embedding KNN For Speech In-Context Learning Unlocks Speech Recognition Abilities of Large Multimodal Models

Haolong Zheng, Yekaterina Yegorova, Mark Hasegawa-Johnson

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏