arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4549 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4549 篇

2512.12772 2026-05-15 cs.MM cs.CV 84%

JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation

JointAVBench: 一个用于联合音频视觉推理评估的基准测试

Jianghan Chao, Jianzhang Gao, Wenhui Tan, Yuchong Sun, Ruihua Song, Liyun Ru

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学香樟人工智能学院) Baichuan Inc(百川科技)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出JointAVBench基准测试,旨在评估多模态大语言模型在联合音频视觉推理中的表现,涵盖多模态依赖、多类音频信息和不同场景跨度,通过自动化流程生成问题并评估不同模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23744 2026-05-01 cs.CL cs.AI 84%

Compose and Fuse: Revisiting the Foundational Bottlenecks in Multimodal Reasoning

组合与融合:重新审视多模态推理中的基础瓶颈

Yucheng Wang, Yifan Hou, Aydin Javadov, Mubashara Akhtar, Mrinmaya Sachan

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文通过逻辑基础评估框架,发现多模态推理中模态交互的六个模式影响推理效果,指出任务组合和融合是主要瓶颈,提出通过分步提示和早融控制提升推理性能。

Comments Our code (https://github.com/DELTA-DoubleWise/OmniReason) and data (https://huggingface.co/datasets/ycwang11/OmniReason) are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08618 2026-04-28 eess.AS cs.CV cs.SD 84%

VAPO: End-to-end Slide-Enhanced Speech Recognition with Omni-modal Large Language Models

VAPO:基于多模态大语言模型的端到端幻灯片增强语音识别

Rui Hu, Delai Qiu, Yining Wang, Shengping Liu, Jitao Sang

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室) Unisound AI Technology Co., Ltd.(Unisound人工智能技术有限公司) State Key Laboratory of AI Safety, Beijing(人工智能安全国家重点实验室)

专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS

AI总结 VAPO通过多目标强化学习优化多模态大语言模型,解决视觉干扰问题,提升幻灯片增强语音识别的准确率和领域专用实体识别性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14170 2026-04-14 cs.CV cs.AI cs.ET 84%

Progressive Multimodal Interaction Network for Reliable Quantification of Fish Feeding Intensity in Aquaculture

渐进多模态交互网络用于水产养殖中鱼摄食强度的可靠量化

Shulong Zhang, Mingyuan Yao, Jiayin Zhao, Daoliang Li, Yingyi Chen, Haihua Wang

机构 * National Innovation Center for Digital Fishery(国家数字渔业创新中心) Key Laboratory of Smart Farming Technologies for Aquatic Animal and Livestock, Ministry of Agriculture and Rural Affairs(农业农村部水产动物与畜禽智慧养殖技术重点实验室) State Key Laboratory of Efficient Utilization of Agricultural Water Resources(农业水资源高效利用全国重点实验室) Beijing Engineering and Technology Research Center for Internet of Things in Agriculture(北京市农业物联网工程技术研究中心) Key Laboratory of Digital Fisheries of Shandong Province(山东省数字渔业重点实验室) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出渐进多模态交互网络PMIN,通过整合图像、音频和水波数据,有效解决多模态数据不一致性和决策冲突问题,提升鱼摄食强度量化可靠性,实验表明其在精度、参数和计算成本上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02231 2026-04-13 cs.CV cs.AI cs.LG 84%

See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models

看见、听见与理解:多模态大语言模型中人类语音理解基准测试

Le Thien Phuc Nguyen, Zhuoran Yu, Samuel Low Yu Hang, Subin An, Jeongik Lee, Yohan Ban, SeungEun Chung, Thanh-Huy Nguyen, JuWan Maeng, Soochahn Lee, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Kookmin University(国民大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AV-SpeakerBench基准测试,通过3212道多选题评估多模态大语言模型在真实视频中对语音的细粒度理解能力,发现Gemini 2.5 Pro在音频视觉融合方面表现最佳。

Comments Findings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02391 2026-04-06 cs.SD cs.AI eess.AS 84%

Reliability-Aware Geometric Fusion for Robust Audio-Visual Navigation

可靠性感知的几何融合用于鲁棒的音频视觉导航

Teng Liu, Yinfeng Yu

机构 * Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学联合具身智能研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语种认知计算联合国际研究实验室) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出RAVN框架,通过音频衍生的可靠性线索条件跨模态融合,动态校准音频和视觉输入的整合,引入Acoustic Geometry Reasoner和Reliability-Aware Geometric Modulation,提升复杂环境下的导航性能。

Comments Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02389 2026-04-06 cs.SD cs.AI eess.AS 84%

Audio Spatially-Guided Fusion for Audio-Visual Navigation

音频空间引导融合用于音频视觉导航

Xinyu Zhou, Yinfeng Yu

机构 * Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学联合研究实验室,具身智能) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出一种音频空间引导融合方法,通过自适应提取空间状态信息,实现多模态特征动态对齐与融合,提升在未知声源分布下的导航泛化能力。

Comments Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14992 2026-03-17 cs.AI cs.MM 84%

Exposing Cross-Modal Consistency for Fake News Detection in Short-Form Videos

揭示短视频中跨模态一致性以检测虚假新闻

Chong Tian, Yu Wang, Chenxu Yang, Junyi Guan, Zheng Lin, Yuhan Liu, Xiuying Chen, Qirong Ho

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽亚德人工智能大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出MAGIC3模型,通过多粒度跨模态一致性建模提升虚假新闻检测性能,实现高准确率与低成本的平衡。

Comments 16 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08483 2026-03-11 cs.CV cs.AI cs.LG 84%

X-AVDT: Audio-Visual Cross-Attention for Robust Deepfake Detection

X-AVDT:用于鲁棒深度伪造检测的音频视觉交叉注意力

Youngseo Kim, Kwan Yun, Seokhyeon Hong, Sihun Cha, Colette Suhjung Koo, Junyong Noh

机构 * Visual Media Lab, KAIST(韩国科学技术院视觉媒体实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 X-AVDT通过利用生成器内部的音频视觉一致性线索,提出了一种鲁棒且具有通用性的深度伪造检测方法,有效提升了检测性能。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05275 2026-03-06 cs.MM cs.CL cs.SD 84%

SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning

SarcasmMiner:一种双轨后训练框架,用于鲁棒的音频视觉讽刺推理

Zhu Li, Yongjian Chen, Huiyuan Lai, Xiyuan Gao, Shekhar Nayak, Matt Coler

机构 * Speech Technology Lab, University of Groningen, The Netherlands(格罗宁根大学语音技术实验室,荷兰) Center for Language and Cognition, University of Groningen, The Netherlands(格罗宁根大学语言与认知中心,荷兰)

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.MM

AI总结 SarcasmMiner通过双轨蒸馏和组相对策略优化提升多模态讽刺检测性能,实现F1值显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03811 2026-03-05 cs.SD cs.MM eess.AS 84%

Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement

鲁棒的基于大语言模型的音频视觉语音识别与稀疏模态对齐和视觉单元引导的细化

Fei Su, Cancan Li, Juan Liu, Wei Ju, Hongbin Suo, Ming Li

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) School of Artificial Intelligence, Wuhan University, China(武汉大学人工智能学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) AI Center, OPPO, China(OPPO人工智能中心) Digital Innovation Research Center, Duke Kunshan University, China(杜克大学昆山数字创新研究中心)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM、eess.AS

AI总结 本文提出AVUR-LLM,通过稀疏模态对齐和视觉单元引导细化,提升音频视觉语音识别的鲁棒性,在LRS3数据集上取得显著性能提升。

Comments submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08133 2026-03-03 cs.CV cs.AI 84%

How Do Optical Flow and Textual Prompts Collaborate to Assist in Audio-Visual Semantic Segmentation?

光学流和文本提示如何协作以辅助音频视觉语义分割?

Yujian Lee, Peng Gao, Yongqi Xu, Wentao Fan

机构 * Hong Kong Baptist University(香港 Baptist 大学) Guangdong Provincial/Zhuhai Key Laboratory IRADS(广东省级/珠海关键实验室 IRADS) Department of Computer Science, Beijing Normal-Hong Kong Baptist University, Zhuhai, China(计算机科学系,北京师范大学-香港 Baptist 大学,珠海,中国) Peking University, Shenzhen Graduate School, Shenzhen, China(北京大学,深圳研究生院,深圳,中国)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 SSP通过整合光学流和文本提示,提升音频视觉语义分割的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04326 2026-03-03 cs.CV cs.AI 84%

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

WorldSense: 评估多模态大语言模型的现实世界多模态理解

Jack Hong, Shilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Weidi Xie

机构 * Xiaohongshu Inc.(小红书公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 WorldSense是首个评估多模态大语言模型现实世界多模态理解能力的基准,通过多模态协作、多样化视频任务和高质量标注,全面评估模型在复杂场景中的表现。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23994 2026-03-02 cs.LG cs.AI cs.CV 84%

MINT: Multimodal Imaging-to-Speech Knowledge Transfer for Early Alzheimer's Screening

MINT:多模态影像到语音知识迁移用于早期阿尔茨海默病筛查

Vrushank Ahire, Yogesh Kumar, Anouck Girard, M. A. Ganaie

机构 * Department of CSE, Indian Institute of Technology Ropar(印度理工学院罗帕尔计算机科学与工程系) Embry-Riddle Aeronautical University(埃姆布里-瑞尔德航空大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MINT通过多模态知识迁移,利用MRI生物标志物提升语音识别的阿尔茨海默病早期筛查性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22659 2026-02-27 cs.CV cs.MM 84%

Scaling Audio-Visual Quality Assessment Dataset via Crowdsourcing

通过众包扩大音频-视觉质量评估数据集

Renyu Yang, Jian Jin, Lili Meng, Meiqin Liu, Yilin Wang, Balu Adsumilli, Weisi Lin

机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) School of Information Science and Engineering, Shandong Normal University(信息科学与工程学院,山东师范大学) Institute of Information Science, Beijing Jiao Tong University(信息科学研究院,北京交通大学) YouTube Media Algorithms team, Google Inc.(YouTube媒体算法团队,谷歌公司)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出了一种通过众包扩大音频-视觉质量评估数据集的方法,通过设计实验框架、系统化数据准备和扩展标注,构建了最大的多样化AVQA数据集,用于多模态感知研究。

Comments Accepted to ICASSP 2026. 5 pages (main paper) + 8 pages (supplementary material)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17599 2026-02-20 cs.CV cs.MM cs.SD 84%

Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment

Art2Mus: 通过视觉条件和大规模跨模态对齐进行艺术品到音乐生成

Ivan Rinaldi, Matteo Mendula, Nicola Fanelli, Florence Levé, Matteo Testi, Giovanna Castellano, Gennaro Vessio

机构 * University of Bari Aldo Moro(巴里大学阿尔多·莫罗大学) Catalonia's Telecommunications Technology Centre(加泰罗尼亚电信技术中心) University of Picardie Jules Verne(皮卡第大学朱利·瓦内大学)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 ArtToMus通过直接视觉条件生成音乐,无需图像到文本转换,实现艺术品到音乐的跨模态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11129 2026-02-04 cs.CV cs.AI 84%

video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM

视频-SALMONN S:内存增强的流式音频视觉大语言模型

Guangzhi Sun, Yixuan Li, Xiaodong Wu, Yudong Yang, Wei Li, Zejun Ma, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 视频-SALMONN S通过引入测试时训练机制,实现高效流式视频理解,显著提升长视频任务的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22603 2026-01-28 eess.AS cs.CV cs.SD 84%

Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs

利用大语言模型缓解音频视觉语音识别中的注意力下沉和大规模激活

Anand, Umberto Cappellazzo, Stavros Petridis, Maja Pantic

机构 * University of British Columbia, Canada(不列颠哥伦比亚大学) Imperial College London, UK(伦敦帝国学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS

AI总结 本文提出了一种简单有效的去相关损失,通过减少BOS与其它token的余弦相似性,缓解音频视觉语音识别中的注意力下沉和大规模激活问题,同时在高下采样率下降低词错误率。

Comments IEEE ICASSP 2026. The code is available at https://github.com/umbertocappellazzo/Llama-AVSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16994 2026-01-23 eess.AS cs.MM eess.IV 84%

Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention

关注式AV融合网络:基于混合注意力的音频-视觉质量预测

Ina Salaj, Arijit Biswas

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM、eess.AS

AI总结 本文提出一种结合学习音频特征和手工设计视频特征的混合注意力模型,用于提升音频-视觉质量预测的准确性和鲁棒性。

Comments Accepted to 51st IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 04-08 May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11995 2026-01-21 cs.MM cs.AI cs.IR cs.LG cs.SD 84%

Learning Audio-Visual Embeddings with Inferred Latent Interaction Graphs

通过推断的潜在交互图学习音频-视觉嵌入

Donghuo Zeng, Hao Niu, Yanan Wang, Masato Taya

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出通过推断的潜在交互图学习音频-视觉嵌入,以提升嵌入学习的鲁棒性和语义一致性。

Comments 16 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09385 2026-01-15 cs.SD cs.CL cs.MM 84%

SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing

SLAM-LLM: 一种模块化、开源的多模态大语言模型框架及语音、语言、音频和音乐处理的最佳实践

Ziyang Ma, Guanrou Yang, Wenxi Chen, Zhifu Gao, Yexing Du, Xiquan Li, Zhisheng Zheng, Haina Zhu, Jianheng Zhuo, Zheshu Song, Ruiyang Xu, Tiranrui Wang, Yifan Yang, Yanqiao Zhu, Zhikang Niu, Liumeng Xue, Yinghao Ma, Ruibin Yuan, Shiliang Zhang, Kai Yu, Eng Siong Chng, Xie Chen

机构 * X-LANCE Lab, School of Computer Science, MoE Key Lab of Artificial Intelligence Shanghai Jiao Tong University(X-LANCE实验室,计算机科学学院,人工智能教育部重点实验室,上海交通大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Peng Cheng Laboratory(鹏城实验室) University of Texas at Austin(德克萨斯大学奥斯汀分校) Tianjin University(天津大学) Hong Kong University of Science and Technology(香港科学大学) Queen Mary University of London(伦敦玛丽女王大学) Nanyang Technological University(南洋理工大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.MM

AI总结 SLAM-LLM是一种开源多模态大语言模型框架,专注于语音、语言、音频和音乐处理,提供模块化配置和高性能检查点以加速研究开发。

Comments Published in IEEE Journal of Selected Topics in Signal Processing (JSTSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08457 2026-01-14 cs.AI cs.CL 84%

An Under-Explored Application for Explainable Multimodal Misogyny Detection in code-mixed Hindi-English

可解释的多模态 misogyny 检测在混合印地语-英语中的一个未被充分探索的应用

Sargam Yadav, Abhishek Kaushik, Kevin Mc Daid

专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多模态且可解释的网页应用,用于检测混合印地语-英语中的性别歧视,利用Transformer模型和可解释性技术提升透明度和可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07216 2026-01-13 cs.LG cs.MM cs.SD eess.AS 84%

Versatile audio-visual learning for emotion recognition

多功能音频视觉学习用于情绪识别

Lucas Goncalves, Seong-Gyun Leem, Wei-Cheng Lin, Berrak Sisman, Carlos Busso

机构 * Multimodal Signal Processing (MSP) Lab(多模态信号处理实验室) Erik Jonsson School of Engineering and Computer Science(埃里克·乔纳森工程与计算机科学学院) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.MM、eess.AS

AI总结 本文提出VAVL框架,通过共享层和残差连接实现灵活的音频视觉学习,提升情绪识别和预测性能。

Comments 18 pages, 4 Figures, 3 tables (published at IEEE Transactions on Affective Computing)

Journal ref IEEE Transactions on Affective Computing 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10069 2026-01-07 cs.AI cs.MM 84%

SyncLipMAE: Contrastive Masked Pretraining for Audio-Visual Talking-Face Representation

SyncLipMAE:用于音频视觉谈话面部表示的对比掩码预训练

Zeyu Ling, Xiaodong Gu, Jiangnan Tang, Changqing Zou

机构 * State Key Laboratory of CAD&CG(CAD与CG国家重点实验室) ByteDance(字节跳动)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 SyncLipMAE通过对比掩码预训练实现音频视觉谈话面部的同步感知表示,适用于多下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14083 2025-12-17 eess.AS cs.CL cs.LG 84%

Scalable Frameworks for Real-World Audio-Visual Speech Recognition

可扩展的音频视觉语音识别系统框架

Sungnyun Kim

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出了一种可扩展的音频视觉语音识别系统框架,通过分层方法提升模型在现实环境中的鲁棒性和可扩展性。

Comments PhD Dissertation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10963 2025-12-15 cs.IR cs.AI cs.HC cs.LG cs.MM 84%

Emotion-Driven Personalized Recommendation for AI-Generated Content Using Multi-Modal Sentiment and Intent Analysis

基于多模态情感与意图分析的情绪驱动个性化推荐

Zheqi Hu, Xuanjing Chen, Jinlin Hu

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 本研究提出基于多模态情感与意图分析的情绪驱动个性化推荐模型,通过融合视觉、听觉和文本信息提升推荐效果,实验显示在F1得分和损失上均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00115 2025-12-02 cs.SD cs.CV cs.MM 84%

MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning

MoLT:基于层级令牌的高效音频视觉学习

Kyeongha Rho, Hyeongkeun Lee, Jae Won Cho, Joon Son Chung

机构 * KAIST(韩国科学技术院) Sejong University(世宗大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 MoLT通过层级令牌融合提升音频视觉学习效率,采用轻量适应策略和正交正则化,优于现有方法。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01711 2025-11-19 cs.CV cs.AI 84%

GAIS: Frame-Level Gated Audio-Visual Integration with Semantic Variance-Scaled Perturbation for Text-Video Retrieval

Bowen Yang, Yun Cao, Chen He, Xiaosu Su

机构 * School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16343 2025-10-28 cs.SD cs.AI eess.AS 84%

Detect Any Sound: Open-Vocabulary Sound Event Detection with Multi-Modal Queries

Pengfei Cai, Yan Song, Qing Gu, Nan Jiang, Haoyu Song, Ian McLoughlin

机构 * University of Science and Technology of China(科学技术大学) Singapore Institute of Technology(新加坡理工学院)

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI、eess.AS

Comments Accepted by MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00358 2025-10-28 cs.SD cs.AI cs.LG eess.AS 84%

$\texttt{AVROBUSTBENCH}$: Benchmarking the Robustness of Audio-Visual Recognition Models at Test-Time

Sarthak Kumar Maharana, Saksham Singh Kushwaha, Baoming Zhang, Adrian Rodriguez, Songtao Wei, Yapeng Tian, Yunhui Guo

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.AI、eess.AS

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏