arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 218 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 218 篇

2607.03657 2026-07-07 cs.CV cs.AI 新提交 93%

ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation

ViPo-MLLM:用于无注释手语翻译的视觉-姿势多模态大语言模型

Ahmed Abul Hasanaath, Bicheng Xu, Mir Rayat Imtiaz Hossain, Leonid Sigal, Hamzah Luqman

机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油矿物大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(title);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究尝试无注释手语翻译,提出ViPo-MLLM框架结合时空RGB和人体姿势特征,用专用编码器与交叉模态注意力,经结构化提示和训练后由大语言模型处理。该模型在数据集取得新成果,验证了机制有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07531 2026-06-09 cs.CL cs.AI 新提交 93%

mllm-shap: A Shapley Value Explainability Platform for Text-Audio Multimodal Large Language Models

mllm-shap:面向文本-音频多模态大语言模型的Shapley值可解释性平台

Jakub Muszyński, Paweł Pozorski, Maria Ganzha

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出mllm-shap框架,通过模态感知掩码、多轮对话追踪和音素对齐分组技术,将Shapley值可解释性扩展到文本-音频多模态大语言模型,并实现10-50倍的计算加速。

Comments Submitted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03213 2026-07-07 cs.CV cs.AI cs.CL cs.HC 新提交 91%

OpenGlass: A Sensing-Computing Split Architecture for Local MLLM-Driven Real-Time Visual Assistance

OpenGlass:用于本地MLLM驱动的实时视觉辅助的传感-计算分离架构

Mengzhang Li, Yuan Yao

机构 * Shanghai Qizhi Institute(上海期智研究院) College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对视障和低视力用户,OpenGlass以传感-计算分离解决云MLLM辅助需上传数据、有网络延迟,以及可穿戴眼镜计算和电量受限问题,在本地设备实现低延迟多模态视觉辅助,并给出评估结果。

Comments Accepted to ACL 2026 System Demonstrations. 11 pages, 5 figures, 8 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations), pages 829-839, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10412 2026-08-12 cs.HC cs.CY 新提交 90%

When the Interviewer Is a Bot: Behavior, Breakdowns, and Trust in MLLM-Led Interviews

当面试官是机器人时:多模态大语言模型(MLLM)主导的面试中的行为、故障与信任

He Zhang, Kambinachi Chukwuma, ChanMin Kim, John M. Carroll

专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(abstract)

AI总结 该研究通过构建InterviewBot系统开展实证研究,分析了MLLM主导面试的行为、故障与社会动态,为以人为中心的面试自动化提供设计启示。

Comments Accepted to ACM HCOMP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12820 2026-07-15 cs.CV 新提交 90%

AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

AVSCap:为全模态视频字幕编排视听协同

Yanghai Wang, Jiahao Wang, Jiafu Tang, Yuanxing Zhang, Zhe Cao, Hanyan Bian, Zijie Zhang, Weiliang Luo, Zhiyu Pan, Zixuan Dong, Jiaheng Liu, Zhaoxiang Zhang

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title,abstract);multimodal(abstract);cross-modal(abstract)

AI总结 研究全模态视频字幕编排视听协同问题,提出AVSCap框架,构建训练语料库,采用两阶段策略训练字幕生成器,引入新基准,实验表明该模型在非语音音频覆盖率和跨模态绑定方面表现出色,提升了整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14786 2026-06-16 cs.MM cs.AI cs.CV 新提交 89%

MatchLM2Lite: A Scalable MLLM-to-Lite Framework for Reproduced Content Identification

MatchLM2Lite: 一种可扩展的MLLM-to-Lite框架用于重复内容识别

Xiaotian Fan, Hiok Hian Ong, David Yuchen Wang, Zirui Zhu, Kanchan Sarkar, Kun Xu

机构 * Tiktok(字节跳动) National University of Singapore School of Computing(新加坡国立大学计算机学院)

专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出MatchLM2Lite框架,通过将多模态大语言模型蒸馏为轻量模型,实现视频、音频和文本联合建模的实时重复内容识别,在降低35倍计算成本的同时保持高准确率,并成功部署于大规模生产环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29112 2026-08-03 cs.SD cs.AI 新提交 89%

DoubleHelix: Structured Cross-Modal Fusion for Audio-Visual Speech Recognition with LLMs

DoubleHelix:结合大语言模型的视听语音识别结构化跨模态融合方法

Ziwei Cheng, Zhenhua Tan, Zhuomin Zhu

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 该研究针对视听语音识别跨模态融合缺乏结构化迭代优化的问题,提出DoubleHelix融合框架,通过三个组件实现迭代交互与退化感知增强,在LRS3数据集上大幅降低词错误率并提升噪声鲁棒性。

Comments ACM MM2026 ACCEPTED

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04472 2026-07-07 cs.CV 新提交 89%

EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration

EVAS:通过视听协同和引导边界校准实现高效多模态时间伪造定位

Shen Shen, Quan Zhang, Dan Jiang, Ke Zhang

机构 * Soochow University(苏州大学) Tsinghua University(清华大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对人工智能生成内容带来的多模态取证挑战,提出EVAS框架,利用多阶段视听协同机制和边界感知细化策略,结合解耦训练范式与轻量级网络,有效定位长视频中稀疏分布的伪造片段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10448 2026-08-12 cs.AI 新提交 89%

Rationale-Guided Learning for Multimodal Emotion Recognition

基于理由引导学习的多模态情感识别

Sujung Oh, Jung Uk Kim, Sangmin Lee

专题命中 音频语音多模态 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态情感识别忽略人类因果推理的问题,提出理由引导学习框架,结合双加工理论与MLLM生成的理由训练模型,在IEMOCAP和MELD基准取得最优性能,且推理无额外开销。

Comments ICASSP 2026

Journal ref S. Oh, J. U. Kim and S. Lee, "Rationale-Guided Learning for Multimodal Emotion Recognition," ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026, pp. 12577-12581

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11329 2026-08-13 cs.SD cs.CV cs.MM 新提交 88%

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

Qwen-MusicAVQA-7B:一种用于音乐音频-视觉问答的多模态模型

Maryam Dehdashti

机构 * Inference Matter Labs(推理物质实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(title);omni-modal(abstract);分类 cs.CV、cs.MM

AI总结 该研究提出轻量级多模态模型Qwen-MusicAVQA-7B,通过连接冻结的Whisper编码器与Qwen2-VL-7B-Instruct,在MUSIC-AVQA等基准上实现高准确率,训练成本低,且发现音频时间信息保留程度影响下游问答准确率。

Comments 24 pages, 1 figure, 8 tables. Code: https://github.com/MKDehdashti/Qwen2-vl-audio Checkpoints: https://huggingface.co/MayaKD/qwen2-vl-audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08231 2026-06-09 cs.CV 新提交 88%

Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning

多模态基础模型中的测试时扩展:生成与推理的综合调查

Cong Wan, Ying He, Zhongzhan Huang, Hefeng Wu

机构 * Sun Yat-sen University(中山大学)

专题命中 音频语音多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV

AI总结 本文首次系统综述多模态基础模型中的测试时扩展(TTS)方法,提出统一分类框架(采样、反馈、搜索三类),总结应用与基准,并讨论未来方向。

Comments Accepted by ACL 2026, Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07923 2026-08-11 cs.CV cs.MM cs.SD 新提交 87%

SCoPE: Training-Free Audio-Visual Event Perception via Sparse Cross-Modal Prior Exchange

SCoPE:基于稀疏跨模态先验交换的无训练视听事件感知

Jaemo Jeong, Junho Yoon, Hyunju Kim, Dongman Lee

机构 * KAIST(韩国科学技术院)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(title);分类 cs.CV、cs.MM

AI总结 针对无训练视听事件感知的虚假共激活问题,提出SCoPE框架,通过跨模态标签竞争消除FCA,在LLP等数据集上显著提升性能且可直接迁移。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05495 2026-08-07 cs.CR cs.HC 新提交 87%

PromptShield Home: Ambient Multimodal Prompt Injection Defense for Smart-Home Agents

PromptShield Home:面向智能家居智能体的环境多模态提示注入防御方案

He Zhang, Feilong Li, Dingning Long, Yilin Cui, Peijun Zhang, Yuewen Zhang, Qianyao Xu, Xinyi Fu

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);audio-visual(abstract)

AI总结 该研究针对智能家居智能体的提示注入安全问题,构建了现实场景基准测试PromptShield-Home,对比了三类防御层的性能,发现多智能体调解的上限性能最优,提出应采用学习路由与传感器融合方案保障安全。

Comments This work has been accepted as a poster to UbiComp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07907 2026-07-10 cs.LG cs.AI cs.CL cs.CR cs.MM 新提交 87%

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

跨视觉、语言、视频和音频的多模态遗忘:方法、数据集和基准的综述

Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu, Vaidehi Patil

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 综述跨视觉、语言、音频和视频的多模态遗忘,基于相关进展等提供统一视角,通过分类法系统比较模型架构和模态,阐明权衡,强调开放问题与实际考虑,支持未来研究与部署,并发布存储库。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07643 2026-06-09 cs.CV cs.AI cs.SD eess.AS 新提交 87%

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

AVI-Bench:迈向全模态大语言模型的人类级视听智能

Yaoting Wang, Ziyi Zhang, Wenming Tu, Shaoxuan Xu, Wenjie Du, Cheng Liang, Weijun Wang, Yuanchao Li, Guangyao Li, Hao Fei, Yuanchun Li, Henghui Ding, Yunxin Liu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、eess.AS

AI总结 提出AVI-Bench基准,通过感知、理解、推理三阶段跨模态任务评估全模态大语言模型的视听智能,并引入AVI-Bench-PriSe测试原始视听感知,揭示当前模型局限,构建四级AVI分类体系。

Comments 31 pages, 8 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09435 2026-08-11 cs.AI 新提交 86%

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

听、看与跟踪:面向全模态大模型的时空视听声音事件推理

Zhi Zeng, Cheng Zhang, Zesheng Yang, Rendong Pi, Jiaying Wu, Di Zhang, Zihan Ma, Guodong Li, Zhou Yang, Yu Xiang, Yifei Zheng, Minnan Luo

专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title);分类 cs.AI

AI总结 针对现有模型缺失的时空视听推理能力,构建ST-OmniQA基准,提出ST-Omni-R1模型,在该基准上平均语义准确率达77.83%,且空间运动表示可跨基准迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08794 2026-08-11 cs.AI cs.MM cs.SD 新提交 86%

Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs

面向全模态大语言模型(Omni-LLMs)的基于局部视听动态的延迟音频剪枝方法

Kyeongyoon Lee, Hongyeob Kim, Youngeun Kim, Sungeun Hong

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);omni-modal(abstract);分类 cs.AI、cs.MM

AI总结 针对全模态大语言模型的高开销问题,提出两阶段框架A-PACK,利用局部视听动态延迟音频剪枝,在Qwen2.5-Omni基准上实现性能最优,同时大幅降低预填充开销并提升解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16107 2026-07-20 eess.AS cs.CV 新提交 86%

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

视听火烈鸟:用于长而复杂视频的开放视听智能

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon Kim, Sungwon Kim, S Sakshi, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

机构 * NVIDIA, USA(美国NVIDIA公司) University of Maryland, USA(美国马里兰大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CV、eess.AS

AI总结 研究提出视听火烈鸟,用于长复杂视频的联合理解与推理。贡献包括构建大规模视频集、设计三阶段课程及推理框架。实验显示其在多基准测试中表现优异,超越同类开放模型,在长复杂视听理解推理任务中竞争力强,有现实应用价值和泛化能力。

Comments Project Page: https://avflamingo.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15295 2026-07-20 cs.MM cs.AI cs.LG cs.SD 新提交 86%

AV-JEPA: Extending LeJEPA to Audio-Visual Self-Supervised Learning

AV-JEPA:将LeJEPA扩展到视听自监督学习

Benjamin Robson, Santeri Mentu, Wenshuai Zhao, Arno Solin

机构 * ELLIS Institute Finland(芬兰ELLIS研究所) Department of Computer Science, Aalto University, Espoo, Finland(艾尔沃斯大学计算机科学系)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 研究将LeJEPA扩展到视听自监督学习,核心方法是用早期融合视觉Transformer和模态丢弃作掩码训练模型对齐视图嵌入,主要贡献是实现跨模态对齐,架构简洁,在分类任务中有竞争力且支持零样本音频-视频检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20579 2026-07-24 cs.CR 新提交 86%

Deepfake News Detection: A Multimodal Framework Integrating LipNet, DeepSpeech and ResNET for Enhanced Audio-Visual Analysis

深度伪造新闻检测:一种集成LipNet、DeepSpeech和ResNET的多模态框架用于增强视听分析

Ameena Khan, Muhammad Ahsan Aziz, Muhammad Junaid Asif, Naeem Akhter, Rana Fayyaz Ahmad

专题命中 音频语音多模态 :multimodal(title);audio-visual(title);multi-modal(abstract)

AI总结 针对深度伪造新闻威胁数字新闻媒体真实性的问题,提出集成LipNet、DeepSpeech和ResNET的多模态框架,从音频和视觉线索提取特征,经多种模型分类,实验表明该方法准确率达94%,优于基线,具鲁棒性和实际潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13239 2026-08-14 cs.CV 新提交 85%

Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?

社会视听问答的推理:我们处于什么阶段?

Koen P. de Vries, Xavier Alameda-Pineda, Estefanía Talavera, Stéphane Lathuilière

机构 * Inria(法国国家信息与自动化研究所) Univ. Grenoble Alpes(格勒诺布尔大学) CNRS(法国国家科学研究中心) University of Twente(特文特大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract,abstract_cn);分类 cs.CV

AI总结 本文针对社会视听问答研究,发现IntentBench存在高噪声,Vanilla SFT基线性能优于现有推理方法,仅用文本模态即可实现与视频相当的性能,并发布了IntentBench-Prime等资源。

Comments Accepted at HCMIW ECCV workshop. Code available here: https://github.com/koenv759/VanillaSFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20970 2026-06-23 cs.CV 新提交 85%

CogniRoute: Learning to Route Social Evidence in Omni-Modal Models

CogniRoute: 在全模态模型中学习路由社会证据

Yifan Shen, Pei Tian, Xinzhuo Li, Bowen Fang, Shujun Xia, Bingxuan Li, Ana Jojic, Wenming Ye, Xu Cao, James Matthew Rehg, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) Google(谷歌)

专题命中 音频语音多模态 :omni-modal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 提出CogniRoute框架,通过模式引导的专家混合和路由感知强化学习,解决全模态模型在社会视频问答中证据选择不足的问题,在OmniSocialBench上准确率达59.38%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14702 2026-06-18 cs.CV 新提交 85%

OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains

OmniVideo-100K:通过结构化脚本和证据链进行音视频推理的数据集

Xinyue Cai, Chaoyou Fu, Yi-Fan Zhang, Ran He, Caifeng Shan

机构 * Nanjing University(南京大学) CASIA(中国科学院自动化研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出OmniVideo-100K数据集,通过实体锚定视频脚本和线索引导的QA生成机制,解决音视频问答中跨段实体不一致和长时推理不足的问题,微调模型在多个基准上取得显著提升。

Comments Project page: https://github.com/MiG-NJU/OmniVideo-100K

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10720 2026-08-12 cs.AI cs.CL cs.CV 新提交 85%

Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence

Ex-Omni-2D:具备原生视觉存在的高表达全模态对话模型

Haoyu Zhang, Zhipeng Li, Xiaoying Tang, Tianshu Yu, Yiwen Guo

专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Ex-Omni-2D是一种全模态对话框架,可生成含文本、个性化语音与参考条件视频的协同响应,通过特定机制实现高效增量生成,在指定分辨率下达成1.293的端到端RTF,提供实用的质量效率平衡点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24786 2026-07-29 cs.IR cs.AI cs.MM cs.SD eess.AS 新提交 85%

Unlocking Spatial Grounding in Large Audio-Visual Retrieval models

在大型视听检索模型中解锁空间定位

Hugo Malard, Michel Olvera, Sanjeel Parekh, Gaël Richard, Slim Essid, Stéphane Lathuilière

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 研究针对视听声源定位任务,利用大规模视听检索模型的潜在表示,引入LAIP框架,通过音频信息池化恢复局部空间信息,在相关数据集上取得领先性能,证明可从现有检索表示解锁定位,为检索和定位任务提供统一路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10299 2026-07-14 cs.LG 新提交 85%

Empowering Long-form Omni-modal Understanding with Robust Audio Perception

通过强大的音频感知增强长格式全模态理解

Kaiying Yan, Luoyi Sun, Xiao Zhou, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学 上海人工智能研究院) Zhejiang University(浙江大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);audio-visual(abstract)

AI总结 为解决全模态理解不足问题,提出AVDC数据集及AVDC-QA-CoT数据集,利用现成模型标注视频,采用两阶段训练范式,在多下游任务实验中取得显著性能提升,推动全模态感知发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10147 2026-06-10 cs.AI cs.CL cs.CV cs.SD 新提交 85%

From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs

从感知到决策:多模态大语言模型中听觉与视觉感知的信息流

Wish Suharitdamrong, Muhammad Awais, Xiatian Zhu, Sara Atito

机构 * Surrey Institute for People-Centred AI (PAI)(萨里人本人工智能研究所) University of Surrey(萨里大学) Centre for Vision, Speech and Signal Processing (CVSSP)(视觉、语音和信号处理中心)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究多模态大语言模型(AVLLMs)中音频和视觉信息流的路径与整合机制,发现顺序流与并行流两种路由模式,并证明信息传递后可丢弃无关token以提升效率。

Comments 40 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22794 2026-07-28 cs.LG cs.AI cs.CL cs.SD 新提交 84%

Multimodal Domain Generalization for Depression Detection: An Attention-Based BiLSTM Network with Domain-Adversarial Training

用于抑郁症检测的多模态域泛化:基于注意力的双向长短期记忆网络与域对抗训练

Ali Tabaraei, Federico Simonetta, Stavros Ntalampiras

机构 * University of Milan(米兰大学) Gran Sasso Science Institute (GSSI)(大萨索科学研究所)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 研究针对深度学习抑郁症检测泛化受限问题,提出含域泛化的多模态检测框架,集成BiLSTM与注意力机制,用梯度反转层增强泛化,实验表明该方法提升了准确率和F1分数,超越现有基准,消融研究突出各因素贡献。

Comments 12 pages, 8 figures, 6 tables. Accepted for publication in IEEE Transactions on Neural Networks and Learning Systems (TNNLS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07294 2026-07-09 cs.RO cs.AI cs.CL 新提交 84%

Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders

用于社交机器人对话轮次转换的多模态语音活动投影及与语音活动相关的预训练编码器

Antonio Cano, Guillermo Pérez, Luis Merino, Randy Gomez

机构 * i Intelligent Insights(4i智能洞察公司) Universidad de Sevilla(塞维利亚大学) Universidad Pablo de Olavide(巴勃罗·德奥拉维德大学) Honda Research Institute Japan(本田日本研究所)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.AI

AI总结 研究社交机器人对话轮次转换,提出多模态语音活动投影框架,基于预训练视听主干并经低秩适应,结合说话人间注意力及语义一致性损失,实验表明该方法优于基线,适用于调解型人机交互。

Comments Accepted for presentation at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026). Acceptance notification date: 30 May 2026. Final published version pending

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06611 2026-07-09 cs.CL cs.AI cs.LG cs.SD 新提交 84%

Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts

通过生成的多语言转录本的蒸馏和跨模态集成进行音频情感分析

Andrei-George Durdun, Victor Constantinescu, Radu Tudor Ionescu

机构 * University of Bucharest(布加勒斯特大学) PPC Romania(罗马尼亚PPC)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究语音情感分析难题,提出通过跨模态变压器集成音频与文本信息的多模态方案,经自动语音识别生成转录本并翻译为多语言文本,还进行知识蒸馏,实验证明该方法能提升多模态情感分类性能及增强单模态音频模型。

Comments Accepted at KES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏