arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-07 至 2026-07-07 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 12 篇

2607.03657 2026-07-07 cs.CV cs.AI 新提交 93%

ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation

ViPo-MLLM:用于无注释手语翻译的视觉-姿势多模态大语言模型

Ahmed Abul Hasanaath, Bicheng Xu, Mir Rayat Imtiaz Hossain, Leonid Sigal, Hamzah Luqman

机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油矿物大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(title);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究尝试无注释手语翻译,提出ViPo-MLLM框架结合时空RGB和人体姿势特征,用专用编码器与交叉模态注意力,经结构化提示和训练后由大语言模型处理。该模型在数据集取得新成果,验证了机制有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03213 2026-07-07 cs.CV cs.AI cs.CL cs.HC 新提交 91%

OpenGlass: A Sensing-Computing Split Architecture for Local MLLM-Driven Real-Time Visual Assistance

OpenGlass:用于本地MLLM驱动的实时视觉辅助的传感-计算分离架构

Mengzhang Li, Yuan Yao

机构 * Shanghai Qizhi Institute(上海期智研究院) College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对视障和低视力用户,OpenGlass以传感-计算分离解决云MLLM辅助需上传数据、有网络延迟,以及可穿戴眼镜计算和电量受限问题,在本地设备实现低延迟多模态视觉辅助,并给出评估结果。

Comments Accepted to ACL 2026 System Demonstrations. 11 pages, 5 figures, 8 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations), pages 829-839, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04472 2026-07-07 cs.CV 新提交 89%

EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration

EVAS:通过视听协同和引导边界校准实现高效多模态时间伪造定位

Shen Shen, Quan Zhang, Dan Jiang, Ke Zhang

机构 * Soochow University(苏州大学) Tsinghua University(清华大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对人工智能生成内容带来的多模态取证挑战,提出EVAS框架,利用多阶段视听协同机制和边界感知细化策略,结合解耦训练范式与轻量级网络,有效定位长视频中稀疏分布的伪造片段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03825 2026-07-07 cs.CV cs.AI 新提交 84%

Q-TriM: Question-Guided Tri-Modal Attention for Audio-Visual Question Answering

Q-TriM:用于视听问答的问题引导三模态注意力

SungHun Kim, SeungJun Baek

机构 * Dept. of Computer Science and Engineering(计算机科学与工程系)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究视听问答问题,提出Q-TriM以浅并行方式进行多模态融合,引入基于文本的视频和音频注意力操作框架,避免深度堆叠融合的问题,在三个基准测试中达最优性能。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02862 2026-07-07 cs.CL eess.AS 新提交 81%

Jointly Improving Dialect Identification and ASR in Indian Languages using Multimodal Feature Fusion

使用多模态特征融合联合改进印度语言中的方言识别和自动语音识别

Saurabh Kumar, Amartyaveer, Prasanta Kumar Ghosh

机构 * Department of Electrical Engineering(电气工程系)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

AI总结 针对印度低资源且方言差异大的语言,提出多模态框架联合改进方言识别和自动语音识别。用瓶颈编码器和RoBERTa编码器提取融合特征,经门控和注意力编码器处理,提升了识别准确率和降低错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02799 2026-07-07 cs.CV 新提交 79%

Conversational Human Audio-visual Talking Dialogue Generation

对话式人类视听对话生成

Junhao Song, Lluis Guasch, Xilin He, Zhongyu Yang, Yingfang Yuan, Weicheng Xie, Linlin Shen, Haijun Lin, Shizhe Liu, Wei Pang, Siyang Song

机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算系) Department of Earth Science & Engineering, Imperial College London(伦敦帝国理工学院地球科学与工程系) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Department of Computer Science, Heriot-Watt University(赫瑞瓦特大学计算机科学系) School of Computer Science, Northumbria University(诺森比亚大学计算机科学学院) College of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(深圳大学广东省智能信息处理重点实验室) School of Engineering and Design, Hunan Normal University(湖南师范大学工程与设计学院) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 提出CHAT框架,统一大语言模型和说话人脸模型,通过交互音频和面部行为细化模块,从单一文本提示生成多样、配对且相互响应的语音-面部对话片段,优于现有方法,合成数据集可作预训练数据。

Comments Accepted to ECCV 2026 as a main paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08468 2026-07-07 cs.SD eess.SP 78%

Audio-Visual Speech Enhancement: Architectural Design and Deployment Strategies

音频-视觉语音增强:架构设计与部署策略

Anis Hamadouche, Haifeng Luo, Mathini Sellathurai, Amir Hussain, Tharm Ratnarajah

机构 * School of Engineering & Physical Sciences, Heriot-Watt University(赫瑞斯泰学院,赫瑞斯泰大学) College of Engineering Department of Electrical and Computer Engineering, San Diego State University(工程学院电子与计算机工程系,圣地亚哥州立大学) SDAIA-KFUPM Joint Research Centre for Artificial Intelligence, King Fahd University of Petroleum and Minerals(SDAIA-KFUPM人工智能联合研究中心,国王法赫德石油与矿物大学)

专题命中 音频语音多模态 :audio-visual(title,abstract)

AI总结 本文提出一种云-边协同的音频-视觉语音增强系统,通过CNN和LSTM融合网络实现时序一致性,并探讨网络负载和压缩对实时性能的影响,揭示了5G和有线以太网在解压音频视频中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06121 2026-07-07 cs.RO 版本更新 78%

Glance-Say: Multimodal Human-Robot Collaboration and Intent Recognition via Sticky Glance

Glance-Say:通过粘性注视实现多模态人机协作与意图识别

Yuzhi Lai, Shenghai Yuan, Peizheng Li, Benjamin Kiefer, Andreas Zell

机构 * University of Tuebingen(图宾根大学) Nanyang Technological University(南洋理工大学) Mercedes-Benz(梅赛德斯-奔驰)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 针对运动障碍者,本文提出多模态交互框架,用粘性注视算法稳定基于注视的意图,引入注视-语音交互范式及共享控制方案,实验表明其在目标跟踪、选择精度及任务时长上效果更佳。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03806 2026-07-07 eess.AS cs.AI eess.SP 新提交 62%

Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings

探测CLAP音频嵌入中的低层声学属性编码

Héctor Martel, Joe Hennessy-Priest, Taemin Cho

机构 * BandLab Technologies(BandLab技术公司)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 该研究通过探测框架分析CLAP音频嵌入,探究混响、响度等三类基础声学属性的编码方式,发现多数属性可恢复,存在线性与非线性两种编码模式,还验证了跨模态一致性。

Comments Accepted to DAFx 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12555 2026-07-07 cs.SD cs.CV cs.MM 新提交 62%

AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation

AudioX-Turbo:高效任意到音频生成的统一框架

Zeyue Tian, Lei Ke, Zhaoyang Liu, Ruibin Yuan, Liumeng Xue, Yujiu Yang, Weijia Chen, Xu Tan, Qifeng Chen, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Noiz AI Independent Researcher(独立研究员)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 提出AudioX-Turbo,基于教师-学生范式的统一高效框架,通过多模态扩散Transformer和分布匹配蒸馏实现文本、视频、音频到音频的生成,仅需4步采样,NFE减少约25倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15177 2026-07-07 cs.SD cs.MM eess.AS 版本更新 62%

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

用于以音频为中心任务的音频-语言模型:系统综述

Yi Su, Jisheng Bai, Qisheng Xu, Kele Xu, Yong Dou

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) School of Communications and Information Engineering, Xi’an University of Posts and Telecommunications(通信与信息工程学院,西安邮电大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM、eess.AS

AI总结 对基于配对音频-文本数据训练的音频-语言模型进行系统综述,涵盖语音、音乐和声音,给出统一分类法,建立研究框架,助研究者了解技术发展与趋势,为应用提供参考。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12527 2026-07-07 eess.AS 版本更新 57%

Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models

Audio-Cogito:迈向大型音频语言模型中的深度音频推理

Longhao Li, Hongjie Chen, Zehan Li, Qihan Hu, Jian Kang, Jie Li, Lei Xie, Yongxiang Li

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出Audio-Cogito,通过开发Cogito-pipe数据集和自蒸馏策略,提升音频推理能力,在MMAR基准和Interspeech 2026挑战中表现优异。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏