arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-16 至 2026-07-16 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 7 篇

2607.13110 2026-07-16 cs.LG cs.AI eess.SP 新提交 83%

A Hybrid Mamba for Audio-Visual Navigation

用于视听导航的混合曼巴

Yi Wang, Yinfeng Yu

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 研究针对视听导航骨干网络多年未变的问题,提出Samba,用曼巴状态编码器取代传统GRU,构建音频曼巴编码器,实验表明其泛化性能出色,能提升导航成功率,以低成本解锁更强能力,为范式演进提供途径。

Comments Main paper (6 pages). Accepted for publication by IEEE International Conference on Systems and Man and Cybernetics 2026 (IEEE SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13952 2026-07-16 cs.SD cs.AI eess.AS 版本更新 81%

LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement

基于大语言模型的强化学习音频视觉语音增强

Chih-Ning Chen, Jen-Cheng Hou, Hsin-Min Wang, Shao-Yi Chien, Yu Tsao, Fan-Gang Zeng

机构 * Department of Electrical Engineering, National Taiwan University, Taiwan(台湾大学电子工程系) Research Center for Information Technology Innovation, Academia Sinica, Taiwan(中央研究院资讯科技创新研究中心) Center for Hearing Research, University of California Irvine, USA(加州大学尔湾分校听力研究中心)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、eess.AS

AI总结 本文提出基于大语言模型的可解释奖励模型的音频视觉语音增强框架,利用语言模型生成语音增强的自然语言描述,并通过情感分析模型转换为评分作为PPO奖励,提升语音质量评估效果。

Comments 6 pages, 4 figures, Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13614 2026-07-16 cs.HC cs.MM 新提交 79%

VIP-MINGLE: A Corpus for Videoconference and In-Person Multimodal Interaction in Group Language Engagement

VIP-MINGLE:用于群体语言交流中视频会议和面对面多模态交互的语料库

Andrew Chang, Abhinay K Bodi, Wenxin Deng, Junrui Huang, Venu G Kadamba, Sumanth B H Karanam, Dhiwahar A Kennady, David Poeppel, Dustin Freeman

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 介绍VIP-MINGLE多模态数据集,含59小时录音等,有两种环境下配对会话,涵盖多种数据。分析发现不同环境多模态行为分布有变化,该数据集是跨环境群体对话模型开发的关键资源。

Comments Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06405 2026-07-16 cs.MM cs.SD 版本更新 79%

Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space

在潜在空间中通过跨模态对齐实现精确的视频到音频生成

Thanh V. T. Tran, Ngoc-Son Nguyen, Luong Tran, Long-Khanh Pham, Paarth Neekhara, Shehzeen Hussain, Van Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心) NVIDIA Corporation(NVIDIA公司)

专题命中 音频语音多模态 :cross-modal(title);audio-visual(abstract);分类 cs.MM

AI总结 研究视频到音频生成问题,提出Flowley架构,结合视觉特征与文本提示,通过渐进软掩码交叉注意力实现视听同步,无额外计算成本,还提出SoundCap字幕,该方法在多个指标及零样本音频质量上达先进水平。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15886 2026-07-16 cs.CL 版本更新 79%

Linked Multi-Modal Data on Russian Domestic and Foreign Policy Speeches

连接多模型数据:俄罗斯国内与对外政策演讲

Daria Blinova, Gayathri Emuru, Rakesh Emuru, Kushagradheer Shridheer Srivastava, Mina Rulis, Sunita Chandrasekaran, Benjamin E. Bagozzi

机构 * University of Delaware, Department of Political Science & International Relations(德克萨斯大学,政治科学与国际关系系) University of Delaware, Masters of Science in Data Science Program(德克萨斯大学,数据科学硕士项目) University of Delaware, Department of Computer & Information Sciences(德克萨斯大学,计算机与信息科学系) University of Pennsylvania, Department of Political Science(宾夕法尼亚大学,政治科学系)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 cs.CL

AI总结 本文介绍了一个连接多模态政治通讯的数据集,涵盖俄罗斯政府多个 decades 的官方演讲,提供俄语和英语文本、图像及注释,并通过 transformer 多模态模型进行主题标注,支持政治通讯的多模态分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13669 2026-07-16 cs.CV 新提交 70%

Learning Speaker Identity Beyond Language and Modality Constraints: Insights from the POLY-SIM 2026 Challenge

超越语言和模态限制学习说话者身份:来自POLY-SIM 2026挑战赛的见解

Marta Moscati, Muhammad Saad Saeed, Marina Zanoni, Mubashir Noman, Rohan Kumar Das, Monorama Swain, Yassin Terraf, Yufang Hou, Elisabeth Andre, Khalid Mahmood Malik, Markus Schedl, Shah Nawaz

机构 * Institute of Computational Perception, Johannes Kepler University(约翰内斯·开普勒大学计算感知研究所) University of Michigan-Flint(密歇根大学弗林特分校) BDO DIGITAL Gmbh(BDO数字有限公司) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Fortemedia(富特媒体公司) College of Computing, Mohammed VI Polytechnic University(穆罕默德六世理工大学计算学院) IT:U Interdisciplinary Transformation University(IT:U跨学科转型大学) University of Augsburg(奥格斯堡大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 POLY-SIM 2026挑战赛旨在解决多模态说话者识别中语言和模态限制问题,针对实际应用中信息缺失、多语言等挑战,为比较解决方案提供标准化设置。

Comments Accepted at ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16496 2026-07-16 eess.SY cs.AI cs.LG cs.SY 57%

Synergies between Federated Foundation Models and Smart Power Grids

联邦基础模型与智能电力电网的协同作用

Seyyedali Hosseinalipour, Shimiao Li, Adedoyin Inaolaji, Filippo Malandra, Luis Herrera, Nicholas Mastronarde

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出联邦基础模型与智能电网的协同方法,通过双向视角探讨M3T FedFMs在电网功能增强和模型设计优化中的应用。

Journal ref IEEE Electrification Magazine, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏