arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-17 至 2026-04-17 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2507.11812 2026-04-17 cs.SD eess.AS eess.SP 83%

A Multimodal Data Fusion Generative Adversarial Network for Real Time Underwater Sound Speed Field Construction

一种多模态数据融合生成对抗网络用于实时水下声速场构建

Wei Huang, Yuqiang Huang, Jixuan Zhou, Fang Ji, Hao Zhang, Tianhe Xu

机构 * Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学院) Hanjiang National Laboratory(汉江国家实验室) School of Space Science and Technology, Shandong University (Weihai)(山东大学(威海)空间科学与技术学院) China Waterborne Transport Research Institute(中国水上运输研究院) China Ship Research and Development Academy(中国船舶研究与发展院)

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 本文提出MDF-RAGAN模型,通过多源融合和跨模态注意力机制提升水下声速场构建精度,实验显示其在误差小于0.3m/s的情况下优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03416 2026-04-17 cs.CV 79%

GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models

GAMBIT:一种用于多模态大语言模型的游戏化突破框架

Xiangdong Hu, Yangyang Jiang, Qin Hu, Xiaojun Jia

机构 * Georgia State University(佐治亚州立大学) Shandong University(山东大学) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GAMBIT框架,通过分解重组有害视觉语义并构建游戏化场景,使模型在探索和重建意图中主动完成突破,提升攻击成功率。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24470 2026-04-17 cs.CV cs.AI cs.CL cs.SI 67%

Counting Without Numbers and Finding Without Words

不使用数字进行计数和不使用词语进行寻找

Badri Narayana Patro

机构 * Microsoft(微软)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出首个多模态重聚系统,整合视觉和声学生物特征,通过处理不同频率的动物声音和容忍压力导致的外观变化,实现基于生物通信原理的AI应用,帮助无语言能力的弱势群体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14619 2026-04-17 cs.SD cs.LG eess.AS q-fin.CP q-fin.ST 57%

The Acoustic Camouflage Phenomenon: Re-evaluating Speech Features for Financial Risk Prediction

声音伪装现象:重新评估语音特征用于金融风险预测

Dhruvin Dungrani, Disha Dungrani

机构 * Department of Information Systems(信息系统系)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文研究了在真实会议环境中,高训练度演讲者使用语音特征(音高、抖动和犹豫)进行金融风险预测的局限性,发现融合声音特征会降低性能,提出声音伪装现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07222 2026-04-17 cs.LG cs.CL 57%

Pay Less Attention to Function Words for Free Robustness of Vision-Language Models

减少对功能词的关注以实现视觉语言模型的自由鲁棒性

Qiwei Tian, Chenhao Lin, Zhengyu Zhao, Chao Shen

机构 * School of Cyber Science and Engineering, Xi’an Jiaotong University, Xi’an 710049, China(西安交通大学计算机科学与工程学院,西安 710049,中国)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出FDA方法,通过减少功能词的注意力影响,提升视觉语言模型在跨模态对抗攻击下的鲁棒性,实验显示在检索任务中ASR下降18%/13%/53%,性能损失极小。

Comments The paper has been accepted by ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏