arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-02 至 2026-06-02 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 12 篇

2606.00125 2026-06-02 cs.IR cs.AI cs.LG cs.MM 84%

Multimodal Music Recommendation System using LLMs

使用LLMs的多模态音乐推荐系统

Srikar Prabhas Kandagatla, Sreehitha R. Narayana, Chandana Magapu, Swetha Mohan, Shamanth Kuthpadi, Hongjie Chen, Ryan A. Rossi, Franck Dernoncourt, Nesreen Ahmed

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Dolby Laboratories(Dolby实验室) Adobe Research(Adobe研究) Cisco Research(Cisco研究)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 提出一个多模态框架,通过融合音频、歌词、LLM生成的语义元数据和收听完成率,在基于会话的音乐推荐中显著提升Recall和NDCG。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12819 2026-06-02 cs.IR cs.CV 79%

WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata

WISE:一种用于视觉场景、音频、物体、人脸、语音和元数据的多模态搜索引擎

Prasanna Sridhar, Horace Lee, David M. S. Pinto, Andrew Zisserman, Abhishek Dutta

机构 * Engineering Science University of Oxford(工程科学大学牛津)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出WISE开源多模态搜索引擎,整合场景级和物体级的自然语言与反向图像查询、人脸搜索、音频事件检索、语音转录搜索及元数据过滤,支持跨模态组合查询,采用向量搜索实现高效扩展,可本地部署。

Comments Software: https://www.robots.ox.ac.uk/~vgg/software/wise/ , Online demos: https://www.robots.ox.ac.uk/~vgg/software/wise/demo/ , Example Queries: https://www.robots.ox.ac.uk/~vgg/software/wise/examples/

Journal ref International ACM SIGIR Conference on Research and Development in Information Retrieval (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25195 2026-06-02 cs.CV 77%

Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation

Baton: 用于联合视频-音频生成的显式语义蓝图

Shuyuan Tu, Qi Tian, Zihan Yang, Yue Wu, Xintong Han, Weijie Kong, Jiangfeng Xiong, Jian-Wei Zhang, Zhao Zhong, Liefeng Bo, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯幻元)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 提出Baton框架,通过VA-Planner生成语义对齐的模态感知规划令牌作为蓝图,注入扩散骨干以协调视频和音频去噪,解决现有方法因缺乏共享长期规划导致的跨模态对齐脆弱问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25773 2026-06-02 cs.CV cs.AI cs.CL 67%

v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound

v-HUB: 从视觉和声音理解视频幽默的基准

Zhengpeng Shi, Yanpeng Zhao, Jianqun Zhou, Yuxuan Wang, Qinrong Cui, Wei Bi, Songchun Zhu, Bo Zhao, Zilong Zheng

机构 * Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Beijing Institute for General Artificial Intelligence(北京一般人工智能研究院) Independent Researcher(独立研究者)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出v-HUB基准,通过非语言短视频评估多模态大语言模型在仅凭视觉线索理解幽默的能力,并发现音频信息有助于提升幽默理解。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18614 2026-06-02 cs.CL cs.LG cs.MM cs.SD eess.AS 67%

MAVL: A Multilingual Audio-Video Lyrics Dataset for Animated Song Translation

MAVL:面向动画歌曲翻译的多语言音视频歌词数据集

Woohyun Cho, Youngmin Kim, Sunghyun Lee, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.MM、eess.AS

AI总结 提出首个多语言多模态歌词翻译基准MAVL,并设计音节约束的音视频大语言模型SylAVL-CoT,利用音视频线索和音节约束提升歌词可唱性和翻译准确性。

Comments Accepted to EMNLP 2025, Project Page: https://k1064190.github.io/papers/paper1.html, our codes and datasets are available at https://github.com/k1064190/MAVL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00851 2026-06-02 cs.SD cs.CL cs.HC cs.LG eess.AS 62%

Sympatheia: Emotionally Adaptive Voice Assistant with Continuous Affect Conditioning

Sympatheia: 具有连续情感调节的情感自适应语音助手

Sukru Samet Dindar, Riki Shimizu, Xilin Jiang, Nima Mesgarani

机构 * Department of Electrical Engineering, Columbia University(电气工程系,哥伦比亚大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 提出Sympatheia语音对话框架,通过从用户语音推断情感并结合连续效价-唤醒度控制信号,实现情感自适应响应,优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06199 2026-06-02 eess.AS cs.AI cs.SD 62%

FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation

FastSLM:用于高效长语音自适应的层次时间抽象

Junseok Lee, Sangyong Lee, Chang-Jae Chun

机构 * OKESTRO Sejong University(世宗大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 针对长语音输入中标记爆炸问题,提出FastSLM架构,通过层次时间抽象器(HTA)实现每秒1.67个标记的极端压缩率(减少97%),在显著降低计算量和参数的同时,在长语音基准上达到与最先进模型竞争的性能。

Comments Title updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01704 2026-06-02 eess.AS 57%

Kinship Verification Using Voice

使用语音进行亲属关系验证

Jagabandhu Mishra, Tomi H. Kinnunen

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本研究通过提出新的评估协议和多种神经网络说话人嵌入提取器,建立了语音亲属关系验证的基础,并揭示了说话人验证与亲属关系验证之间的密切联系。

Comments Submited to IEEE TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01264 2026-06-02 q-bio.NC cs.HC cs.SD eess.AS eess.SP 57%

A 1000-hour EEG-EMG-audio dataset of Japanese speech production

1000小时日语语音产生的EEG-EMG-音频数据集

Motoshige Sato, Ilya Horiguchi, Masakazu Inoue, Kenichi Tomeoka, Eri Hatakeyama, Yuya Kita, Atsushi Yamamoto, Ippei Fujisawa, Shuntaro Sasai

机构 * National Institute of Information and Communications Technology, Japan(日本信息与通信技术研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本研究构建了一个包含1020小时同步头皮脑电图、面部肌电图和语音音频的多模态数据集,来自三名健康日语母语者在开放词汇有声语音过程中的记录,旨在支持语音解码、多模态信号处理及脑电图表示学习等研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00712 2026-06-02 cs.CV 57%

CASTLE2026 Team WDL Technical Report

CASTLE2026 团队 WDL 技术报告

Zhengyang Li, Zhenglin Du, Yi Wen, Fang Liu, Shuo Li, Xu Liu

机构 * Key Laboratory of Intelligent Perception and Image Understanding(智能感知与图像理解重点实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出基于 Qwen 的证据感知多模态推理流程,通过提示路由和置信度加权投票解决长视频问答,在 CASTLE 挑战赛中排名第一。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00670 2026-06-02 cs.SD cs.AI 57%

Beyond the Mouth: Upper-Face Affective Cues in Audiovisual Sentence Recognition under Acoustic Uncertainty

超越口部:声学不确定性下视听句子识别中的上半脸情感线索

Zhou Yang, Yueyi Yang

机构 * Faculty of Education and Psychology, University of Oulu, Finland(奥卢大学教育与心理学学院,芬兰) Center for Machine Vision and Signal Analysis, University of Oulu, Finland(奥卢大学机器视觉与信号分析中心,芬兰)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究利用CREMA-D语料库,通过特征分类器探究在声学退化条件下,上半脸情感信息是否有助于视听句子识别,发现上半脸情感线索能提升模型校准和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00324 2026-06-02 cs.IR cs.AI 57%

LLMs Need Encoders for Semantic IDs Too

LLM 也需要语义 ID 的编码器

Xiangyi Chen, Zelun Wang, Xinyi Li, Yi-Ping Hsu, Jaewon Yang, Jiajing Xu

机构 * Pinterest United States(Pinterest美国公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出 PrefixMem,一种基于前缀 n-gram 记忆表的轻量级语义 ID 编码器,为 LLM 提供结构化、前缀条件的表示,显著提升生成推荐中的语义 ID 准确率和检索召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏