arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-13 至 2026-08-13 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 6 篇

2608.11329 2026-08-13 cs.SD cs.CV cs.MM 新提交 88%

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

Qwen-MusicAVQA-7B:一种用于音乐音频-视觉问答的多模态模型

Maryam Dehdashti

机构 * Inference Matter Labs(推理物质实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(title);omni-modal(abstract);分类 cs.CV、cs.MM

AI总结 该研究提出轻量级多模态模型Qwen-MusicAVQA-7B,通过连接冻结的Whisper编码器与Qwen2-VL-7B-Instruct,在MUSIC-AVQA等基准上实现高准确率,训练成本低,且发现音频时间信息保留程度影响下游问答准确率。

Comments 24 pages, 1 figure, 8 tables. Code: https://github.com/MKDehdashti/Qwen2-vl-audio Checkpoints: https://huggingface.co/MayaKD/qwen2-vl-audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15124 2026-08-13 cs.SD 版本更新 82%

Synaspot: A Lightweight, Streaming Multi-modal Framework for Keyword Spotting with Audio-Text Synergy

Synaspot:一种轻量级、流式多模态框架,用于音频-文本协同的关键字检测

Kewei Li, Yinan Zhong, Xiaotao Liang, Tianchi Dai, Shaofei Xue

专题命中 音频语音多模态 :multi-modal(title,abstract);multimodal(abstract)

AI总结 Synaspot提出了一种轻量级流式多模态框架,通过减少说话人特定信息和有效融合语音文本特征,实现更高效的关键字检测。

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12034 2026-08-13 eess.AS cs.SD 新提交 57%

The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models

2026 IEEE SLT智能眼镜挑战赛:基于音频-语言模型的自我中心多说话人语音识别与理解基准测试

Dehui Gao, Zhixian Zhao, Zhennan Lin, Yujie Liao, Yuhang Dai, Yike Zhu, Longshuai Xiao, Hui Bu, Xin Xu, Xie Chen, Shuai Wang, Liumeng Xue, Zhonghua Fu, Jun Du, Eng-Siong Chng, Jun Zhou, Lei Xie

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文介绍IEEE SLT 2026智能眼镜挑战赛,构建含714个真实场景会话的106小时四通道自我中心语音数据集,评估TSA-ASR与SLU,发现说话人重叠影响TSA-ASR性能、音频-语言模型难理解副语言声学。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11804 2026-08-13 eess.AS cs.SD 新提交 57%

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

MiDashengLM-Gen:基于大语言模型驱动的自回归流匹配的统一音频场景生成

Xingwei Sun, Heinrich Dinkel, Gang Li, Jiahao Mei, Yadong Niu, Zerui Han, Yuepeng Jiang, Jiahao Zhou, Lichun Fan, Jian Luan

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 MiDashengLM-Gen是首个端到端训练的通用文本到音频生成模型,通过结合LLM与每token条件流匹配,在Seed-TTS等基准上大幅提升语音可懂度,且支持多语言场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11496 2026-08-13 cs.LO 新提交 50%

Discrete Linear Ensemble Logic

Manfred Droste, Guo-Qiang Zhang

专题命中 音频语音多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11551 2026-08-13 cs.IT math.IT 新提交 50%

Semantic Error Control Coding with Foundation Models for Future Communications

面向未来通信的、基于基础模型的语义差错控制编码

Chentao Yue, Gaoyang Pang, Branka Vucetic, Yonghui Li

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出基于基础模型的语义差错控制编码(SECC)框架,将信源语义结构融入编解码,在AWGN信道上较传统解码获数分贝编码增益,错误率低于正态近似界,同时指出相关开放挑战。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏