MLLM-based Speech Recognition: When and How is Multimodality Beneficial?
机构 * Worcester Polytechnic Institute(沃斯特理工学院)
专题命中 音频语音多模态 :MLLM(title);multi-modal(abstract);分类 cs.CL、cs.MM、eess.AS
Journal ref IEEE Transactions on Multimedia, 2026
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Worcester Polytechnic Institute(沃斯特理工学院)
专题命中 音频语音多模态 :MLLM(title);multi-modal(abstract);分类 cs.CL、cs.MM、eess.AS
Journal ref IEEE Transactions on Multimedia, 2026
作为视听模态声场的物体
机构 * University of Maryland, College Park(马里兰大学帕克分校)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM
AI总结 本文针对现有碰撞声建模方法成本高或需大量数据的问题,提出AV-MSF表示,结合3D高斯溅射与模态参数实现少样本重建,在真实数据集上达最优渲染性能,还支持接触定位等下游应用。
Comments ECCV 2026, Project page: https://zisenshao.github.io/AV-MSF/
身份作为存在:迈向基于外观和声音的联合音频视频生成
机构 * Tencent Inc.(腾讯公司) ; Peking University(北京大学)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV
AI总结 本文提出一个统一的框架,实现身份感知的音频视频生成,通过数据整理管道和灵活的身份注入机制,提升生成内容的高保真度和一致性。
Vorch-Streamer:将人类音视频生扩展至实时长格式流式生成
机构 * Vorch Team(Vorch团队) ; Tongji University(同济大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV
AI总结 Vorch-Streamer是一款后训练框架,通过混合训练、自强制与DMD蒸馏等技术,实现了超24 FPS的实时长格式T2AV流式音视频生成,兼具音唇同步性与身份保留能力。
Comments Project page: https://vorch-project.github.io/Vorch-Streamer-project/
AVCap:用细节感知奖励强化音视频联合字幕
机构 * MMLab, CUHK(香港中文大学MMLab) ; Peking University(北京大学)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV
AI总结 针对音视频联合字幕的数据集、奖励信号、评估基准的局限,提出AVCap-100K数据集、AVCap模型及专用基准指标,通过Da-GRPO优化的AVCap模型性能优异。
AnyTrack:用任意模态统一视觉目标跟踪
机构 * Army Engineering University of PLA(中国人民解放军陆军工程大学) ; Dalian University of Technology(大连理工大学) ; National University of Defense Technology(国防科技大学)
专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对现有多模态目标跟踪器适配性与泛化性差的问题,提出AnyTrack框架,通过MIM与CUM模块实现任意模态的统一跟踪,扩展基准后实验验证其性能先进、灵活有效。
Comments Accepted by ACM MM2026. More modifications may be performed
基于预训练特征、数据增强及新SheetSage-A2S数据集的音频转乐谱转录
机构 * University College Dublin(都柏林大学学院) ; Guangxi Normal University(广西师范大学) ; Great Bay University(大湾区大学) ; Shenzhen University(深圳大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM
AI总结 该研究针对流行音乐音频转乐谱研究不足的问题,构建了SheetSage-A2S数据集,结合预训练模型MuQ与数据增强改进A2S方法,在古典与流行音乐基准上均取得优于现有技术的性能。
Comments Accepted at the 34th ACM International Conference on Multimedia (MM '26)
GEB-Bench:多视角呈现的抽象结构
机构 * Fudan University(复旦大学) ; Peking University(北京大学)
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.CL
AI总结 本研究推出GEB-Bench基准,评估12种模型发现其在结构识别与跨视角映射间存在差距,仅前沿模型能缩小该差距,且表面复杂性会增加模型负担。
MetaSICL: 通过元语音上下文学习适应听觉大语言模型
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 提出MetaSICL方法,利用高资源语音数据通过元学习增强听觉大语言模型的上下文学习能力,在低资源场景下优于直接微调。
MMAG:多控制混合音频生成基准
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS
AI总结 本研究针对现有音频生成基准的不足,推出MMAG混合音频生成基准,构建含4000个标注音频的数据集,提出系统评估协议,测试发现各类模型在多控制能力间存在性能权衡,为该领域提供综合基准。
Comments 15 pages, 6 figures
塑造你的信息流:一种基于大语言模型的智能体对话推荐系统
机构 * Meta Platforms(元平台公司)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出基于LLM的智能体推荐框架SYF,采用三层架构实现实时多模态内容协同策划,经离线评估与在线A/B实验验证,可提升信息流相关性与用户情感,为工业场景提供交互式推荐方案。
Comments Accepted in RecSys 2026 Industrial Track
识别野外伴随语音的手势
机构 * Visual Geometry Group, Dept. of Engineering Science, University of Oxford(视觉几何组,工程科学系,牛津大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对当前多模态模型难以捕捉语义性伴随手势的问题,构建了首个大规模基准数据集GRW,用于训练视频模型进行手势语义分类、对应词汇识别和时序定位。
Journal ref European Conference on Computer Vision (ECCV), 2026
基于互补音频表示的帧级盘索里调式分类
专题命中 音频语音多模态 :cross-modal(abstract)
AI总结 本研究针对韩国传统声乐盘索里,采用46小时帧级标注与4种互补音频表示,构建调式分类模型,验证其学习调式特征而非记忆曲目,揭示了源分离对线索的影响及预训练的局限性。
Comments Accepted to the 27th International Society for Music Information Retrieval (ISMIR) Conference, 2026
Journal ref ISMIR 2026