arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-21 至 2026-04-21 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 11 篇

2604.16617 2026-04-21 cs.CV cs.MM cs.SD 86%

AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers

AVRT:通过单模态教师模型实现音频-视觉推理迁移

Edson Araujo, Saurabhchand Bhati, M. Jehanzeb Mirza, Brian Kingsbury, Samuel Thomas, Rogerio Feris, James R. Glass, Hilde Kuehne

机构 * University of Tübingen, Germany(图宾根大学) MIT, Cambridge MA, USA(麻省理工学院) IBM Research, USA(IBM研究院) MIT-IBM Watson AI Lab, USA(麻省理工-IBM沃森人工智能实验室) Tuebingen AI Center, Germany(图宾根人工智能中心)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出AVRT框架,通过单模态教师模型生成高质量音频-视觉推理轨迹,并利用LLM合并模型整合轨迹,从而在多模态设置中实现推理迁移,取得音视频和音频任务的最优效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10747 2026-04-21 cs.SD cs.AI cs.CL cs.LG eess.AS 82%

Multimodal Sentiment Analysis with Missing Modality: A Knowledge-Transfer Approach

多模态情感分析中的缺失模态:一种知识迁移方法

Weide Liu, Huijing Zhan

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) Singapore University of Social Sciences, Singapore(新加坡社会科学研究大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文提出知识迁移网络以重建缺失音频特征,并开发跨模态注意力机制以提升情感预测,实验表明在三个公开数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18203 2026-04-21 cs.CL 79%

Multiplication in Multimodal LLMs: Computation with Text, Image, and Audio Inputs

多模态大语言模型中的乘法:文本、图像和音频输入的计算

Samuel G. Balter, Ethan Jerzak, Connor T. Jerzak

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) National University of Singapore (NUS)(新加坡国立大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 研究多模态大语言模型在处理不同模态下的多数字乘法时的局限性,提出一个受控的多模态乘法基准,通过因子变化数字长度、稀疏性、表示形式和模态,定义算术负载作为总和和非零数字计数的乘积,揭示模型性能与算术负载的关系。

Comments To appear in ACL Findings (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16307 2026-04-21 cs.MM cs.HC 79%

Multimodal Digital Sensing of Early-Life Laying Hens: A Pilot Study Integrating Thermal, Acoustic, Optical-Flow and Environmental Data

多模态数字传感用于早期生活阶段产蛋鸡的监测:整合热成像、音频、光流和环境数据的试点研究

Yashan Dhaliwal, Daniel Essien, Suresh Neethirajan

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 本研究通过多模态传感整合热成像、音频、光流和环境数据,评估了早期产蛋鸡生理和行为发展特征,发现温度、声音和光流数据与年龄相关的变化,为精准养鸡的福利监测提供了基础。

Comments 29 pages, 11 figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14582 2026-04-21 cs.CV 77%

OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models

OmniZip:面向快速多模态大语言模型的音频引导动态令牌压缩

Keda Tao, Kele Shao, Bohan Yu, Weiqiang Wang, Jian liu, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出OmniZip,一种无需训练的音频引导多模态令牌压缩框架,通过动态压缩音频视频令牌提升推理速度和内存效率,保持模型性能。

Comments [CVPR 2026] Code Link: https://github.com/KD-TAO/OmniZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16756 2026-04-21 cs.AI cs.CL cs.CV cs.RO eess.AS 70%

End-to-end Listen, Look, Speak and Act

端到端听、看、说和行动

Siyin Wang, Wenyi Yu, Xianzhao Chen, Xiaohai Tian, Jun Zhang, Lu Lu, Chao Zhang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出ELLSA模型,首个端到端全双工系统,实现视觉、文本、语音和行动的同步感知与生成,支持对话轮替、指令拒绝等复杂交互行为,推动更自然的人工智能发展。

Comments 22 pages, 8 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14122 2026-04-21 cs.CV 70%

EgoSound: Benchmarking Sound Understanding in Egocentric Videos

EgoSound:评估egocentric视频中声音理解的基准测试

Bingwen Zhu, Yuqian Fu, Qiaole Dong, Guolei Sun, Tianwen Qian, Yuzheng Wu, Danda Pani Paudel, Xiangyang Xue, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) East China Normal University(华东师范大学) KAUST(卡塔尔大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 EgoSound首次系统评估多模态大语言模型在egocentric视频中的声音理解能力,包含7个任务分类,揭示当前模型在空间和因果理解上的局限。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02908 2026-04-21 cs.CV cs.HC cs.MM 62%

SentiAvatar: Towards Expressive and Interactive Digital Humans

SentiAvatar:迈向表达性和互动性的数字人类

Chuhao Jin, Rui Zhang, Qingzhe Gao, Haoyu Shi, Dayu Wu, Yichen Jiang, Yihan Wu, Ruihua Song

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 Gallagher人工智能学院) SentiPulse College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出SentiAvatar框架,通过构建SuSu虚拟角色,解决多模态数据不足、语义到动作映射和动作语调同步问题,实现高精度实时交互。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18423 2026-04-21 cs.CL 57%

BhashaSutra: A Task-Centric Unified Survey of Indian NLP Datasets, Corpora, and Resources

BhashaSutra:印度NLP数据集、语料库和资源的任务导向统一调查

Raghvendra Kumar, Devankar Raj, Sriparna Saha

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna, India(印度理工学院帕纳加邦计算机科学与工程系) Indian Institute of Technology Patna, India(印度理工学院帕纳加邦)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文首次系统梳理印度NLP资源,涵盖200+数据集、50+基准测试和100+模型工具,分析注释、评估及模型设计趋势,识别数据稀疏、语言覆盖不均等挑战,为公平、文化导向的NLP研究提供基础。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18159 2026-04-21 cs.CL 57%

FreezeEmpath: Efficient Training for Empathetic Spoken Chatbots with Frozen LLMs

FreezeEmpath: 基于冻结大语言模型的高效共情语音聊天机器人训练

Yun Hong, Yan Zhou, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences(智能信息处理重点实验室,计算技术研究所,中国科学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出 FreezeEmpath,通过冻结大语言模型参数,利用现有语音指令和情感识别数据高效训练共情语音聊天机器人,实现情感表达和对话性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17023 2026-04-21 cs.HC cs.AI cs.CY 57%

The Instrumental Dissolution of Typing: Why AI Challenges the Keyboard Era in Knowledge Work

打字的消解:为何AI挑战键盘时代的知识工作

Wei Roy Hua

机构 * T5 Innovations(8T5创新)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 AI使键盘在知识工作中不再必要,通过迁移功能至AI系统结束键盘时代,核心贡献是识别验证瓶颈,重新定义专业能力与劳动认可。

Comments 146 pages, 9 sections. Also available at https://zenodo.org/records/19605842

详情

展开后加载摘要…

URL PDF HTML 收藏