arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4559 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4559 篇

2510.11579 2026-04-03 cs.CV cs.LG 79%

MS-Mix: Sentiment-Guided Adaptive Augmentation for Multimodal Sentiment Analysis

MS-Mix:基于情感的自适应增强用于多模态情感分析

Hongyu Zhu, Lin Chen, Xin Jin, Mingsheng Shang

机构 * Chongqing Institute of Green Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究院) Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆学院) School of Engineering, Westlake University(西湖大学工学院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MS-Mix,一种基于情感的自适应增强框架,通过情感感知的样本选择策略、情感强度引导模块和情感对齐损失提升多模态情感分析的鲁棒性和实用性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00489 2026-04-02 cs.CL 79%

Adapting Text LLMs to Speech via Multimodal Depth Up-Scaling

通过多模态深度扩展适应文本LLM到语音

Kazuki Yano, Jun Suzuki, Shinji Watanabe

机构 * Tohoku University(东北大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出多模态深度扩展方法,通过在冻结的文本LLM中插入新层并仅训练这些层来适应语音数据,实验表明其在ASR性能上接近全微调,且文本能力退化更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27918 2026-03-31 cs.CR cs.AI 79%

Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey

对多模态大语言模型的对抗攻击:全面综述

Bhavuk Jain, Sercan Ö. Arık, Hardeo K. Thakur

机构 * Google(谷歌) Bennett University, India(印度贝内特大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文综述了多模态大语言模型面临的对抗威胁,分析了攻击类型及其根源,提出分类框架以提升模型安全性。

Comments Survey paper, 37 pages, 10 figures, accepted at TMLR

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25107 2026-03-27 cs.CV 79%

Label What Matters: Modality-Balanced and Difficulty-Aware Multimodal Active Learning

关键性标注:模态平衡与难度意识的多模态主动学习

Yuqiao Zeng, Xu Wang, Tengfei Liang, Yiqing Hao, Yi Jin, Hui Yu

机构 * Key Laboratory of Big Data and Artificial Intelligence in Transportation, Ministry of Education(北京交通大学计算机与信息技术学院;轨道交通控制与安全国家重点实验室;交通大数据与人工智能教育部重点实验室) State Key Laboratory of Advanced Rail Autonomous Operation(格拉斯哥大学心理与神经科学学院) School of Computer and Information Technology, Beijing Jiaotong University School of Psychology & Neuroscience, University of Glasgow

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出RL-MBA框架,通过强化学习实现多模态主动学习的模态平衡与难度意识,提升分类准确率和模态公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23960 2026-03-26 cs.CV 79%

Leave No Stone Unturned: Uncovering Holistic Audio-Visual Intrinsic Coherence for Deepfake Detection

不留死角:揭示深度伪造检测中的整体音频视觉内在一致性

Jielun Peng, Yabin Wang, Yaqi Li, Long Kong, Xiaopeng Hong

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 本文提出HAVIC方法,通过学习模态特定的结构一致性及跨模态微/宏观一致性,提升深度伪造检测的鲁棒性和泛化能力,实验表明其在跨数据集场景中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22985 2026-03-25 cs.CL cs.CY 79%

Beyond Hate: Differentiating Uncivil and Intolerant Speech in Multimodal Content Moderation

超越仇恨:区分多模态内容审核中的不文明与不宽容言论

Nils A. Herrmann, Tobias Eder, Jingyi He, Georg Groh

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出细粒度标注方案区分不文明与不宽容言论,通过2030个仇恨漫画数据验证,细粒度标注提升模型性能,减少有害内容误判。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14203 2026-03-25 cs.CV 79%

Selective Noise Suppression and Discriminative Mutual Interaction for Robust Audio-Visual Segmentation

选择性噪声抑制与判别互作用用于鲁棒音频视觉分割

Kai Peng, Yunzhe Shen, Miao Zhang, Leiye Liu, Yidong Han, Wei Ji, Jingjing Li, Yongri Piao, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) Yale University(耶鲁大学) University of Alberta(阿尔伯塔大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 本文提出SDAVS方法,通过选择性噪声抑制处理器和判别音频视觉互融合策略,提升动态场景中音频视觉分割的鲁棒性与准确性。

Comments Accepted to IEEE Transactions on Multimedia (TMM) 2026. Code: https://github.com/happylife-pk/SDAVS

Journal ref IEEE Transactions on Multimedia (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22306 2026-03-25 cs.AI 79%

Memory Bear AI Memory Science Engine for Multimodal Affective Intelligence: A Technical Report

Memory Bear AI记忆科学引擎:多模态情感智能的技术报告

Deliang Wen, Ke Sun, Yu Wang

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Memory Bear AI框架,通过结构化记忆处理提升多模态情感智能,实现持续、鲁棒的情感识别与应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21803 2026-03-24 cs.CV 79%

Timing In stand-up Comedy: Text, Audio, Laughter, Kinesics (TIC-TALK): Pipeline and Database for the Multimodal Study of Comedic Timing

喜剧表演中的时间:文本、音频、笑声、身体语言(TIC-TALK):用于喜剧时间多模态研究的管道和数据库

Yaelle Zribi, Florian Cafiero, Vincent Lépinay, Chahan Vidal-Gorène

机构 * Centre Jean-Mabillon, École nationale des chartes, PSL, Paris, France(中心 Jean-Mabillon,国家档案学院,PSL,巴黎,法国) Laboratoire de Recherche, EPITA, Paris, France(研究实验室,EPITA,巴黎,法国) médialab, Sciences Po, Paris, France(媒体实验室,社会科学高等学院,巴黎,法国)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文介绍TIC-TALK数据库,通过5400多个时间对齐的主题片段,结合BERTopic、Whisper-AT、YOLOv8等技术,研究喜剧表演中的时间动态及观众反应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21013 2026-03-24 cs.AI cs.LG cs.RO 79%

A Framework for Low-Latency, LLM-driven Multimodal Interaction on the Pepper Robot

一种用于Pepper机器人低延迟LLM驱动多模态交互的框架

Erich Studerus, Vivienne Jia Zhong, Stephan Vonschallen

机构 * Institute for Information Systems(信息系统研究所) University of Applied Sciences and Arts Northwestern Switzerland(西北瑞士应用科学与艺术大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一个开源Android框架,通过端到端语音模型和功能调用能力,实现低延迟多模态交互,提升Pepper机器人的人机交互性能。

Comments 4 pages, 2 figures. To appear in Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (HRI '26), Edinburgh, Scotland, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02393 2026-03-23 cs.RO cs.CV 79%

EgoSpot:Egocentric Multimodal Control for Hands-Free Mobile Manipulation

EgoSpot:面向无手移动操作的视角多模态控制

Ganlin Zhang, Deheng Zhang, Longteng Duan, Guo Han, Yuqian Fu, Danda Pani Paudel, Luc Van Gool, Eric Vollenweider

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zurich(苏黎世联邦理工学院) SJTU(上海交通大学) Microsoft(微软公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种基于微软HoloLens 2混合现实头显的无手控制框架,通过眼动、头部动作和语音指令融合实现机器人移动和机械臂操作的实时控制,提升无障碍交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10045 2026-03-20 cs.CL 79%

Do Language Models Associate Sound with Meaning? A Multimodal Study of Sound Symbolism

语言模型是否将声音与意义关联?一种多模态研究声音象征主义

Jinhong Jeong, Sunghyun Lee, Jaeyoung Lee, Seonah Han, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学) Korea University(韩国大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 研究语言模型在多模态输入中对声音象征性的处理,通过分析不同语义维度下的音节注意力分数,揭示模型对声音与意义关联的理解机制。

Comments 33 pages, 27 tables, 10 figures, accepted to AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07209 2026-03-18 cs.MM cs.LG cs.SD 79%

Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits

通过条件音频生成实现一致的音频视觉编辑

Masato Ishii, Akio Hayakawa, Takashi Shibuya, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM

AI总结 本文提出一种联合音频视觉编辑 pipeline,通过条件音频生成实现视频编辑与音频的协调一致,实验表明其在保持音频视觉一致性方面优于现有方法。

Comments Source code: https://github.com/SonyResearch/CoherentAVEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13760 2026-03-17 cs.AI cs.SD 79%

Multimodal Emotion Regression with Multi-Objective Optimization and VAD-Aware Audio Modeling for the 10th ABAW EMI Track

多模态情感回归:基于多目标优化和VAD感知音频建模的第10届ABAW EMI任务

Jiawen Huang, Chenxi Huang, Zhuofan Wen, Hailiang Yao, Shun Chen, Longjiang Yang, Cong Yu, Fengyu Zhang, Ran Liu, Bin Liu

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出多目标优化和VAD感知音频建模方法,用于改进Hume-Vidmimic2数据集上的情感模仿强度估计任务,通过多模态融合和共享回归头提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10465 2026-03-12 cs.SD cs.CV cs.HC 79%

MoXaRt: Audio-Visual Object-Guided Sound Interaction for XR

MoXaRt: 基于音频视觉对象的XR声音交互

Tianyu Xu, Sieun Kim, Qianhui Zheng, Ruoyu Xu, Tejasvi Ravi, Anuva Kulkarni, Katrina Passarella-Ward, Junyi Zhu, Adarsh Kowdle

机构 * Google Mountain View CA USA(谷歌山景城) University of Michigan Ann Arbor MI USA(密歇根大学安 Arbor分校) Columbia University New York NY USA(哥伦比亚大学) Google San Francisco CA USA(谷歌旧金山)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 MoXaRt通过音频视觉线索分离交织声源,提升XR环境中的语音可懂度和社交参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23610 2026-03-12 cs.SD cs.CV 79%

Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention

高效音频-视觉语音分离与离散唇语语义及多尺度全局-局部注意力

Kai Li, Kejun Gao, Xiaolin Hu

机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University, Beijing(计算机科学与技术系,人工智能研究院,BNRist,清华大学,北京) IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing(IDG/麦克戈文脑研究 institute,清华大学,北京) Chinese Institute for Brain Research (CIBR), Beijing(中国脑科学研究院(CIBR),北京)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 Dolphin通过离散唇语语义和多尺度全局-局部注意力实现高效音频-视觉语音分离,提升分离质量和效率。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08282 2026-03-10 cs.CL 79%

Using Multimodal and Language-Agnostic Sentence Embeddings for Abstractive Summarization

利用多模态和语言无关的句子嵌入进行抽象摘要

Chaimae Chellaf, Salima Mdhaffar, Yannick Estève, Stéphane Huet

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出SBARThez框架,利用多模态和多语言句子嵌入提升抽象摘要的准确性与跨语言能力。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19821 2026-03-10 cs.CV 79%

Query-Guided Spatial-Temporal-Frequency Interaction for Music Audio-Visual Question Answering

基于查询引导的时空频交互的音乐音频视觉问答

Kun Li, Michael Ying Yang, Sami Sebastian Brandt

机构 * University of Twente(特文特大学) University of Bath(巴斯大学) IT University of Copenhagen(哥本哈根IT大学)

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出一种查询引导的时空频交互方法,通过整合问题引导的线索和频域特性,提升音频-视觉问答的性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03060 2026-03-04 eess.IV eess.AS 79%

DLIOS: An LLM-Augmented Real-Time Multi-Modal Interactive Enhancement Overlay System for Douyin Live Streaming

DLIOS:一种增强现实时间多模态交互增强叠加系统的大型语言模型增强系统,用于抖音直播

Shuide Wen, Sungil Seok, Beier Ku, Richee Li, Yubin He, Bowen Qu, Yang Yang, Ping Su, Can Jiao

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS

AI总结 DLIOS通过LLM增强实时多模态交互增强系统,实现抖音直播中的弹幕、礼物效果和TTS广播的高效处理与优化。

Comments 14 pages, 13 figures, 6 tables, 7 algorithms, 16 references, submitted to ACM/IEEE International Conference on Systems and Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02072 2026-03-03 cs.HC cs.AI 79%

Cognitive Prosthetic: An AI-Enabled Multimodal System for Episodic Recall in Knowledge Work

认知假体:一种基于AI的多模态系统,用于知识工作中的事件回忆

Lawrence Obiuwevwi, Krzysztof J. Rechowicz, Vikas Ashok, Sachin Shetty, Sampath Jayarathna

机构 * Old Dominion University(老奥 Dominion 大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的多模态系统CPMS,通过结构化事件捕获和自然语言检索,支持知识工作中的事件回忆,同时保障隐私安全。

Comments CHI EA '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01431 2026-03-03 cs.CV 79%

SeaVIS: Sound-Enhanced Association for Online Audio-Visual Instance Segmentation

SeaVIS: 声音增强的在线音频视觉实例分割

Yingjian Zhu, Ying Wang, Yuyang Hong, Ruohao Guo, Kun Ding, Xin Gu, Bin Fan, Shiming Xiang

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 SeaVIS通过引入因果交叉注意力融合模块和音频引导对比学习策略,实现了高效的在线音频视觉实例分割,提升了声音跟随能力并保持了实时处理性能。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02817 2026-02-24 cs.CL 79%

BOOM: Beyond Only One Modality KIT's Multimodal Multilingual Lecture Companion

BOOM: 超越单一模态的KIT多模态多语言讲座伴侣

Sai Koneru, Fabian Retkowski, Christian Huber, Lukas Hilgert, Seymanur Akti, Enes Yavuz Ugan, Alexander Waibel, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 BOOM通过多模态翻译技术,为多语言学习者提供同步的文本、幻灯片和语音输出,实现讲座内容的本地化与完整性保留。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10222 2026-02-12 cs.SD cs.AI 79%

Speech-Audio Compositional Attacks on Multimodal LLMs and Their Mitigation with SALMONN-Guard

针对多模态大语言模型的语音音频组合攻击及其通过SALMONN-Guard的缓解

Yudong Yang, Xuezhen Zhang, Zhifeng Han, Siyin Wang, Jimin Zhuang, Zengrui Jin, Jing Shao, Guangzhi Sun, Chao Zhang

机构 * Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Cambridge(剑桥大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态LLMs的安全性,提出SACRED-Bench评估语音音频组合攻击,并通过SALMONN-Guard将攻击成功率降低至20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04392 2026-02-12 eess.AS 79%

SLM-S2ST: A multimodal language model for direct speech-to-speech translation

SLM-S2ST: 一种用于直接语音到语音翻译的多模态语言模型

Yuxuan Hu, Haibin Wu, Ruchao Fan, Xiaofei Wang, Heng Lu, Yao Qian, Jinyu Li

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 SLM-S2ST是一种多模态语言模型,通过音频转换器头和流式 vocoder 实现高效的语音到语音翻译,实验表明其性能优于现有模型。

Comments Accepted by ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09121 2026-02-11 cs.AI 79%

Uncertainty-Aware Multimodal Emotion Recognition through Dirichlet Parameterization

通过狄利克雷参数化实现的不确定性感知多模态情绪识别

Rémi Grzeczkowicz, Eric Soriano, Ali Janati, Miyu Zhang, Gerard Comas-Quiles, Victor Carballo Araruna, Aneesh Jonelagadda

机构 * Kaliber Labs(Kaliber实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种轻量级且隐私保护的多模态情绪识别框架,通过狄利克雷参数化方法协调不同模态的不确定性,实现高效且鲁棒的情绪识别。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07960 2026-02-10 cs.CV 79%

D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning

D-ORCA:面向鲁棒音频视觉描述的对话中心优化

Changli Tang, Tianyi Wang, Fengyun Rao, Jing Lyu, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 D-ORCA通过对话中心优化,提升音频视觉描述的鲁棒性和准确性,填补开源生态关键空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07434 2026-02-10 cs.RO cs.AI 79%

Bridging Speech, Emotion, and Motion: a VLM-based Multimodal Edge-deployable Framework for Humanoid Robots

弥合语音、情感与运动:一种基于视觉语言模型的多模态边缘可部署框架用于人形机器人

Songhua Yang, Xuetao Li, Xuanye Fei, Mengde Li, Miao Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出SeM$^2$框架,通过多模态感知、思维链推理和语义序列对齐机制,实现情感一致的多模态交互,提升人形机器人在现实环境中的社交表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11261 2026-02-10 cs.CL 79%

Kahaani: A Multimodal Co-Creative Storytelling System

Kahaani:一种多模态协同创作叙事系统

Samee Arif, Muhammad Saad Haroon, Aamina Jamal Khan, Taimoor Arif, Agha Ali Raza, Awais Athar

机构 * Lahore University of Management Sciences(拉瓦尔大学管理科学学院) University of Michigan(密歇根大学) Strategize Labs(战略实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 Kahaani通过多模态技术帮助儿童提升英语能力、学习生活教训并理解故事结构,采用协同创作方式提供沉浸式教育体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22508 2026-02-02 cs.CV 79%

CoVA: Text-Guided Composed Video Retrieval for Audio-Visual Content

CoVA: 基于文本引导的复合视频检索用于音频视觉内容

Gyuwon Han, Young Kyun Jang, Chanho Eom

专题命中 音频语音多模态 :audio-visual(title);cross-modal(abstract);分类 cs.CV

AI总结 CoVA通过整合视频、音频和文本特征,解决音频视觉内容检索中的跨模态变化问题,提出AVT复合融合方法并构建AV-Comp基准。

Comments Please visit our project page at https://perceptualai-lab.github.io/CoVA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19673 2026-01-28 cs.SD cs.AI 79%

A Benchmark for Audio Reasoning Capabilities of Multimodal Large Language Models

多模态大语言模型音频推理能力的基准测试

Iwona Christop, Mateusz Czyżnikiewicz, Paweł Skórzewski, Łukasz Bondaruk, Jakub Kubiak, Marcin Lewandowski, Marek Kubis

机构 * Adam Mickiewicz University(亚当·密克维茨大学) Samsung R&D Institute Poland(三星波兰研发中心)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Audio Reasoning Tasks基准测试,用于评估多模态模型在结合不同音频任务进行推理方面的能力。

Comments 31 pages, 2 figures, accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏