arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-27 至 2026-04-27 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 3 篇

2604.22739 2026-04-27 cs.CV 79%

Inter-Stance: A Dyadic Multimodal Corpus for Conversational Stance Analysis

跨实例:一种双人多模态语料库用于对话立场分析

Xiang Zhang, Xiaotian Li, Taoyue Wang, Nan Bi, Xin Zhou, Cody Zhou, Zoie Wang, Andrew Yang, Yuming Su, Jeff Cohn, Qiang Ji, Lijun Yin

机构 * State University of New York at Binghamton(纽约州立大学布法罗分校) Choate Rosemary Hall(乔斯-罗丝玛丽高中) Rensselaer Polytechnic Institute(拉特格斯理工学院) Ward Melville High School(沃德梅尔维尔高中) University of Pittsburgh(匹兹堡大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一个包含多模态双人交互数据的语料库,用于研究对话中的立场分析,包含2D面部视频、3D面部几何、热谱动态、语音行为、生理数据及自我报告情感,通过实验评估双人互动的多模态建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22209 2026-04-27 eess.AS cs.AI cs.CL cs.SD 75%

UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions

UniSonate:一种统一的语音、音乐和音效生成模型,通过文本指令控制

Chunyu Qiang, Xiaopeng Wang, Kang Yin, Yuzhe Liang, Yuxin Guo, Teng Ma, Ziyu Zhang, Tianrui Wang, Cheng Gong, Yushen Chen, Ruibo Fu, Chen Zhang, Longbiao Wang, Jianwu Dang

机构 * Tianjin University(天津大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 UniSonate通过统一的文本指令接口生成语音、音乐和音效,采用动态令牌注入机制和多阶段课程学习策略,提升跨模态生成性能,实现指令驱动的TTS和TTM的SOTA表现。

Comments Accepted to ACL 2026 main conference (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11594 2026-04-27 eess.AS cs.SD 70%

HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models

HumDial-EIBench: 一个用于音频语言模型的情感智能基准测试

Shuiyuan Wang, Zhixian Zhao, Hongfei Xue, Chengyou Wang, Shuai Wang, Hui Bu, Xin Xu, Lei Xie

机构 * Nanjing University, China(南京大学,中国) AISHELL, China(AISHELL,中国)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 本文提出HumDial-EIBench,通过真实人类对话评估音频语言模型的情感智能,采用多选题和对抗性干扰项减少主观评分偏差,发现大多数模型在多轮情感跟踪和隐含因果推理上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏