arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-27 至 2026-02-27 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2602.22659 2026-02-27 cs.CV cs.MM 84%

Scaling Audio-Visual Quality Assessment Dataset via Crowdsourcing

通过众包扩大音频-视觉质量评估数据集

Renyu Yang, Jian Jin, Lili Meng, Meiqin Liu, Yilin Wang, Balu Adsumilli, Weisi Lin

机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) School of Information Science and Engineering, Shandong Normal University(信息科学与工程学院,山东师范大学) Institute of Information Science, Beijing Jiao Tong University(信息科学研究院,北京交通大学) YouTube Media Algorithms team, Google Inc.(YouTube媒体算法团队,谷歌公司)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出了一种通过众包扩大音频-视觉质量评估数据集的方法,通过设计实验框架、系统化数据准备和扩展标注,构建了最大的多样化AVQA数据集,用于多模态感知研究。

Comments Accepted to ICASSP 2026. 5 pages (main paper) + 8 pages (supplementary material)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15340 2026-02-27 cs.CV 70%

Towards Seamless Interaction: Causal Turn-Level Modeling of Interactive 3D Conversational Head Dynamics

迈向无缝交互:交互式3D对话头部动力学的因果回合级建模

Junjie Chen, Fei Wang, Zhihao Huang, Qing Zhou, Kun Li, Dan Guo, Linfeng Zhang, Xun Yang

机构 * HFUT(合肥工业大学) IAI, Hefei Comprehensive National Science Center(人工智能研究院,合肥综合性国家科学中心) USTC(中国科学技术大学) SJTU(上海交通大学) TeleAI, China Telecom(TeleAI,中国电信) NWPU(西北工业大学) UAEU(阿联酋大学) AHPU(安徽大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 TIMAR通过因果回合级建模,实现了交互式3D对话头部动态的高效生成,提升了对话的表达性和时序一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05115 2026-02-27 cs.GR cs.CV cs.SD eess.AS 62%

RAP: Real-time Audio-driven Portrait Animation with Video Diffusion Transformer

RAP: 基于音频的实时人物动画与视频扩散变换器

Fangyu Du, Taiqing Li, Qian Qiao, Tan Yu, Ziwei Zhang, Dingcheng Zhen, Xu Jia, Yang Yang, Shunshun Yin, Siyuan Liu

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

AI总结 RAP通过混合注意力机制和静态-动态训练-推理范式,在实时约束下实现高质量音频驱动人物动画,提升音频-视觉同步与视觉保真度。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23266 2026-02-27 cs.CL 57%

Discourse-Aware Dual-Track Streaming Response for Low-Latency Spoken Dialogue Systems

面向 discourse 的双轨流式响应用于低延迟语音对话系统

Siyuan Liu, Jiahui Xu, Feng Jiang, Kuang Wang, Zefeng Zhao, Chu-Ren Huang, Jinghang Gu, Changqing Yin, Haizhou Li

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Department of Language Science and Technology, Hong Kong Polytechnic University(香港理工大学语言科学与技术系) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院) School of Data Science, Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Artificial Intelligence, Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 DDTSR 提出了一种低延迟语音对话系统框架,通过双轨流式响应机制实现听中思考和说中思考,显著降低响应延迟并保持 discourse 质量。

详情

展开后加载摘要…

URL PDF HTML 收藏