arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-20 至 2026-04-20 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 2 篇

2604.15322 2026-04-20 cs.HC cs.CL cs.LG 57%

Acoustic and Facial Markers of Perceived Conversational Success in Spontaneous Speech

语音与面部特征在自发言语中感知对话成功的标志

Thanushi Withanage, Elizabeth Redcay, Carol Espy-Wilson

机构 * Department of Electrical and Computer Engineering, University of Maryland College Park, MD, USA(电气与计算机工程系,马里兰大学学院市分校) Department of Psychology, University of Maryland College Park, MD, USA(心理学系,马里兰大学学院市分校)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究通过分析自发Zoom对话,探讨对话动态与感知互动质量的关系,发现同步现象能可靠检测并预测更高的对话成功感知。

Comments Accepted for presentation at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15301 2026-04-20 cs.CV 57%

Think in Latent Thoughts: A New Paradigm for Gloss-Free Sign Language Translation

在潜在思想中思考:一种无手势词的签语翻译新范式

Yiyang Jiang, Li Zhang, Xiao-Yong Wei, Li Qing

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于推理的签语翻译框架,通过潜在思想序列作为中间层提升翻译的连贯性和准确性,并构建了一个新的大规模无手势词数据集。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏