arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-21 至 2026-08-21 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 2 篇

2608.19523 2026-08-21 eess.AS 新提交 85%

DAVSS: Distilled Audio-Visual State Space Models

DAVSS:蒸馏视听状态空间模型

Saurabhchand Bhati, Mrudula Athi, Amit S. Chhetri, James Glass

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 本研究提出14M参数的DAVSS模型,通过小patch提升输入分辨率、30%参数用于联合建模,在体积远小于CAV-MAE等Transformer视听模型的同时,性能仍优于后者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19527 2026-08-21 cs.HC cs.CL cs.SD 新提交 61%

Does Listening Matter? Backchanneling and Nodding in AI Clone

倾听重要吗?AI克隆中的反馈式回应与点头动作

Koji Inoue, Kazushi Kato, Tatsuya Kawahara, Shunichi Kasahara

专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.CL

AI总结 本研究将口头反馈式回应与头部点头整合到配备语音克隆及LLM响应的AI克隆中,经35人被试内研究证实,添加互动倾听行为可提升AI克隆的感知专注度、真实感与共同在场感,其保真度需涵盖倾听行为。

Comments This paper has been accepted to the Late-Breaking Results (LBR) track of the 28th International Conference on Multimodal Interaction (ICMI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏