arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-23 至 2026-04-23 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 2 篇

2604.20267 2026-04-23 cs.SD cs.AI 84%

ATIR: Towards Audio-Text Interleaved Contextual Retrieval

ATIR:面向音频-文本交错上下文检索

Tong Zhao, Chenghao Zhang, Yutao Zhu, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 音频语音多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文提出ATIR任务,通过整合ASR、QA和检索数据集构建基准,解决现有音频检索数据集在语义检索上的局限,引入新的token压缩机制提升MLLM在ATIR中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23089 2026-04-23 cs.CV 79%

A Synchronized Audio-Visual Multi-View Capture System

同步的音频-视觉多视角捕捉系统

Xiangwei Shi, Gara Dorta, Ruud de Jong, Ojas Shirekar, Chirag Raman

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 本文提出一种同步音频-视觉多视角捕捉系统,通过统一时间架构整合多摄像机和多通道麦克风,实现高质量的音频视频同步记录,支持对话行为的精细分析与建模。

详情

展开后加载摘要…

URL PDF HTML 收藏