arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-09 至 2026-04-09 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2604.06824 2026-04-09 cs.CV 83%

Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning

生成、分析与优化:基于MLLM元推理的无训练声源定位

Subin Park, Jung Uk Kim

机构 * Kyung Hee University(庆熙大学)

专题命中 音频语音多模态 :MLLM(title);multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出无训练的声源定位框架,利用多模态大语言模型的推理能力,通过生成-分析-优化流程实现声源定位,实验表明在单源和多源基准上表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06901 2026-04-09 cs.CE cs.AI cs.CV cs.CY cs.ET 81%

XR-CareerAssist: An Immersive Platform for Personalised Career Guidance Leveraging Extended Reality and Multimodal AI

XR-CareerAssist:一种结合扩展现实与多模态AI的沉浸式个性化职业指导平台

N. D. Tantaroudas, A. J. McCracken, I. Karachalios, E. Papatheou, V. Pastrikakis

机构 * Institute of Communications and Computer Systems (ICCS)(通信与计算机系统研究所) DASKALOS-APPS National Technical University of Athens(雅典国家技术大学) University of Exeter(埃克塞特大学) CVCOSMOS Ltd(CVCOSMOS有限公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出XR-CareerAssist平台,结合扩展现实与多模态AI,提供沉浸式、多语言的职业指导。系统整合语音识别、神经机器翻译、对话训练助手、视觉-语言模型和3D虚拟形象,通过动态Sankey图展示职业轨迹,实验显示高准确率和用户满意度。

Comments 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09677 2026-04-09 cs.AI 70%

Logics-Parsing-Omni Technical Report

逻辑-解析-全能技术报告

Xin An, Jingyi Cai, Xiangyang Chen, Huayao Liu, Peiting Liu, Peng Wang, Bei Yang, Xiuwen Zhu, Yongfan Chen, Yan Gao, Yuan Gao, Baoyu Hou, Guangzheng Hu, Shuzhao Li, Weixu Qiao, Weidong Ren, Yanan Wang, Boyu Yang, Fan Yang, Jiangtao Zhang, Lixin Zhang, Lin Qu, Hu Wei, Xiaoxiao Xu, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.AI

AI总结 本文提出Omni Parsing框架,通过三级层次结构实现多模态解析,整合整体检测、细粒度识别和多级解释,构建证据锚定机制以提升逻辑推理能力,释放Logics-Parsing-Omni模型并发布评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23435 2026-04-09 cs.SD cs.AI cs.MM eess.AS 67%

AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models

AudioRole: 一个用于大型语言模型角色扮演的音频数据集

Wenyu Li, Xiaoqi Jiao, Yi Chang, Guangyan Zhang, Yiwen Guo

机构 * Westlake University(西湖大学) Tencent LIGHTSPEED STUDIOS(腾讯LIGHTSPEED STUDIOS) Independent Researcher(独立研究员)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文提出AudioRole数据集,通过13部电视剧1000+小时的100万+角色对话,提供同步音频文本对及角色身份标注,结合ARP-Eval评估框架,验证了GLM-4-Voice在角色扮演中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏