arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2861 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 221 篇

2608.07487 2026-08-11 cs.HC cs.CY 新提交 78%

SafeStudent Driving: A Multimodal Driver-Safety System to Support Teen Drivers Using Computer Vision and Mobile Sensing

SafeStudent驾驶:一种基于计算机视觉与移动感知的多模态驾驶员安全系统,用于支持青少年驾驶员

Max Liu, Yu Sun

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 该研究开发了一种部署在 Raspberry Pi 和 Flutter 移动应用上的 SafeStudent Driving 多模态系统,通过计算机视觉与移动感知技术辅助青少年驾驶员,实验验证了其有效性,为新手驾驶员安全习惯养成提供了低成本方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04798 2026-08-06 cs.HC 新提交 78%

Reference-Based Manipulation: A Framework and Pipeline for Multimodal Spatial Reasoning

基于参考的操作:多模态空间推理的框架与流程

Yangyang He, Zhuangze Hou, Yonglin Chen, Can Liu

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本研究针对沉浸式平台中多模态空间交互问题,提出基于参考的操作框架,分解空间参考为源、锚点、框架组件,实现LLM驱动的流程并验证其效用,为空间交互设计提供关键经验。

Comments 16 pages, 10 figures. Accepted to the 39th Annual ACM Symposium on User Interface Software and Technology (UIST 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29602 2026-08-03 cs.CL cs.AI cs.CV cs.HC 新提交 78%

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

FriendBench:人类与多模态大语言模型的二元熟悉度推理基准

Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin Peloquin

机构 * Fluid Concepts Research(流体概念研究机构)

专题命中 音频语音多模态 :multimodal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究推出FriendBench基准,通过20秒二元破冰对话片段推断两人熟悉度,对比7家公司26个模型与人类的表现,发现模型与人类准确率无统计差异但先验倾向不同,且仅人类能从可见行为中获益,同时发布了相关资源。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26553 2026-07-30 cs.SD 新提交 78%

ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization

ThinkOmni:用于音频伪造检测与定位的推理驱动全模态大语言模型框架

Yuxiong Xu, Kaiqing Lin, Bin Li, Haodong Li, Sheng Li

机构 * Shenzhen University(深圳大学) Afirstsoft Technology Group Co., Ltd.(安福软件科技集团有限公司)

专题命中 音频语音多模态 :omni-modal(title,abstract)

AI总结 针对现有AFDL方法泛化能力不足的问题,提出推理驱动的全模态大语言模型ThinkOmni,构建FACoT数据集,引入FMIL与FCML,实现了跨数据集的音频伪造检测与定位。

Comments Accepted by ACM MM 2026, 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26047 2026-07-29 cs.RO 新提交 78%

S2A2: Audio-Visual Imitation Learning for Manipulation Tasks Using Acoustic Spatial Information

S2A2:利用声学空间信息进行操作任务的视听模仿学习

Kaneyoshi Hiratsuka, Benjamin Yen, Ryosuke Kojima

机构 * Kyoto University(京都大学) RIKEN(理化学研究所) Institute of Science Tokyo(东京理科大学)

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract)

AI总结 研究利用声学信息进行操作任务的模仿学习,提出多模态框架S2A2,集成视觉与声学信息,实现多种策略集成,模拟与真实机器人实验表明其对特定任务有效且适用于现实操作。

Comments Project page: https://azuma413.github.io/projects/s2a2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21496 2026-07-24 eess.SP cs.LG 新提交 78%

Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models

使用基于语音的多模态大语言模型实现可泛化的认知障碍检测

Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao

机构 * Faculty of Digital Innovation, Arts \& Sciences, Saskatchewan Polytechnic, Regina SK S4S 5X1, Canada School of Basic Medical Sciences, Hebei University, Baoding 071000, China Department of Civil \& Environmental Engineering School of Mining \& Petroleum Engineering, University of Alberta, Edmonton AB T6G 2H5, Canada

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 研究针对认知障碍检测问题,提出基于开源大语言模型的多模态检测框架,整合语音音频与转录文本,提取特定模态嵌入后连接成特征向量用于分类,在相关基准数据集上评估,该框架准确率达92.4%,优于单模态基线且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12958 2026-07-15 cs.HC 新提交 78%

CD-MED: Cross-Domain Multimodal Emotion Descriptor for Visual Comparison of Digital Objects

CD-MED:用于数字对象视觉比较的跨域多模态情感描述符

Elnara Kadyrgali, Muragul Muratbekova, Pakizar Shamoi

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 研究针对数字对象跨模态情感比较难题,提出CD-MED方法,通过各模态情感识别模型输出转化为共享描述符,在共同情感空间表示对象,实现跨域情感比较、检索、推荐及可视化。

Comments Submitted to 2026 Joint 14th International Conference on Soft Computing and Intelligent Systems and 27th International Symposium on Advanced Intelligent Systems (SCIS&ISIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11654 2026-07-14 cs.RO cs.SE 新提交 78%

A Model for Mediating Multi-Modal Human Intent into Safe Maneuvers for UAVs

一种将多模态人类意图转化为无人机安全机动的中介模型

Sofia Nelson, Dalal Alrajeh, Pedro Antonio Alarcon Granadeno, Jane Cleland-Huang

机构 * University of Notre Dame(诺丁汉大学) Imperial College London(伦敦帝国理工学院)

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 研究如何将多模态人类意图转化为无人机安全机动,提出需求导向的机动响应模型,通过结构化管道处理操作员输入,经多种约束验证后执行,还形式化为此类规范模型,经实验室验证可可靠解释并安全执行相关输入。

Comments 11 pages, 4 figures, preprint for MODRE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22983 2026-06-23 cs.DC 新提交 78%

LiveServe: Interaction-Aware Serving for Real-Time Omni-Modal LLMs

LiveServe:面向实时全模态大语言模型的交互感知服务系统

Xiangyu Zhi, Peiqi Yin, Sheng Guan, Chenguang Zheng, James Cheng, Xiao Yan

专题命中 音频语音多模态 :omni-modal(title,abstract)

AI总结 提出交互感知服务系统LiveServe,通过感知播放进度、语音活动和打断事件,优化调度与KV缓存管理,降低音频延迟并提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09271 2026-06-09 cs.SD cs.LG 新提交 78%

Multi-View Speech Representation Learning for Parkinson's Disease Detection Using Context-guided Cross-modal Attention

基于上下文引导跨模态注意力的多视角语音表示学习用于帕金森病检测

George Theodosiou, Loukas Ilias, Dimitris Askounis

机构 * National Technical University of Athens(雅典国家技术大学)

专题命中 音频语音多模态 :cross-modal(title,abstract)

AI总结 提出多分支深度学习框架,融合Log-Mel谱图、MFCC和HuBERT嵌入三种互补语音模态,通过上下文引导跨模态注意力机制动态加权,在PC-GITA语料库上实现91.51%准确率和95.97% AUC,验证了异质语音建模对帕金森病检测的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08726 2026-06-09 cs.CR 新提交 78%

Evaluating Multimodal Steganalysis for Split-Payload Audiovisual Steganography

评估针对拆分载荷视听隐写的多模态隐写分析

Prateek Paudel, Nitin Jha, Abhishek Parakh

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文研究拆分载荷视听隐写能否逃避单模态和多模态隐写分析,实验表明跨模态拆分载荷可增加检测难度,但多模态检测器的优势主要来自视频流而非真正的音视频联合信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04224 2026-08-06 cs.CV 新提交 77%

OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films

OmniVR:用于恢复退化历史影片的联合视频-音频条件生成模型

Xin Lu, Zihao Fan, Mingchen Zhong, Jie Huang, Xueyang Fu, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) JD Explore Academy(京东探索研究院)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 提出首个联合音视频生成修复模型OmniVR,通过三项关键设计解决历史影片的音视频共同退化问题,在多类指标上超越现有方法,还发布了相关基准OmniVRBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21735 2026-06-23 eess.AS cs.SD 新提交 77%

Bridging the Age Gap: Towards Detecting Neural Audio Codec Synthesized Elderly Speech Deepfake

弥合年龄差距:面向检测神经音频编解码器合成的老年语音深度伪造

Orchid Chetia Phukan, Girish, Mohd Mujtaba Akhtar, Chi-Chun Lee

机构 * BIIC Lab, NTHU, Taiwan(国立台湾大学BIIC实验室) UPES, India(印度UPES大学) VBSPU, India(印度VBSPU大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 eess.AS

AI总结 提出老年语音编解码伪造检测(ECFD)任务,发布中英文ECF数据集,发现现有检测器泛化差,利用多模态基础模型融合(BONSAI框架)实现1.66%平均等错误率,建立新基准。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05769 2026-07-08 cs.CV cs.AI 新提交 76%

LEGATO 2: Toward Multimodal Sheet Music Recognition and Understanding

LEGATO 2:迈向多模态乐谱识别与理解

Guang Yang, Brian Siyuan Zheng, Victoria Ebert, Noah A. Smith

机构 * Paul G. Allen School of Computer Science & Engineering, University of Washington(保罗·G·艾伦计算机科学与工程学院,华盛顿大学)

专题命中 音频语音多模态 :multimodal(title);分类 cs.CV、cs.AI

AI总结 LEGATO 2提出从乐谱图像提取符号与语义知识的新流程,结合系统级分割和自回归视觉语言模型,能生成含文本的符号转录,在多数据集上优于现有技术,还能补充语言模型视觉输入,提升乐谱理解水平。

Comments 23 pages. Equal contribution: Guang Yang and Brian Siyuan Zheng

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17281 2026-06-17 cs.CL cs.SD eess.AS 新提交 76%

Are you speaking my languages? On spoken language adherence in multimodal LLMs

你在说我的语言吗?多模态大语言模型中的口语遵循问题

Hyungwon Kim, Kandarp Joshi, Lillian Zhou, Pavel Golik, Petar Aleksic

机构 * Google DeepMind(谷歌DeepMind)

专题命中 音频语音多模态 :multimodal(title);分类 cs.CL、eess.AS

AI总结 针对多模态大语言模型在自动语音识别中输出语言识别错误的问题,提出软提示方法、监督微调和思维链推理三种缓解策略,并引入新指标量化语言违背,比较各方法在减少违规和保持ASR性能上的效果。

Comments 7 pages, 3 tables in the main body

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12176 2026-07-15 cs.CV 新提交 74%

A Calibrated Multimodal Ensemble for Ambivalence/Hesitancy Recognition: System Description and Private-Test Submission Strategy

用于矛盾/犹豫识别的校准多模态集成:系统描述与私密测试提交策略

Josep Cabacas-Maso, Ismael Benito-Altamirano, Carles Ventura

机构 * eHealth Center, Faculty of Computer Science, Multimedia and Telecommunicactions, Universitat Oberta de Catalunya(加泰罗尼亚开放大学计算机科学、多媒体与电信学院电子健康中心) MIND/IN2UB, Department of Electronic and Biomedical Engineeering, Universitat de Barcelona(巴塞罗那大学电子与生物医学工程系MIND/IN2UB) Institute of Semiconductor Technology (IHT) & Laboratory for Emerging Nanometrology (LENA), Technische Universität Braunschweig(布伦瑞克工业大学半导体技术研究所(IHT)和新兴纳米计量实验室(LENA))

专题命中 音频语音多模态 :multimodal(title);分类 cs.CV

AI总结 该研究针对BAH数据集上的ABAW A/H挑战,提出校准多模态集成系统,由三个融合模型组成。在公共测试集上宏F1达0.7358,介绍五次私密测试提交的配置等,首次提交在私密测试中宏F1为0.7361,验证系统能推广到未见参与者。

Comments 8 pages, 1 figure, ECCV workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09765 2026-08-11 cs.CL cs.CV 新提交 73%

REFRAMED: Towards Realistic Audio Description Generation for Movies

REFRAMED:面向电影的真实音频描述生成

Igor Sterner, Mirella Lapata, Alex Lascarides, Frank Keller

专题命中 音频语音多模态 :multimodal(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 本文提出新的音频描述生成范式,构建含206部电影的REFRAMED数据集及评估协议,实验显示现有AD系统和多模态LLMs表现优于简单基线但不及专业人类,为视频理解研究提供新基础。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25543 2026-07-29 cs.CV cs.AI 新提交 73%

Less is More: Modality-Decoupling for General AIGC Audio-Video Detection

少即是多:通用AIGC音频-视频检测的模态解耦

Jielun Peng, Yabin Wang, Yaqi Li, Jincheng Liu, Xiaopeng Hong, Athanasios V. Vasilakos

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Agder(阿格德大学)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 针对通用AIGC音频-视频检测,现有方法假设不总成立,本文提出DAV-Det系统,通过决策级融合独立建模各模态取证证据,视觉和音频检测器分别利用多粒度表示及门控双分支架构,在挑战赛中排名第一。

Comments First place in the General AIGC Audio-Video Detection Challenge at the IJCAI-ECAI 2026 DDL 2.0 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25990 2026-06-25 cs.CL cs.AI cs.SD 新提交 73%

SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models

SpeechEQ: 社交感知语音对话模型的情商基准测试

Liang-Yuan Wu, Zih-Ching Chen, Tongshuang Wu, Chao-Han Huck Yang, Hua Shen

机构 * New York University(纽约大学) NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) NYU Shanghai(上海纽约大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 提出SpeechEQ框架,基于EQ-i 2.0理论构建2265个对话数据集,通过口语情商(SEQ)评分评估语音语言模型在主动多轮对话中的副语言社交线索推理能力,揭示端到端模型存在模态捷径、安全陷阱和上下文遗忘等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07608 2026-06-09 cs.CL cs.AI cs.LG cs.SD 新提交 73%

Subtitle-Aligned Fine-Tuning of Whisper for Swiss German ASR: Benchmark Contamination, Convention Mismatch, and an Honest Baseline at 25.6% WER (13.8% cWER)

针对瑞士德语音识别的Whisper字幕对齐微调:基准污染、惯例不匹配以及25.6% WER(13.8% cWER)的诚实基线

Felix Akeret

机构 * Independent Researcher, Zurich, Switzerland(独立研究员,瑞士苏黎世) ETH Zürich(苏黎世联邦理工学院) University of Bern(伯尔尼大学) FHNW(西北应用科学与艺术大学) CeTIM Leiden/Munich(CeTIM 莱顿/慕尼黑)

专题命中 音频语音多模态 :multimodal(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 通过1,367小时广播语音与标准德语字幕的弱监督,系统微调Whisper large-v3用于瑞士德语音识,发现公开结果因基准污染被高估,并发布两个诚实评估的模型。

Comments 15 pages, 21 tables. Models available at https://huggingface.co/Flix-AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08366 2026-08-11 cs.CV q-bio.GN 新提交 70%

VOICE: A Vision-Omics Foundation Model Integrating Direct and Retrieval-Based Prediction of In-situ Single-Cell Gene Expression

VOICE:一种融合原位单细胞基因表达直接预测与基于检索预测的视觉-组学基础模型

Xin Luo, Yicheng Tao, Haoxuan Zeng, Suyuan Wang, Chenzi Ouyang, Meiqi Zhu, Kai Liu, Shuibing Chen, Jie Liu

机构 * University of Michigan(密歇根大学) Weill Cornell Medicine(威尔康奈尔医学院)

专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 该研究提出多模态基础模型 VOICE,通过对比学习对齐 H&E 形态与单细胞表达嵌入,融合直接回归与参考检索分支,泛化性良好且在七项指标上优于现有方法,可从 H&E 图像预测单细胞基因表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06930 2026-08-10 cs.CV 新提交 70%

AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward

AVCap:用细节感知奖励强化音视频联合字幕

Mingyang Wu, Kaituo Feng, Bohao Li, Kaixiong Gong, Zihao Yin, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MMLab) Peking University(北京大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 针对音视频联合字幕的数据集、奖励信号、评估基准的局限,提出AVCap-100K数据集、AVCap模型及专用基准指标,通过Da-GRPO优化的AVCap模型性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06773 2026-08-10 cs.CV 新提交 70%

AnyTrack: Unifying Visual Object Tracking with Any Modalities

AnyTrack:用任意模态统一视觉目标跟踪

Hao Li, Yunzhi Zhuge, Wenning Hao, Pingping Zhang, Xiaoxiong Zhang, Dong Wang, Huchuan Lu

机构 * Army Engineering University of PLA(中国人民解放军陆军工程大学) Dalian University of Technology(大连理工大学) National University of Defense Technology(国防科技大学)

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对现有多模态目标跟踪器适配性与泛化性差的问题,提出AnyTrack框架,通过MIM与CUM模块实现任意模态的统一跟踪,扩展基准后实验验证其性能先进、灵活有效。

Comments Accepted by ACM MM2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04709 2026-08-06 cs.CL 新提交 70%

EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Live Chatbot

EmpaAva:开源智能体式3D化身共情实时聊天机器人

Jie Yang, Wenhao Xu, Shuhui Lin, Hao Fei

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Oxford(牛津大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL

AI总结 该研究提出首个开源智能体式3D化身共情聊天机器人EmpaAva,通过三智能体架构实现闭环多模态交互,在评估中优于多款基准模型,将开源并提供在线演示。

Comments Project&Demo: https://empaava.top/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04351 2026-08-06 cs.SD cs.AI 新提交 70%

HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models

HyPASE:用于大音频语言模型的参数高效语音情感微调框架的双曲几何方法

Tian Jin, Ruikang Zhang, Zefeng Zhao, Ding Luo, Jin Zeng

机构 * Tongji University(同济大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学)

专题命中 音频语音多模态 :cross-modal(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出HyPASE双曲PEFT框架,利用庞加莱球模型及HGA、EMCA组件,在MELD、IEMOCAP等数据集上优于欧氏PEFT基线,实现高效的大音频语言模型语音情感微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17773 2026-07-21 cs.MM 新提交 70%

FillGauss: Fine-Grained Filling-Aware Impact Sound Generation for 3D Gaussian Splatting

FillGauss:用于3D高斯点云的细粒度填充感知撞击声生成

Chen Yang, Ganye Wen, Bin Huang, Jiayi Lyu, Zehai Niu, Linlin Shen, Jinbao Wang

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.MM

AI总结 研究针对多模态AI中从视觉合成撞击声的挑战,提出细粒度填充感知撞击声生成任务。基于FillImpact数据集,构建FillGauss框架,融合多种要素实现位置、撞击物及填充感知音频生成,达物理基础跨模态音频生成新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13669 2026-07-16 cs.CV 新提交 70%

Learning Speaker Identity Beyond Language and Modality Constraints: Insights from the POLY-SIM 2026 Challenge

超越语言和模态限制学习说话者身份:来自POLY-SIM 2026挑战赛的见解

Marta Moscati, Muhammad Saad Saeed, Marina Zanoni, Mubashir Noman, Rohan Kumar Das, Monorama Swain, Yassin Terraf, Yufang Hou, Elisabeth Andre, Khalid Mahmood Malik, Markus Schedl, Shah Nawaz

机构 * Institute of Computational Perception, Johannes Kepler University(约翰内斯·开普勒大学计算感知研究所) University of Michigan-Flint(密歇根大学弗林特分校) BDO DIGITAL Gmbh(BDO数字有限公司) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Fortemedia(富特媒体公司) College of Computing, Mohammed VI Polytechnic University(穆罕默德六世理工大学计算学院) IT:U Interdisciplinary Transformation University(IT:U跨学科转型大学) University of Augsburg(奥格斯堡大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 POLY-SIM 2026挑战赛旨在解决多模态说话者识别中语言和模态限制问题,针对实际应用中信息缺失、多语言等挑战,为比较解决方案提供标准化设置。

Comments Accepted at ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11487 2026-07-14 cs.CL cs.AI cs.CV cs.HC cs.MM 新提交 70%

LightMem-Ego: Your AI Memory for Everyday Life

LightMem-Ego:适用于日常生活的人工智能记忆

Yijun Chen, Boyi Xiao, Yixian Zhao, Haoting Xia, Buqiang Xu, Jizhan Fang, Yanya Li, Yaqi Zheng, Xuehai Wang, Zirui Xue, Liuxin Zhang, Hui Li, Ningyu Zhang

机构 * Zhejiang University(浙江大学) South China University of Technology(华南理工大学) Central China Normal University(华中师范大学) Lenovo Group Limited(联想集团有限公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对移动和可穿戴设备上个人AI助手回答过去经历查询难的问题,提出LightMem-Ego轻量级流多模态记忆系统,能捕获、对齐并组织视觉和音频流成分层记忆,基于多模态证据生成答案,可部署在多种设备上提供多种支持。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22766 2026-06-23 cs.CV 新提交 70%

READ More than What You See: Reinforcement Learning for Accurate and Coherent Audio Description Generations

READ:超越所见——基于强化学习的准确连贯音频描述生成

Bo Fang, Xinyao Zhang, Yuxin Song, Hui Zhang, Hang Zhou, Antoni B. Chan

机构 * City University of Hong Kong(香港城市大学) Baidu Inc(百度公司) Tsinghua University(清华大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 提出首个基于强化学习的音频描述生成框架READ,通过序列级优化和连贯性奖励,显著提升生成准确性与连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17542 2026-06-17 cs.CL 新提交 70%

Evaluating Large Language Models Abilities for Addressee, Turn-change, and Next Speaker Prediction in Meetings

评估大型语言模型在会议中的收话人、话轮转换和下一说话人预测能力

Ryo Fukuda, Takatomo Kano, Siddhant Arora, Marc Delcroix, Naohiro Tawara, Atsunori Ogawa, Yuya Chiba, Atsushi Ando, William Chen, Shinji Watanabe

机构 * NTT, Inc., Japan(日本电信电话公司) Language Technologies Institute, Carnegie Mellon University, USA(卡内基梅隆大学语言技术研究所)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL

AI总结 利用大型语言模型(LLMs)研究多模态多人对话中的话轮转换,构建了收话人检测、话轮转换预测和下一说话人预测三个任务的评估框架,实验表明LLMs在下一说话人预测上优于监督模型和人类,但多模态LLM在收话人检测和话轮转换预测上仍低于人类水平。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏