Cross modal video representations for weakly supervised active speaker localization
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM
CookVoice:风格可控的多模态人声生成统一框架
机构 * UNSW Sydney(新南威尔士大学悉尼分校) ; Dolby Laboratories(杜比实验室)
专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract)
AI总结 CookVoice是统一的多模态人声生成框架,分解人声为内容、韵律、风格,支持多任务,参数少、推理高效,可控性强且生成质量接近基线模型。
SafeStudent驾驶:一种基于计算机视觉与移动感知的多模态驾驶员安全系统,用于支持青少年驾驶员
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 该研究开发了一种部署在 Raspberry Pi 和 Flutter 移动应用上的 SafeStudent Driving 多模态系统,通过计算机视觉与移动感知技术辅助青少年驾驶员,实验验证了其有效性,为新手驾驶员安全习惯养成提供了低成本方案。
可读且直观的多模态机器人状态与意图通信:在线和真实世界研究验证
机构 * Chair of Perception for Intelligent Systems, Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所智能系统感知教席) ; Centre for Applied Autonomous Sensor Systems (AASS), Örebro University(厄勒布鲁大学应用自主传感器系统中心) ; Robotics Institute Germany (RIG)(德国机器人研究所)
专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract)
AI总结 针对移动非人形机器人,通过在线和真实世界实验,系统比较了低表达单模态LED与高表达多模态(凝视、手势、语音)通信策略,发现多模态更可读直观,且真实环境中可读性和信心下降。
Comments Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)
基于参考的操作:多模态空间推理的框架与流程
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 本研究针对沉浸式平台中多模态空间交互问题,提出基于参考的操作框架,分解空间参考为源、锚点、框架组件,实现LLM驱动的流程并验证其效用,为空间交互设计提供关键经验。
Comments 16 pages, 10 figures. Accepted to the 39th Annual ACM Symposium on User Interface Software and Technology (UIST 2026)
FriendBench:人类与多模态大语言模型的二元熟悉度推理基准
机构 * Fluid Concepts Research(流体概念研究机构)
专题命中 音频语音多模态 :multimodal(title);分类 cs.CV、cs.CL、cs.AI
AI总结 该研究推出FriendBench基准,通过20秒二元破冰对话片段推断两人熟悉度,对比7家公司26个模型与人类的表现,发现模型与人类准确率无统计差异但先验倾向不同,且仅人类能从可见行为中获益,同时发布了相关资源。
Comments 15 pages, 3 figures
利用感知能力:针对多模态大语言模型智能体的隐蔽并发音频提示注入攻击
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 该研究针对多模态LLM智能体提出隐蔽并发音频提示注入攻击,构建首个相关基准并评估多款智能体,还提出CADV防御机制,经实验验证攻击有效且防御可靠。
Comments 19 pages, 8 figures, The code is publicly available at https://github.com/Limax666/AudioAgentSecurity
ThinkOmni:用于音频伪造检测与定位的推理驱动全模态大语言模型框架
机构 * Shenzhen University(深圳大学) ; Afirstsoft Technology Group Co., Ltd.(安福软件科技集团有限公司)
专题命中 音频语音多模态 :omni-modal(title,abstract)
AI总结 针对现有AFDL方法泛化能力不足的问题,提出推理驱动的全模态大语言模型ThinkOmni,构建FACoT数据集,引入FMIL与FCML,实现了跨数据集的音频伪造检测与定位。
Comments Accepted by ACM MM 2026, 21 pages, 12 figures
S2A2:利用声学空间信息进行操作任务的视听模仿学习
机构 * Kyoto University(京都大学) ; RIKEN(理化学研究所) ; Institute of Science Tokyo(东京理科大学)
专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract)
AI总结 研究利用声学信息进行操作任务的模仿学习,提出多模态框架S2A2,集成视觉与声学信息,实现多种策略集成,模拟与真实机器人实验表明其对特定任务有效且适用于现实操作。
Comments Project page: https://azuma413.github.io/projects/s2a2
使用基于语音的多模态大语言模型实现可泛化的认知障碍检测
机构 * Faculty of Digital Innovation, Arts \& Sciences, Saskatchewan Polytechnic, Regina SK S4S 5X1, Canada ; School of Basic Medical Sciences, Hebei University, Baoding 071000, China ; Department of Civil \& Environmental Engineering ; School of Mining \& Petroleum Engineering, University of Alberta, Edmonton AB T6G 2H5, Canada
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 研究针对认知障碍检测问题,提出基于开源大语言模型的多模态检测框架,整合语音音频与转录文本,提取特定模态嵌入后连接成特征向量用于分类,在相关基准数据集上评估,该框架准确率达92.4%,优于单模态基线且泛化能力强。
LH-AVLN:长距离视听语言导航基准测试
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Jilin University(吉林大学)
专题命中 音频语音多模态 :audio-visual(title,abstract)
AI总结 介绍长距离视听语言导航基准LH-AVLN,结合多目标任务执行等。提出免训练参考智能体PAG-Nav,可维护语义地图并规划。实验表明现有智能体完成任务有困难,PAG-Nav提供更强诊断基线。
Comments 12 pages, 3 figures
对Hugging Face上通用大语言模型和多模态大语言模型感知的实证研究
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 本文通过分析Hugging Face上662条讨论帖,揭示用户对LLM的主要关注点,包括访问障碍、生成质量及部署复杂性,并提出改进LLM生态系统的建议。
在可刷新触觉显示器上支持多模态数据交互:一种将触觉与对话式AI结合的架构
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 本文提出了一种结合触觉与对话式AI的架构,用于在可刷新触觉显示器上实现多模态数据交互,通过融合触觉输入与语音语言,提升视障人士的数据可视化体验。
Comments Accepted to be presented at IEEE PacificVis 2026; Best Paper Award (VisNotes track); Replacement: external DOI added
CD-MED:用于数字对象视觉比较的跨域多模态情感描述符
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 研究针对数字对象跨模态情感比较难题,提出CD-MED方法,通过各模态情感识别模型输出转化为共享描述符,在共同情感空间表示对象,实现跨域情感比较、检索、推荐及可视化。
Comments Submitted to 2026 Joint 14th International Conference on Soft Computing and Intelligent Systems and 27th International Symposium on Advanced Intelligent Systems (SCIS&ISIS 2026)
一种将多模态人类意图转化为无人机安全机动的中介模型
机构 * University of Notre Dame(诺丁汉大学) ; Imperial College London(伦敦帝国理工学院)
专题命中 音频语音多模态 :multi-modal(title,abstract)
AI总结 研究如何将多模态人类意图转化为无人机安全机动,提出需求导向的机动响应模型,通过结构化管道处理操作员输入,经多种约束验证后执行,还形式化为此类规范模型,经实验室验证可可靠解释并安全执行相关输入。
Comments 11 pages, 4 figures, preprint for MODRE 2026
音频-视觉语音增强:架构设计与部署策略
机构 * School of Engineering & Physical Sciences, Heriot-Watt University(赫瑞斯泰学院,赫瑞斯泰大学) ; College of Engineering Department of Electrical and Computer Engineering, San Diego State University(工程学院电子与计算机工程系,圣地亚哥州立大学) ; SDAIA-KFUPM Joint Research Centre for Artificial Intelligence, King Fahd University of Petroleum and Minerals(SDAIA-KFUPM人工智能联合研究中心,国王法赫德石油与矿物大学)
专题命中 音频语音多模态 :audio-visual(title,abstract)
AI总结 本文提出一种云-边协同的音频-视觉语音增强系统,通过CNN和LSTM融合网络实现时序一致性,并探讨网络负载和压缩对实时性能的影响,揭示了5G和有线以太网在解压音频视频中的关键作用。
Glance-Say:通过粘性注视实现多模态人机协作与意图识别
机构 * University of Tuebingen(图宾根大学) ; Nanyang Technological University(南洋理工大学) ; Mercedes-Benz(梅赛德斯-奔驰)
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 针对运动障碍者,本文提出多模态交互框架,用粘性注视算法稳定基于注视的意图,引入注视-语音交互范式及共享控制方案,实验表明其在目标跟踪、选择精度及任务时长上效果更佳。
Comments 8 pages, 6 figures
利用合成与增强生物信号实现多模态和多通道心音分类的规模化
机构 * School of Electrical Engineering, Computing, and Mathematical Sciences (EECMS), Faculty of Science and Engineering, Curtin University, Bentley, WA 6102, Australia(电气工程、计算与数学科学学院(EECMS),科学与工程学院, Curtin 大学,Bentley,WA 6102,澳大利亚)
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 针对心音分类中同步和多通道数据集有限的问题,提出结合传统信号处理与去噪扩散模型生成增强数据,微调Wav2Vec 2.0分类器,在多个数据集上取得最优性能。
Comments 35 pages, 37 figures, 19 tables
关于优化口语语言模型的多模态越狱攻击
机构 * Saarland University(萨尔大学) ; DFKI GmbH(德国人工智能研究中心) ; ETH AI Center(ETH人工智能中心)
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 提出联合音频文本多模态攻击框架JAMA,通过梯度优化同时扰动语音和文本模态,在四个SLM上实现1.5至20倍于单模态的越狱成功率,并分析其运行机制。
Comments Accepted at INTERSPEECH 2026
LiveServe:面向实时全模态大语言模型的交互感知服务系统
专题命中 音频语音多模态 :omni-modal(title,abstract)
AI总结 提出交互感知服务系统LiveServe,通过感知播放进度、语音活动和打断事件,优化调度与KV缓存管理,降低音频延迟并提升吞吐量。
ERM-MinMaxGAP:多语言多模态语音-LLM情感识别中的性别偏见基准测试与缓解
机构 * Kyoto University, Japan(京都大学,日本) ; Agency for Science, Technology, and Research (A*STAR), Singapore(科技研究局(A*STAR),新加坡)
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 针对多语言语音大模型在情感识别中的性别偏见问题,提出基于MELD-ST的多语言多模态基准,并设计ERM-MinMaxGAP训练目标,通过自适应公平权重和MinMaxGAP正则化器,在英日德三种语言上提升性能并缩小性别差距。
Comments This paper has been accepted for presentation at INTERSPEECH 2026 and as non-archival paper at ICML 2026 Workshop on Machine Learning for Audio
基于上下文引导跨模态注意力的多视角语音表示学习用于帕金森病检测
机构 * National Technical University of Athens(雅典国家技术大学)
专题命中 音频语音多模态 :cross-modal(title,abstract)
AI总结 提出多分支深度学习框架,融合Log-Mel谱图、MFCC和HuBERT嵌入三种互补语音模态,通过上下文引导跨模态注意力机制动态加权,在PC-GITA语料库上实现91.51%准确率和95.97% AUC,验证了异质语音建模对帕金森病检测的有效性。
评估针对拆分载荷视听隐写的多模态隐写分析
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 本文研究拆分载荷视听隐写能否逃避单模态和多模态隐写分析,实验表明跨模态拆分载荷可增加检测难度,但多模态检测器的优势主要来自视频流而非真正的音视频联合信号。
基于自由空间光子极端学习机的多模态光学特征提取
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 本文提出一种统一的自由空间光子极端学习机平台,通过相位SLM编码、类傅里叶自由空间传播和相机强度检测,实现对图像、音频、表格和回归任务的多模态光学特征提取,并在多个基准上取得高精度。
多模态语义源的安全联合源信道编码
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 研究在噪声窃听信道上传输多模态语义源的安全联合源信道编码问题,建立了速率-失真-感知权衡的基本界限。
ORACAL: 一种基于因果图增强的鲁棒且可解释的智能合约漏洞检测多模态框架
机构 * Information Security Lab, University of Information Technology(信息安全部,信息科技大学) ; Vietnam National University(越南国家大学) ; School of Computer Science and Information Technology, Adelaide University(计算机科学与信息技术学院,阿德莱德大学)
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 提出ORACAL异构多模态图学习框架,集成控制流图、数据流图和调用图,通过RAG和LLM增强关键子图,并采用因果注意力机制和PGExplainer实现鲁棒且可解释的智能合约漏洞检测。
Comments 21 pages, version 2
GPT-4o mini 是否被自身的安全过滤器蒙蔽?揭示多模态到单模态瓶颈在仇恨言论检测中的作用
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 本文通过 Hateful Memes Challenge 数据集系统分析 GPT-4o mini 在多模态仇恨言论检测中的安全架构,发现并实验验证了“单模态瓶颈”缺陷,即上下文无关的安全过滤器会优先阻断多模态推理,导致误报。
Comments This paper reports preliminary findings from a small-scale study whose sample size is insufficient to support the stated conclusions. The authors are withdrawing it to conduct a more comprehensive evaluation
通过建模内模和跨模态因果注意力来解构偏见以进行多模态情感分析
机构 * School of Computer Science, South China Normal University(华南师范大学计算机学院) ; School of Electronics and Information Technology, Sun Yat-sen University(中山大学电子与信息学院)
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 本文提出了一种多关系多模态因果干预(MMCI)框架,通过因果理论的后门调整来解决多模态情感分析中因统计捷径导致的偏见问题,通过建模多模态输入为多关系图并应用注意力机制分离因果特征和捷径特征,从而提升模型在分布偏移下的稳定性。
Comments Corrected several hyperparameter settings. Updated some experimental results
DFLOP: 一种基于数据的多模态大语言模型训练流水线优化框架
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 本文提出DFLOP框架,通过数据驱动的方法优化多模态大语言模型的训练流水线,提升GPU利用率和训练效率,实验证明其比现有框架快3.6倍。
Comments Accepted to Proceedings of the ACM on Management of Data (SIGMOD 2026)
Journal ref Proc. ACM Manag. Data 4, 3, Article 160 (June 2026), 29 pages
FAM-HRI: 基于基础模型的多模态人机交互框架,结合目光和语音
机构 * University of Tuebingen(图宾根大学) ; Nanyang Technological University(南洋理工大学) ; Mercedes-Benz(梅赛德斯-奔驰)
专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract)
AI总结 本文提出FAM-HRI,一种结合目光和语音的多模态人机交互框架,利用基础模型融合语言和目光输入,以提高任务执行的成功率和交互效率,为肢体障碍者提供实用解决方案。
Comments This work has been accepted for publication in IEEE Transactions on Automation Science and Engineering @ 2026 IEEE