arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4557 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4557 篇

2606.03168 2026-06-03 cs.CV 79%

JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation

JAVEDIT: 联合音频-视觉指令引导视频编辑与智能体数据策展

Yinan Chen, Chuming Lin, Zhennan Chen, Yuxiang Zeng, Junwei Zhu, Yali Bi, Xijie Huang, Chengming Xu, Donghao Luo, Zhucun Xue, Xiaobin Hu, Chengjie Wang, Yong Liu, Jiangning Zhang, Shuicheng Yan

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯优图实验室) Nanjing University(南京大学) University of Auckland(奥克兰大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 针对联合音频-视觉编辑缺乏数据集和基准的问题,提出首个大规模高质量数据集JAVEdit-100k、基准JAVEditBench以及基线模型JAVEdit,在六项指标中五项超越所有基线。

Comments Equal contributions from first two authors. Project page: https://ryanchenyn.github.io/projects/JAVEdit Code: https://github.com/RyanChenYN/JAVEdit Dataset: https://huggingface.co/datasets/Coraxor/JAVEdit-100k

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13713 2026-06-03 cs.IR cs.SD eess.AS 79%

TALKPLAY: Multimodal Music Recommendation with Large Language Models

TALKPLAY: 基于大语言模型的多模态音乐推荐

Seungheon Doh, Keunwoo Choi, Juhan Nam

机构 * KAIST(韩国科学技术院) talkpl.ai

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 提出TALKPLAY系统,通过将推荐转化为token生成问题,利用大语言模型处理多模态音乐特征,实现端到端对话式推荐,显著优于单模态方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12819 2026-06-02 cs.IR cs.CV 79%

WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata

WISE:一种用于视觉场景、音频、物体、人脸、语音和元数据的多模态搜索引擎

Prasanna Sridhar, Horace Lee, David M. S. Pinto, Andrew Zisserman, Abhishek Dutta

机构 * Engineering Science University of Oxford(工程科学大学牛津)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出WISE开源多模态搜索引擎,整合场景级和物体级的自然语言与反向图像查询、人脸搜索、音频事件检索、语音转录搜索及元数据过滤,支持跨模态组合查询,采用向量搜索实现高效扩展,可本地部署。

Comments Software: https://www.robots.ox.ac.uk/~vgg/software/wise/ , Online demos: https://www.robots.ox.ac.uk/~vgg/software/wise/demo/ , Example Queries: https://www.robots.ox.ac.uk/~vgg/software/wise/examples/

Journal ref International ACM SIGIR Conference on Research and Development in Information Retrieval (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30073 2026-05-29 cs.CV 79%

Native Audio-Visual Alignment for Generation

原生音视频对齐生成

Longbin Ji, Guan Wang, Xuan Wei, Chenye Yang, Xiangrui Liu, Zhenyu Zhang, Shuohuan Wang, Yu Sun, Jingzhou He

机构 * ERNIE Team, Baidu Inc.(百度公司ERNIE团队)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 提出NAVA框架,通过原生音视频对齐和上下文条件联合去噪,实现高质量、同步且可控的音视频生成。

Comments Project page: https://ernie-research.github.io/NAVA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29353 2026-05-29 cs.CR cs.CV 79%

DeepFake Forensics AI: A Multi-Modal Detection and Blockchain-Anchored Evidence Management Platform

DeepFake Forensics AI:多模态检测与区块链锚定证据管理平台

Naisha Minnah

机构 * Department of Computer Science(计算机科学系) Providence Women's College(普罗维登斯女子学院) University of Calicut(卡利卡特大学)

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出一个统一平台,通过训练四种神经网络检测图像、视频和音频中的合成媒体,并利用以太坊区块链实现证据的不可篡改存储与管理。

Comments 5 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17233 2026-05-28 cs.LG cs.SD eess.AS 79%

Semantic-Aware Interpretable Multimodal Music Auto-Tagging

语义感知可解释多模态音乐自动标注

Andreas Patakis, Vassilis Lyberatos, Spyridon Kantarelis, Edmund Dervakos, Giorgos Stamou

机构 * National Technical University of Athens(希腊国家技术大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 提出一种利用多模态音乐特征组和期望最大化算法实现可解释音乐自动标注的方法,在保持竞争性能的同时提供决策过程透明度。

Comments Accepted at Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24047 2026-05-26 cs.CV 79%

EMMA: Extracting Multiple physical parameters from Multimodal Data

EMMA: 从多模态数据中提取多个物理参数

Farhat Shaikh, Ayan Banerjee, Sandeep Gupta

机构 * IMPACT Lab, School of Computing & Augmented Intelligence (SCAI)(IMPACT实验室,计算与增强智能学院) Arizona State University, Tempe, AZ(亚利桑那州立大学,Tempe)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出EMMA框架,利用物理信息多模态融合和LTC网络,从原始视频、音频和图像时间序列中联合推断系统动力学参数,无需先验条件或专用传感器,在100+场景中优于单模态方法。

Comments Accepted at CVPR 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23703 2026-05-26 cs.HC cs.AI cs.CY 79%

Talking Slide Avatars: Open-Source Multimodal Communication Approach for Teaching

Talking Slide Avatars: 面向教学的开源多模态通信方法

Xinxing Wu

机构 * School of Mathematics and Computer Science, Kentucky State University(肯塔基州立大学数学与计算机科学学院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出一种集成OpenVoice和Ditto-TalkingHead的开源工作流,用于创建可说话的幻灯片头像,以增强在线教学中的教师存在感和叙事连续性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22170 2026-05-22 cs.CL 79%

Do Factual Recall Mechanisms Carry over from Text to Speech in Multimodal Language Models?

事实回忆机制在文本到语音的多模态语言模型中是否延续?

Luca Modica, Filip Landin, Mehrdad Farahani, Livia Qian, Gabriel Skantze, Richard Johansson

机构 * Zenseact Unbox AI Chalmers University of Technology(楚德斯大学) University of Gothenburg(哥德堡大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 研究探讨了多模态语言模型中事实回忆机制在文本和语音模态间的延续性,通过因果中介分析揭示了语音到文本与文本到文本在事实存储和回忆中的差异。

Comments In *SEM 2026, the 15th Joint Conference on Lexical and Computational Semantics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22120 2026-05-22 eess.AS cs.SD 79%

Effective User-defined Keyword Spotting with Dual-stage Matching, Multi-modal Enrollment, and Continual Adaptation

高效的用户定义关键词侦测:双阶段匹配、多模态注册与持续适应

Zhiqi Ai, Han Cheng, Shiyi Mu, Xinnuo Li, Yongjin Zhou, Shugong Xu

机构 * New York University(纽约大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS

AI总结 本文提出DMA-KWS框架,通过双阶段匹配、多模态注册和持续适应方法,解决用户定义关键词侦测中的混淆词区分、说话人发音不一致和高数据成本问题,实验表明其在LibriPhrase Hard子集上达到97.85%的AUC和6.13%的EER,性能领先。

Comments 14 pages, 13 figures, 12 tables. Accepted by TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12081 2026-05-21 eess.AS 79%

VoxATtack: A Multimodal Attack on Voice Anonymization Systems

VoxATtack: 一种多模态攻击 Voice Anonymization 系统

Ahmad Aloradi, Ünal Ege Gaznepoglu, Emanuël A. P. Habets, Daniel Tenbrinck

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 本文提出 VoxATtack 模型,通过结合语音和文本信息,攻击语音匿名化系统,展示了文本信息和选择性数据增强对当前语音匿名化方法的漏洞暴露。

Comments 5 pages, 3 figures, 3 tables, accepted at WASPAA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18884 2026-05-20 cs.LG cs.CV 79%

Navigating the Emotion Tree: Hierarchical Hyperbolic RAG for Multimodal Emotion Recognition

在情绪树中导航:用于多模态情绪识别的分层双曲RAG

Zeheng Wang, Bo Zhao, Yijie Zhu, Zhishu Liu, Hui Ma, Ruixin Zhang, Shouhong Ding, Qianyu Xie, Zitong Yu

机构 * Great Bay University(广东东莞大亚湾大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出HyperEmo-RAG,一种利用结构化情绪知识库的检索增强生成框架,通过双曲空间嵌入和证据图构建来提升多模态情绪识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12987 2026-05-19 cs.CL 79%

Leveraging Multimodal Self-Consistency Reasoning in Coding Motivational Interviewing for Alcohol Use Reduction

利用多模态自一致性推理进行编码动机访谈以减少酒精使用

Guangzeng Han, James G. Murphy, Benjamin O. Ladd, Xiaolei Huang, Brian Borsari

机构 * Department of Computer Science, University of Memphis(密苏里大学计算机科学系) Veterans Affairs Health Care System(退伍军人事务医疗系统) Department of Psychiatry and Behavioral Sciences, University of California San Francisco(旧金山大学精神病学与行为科学系) Department of Psychology, University of Memphis(密苏里大学心理学系) Department of Psychology, Washington State University Vancouver(华盛顿州立大学温哥华分校心理学系)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出基于音频语言模型的自动动机访谈编码方法,通过多模态自一致性推理提升编码鲁棒性,实验显示其在准确率、精确率和召回率上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15280 2026-05-14 cs.HC cs.AI 79%

LLM-based Multimodal Feedback Produces Equivalent Learning and Better Student Perceptions than Educator Feedback

基于大语言模型的多模态反馈在学习效果和学生感知上与教师反馈相当且更优

Chloe Qianhui Zhao, Jie Cao, Jionghao Lin, Kenneth R. Koedinger

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) The University of Hong Kong(香港大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种实时AI辅助的多模态反馈系统,通过整合结构化文本解释与动态多媒体资源,实现学习效果与学生感知的提升,证明AI反馈在清晰度、具体性等方面优于传统教师反馈。

Comments 11 pages, to be published at the 16th International Learning Analytics & Knowledge Conference (LAK '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07478 2026-05-11 cs.CV 79%

AudioFace: Language-Assisted Speech-Driven Facial Animation with Multimodal Language Models

AudioFace: 基于语言的语音驱动面部动画与多模态语言模型

Kai Zheng, Zejian Kang, Rui Mao, Hongyuan Zou, Yuanchen Fei, Xuanyang Xu, Xiangru Huang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) Tiangong University(天工大学) Hunan University(湖南大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出AudioFace框架,通过语言和发音信息指导语音驱动的面部动作生成,提升语音与面部运动的对应精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06757 2026-04-29 cs.SD cs.CV 79%

XM-ALIGN: Unified Cross-Modal Embedding Alignment for Face-Voice Association

XM-ALIGN:面向人脸-语音关联的统一跨模态嵌入对齐框架

Zhihua Fang, Shumei Tao, Junxu Wang, Liang He

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Xinjiang Multimodal Information Technology Engineering Research Center(新疆多模态信息处理工程技术研究中心) Urumqi Branch, China Mobile Group Xinjiang Co., Ltd(中国移动新疆乌鲁木齐分公司) School of Intelligence Science and Technology, Xinjiang University(新疆大学智能科学与技术学院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出XM-ALIGN框架,通过显式与隐式对齐机制提升跨模态验证性能,采用共享分类器联合优化人脸与语音嵌入,并通过数据增强提升泛化能力。

Comments FAME 2026 Technical Report

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25255 2026-04-29 cs.CV 79%

Personalized Cross-Modal Emotional Correlation Learning for Speech-Preserving Facial Expression Manipulation

面向语音保留的面部表情操控的个性化跨模态情感相关学习

Tianshui Chen, Yujie Zhu, Jianman Lin, Zhijing Yang, Chunmei Qing, Feng Gao, Liang Lin

机构 * Guangdong University of Technology(广东工业大学) South China University of Technology(华南理工大学) Peking University(北京大学) Sun Yat-Sen University(中山大学)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出PCMECL算法,通过个性化提示和特征差分提升跨模态对齐,解决面部表情操控中情感操控的监督问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18612 2026-04-29 cs.CR cs.CV 79%

Multimodal Privacy-Preserving Entity Resolution with Fully Homomorphic Encryption

多模态隐私保护实体解析与全同态加密

Susim Roy, Nalini Ratha

机构 * University at Buffalo, The State University of New York Department of Computer Science(布法罗大学计算机科学与工程系)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态框架,利用政府和金融机构的数据集,解决数据量、匹配精度和隐私问题,通过全同态加密保障隐私,实现低误判率和高效计算。

Comments 5 pages, 3 figures, IEEE ICASSP'26

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23692 2026-04-28 cs.GR cs.CV 79%

Personalizing Causal Audio-Driven Facial Motion via Dynamic Multi-modal Retrieval

通过动态多模态检索个性化因果音频驱动面部运动

Xuangeng Chu, Yu Han, Wei Mao, Shih-En Wei

机构 * The University of Tokyo, Codec Avatars Lab, Meta(东京大学,Codec Avatars实验室,Meta) Codec Avatars Lab, Meta(Codec Avatars实验室,Meta)

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种端到端的因果框架,通过动态多模态风格检索实现个性化因果面部运动生成,解决实时流媒体与高保真个性化之间的矛盾,提升低延迟并利用无结构风格参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22739 2026-04-27 cs.CV 79%

Inter-Stance: A Dyadic Multimodal Corpus for Conversational Stance Analysis

跨实例:一种双人多模态语料库用于对话立场分析

Xiang Zhang, Xiaotian Li, Taoyue Wang, Nan Bi, Xin Zhou, Cody Zhou, Zoie Wang, Andrew Yang, Yuming Su, Jeff Cohn, Qiang Ji, Lijun Yin

机构 * State University of New York at Binghamton(纽约州立大学布法罗分校) Choate Rosemary Hall(乔斯-罗丝玛丽高中) Rensselaer Polytechnic Institute(拉特格斯理工学院) Ward Melville High School(沃德梅尔维尔高中) University of Pittsburgh(匹兹堡大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一个包含多模态双人交互数据的语料库,用于研究对话中的立场分析,包含2D面部视频、3D面部几何、热谱动态、语音行为、生理数据及自我报告情感,通过实验评估双人互动的多模态建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20940 2026-04-24 cs.MM cs.NI cs.SD 79%

Sema: Semantic Transport for Real-Time Multimodal Agents

Sema:面向实时多模态代理的语义传输

Jiaying Meng, Bojie Li

机构 * Pine AI

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 Sema通过结合离散音频分词与混合屏幕表示及突发性分组传输,有效降低带宽并保持任务准确性,解决多模态代理传输中的语义保真问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23089 2026-04-23 cs.CV 79%

A Synchronized Audio-Visual Multi-View Capture System

同步的音频-视觉多视角捕捉系统

Xiangwei Shi, Gara Dorta, Ruud de Jong, Ojas Shirekar, Chirag Raman

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 本文提出一种同步音频-视觉多视角捕捉系统,通过统一时间架构整合多摄像机和多通道麦克风,实现高质量的音频视频同步记录,支持对话行为的精细分析与建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18203 2026-04-21 cs.CL 79%

Multiplication in Multimodal LLMs: Computation with Text, Image, and Audio Inputs

多模态大语言模型中的乘法:文本、图像和音频输入的计算

Samuel G. Balter, Ethan Jerzak, Connor T. Jerzak

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) National University of Singapore (NUS)(新加坡国立大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 研究多模态大语言模型在处理不同模态下的多数字乘法时的局限性,提出一个受控的多模态乘法基准,通过因子变化数字长度、稀疏性、表示形式和模态,定义算术负载作为总和和非零数字计数的乘积,揭示模型性能与算术负载的关系。

Comments To appear in ACL Findings (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16307 2026-04-21 cs.MM cs.HC 79%

Multimodal Digital Sensing of Early-Life Laying Hens: A Pilot Study Integrating Thermal, Acoustic, Optical-Flow and Environmental Data

多模态数字传感用于早期生活阶段产蛋鸡的监测:整合热成像、音频、光流和环境数据的试点研究

Yashan Dhaliwal, Daniel Essien, Suresh Neethirajan

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 本研究通过多模态传感整合热成像、音频、光流和环境数据,评估了早期产蛋鸡生理和行为发展特征,发现温度、声音和光流数据与年龄相关的变化,为精准养鸡的福利监测提供了基础。

Comments 29 pages, 11 figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03416 2026-04-17 cs.CV 79%

GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models

GAMBIT:一种用于多模态大语言模型的游戏化突破框架

Xiangdong Hu, Yangyang Jiang, Qin Hu, Xiaojun Jia

机构 * Georgia State University(佐治亚州立大学) Shandong University(山东大学) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GAMBIT框架,通过分解重组有害视觉语义并构建游戏化场景,使模型在探索和重建意图中主动完成突破,提升攻击成功率。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11570 2026-04-14 cs.HC cs.MM 79%

From Multimodal Signals to Adaptive XR Experiences for De-escalation Training

从多模态信号到自适应XR体验的降级训练

Birgit Nierula, Karam Tomotaki-Dawoud, Daniel Johannes Meyer, Iryna Ignatieva, Mina Mottahedin, Thomas Koch, Sebastian Bosse

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出了一种多模态实时通信分析系统,用于自适应VR训练的基础交互层,整合了语音、手势、情感分析、脑电波和生理信号,通过同步技术实现用户意识和无意识沟通线索的连续评估,结合社会符号学和象征互动理论,构建了连接低层信号到冲突缓解的解释层。

Comments 16 pages, 5 figures, ACM Intelligent User Interfaces (IUI) Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08701 2026-04-14 cs.CV cs.LG 79%

Unified Multimodal Uncertain Inference

多模态不确定推断的统一框架

Dengjia Zhang, Alexander Martin, William Jurayj, Kenton Murray, Benjamin Van Durme, Reno Kriz

机构 * Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(人类语言技术卓越中心)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出UMUI框架,通过多模态数据生成校准的概率估计,引入CLUE模型实现跨模态细粒度概率推理,实验表明其在多种模态上表现优于基线模型。

Comments Update citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08359 2026-04-10 eess.AS 79%

Tracking Listener Attention: Gaze-Guided Audio-Visual Speech Enhancement Framework

跟踪听者注意力:基于注视的音频视觉语音增强框架

Hsiang-Cheng Yang, You-Jin Li, Rong Chao, Yu Tsao, Borching Su, Shao-Yi Chien

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

AI总结 本文提出基于注视的音频视觉语音增强框架,通过结合注视方向与面部检测提取目标说话人特征,提升多说话人环境中的语音增强效果。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06950 2026-04-10 cs.CV 79%

Making MLLMs Blind: Adversarial Smuggling Attacks in MLLM Content Moderation

让 MLLMs 失明:MLLM 内容审核中的对抗走私攻击

Zhiheng Li, Zongyang Ma, Yuntong Pan, Ziqi Zhang, Xiaolei Lv, Bo Li, Jun Gao, Jianing Zhang, Chunfeng Yuan, Bing Li, Weiming Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京市多模态信息超智能安全重点实验室) Hellogroup University of Washington(华盛顿大学) Jilin University(吉林大学) ShanghaiTech University(上海科技大学)

专题命中 音频语音多模态 :MLLM(title);multimodal(abstract);分类 cs.CV

AI总结 本文揭示了MLLM在内容审核中面临的新威胁——对抗走私攻击,通过SmuggleBench基准测试发现多种模型易受攻击,提出通过感知和推理角度分析其根本原因并探索缓解策略。

Comments Accepted to ACL 2026. 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29244 2026-04-07 cs.CL cs.LG 79%

The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages

Thiomi数据集:一个大规模多模态语料库,用于低资源非洲语言

Hillary Mutisya, John Mugane, Gavin Nyamboga, Brian Chege, Maryruth Gathoni

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 Thiomi数据集包含超过60万条文本注释和38.5万条音频记录,用于训练和评估ASR、MT和TTS模型,显著提升了非洲语言的语音识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏