arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4549 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4549 篇

2605.08805 2026-05-12 cs.CV 83%

LightAVSeg: Lightweight Audio-Visual Segmentation

LightAVSeg: 轻量级音频视觉分割

Qing Zhong, Guodong Ding, Lingqiao Liu, Zaiwen Feng, Lin Yuanbo Wu, Angela Yao

机构 * College of Informatics, Huazhong Agricultural University, Wuhan, China(华中农业大学信息学院) School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院) School of Computer Science, Adelaide University, Australia(阿德莱德大学计算机科学学院) School of Engineering, University of Warwick, Coventry, UK(沃里克大学工程学院) Zhejiang Yuexiu University, Shaoxing, China(浙江越秀大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出LightAVSeg,通过解耦设计替代重注意力机制,实现线性交互成本,提升效率,实验显示其在MS3基准上达到50.4 mIoU,参数量仅为AVSegFormer的1/7。

Comments 15 pages, 8 figures, 6 tables, Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07593 2026-05-11 cs.CV 83%

TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos

TraceAV-Bench: 多跳轨迹推理长音频视频基准测试

Hengyi Feng, Hao Liang, Mingrui Chen, Bohan Zeng, Meiyi Qiang, Zhengyang Zhao, Zimo Meng, Zeang Sheng, Wentao Zhang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 TraceAV-Bench首次评估多跳轨迹推理和多模态幻觉鲁棒性,包含2200道多选题,覆盖4个维度15个子任务,揭示多模态推理与幻觉鲁棒性脱节问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06897 2026-05-11 cs.CL cs.AI cs.HC cs.MM cs.SD eess.AS 83%

MIST: Multimodal Interactive Speech-based Tool-calling Conversational Assistants for Smart Homes

MIST:面向智能家居的多模态交互语音工具调用对话助手

Maximillian Chen, Xuanming Zhang, Michael Peng, Zhou Yu, Alexandros Papangelis, Yohan Jo

机构 * Columbia University(哥伦比亚大学) Seoul National University(首尔国立大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 本文提出MIST数据集,用于研究具备物理世界约束推理能力的多模态语音助手,发现开放和闭源多模态LLM在该任务上存在显著差距。

Comments Project Page: https://billyzhang24kobe.github.io/mist-smarthome/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00371 2026-05-04 cs.SD cs.AI 83%

GaMMA: Towards Joint Global-Temporal Music Understanding in Large Multimodal Models

GaMMA:迈向大规模多模态模型中的联合全局-时间音乐理解

Zuyao You, Zhesong Yu, Mingyu Liu, Bilei Zhu, Yuan Wan, Zuxuan Wu

机构 * Fudan University(复旦大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 GaMMA通过融合音频编码器和跨模态学习,实现音乐内容的全面理解,并在MusicBench基准测试中取得新高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24191 2026-04-28 cs.CV 83%

Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning

Omni-o3:深度嵌套多模态推理用于 deliberative 音视频推理

Zhicheng Zhang, Wentao Gu, Weicheng Wang, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan, Jufeng Yang

机构 * Nankai University(南开大学) Pengcheng Laboratory(鹏城实验室) Kuaishou Technology(快手科技) Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开国际先进研究院(深圳·福田))

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 Omni-o3通过深度嵌套推理策略,解决多模态交互中搜索空间大且冗余的问题,提升音视频推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11812 2026-04-17 cs.SD eess.AS eess.SP 83%

A Multimodal Data Fusion Generative Adversarial Network for Real Time Underwater Sound Speed Field Construction

一种多模态数据融合生成对抗网络用于实时水下声速场构建

Wei Huang, Yuqiang Huang, Jixuan Zhou, Fang Ji, Hao Zhang, Tianhe Xu

机构 * Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学院) Hanjiang National Laboratory(汉江国家实验室) School of Space Science and Technology, Shandong University (Weihai)(山东大学(威海)空间科学与技术学院) China Waterborne Transport Research Institute(中国水上运输研究院) China Ship Research and Development Academy(中国船舶研究与发展院)

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 本文提出MDF-RAGAN模型,通过多源融合和跨模态注意力机制提升水下声速场构建精度,实验显示其在误差小于0.3m/s的情况下优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11554 2026-04-15 cs.CL 83%

Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale

Relax:一种用于大规模多模态后训练的异步强化学习引擎

Liujie Zhang, Benzhe Ning, Rui Yang, Xiaoyan Yu, Jiaxing Li, Lumeng Wu, Jia Liu, Minghao Li, Weihang Chen, Weiqi Hu, Lei Zhang

机构 * AI Platform, Xiaohongshu Inc(小红书AI平台) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 Relax通过三个协同设计的架构层解决多模态数据流、大规模鲁棒性和延迟-吞吐量平衡问题,实现比veRL快1.20倍的端到端加速,并在多模态强化学习中表现出稳定收敛性。

Comments 17 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10695 2026-04-15 cs.CV 83%

Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification

检索以恢复:通过语义一致的净化实现不完整音频-视觉问答

Jiayu Zhang, Shuo Ye, Qilang Ye, Zihan Song, Jiajian Huang, Zitong Yu

机构 * School of Computing and Information Technology, Great Bay University(大湾大学计算机与信息学院) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) College of Computer Science, Nankai University(南开大学计算机学院) School of mathematics, Sun Yat-sen University(中山大学数学学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出R$^{2}$ScP框架,通过检索而非生成方法处理缺失模态,利用统一语义嵌入进行跨模态检索,并引入上下文感知适应净化机制,提升语义恢复能力,实验表明其在不完整模态场景中性能更优。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09110 2026-04-13 cs.MM 83%

Generalizing Video DeepFake Detection by Self-generated Audio-Visual Pseudo-Fakes

通过自动生成的音频视觉伪假来泛化视频深度伪造检测

Zihe Wei, Yuezun Li

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出AVPF方法,通过自动生成多样化的音频视觉伪假样本提升模型泛化能力,实验显示在多个标准数据集上平均性能提升达7.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06824 2026-04-09 cs.CV 83%

Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning

生成、分析与优化:基于MLLM元推理的无训练声源定位

Subin Park, Jung Uk Kim

机构 * Kyung Hee University(庆熙大学)

专题命中 音频语音多模态 :MLLM(title);multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出无训练的声源定位框架,利用多模态大语言模型的推理能力,通过生成-分析-优化流程实现声源定位,实验表明在单源和多源基准上表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10882 2026-04-07 cs.CL 83%

Computational emotion analysis with multimodal LLMs: Current evidence on an emerging methodological opportunity

基于多模态大语言模型的计算情感分析:当前对新兴方法论机会的证据

Hauke Licht

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL

AI总结 本文评估了多模态大语言模型在政治视频情感分析中的表现,发现实验室条件下的模型表现接近人类水平,但在真实场景中存在显著性能差距及性别偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02605 2026-04-06 cs.AI cs.SD 83%

Do Audio-Visual Large Language Models Really See and Hear?

音频视觉大语言模型真的能看见和听见吗?

Ramaneswaran Selvakumar, Kaousheik Jayakumar, S Sakshi, Sreyan Ghosh, Ruohan Gao, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 研究探讨了音频视觉大语言模型中音频与视觉特征的融合机制,发现当音频与视觉冲突时,最终文本生成中音频信息无法有效表露,揭示了多模态LLM在整合音频和视觉时的模态偏见。

Comments CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19660 2026-04-02 cs.CV cs.SD 83%

Semantic Audio-Visual Navigation in Continuous Environments

语义音频视觉导航在连续环境中

Yichen Zeng, Hebaixu Wang, Meng Liu, Yu Zhou, Chen Gao, Kehan Chen, Gongping Huang

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Shandong Jianzhu University(山东建筑大学) Nankai University(南开大学) Tsinghua University(清华大学) CASIA(中国科学院自动化研究所) UCAS(中国科学院大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出MAGNet模型,通过多模态Transformer实现语义目标推理,提升在连续空间中导航的鲁棒性与成功率。

Comments This paper has been accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03388 2026-03-31 cs.CV 83%

Cross-Modal Urban Sensing: Evaluating Sound-Vision Alignment Across Street-Level and Aerial Imagery

跨模态城市感知:评估声音与视觉在街道级和航空影像中的对齐情况

Pengyu Chen, Xiao Huang, Teng Fei, Sicheng Wang

机构 * Department of Geography, University of South Carolina(南卡罗来纳大学地理系) Department of Environmental Sciences, Emory University(埃默里大学环境科学系) University of Canterbury(坎特伯雷大学) School of Resource and Environmental Sciences, Wuhan University(武汉大学资源与环境科学学院)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 研究通过比较不同视觉表示策略,探讨城市声音与视觉场景的对齐程度,发现街道影像嵌入比分割结果更符合环境声音,而遥感分割在生态分类解释中更有效。

Comments 18 pages, 13 figures

Journal ref Transactions in GIS, 30(2), e70246, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13767 2026-03-26 cs.CV 83%

VocSegMRI: Multimodal Learning for Precise Vocal Tract Segmentation in Real-time MRI

VocSegMRI:多模态学习在实时MRI中的精确声带段分割

Daiqi Liu, Johannes Enk, Maureen Stone, Fangxu Xing, Tomás Arias-Vergara, Jerry L. Prince, Jana Hutter, Jonghye Woo, Andreas Maier, Paula Andrea Pérez-Toro

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃朗根-纽伦堡大学) University of Maryland School of Dentistry(马里兰大学牙科学院) Harvard Medical School/Massachusetts General Hospital(哈佛医学院/麻省总医院) Universidad de Antioquia UdeA(安蒂奥基亚大学 UdeA) Johns Hopkins University(约翰霍普金斯大学) Leibniz University Hannover(汉诺威莱布尼茨大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出VocSegMRI,通过跨注意力融合和对比学习目标,整合视频、音频和语音学输入,实现实时MRI中声带结构的精确分割,实验表明其优于单模态和多模态基线方法。

Comments Preprint submitted to MIDL short paper 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21948 2026-03-24 cs.MM 83%

Look, Listen and Segment: Towards Weakly Supervised Audio-visual Semantic Segmentation

注视、倾听与分割:迈向弱监督音频视觉语义分割

Chengzhi Li, Heyan Huang, Ping Jian, Yanghao Zhou

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出弱监督音频视觉语义分割方法,通过分解为注视、倾听和分割三个阶段,结合渐进跨模态对齐模块,实现基于视频级标签的帧级语义分割,实验表明其在弱监督方法中表现优异。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13340 2026-03-17 cs.CV 83%

Complementarity-Supervised Spectral-Band Routing for Multimodal Emotion Recognition

互补监督的频带路由用于多模态情感识别

Zhexian Huang, Bo Zhao, Hui Ma, Zhishu Liu, Jie Zhang, Ruixin Zhang, Shouhong Ding, Zitong Yu

机构 * Great Bay University(大湾大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Tencent Youtu Lab(腾讯优图实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出互补监督多频带专家网络Atsuko,通过多尺度频带分解和专家协作,解决多模态情感识别中模态间互补性不足和粗粒融合的问题,提升情感任务的细粒表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12583 2026-03-12 eess.AS cs.SD 83%

Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion

鲁棒的音频视觉目标说话人提取与情感感知多注册融合

Zhan Jin, Bang Zeng, Peijun Yang, Jiarong Du, Wei Ju, Yao Tian, Juan Liu, Ming Li

机构 * School of Computer Science, Wuhan University, Wuhan, China(1 武汉大学计算机学院,武汉,中国) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(2 香港中文大学(深圳)人工智能学院,中国) School of Artificial Intelligence, Wuhan University, Wuhan, China(3 武汉大学人工智能学院,武汉,中国) School of Cyber Science and Engineering, Wuhan University, Wuhan, China(4 武汉大学网络科学与工程学院,武汉,中国) Digital Innovation Research Center, Duke Kunshan University, Kunshan, China(5 香港中文大学(深圳)数字创新研究中心,中国) AI Center, OPPO, Beijing, China(6 OPPO人工智能中心,北京,中国)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 eess.AS

AI总结 本文提出一种鲁棒的音频视觉目标说话人提取方法,通过情感感知的多注册融合技术,在模态缺失情况下提升提取性能和鲁棒性。

Comments submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09809 2026-03-11 cs.CV 83%

RA-SSU: Towards Fine-Grained Audio-Visual Learning with Region-Aware Sound Source Understanding

RA-SSU:迈向细粒度音频视觉学习的区域感知声音源理解

Muyi Sun, Yixuan Wang, Hong Wang, Chen Su, Man Zhang, Xingqun Qi, Qi Li, Zhenan Sun

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(香港科技大学跨学科研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 RA-SSU通过构建细粒度音频视觉数据集和SSUFormer模型,实现区域感知的声音源理解,提升音频视觉学习的细粒度表现。

Comments Accepted by IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09084 2026-03-11 cs.CV 83%

OmniEdit: A Training-free framework for Lip Synchronization and Audio-Visual Editing

OmniEdit: 一种无需训练的唇同步与音频视觉编辑框架

Lixiang Lin, Siyuan Jin, Jinshan Zhang

机构 * HiThink Research(HiThink研究机构) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 OmniEdit提出一种无需训练的框架,通过替换编辑序列和去除随机元素,实现唇同步与音频视觉编辑的高效稳定处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07263 2026-03-10 cs.SD eess.AS 83%

Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning

看见上下文:通过多模态推理实现丰富的视觉上下文感知语音识别

Wenjie Tian, Mingchen Shao, Bingshen Mu, Xuelong Geng, Chengyou Wang, Yujie Liao, Zhixian Zhao, Ziyu Zhang, Jingbin Hu, Mengqi Wei, Lei Xie

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);audio-visual(abstract);分类 eess.AS

AI总结 本文提出VASR,通过多模态推理融合丰富视觉上下文,解决音频-视觉语音识别中的单模态主导问题,实现更准确的语音识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06530 2026-03-09 cs.CV 83%

AV-Unified: A Unified Framework for Audio-visual Scene Understanding

AV-Unified: 一个用于音频-视觉场景理解的统一框架

Guangyao Li, Xin Wang, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 AV-Unified提出一个统一框架,通过多尺度时空感知网络和跨模态指导模块,实现音频-视觉场景理解任务的联合学习和高效处理。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10689 2026-03-06 cs.AI 83%

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

OmniVideoBench: 向多模态大语言模型的音频-视觉理解评估迈进

Caorui Li, Yu Chen, Yiyan Ji, Jin Xu, Zhenyu Cui, Shihao Li, Yuanxing Zhang, Wentao Wang, Zhenghao Song, Dingling Zhang, Ying He, Haoxiang Liu, Yuxuan Wang, Qiufeng Wang, Jiafu Tang, Zhenhe Wu, Jiehui Luo, Zhiyu Pan, Weihao Xie, Chenchen Zhang, Zhaohui Wang, Jiayi Tian, Yanghai Wang, Zhe Cao, Minxin Dai, Ke Wang, Runzhe Wen, Yinghao Ma, Yaning Pan, Sungkyun Chang, Termeh Taheri, Haiwen Xia, Christos Plachouras, Emmanouil Benetos, Yizhi Li, Ge Zhang, Jian Yang, Tianhao Peng, Zili Wang, Minghao Liu, Junran Peng, Zhaoxiang Zhang, Jiaheng Liu

机构 * NJU-LINK Team(南京大学链接团队)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 OmniVideoBench通过大规模基准测试评估多模态大语言模型在音频-视觉理解中的协同推理能力,揭示模型与人类推理间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02877 2026-03-04 eess.AS 83%

DBMIF: a deep balanced multimodal iterative fusion framework for air- and bone-conduction speech enhancement

DBMIF:一种用于空气传导和骨传导语音增强的深度平衡多模态迭代融合框架

Yilei Wu, Changyan Zheng, Xingyu Zhang, Yakun Zhang, Chengshi Zheng, Shuang Yang, Ye Yan, Erwei Yin

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 eess.AS

AI总结 DBMIF通过深度平衡多模态迭代融合框架提升空气传导和骨传导语音增强性能,降低字符错误率2.5%以上。

Comments 10 pages, 7 figures, Applied Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22961 2026-03-03 eess.AS 83%

Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models

为统一多模态语音识别适应语音基础模型与大语言模型

Jing-Xuan Zhang, Genshun Wan, Jin Li, Jianqing Gao, Duo Zhao, Zhen-Hua Ling

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 eess.AS

AI总结 本文提出UASR-LLM框架,通过大语言模型与语音基础模型结合,实现多模态语音识别的统一优化与性能提升。

Comments 10 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23393 2026-03-02 cs.SD cs.CV 83%

Leveraging large multimodal models for audio-video deepfake detection: a pilot study

利用大型多模态模型进行音频视频深度伪造检测:一项试点研究

Songjun Cao, Yuqi Li, Yunpeng Luo, Jianjun Yin, Long Ma

机构 * Tencent Youtu Lab(腾讯优图实验室) Fudan University(复旦大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出AV-LMMDetect,利用大型多模态模型进行音频视频深度伪造检测,通过监督微调和分阶段训练,在多个数据集上达到新的性能水平。

Comments 5pages,ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18193 2026-02-24 cs.CV 83%

BLM-Guard: Explainable Multimodal Ad Moderation with Chain-of-Thought and Policy-Aligned Rewards

BLM-Guard:基于推理和政策对齐奖励的可解释多模态广告审核

Yiran Yang, Zhaowei Liu, Yuan Yuan, Yukun Song, Xiong Ma, Yinghao Song, Xiangji Zeng, Lu Sun, Yulu Wang, Hai Zhou, Shuai Cui, Zhaohan Gong, Jiefei Zhang

机构 * Kuaishou Technology(快手科技)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 BLM-Guard通过融合链式推理和政策对齐奖励,实现多模态广告的可解释性审核,提升审核的准确性与鲁棒性。

Comments 7 pages, 3 figures. To appear in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13640 2026-02-17 cs.RO cs.AI 83%

Hierarchical Audio-Visual-Proprioceptive Fusion for Precise Robotic Manipulation

层次化音频-视觉-本体感知融合用于精确机器人操作

Siyuan Li, Jiani Lu, Yu Song, Xianren Li, Bo An, Peng Liu

机构 * Harbin Institute of Technology, China(哈尔滨工业大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出层次化多模态融合框架,通过整合音频、视觉和本体感知信息,提升机器人精确操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08914 2026-02-10 cs.HC cs.AI 83%

Gesturing Toward Abstraction: Multimodal Convention Formation in Collaborative Physical Tasks

指向抽象:协作物理任务中的多模态惯例形成

Kiyosu Maeda, William P. McCarthy, Ching-Yi Tsai, Jeffrey Mu, Haoliang Wang, Robert D. Hawkins, Judith E. Fan, Parastoo Abtahi

机构 * Princeton University(普林斯顿大学) Brown University(布朗大学) MIT(麻省理工学院) Stanford University(斯坦福大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究通过多模态协作任务探讨了如何通过建立语言和手势抽象来提高协作效率,并扩展了惯例形成的概率模型。

Comments Accepted at the 2026 CHI Conference on Human Factors in Computing Systems (CHI 2026). 15 pages

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), ACM, 2026

URL PDF HTML 收藏
2602.03891 2026-02-06 eess.AS cs.AI cs.CV cs.MM cs.SD 83%

Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection

音频亮点:用于音频-视觉视频亮点检测的双路径音频编码器

Seohyun Joo, Yoori Oh

机构 * School of Electrical Engineering(电气工程学院) Music and Audio Research Group(音乐与音频研究组) Seoul National University(首尔国立大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出双路径音频编码器,通过结合语义和动态路径,提升音频-视觉视频亮点检测的性能。

Comments 5 pages, 2 figures, to appear in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏