arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 495 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 495 篇

1904.09078 2019-04-22 cs.LG stat.ML 56%

EmbraceNet: A robust deep learning architecture for multimodal classification

Jun-Ho Choi, Jong-Seok Lee

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);information fusion(journal_ref)

Comments Code available at https://github.com/idearibosome/embracenet

Journal ref Information Fusion 51 (2019) 259-270

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05698 2024-04-02 cs.CV cs.HC cs.MM cs.SD eess.AS 54%

HiCMAE: Hierarchical Contrastive Masked Autoencoder for Self-Supervised Audio-Visual Emotion Recognition

Licai Sun, Zheng Lian, Bin Liu, Jianhua Tao

专题命中 音视频/视觉语言融合 :information fusion(comments,journal_ref);分类 cs.CV、cs.MM

Comments Accepted by Information Fusion. The code is available at https://github.com/sunlicai/HiCMAE

Journal ref Information Fusion, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10441 2026-08-17 cs.CL 版本更新 50%

Decoding Student Minds: Leveraging Conversational Agents for Psychological and Learning Analysis

解码学生心智:利用对话代理进行心理和学习分析

Nour El Houda Ben Chaabene, Hamza Hammami, Laid Kahloul

机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) LIPAH-LR11ES14, National Engineering School of Tunis(突尼斯国家工程学院LIPAH-LR11ES14) Faculty of Sciences of Tunis(突尼斯科学学院) LINFI Laboratory(LINFI实验室)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文提出一种结合多模态数据和语义推理的对话代理,用于实时分析学生认知和情感状态,提升学习表现和情感福祉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09001 2026-08-14 cs.SD eess.AS 版本更新 50%

Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition

基于最优传输的基于大语言模型的视听语音识别语义对齐

Xugang Lu, Peng Shen, Yu Tsao, Hisashi Kawai

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 研究基于大语言模型的视听语音识别,提出基于最优传输的语义对齐框架,通过在多模态融合前对齐声学和视觉表征弥合模态差距,经实验验证该方法能有效提升性能,在多种条件下达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03921 2026-08-12 eess.AS 版本更新 50%

Cyclostationarity Analysis as a Complement to Self-Supervised Representations for Speech Deepfake Detection

循环平稳性分析作为语音深度伪造检测中自监督表示的补充

Cemal Hanilçi, Md Sahidullah, Tomi Kinnunen

专题命中 音视频/视觉语言融合 :hybrid fusion(abstract)

AI总结 本文提出基于循环平稳性分析的声学特征提取框架,用于提升语音深度伪造检测的性能。

Comments accepted for publication in IEEE Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08915 2026-08-11 cs.CL 新提交 50%

Investigating Multimodal Informativity under Different Partner Visibility Conditions in Video-Mediated Dialogue

视频介导对话中不同伙伴可见性条件下的多模态信息性研究

Esam Ghaleb, Hugh Mee Wong, Kristina Kobrock

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本研究针对视频介导对话,构建基于语音、手势或两者的模型识别指称对象,发现手势可单独预测指称,融合模型在转录模型不确定时效果最佳,还揭示了伙伴可见性对互动的语用效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00959 2026-08-11 cs.AI 版本更新 50%

Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

通过部分信息分解理解多模态语言模型中的模态交互

Wanlong Fang, Tianle Zhang, Wen Tao, Alvin Chan

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract)

AI总结 引入部分信息分解(PID)框架,分离感官和语言输入的独特、冗余和协同贡献,揭示多模态大模型中的模态使用模式,并扩展至三模态系统。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29112 2026-08-03 cs.SD cs.AI 新提交 50%

DoubleHelix: Structured Cross-Modal Fusion for Audio-Visual Speech Recognition with LLMs

DoubleHelix:结合大语言模型的视听语音识别结构化跨模态融合方法

Ziwei Cheng, Zhenhua Tan, Zhuomin Zhu

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 该研究针对视听语音识别跨模态融合缺乏结构化迭代优化的问题,提出DoubleHelix融合框架,通过三个组件实现迭代交互与退化感知增强,在LRS3数据集上大幅降低词错误率并提升噪声鲁棒性。

Comments ACM MM2026 ACCEPTED

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22794 2026-07-28 cs.LG cs.AI cs.CL cs.SD 新提交 50%

Multimodal Domain Generalization for Depression Detection: An Attention-Based BiLSTM Network with Domain-Adversarial Training

用于抑郁症检测的多模态域泛化:基于注意力的双向长短期记忆网络与域对抗训练

Ali Tabaraei, Federico Simonetta, Stavros Ntalampiras

机构 * University of Milan(米兰大学) Gran Sasso Science Institute (GSSI)(大萨索科学研究所)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 研究针对深度学习抑郁症检测泛化受限问题,提出含域泛化的多模态检测框架,集成BiLSTM与注意力机制,用梯度反转层增强泛化,实验表明该方法提升了准确率和F1分数,超越现有基准,消融研究突出各因素贡献。

Comments 12 pages, 8 figures, 6 tables. Accepted for publication in IEEE Transactions on Neural Networks and Learning Systems (TNNLS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28445 2026-07-23 cs.SD cs.AI cs.CL cs.LG 版本更新 50%

LoRA-Tuned Large Language Models for Dementia Detection via Multi-View Speech-Derived Features

基于多视角语音特征的LoRA微调大语言模型用于痴呆检测

Jonghyeon Park, Olivier Jiyoun Jung, Myungwoo Oh

机构 * NAVER Cloud(NAVER云) Division of Communication and Media, Ewha Womans University(通信与媒体系,成均馆大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 提出LoRA微调LLM,通过统一提示整合ASR转录、话语主题、时间流畅度和音韵序列四种语音特征,实现多视角推理,在ADReSSo上F1达90.14%。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12477 2026-07-17 cs.AI cs.LG 版本更新 50%

DualHNIE: Dual-Channel Hypergraph Learning for Node Importance Estimation in Heterogeneous Knowledge Graphs

MetaHGNIE:异构知识图谱中的元路径诱导超图对比学习

Jiawen Chen, Yanyan He, Qi Shao, Mengli Wei, Duxin Chen, Wenwu Yu, Yanlong Zhao

机构 * Jiangsu Key Laboratory of Networked Collective Intelligence, School of Mathematics, Southeast University(江苏网络集体智能重点实验室,数学学院,东南大学) Jiangsu Key Laboratory of Networked Collective Intelligence, School of Cyber Science and Engineering, Southeast University(江苏网络集体智能重点实验室,网络科学与工程学院,东南大学) State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, University of Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 研究异构知识图谱中节点重要性估计问题,提出DualHNIE框架,通过构建高阶知识图谱、引入互补编码器及对比对齐机制进行显式高阶建模和解缠双通道表示学习,实验验证其优于现有方法。

Comments Accepted by IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08573 2026-07-10 cs.AI 新提交 50%

SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits

用于情感和情绪识别的SHAP加权跨模态专家融合:证据与局限

Adis Alihodzic, Selma Skopljakovic Hubljar

机构 * Faculty of Science, University of Sarajevo(萨拉热窝大学理学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 研究多模态情感和情绪识别,重新审视XAI引导的自适应融合\xgaf,分析专家特征维度不等时SHAP归因减少的影响,通过实验对比不同融合方法在情感识别任务中的表现,揭示SHAP减少、专家维度和跨模态专家设计对模块化多模态融合的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30675 2026-07-01 eess.AS cs.AI cs.LG q-bio.QM 新提交 50%

Listening Between the Lines: Joint Learning of ASR Embeddings and LLM-Augmented Linguistics for Dementia Detection

弦外之音:ASR嵌入与LLM增强语言学联合学习用于痴呆检测

Olivier Jiyoun Jung, Jonghyeon Park, Myungwoo Oh

机构 * Division of Communication and Media, Ewha Womans University, South Korea(韩国梨花女子大学传播与媒体学院) NAVER Cloud, South Korea(韩国NAVER Cloud)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 提出多模态框架,结合Whisper的声学表示与LLM提取的语言特征,通过门控融合网络实现痴呆检测,在ADReSS和ADReSSo上F1分别达89.47%和90.14%。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30646 2026-07-01 cs.SD cs.AI cs.CL eess.AS 新提交 50%

ASR-Agnostic Multimodal Spectrotemporal Modeling for Early Dementia Detection

ASR无关的多模态谱时建模用于早期痴呆检测

Chukwuemeka Ugwu, Oluwafemi Richard Oyeleke

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 提出一种不依赖语音识别的框架,直接从梅尔频谱图中提取谱时位移场作为数字生物标志物,结合CNN-ConvGRU声学嵌入和交叉注意力融合,在三种语言语料库上验证了多模态融合的语料依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21050 2026-06-23 cs.SD 版本更新 50%

ERM-MinMaxGAP: Benchmarking and Mitigating Gender Bias in Multilingual Multimodal Speech-LLM Emotion Recognition

ERM-MinMaxGAP:多语言多模态语音-LLM情感识别中的性别偏见基准测试与缓解

Zi Haur Pang, Xiaoxue Gao, Tatsuya Kawahara, Nancy F. Chen

机构 * Kyoto University, Japan(京都大学,日本) Agency for Science, Technology, and Research (A*STAR), Singapore(科技研究局(A*STAR),新加坡)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 针对多语言语音大模型在情感识别中的性别偏见问题,提出基于MELD-ST的多语言多模态基准,并设计ERM-MinMaxGAP训练目标,通过自适应公平权重和MinMaxGAP正则化器,在英日德三种语言上提升性能并缩小性别差距。

Comments This paper has been accepted for presentation at INTERSPEECH 2026 and as non-archival paper at ICML 2026 Workshop on Machine Learning for Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17254 2026-06-17 eess.AS 新提交 50%

Synergizing Zero-Shot Cross-Lingual Alzheimer Detection with Language-Invariant Multimodal Bi-Geometric Adversarial Learning

协同零样本跨语言阿尔茨海默检测与语言不变多模态双几何对抗学习

Girish, Mohd Mujtaba Akhtar, Farhan Sheth, Muskaan Singh, Juliana Gerard, Paula McClean, Kongfatt Wong-Lin

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 提出ORBIT框架,通过跨注意力融合、多语言对抗和球面-双曲几何学习实现零样本跨语言阿尔茨海默病检测,多模态融合优于单模态基线。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16843 2026-06-16 cs.CL 新提交 50%

Data-Driven Decoding of Russell's Circumplex Model of Affect

基于数据驱动的Russell情感环状模型解码

Amdjed Belaref, Samir Sadok, Zineb Noumir, Renaud Seguier

机构 * Alten CentraleSupélec IETR UMR CNRS 6164(中央理工-高等电力学院 IETR CNRS 6164 联合研究单位) Inria at Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化研究所,格勒诺布尔阿尔卑斯大学,CNRS,LJK)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文研究Transformer嵌入是否恢复Russell环状模型的几何规律,通过文本和语音模型实验,发现多模态融合完美对齐情感排序,零样本下细粒度情感词接近人类映射坐标。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06285 2026-06-05 cs.AI 50%

TRACE: A Temporal Conditional Estimation for Multimodal Time Series Foundation Models

TRACE: 面向多模态时间序列基础模型的时间条件估计

Ziwen Kan, Yishuo Chen, Kecheng Li, Andrew Wen, Xiaomeng Wang, Liwei Wang, Jihao Duan, Song Wang, Hongfang Liu, Tianlong Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 提出TRACE条件估计范式,通过利用可用辅助模态推断缺失目标模态,解决多模态时间序列中的时间错位和部分模态缺失问题,在医疗和情感分析基准上优于现有融合方法。

Comments 5 figures and 5 tables in the main paper, plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05911 2026-06-05 cs.SD cs.LG eess.AS 50%

DBHN-Net: Dual-Branch Hybrid Neural Network For Low-Complexity Monaural Speech Enhancement

DBHN-Net: 低复杂度单声道语音增强的双分支混合神经网络

Cunhang Fan, Enrui Liu, Jing Zhou, Jian Kang, Jie Li, Andong Li, Jian Zhou, Zhao Lv, Xuelong Li

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, (School of Computer Science and Technology), Anhui University(光电信息获取与防护技术国家重点实验室(计算机科学与技术学院),安徽大学) China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(中国电信人工智能技术(北京)有限公司) Institute of Acoustics, University of Chinese Academy of Sciences(中国科学院声学研究所) Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究所(TeleAI),中国电信,中国)

专题命中 音视频/视觉语言融合 :information fusion(abstract)

AI总结 提出一种结合ANN和SNN的双分支混合神经网络,通过BandSplit、TF-Mamba等模块降低计算复杂度,同时利用交互和融合模块保持性能,在三个公共数据集上实现平均7.5倍复杂度降低。

Comments This article has been accepted for publication in IEEE Transactions on Pattern Analysis and Machine Intelligence(TPAMI)

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence(TPAMI2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06453 2026-06-01 cs.AI 50%

ConSensus: Multi-Agent Collaboration for Multimodal Sensing

ConSensus:面向多模态感知的多智能体协作

Hyungjun Yoon, Mohammad Malekzadeh, Sung-Ju Lee, Fahim Kawsar, Lorena Qendro

机构 * KAIST(韩国科学技术院) Nokia Bell Labs(诺基亚贝尔实验室) University of Glasgow(格拉斯哥大学)

专题命中 音视频/视觉语言融合 :hybrid fusion(abstract)

AI总结 提出ConSensus,一种无需训练的多智能体协作框架,通过将多模态感知任务分解为专用智能体并采用混合融合机制,在五个基准上平均准确率提升7.1%,融合token成本降低12.7倍。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20213 2026-05-12 cs.LG cs.CY 50%

Mixture of Experts for Recognizing Depression from Interview and Reading Tasks

专家混合模型用于从访谈和阅读任务中识别抑郁症

Loukas Ilias, Dimitris Askounis

机构 * DSS Laboratory, School of ECE, National Technical University of Athens, Greece(国家技术大学雅典分校电子工程系DSS实验室)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文提出利用多模态融合和专家混合模型,从访谈和阅读任务的语音中识别抑郁症,实现87%的准确率和86.66%的F1分数。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16579 2026-05-11 cs.LG cs.AI 50%

EviDep: Trustworthy Multimodal Depression Estimation via Disentangled Evidential Learning

EviDep:通过解耦证据学习实现可信的多模态抑郁估计

Fangyuan Liu, Sirui Zhao, Zeyu Zhang, Jinyang Huang, Feng-Qi Cui, Bin Luo, Meng Li, Tong Xu, Enhong Chen

机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) Department of Psychiatry, The First Affiliated Hospital of University of Science and Technology of China, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学附属第一医院精神科,生命科学与医学学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文提出EviDep框架,通过解耦证据学习量化抑郁严重程度及不确定性,提升多模态抑郁估计的可信度和不确定性校准能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29977 2026-04-15 cs.LG cs.AI q-bio.QM 50%

Quantifying Cross-Modal Interactions in Multimodal Glioma Survival Prediction via InterSHAP: Evidence for Additive Signal Integration

通过InterSHAP量化多模态胶质瘤生存预测中的跨模态交互:证据显示信号整合是加性的

Iain Swift, JingHua Ye, Ruairi O'Reilly

机构 * Department of Computer Science, Munster Technological University, Cork, Ireland(莫斯堡技术大学计算机科学系,爱尔兰科克)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文通过InterSHAP评估多模态深度学习在胶质瘤生存预测中的跨模态交互,发现性能提升源于互补信号聚合而非协同效应,为模型审计和联邦学习提供新视角。

Comments 8 pages, 1 figure, under review at XAI 2026 LBW

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03650 2026-04-07 cs.CL 50%

CAGMamba: Context-Aware Gated Cross-Modal Mamba Network for Multimodal Sentiment Analysis

CAGMamba:基于上下文的门控跨模态Mamba网络用于多模态情感分析

Minghai Jiao, Jing Xiao, Peng Xiao, Ende Zhang, Shuang Kan, Wenyan Jiang, Jinyao Li, Yixian Liu, Haidong Xin

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Xingning Power Supply Bureau, Guangdong Power Grid Co., Ltd.(广东电网有限责任公司兴宁供电局)

专题命中 音视频/视觉语言融合 :information fusion(abstract)

AI总结 本文提出CAGMamba网络,通过门控机制实现跨模态信息融合,有效建模上下文依赖和情感演变,实验表明在多模态情感分析任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27321 2026-03-31 cs.LG cs.AI 50%

Multimodal Forecasting for Commodity Prices Using Spectrogram-Based and Time Series Representations

基于频谱和时间序列表示的商品价格多模态预测

Soyeon Park, Doohee Chung, Charmgil Hong

机构 * Impactive AI

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文提出SEMF方法,结合频谱和时间序列表示,提升多变量时间序列预测的准确性与鲁棒性,通过多模态融合和频谱编码在多个商品价格预测任务中优于七种基线模型。

Comments AAAI 2026 Summer Symposium Series; 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25752 2026-03-30 cs.CL cs.SD eess.AS 50%

Relational graph-driven differential denoising and diffusion attention fusion for multimodal conversation emotion recognition

关系图驱动的微分去噪和扩散注意力融合用于多模态对话情感识别

Ying Liu, Yuntao Shou, Wei Ai, Tao Meng, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(中南林业科技大学计算机与数学学院) Department of Computer Science, State University of New York, New Paltz(纽约州立大学新帕尔茨分校计算机科学系)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文提出关系感知去噪和扩散注意力融合模型,通过微分Transformer去噪、构建模态关系子图和文本引导跨模态扩散机制,提升多模态对话情感识别性能。

Comments 19 pages

Journal ref neurocomputing2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23673 2026-03-26 eess.AS cs.SD 50%

Crab: Multi Layer Contrastive Supervision to Improve Speech Emotion Recognition Under Both Acted and Natural Speech Condition

Crab:多层对比监督以提升在表演和自然语音条件下的语音情感识别

Lucas H. Ueda, João G. T. Lima, Paula D. P. Costa

机构 * Dept. of Computer Engineering and Automation (DCA), Faculdade de Engenharia Elétrica e de Computação(计算机工程与自动化系(DCA)、电气与计算机工程学院) AI Lab.(人工智能实验室) Institute of Computing, Universidade Estadual de Campinas, UNICAMP(计算学院,坎皮纳斯州立大学,UNICAMP)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文提出Crab模型,通过多层对比监督策略提升语音情感识别在表演和自然语音条件下的性能,采用跨模态Transformer架构和多任务对比学习,有效解决类别不平衡问题。

Comments IEEE Transactions on Affective Computing submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00030 2026-03-20 cs.LG 50%

Modality Equilibrium Matters: Minor-Modality-Aware Adaptive Alternating for Cross-Modal Memory Enhancement

模态均衡至关重要:面向跨模态记忆增强的次要模态感知自适应交替方法

Xiang Shi, Rui Zhang, Jiawei Liu, Yinpeng Liu, Qikai Cheng, Wei Lu

机构 * School of Information Management, Wuhan University(武汉大学信息管理学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文提出一种基于Shapley值的自适应交替训练框架,通过优先考虑次要模态平衡融合,引入记忆模块和跨模态映射机制,提升多模态学习性能,在四个基准数据集上取得SOTA结果。

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12583 2026-03-12 eess.AS cs.SD 50%

Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion

鲁棒的音频视觉目标说话人提取与情感感知多注册融合

Zhan Jin, Bang Zeng, Peijun Yang, Jiarong Du, Wei Ju, Yao Tian, Juan Liu, Ming Li

机构 * School of Computer Science, Wuhan University, Wuhan, China(1 武汉大学计算机学院,武汉,中国) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(2 香港中文大学(深圳)人工智能学院,中国) School of Artificial Intelligence, Wuhan University, Wuhan, China(3 武汉大学人工智能学院,武汉,中国) School of Cyber Science and Engineering, Wuhan University, Wuhan, China(4 武汉大学网络科学与工程学院,武汉,中国) Digital Innovation Research Center, Duke Kunshan University, Kunshan, China(5 香港中文大学(深圳)数字创新研究中心,中国) AI Center, OPPO, Beijing, China(6 OPPO人工智能中心,北京,中国)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文提出一种鲁棒的音频视觉目标说话人提取方法,通过情感感知的多注册融合技术,在模态缺失情况下提升提取性能和鲁棒性。

Comments submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08459 2026-03-10 cs.LG 50%

Data-Driven Priors for Uncertainty-Aware Deterioration Risk Prediction with Multimodal Data

数据驱动先验用于多模态数据的不确定性感知退化风险预测

L. Julián Lechuga López, Tim G. J. Rudner, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) University of Toronto(多伦多大学) Tandon School of Engineering, New York University(纽约大学工程学院)

专题命中 音视频/视觉语言融合 :information fusion(abstract)

AI总结 本文提出MedCertAIn框架,通过数据驱动的先验方法提升多模态临床数据中风险预测的准确性和不确定性量化能力。

Comments 24 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏