arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6897 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6897 篇

2601.18683 2026-01-27 stat.ME astro-ph.IM cs.LG 78%

Learned harmonic mean estimation of the marginal likelihood for multimodal posteriors with flow matching

基于流匹配的连续归一化流用于多模后验的学得谐均估计

Alicja Polanska, Jason D. McEwen

机构 * Mullard Space Science Laboratory, University College London(穆尔空间科学实验室,伦敦大学学院) Alan Turing Institute(艾伦·图灵研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出基于流匹配的连续归一化流,用于高效估计多模后验的边际似然,解决了传统方法在处理复杂后验时的局限性。

Comments Submitted to 44th International Workshop on Bayesian Inference and Maximum Entropy Methods in Science and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05840 2026-01-27 cs.LG 78%

Multimodal Trajectory Representation Learning for Travel Time Estimation

多模态轨迹表示学习用于旅行时间估计

Zhi Liu, Xuyuan Hu, Xiao Han, Zhehao Dai, Zhaolin Deng, Guojiang Shen, Xiangjie Kong

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang University of Technology College of Computer Science(浙江工业大学计算机科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出多模态动态轨迹整合框架,通过整合GPS、网格轨迹和道路网络约束,提升旅行时间估计的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15390 2026-01-23 cs.LG 78%

FedUMM: A General Framework for Federated Learning with Unified Multimodal Models

FedUMM: 一种统一多模态模型的联邦学习通用框架

Zhaolong Su, Leheng Zhao, Xiaoying Wu, Ziyue Xu, Jindong Wang

机构 * NVIDIA

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 FedUMM提出了一种低通信成本的联邦学习框架,用于训练统一多模态模型,通过参数高效微调实现客户端和服务器的高效协作,提升了隐私保护下的多模态模型训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14942 2026-01-22 cs.LG eess.SP 78%

Communication-Efficient Multi-Modal Edge Inference via Uncertainty-Aware Distributed Learning

通过不确定性感知的分布式学习实现高效的多模态边缘推断

Hang Zhao, Hongru Li, Dongfang Xu, Shenghui Song, Khaled B. Letaief

机构 * Dept. of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出一种三阶段通信感知分布式学习框架,通过减少通信开销和提升稳健性,实现高效的多模态边缘推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13979 2026-01-21 cs.RO 78%

Active Cross-Modal Visuo-Tactile Perception of Deformable Linear Objects

主动跨模态视觉-触觉感知用于可变形线性物体

Raffaele Mazza, Ciro Natale, Pietro Falco

机构 * Dipartimento di Ingegneria, Università degli Studi della Campania Luigi Vanvitelli(工程学院,坎帕尼亚路易吉·范维蒂利大学) Dipartimento di Ingegneria dell’Informazione, Università degli Studi di Padova(信息工程学院,帕多瓦大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 本文提出一种结合视觉和触觉的跨模态感知框架,用于重建受遮挡的可变形线性物体的3D形状。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11545 2026-01-21 cs.HC 78%

Multimodal Data Fusion to Capture Dynamic Interactions between Built Environment and Vulnerable Older Adults

多模态数据融合以捕捉建成环境与易受伤害的老年人之间的动态交互

Houhao Liang, Azrin Jamaluddin, Kresimir Friganovic, Kirstie Neo, Raphael Han, Navrag Singh, Panos Mavros

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本研究通过多模态数据融合技术,探索建成环境对易受伤害老年人移动性的影响,为包容性城市规划提供数据支持。

Comments This work has been accepted to the AAAI 2026 Workshop on AI for Urban Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07399 2026-01-19 cs.IR 78%

Are Multimodal Embeddings Truly Beneficial for Recommendation? A Deep Dive into Whole vs. Individual Modalities

多模态嵌入真的能提升推荐效果吗?对整体与个体模态的深入探究

Yu Ye, Junchen Fu, Yu Song, Kaiwen Zheng, Joemon M. Jose

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究探讨多模态嵌入对推荐效果的实际影响,发现整体嵌入提升效果有限,但文本模态单独使用效果显著,图像模态则不具优势。

Comments Accepted by ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06140 2026-01-13 cs.LG stat.ML 78%

Causal and Federated Multimodal Learning for Cardiovascular Risk Prediction under Heterogeneous Populations

因果与联邦多模态学习用于异质人群中的心血管风险预测

Rohit Kaushik, Eva Kaushik

机构 * Hanson Professional Services(Hanson专业服务) University of Tennessee, Knoxville(田纳西大学 Knoxville分校) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种融合因果学习与联邦学习的多模态框架,用于在异质人群中预测心血管风险,通过整合多种生物医学数据并确保隐私和可解释性,提升预测的鲁棒性和公平性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22947 2026-01-12 eess.SP 78%

Intelligent Multimodal Multi-Sensor Fusion-Based UAV Identification, Localization, and Countermeasures for Safeguarding Low-Altitude Economy

智能多模多传感器融合-based无人机识别、定位与防护系统用于保障低空经济安全

Yi Tao, Zhen Gao, Fangquan Ye, Jingbo Xu, Tao Song, Weidong Li, Yu Su, Lu Peng, Xiaomei Wu, Tong Qin, Zhongxiang Li, Dezhi Zheng

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出基于深度学习的多模多传感器融合系统,用于实现无人机的识别、定位与防护,提升低空经济安全防护效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24793 2026-01-01 cs.LG cs.NE 78%

Self-Supervised Neural Architecture Search for Multimodal Deep Neural Networks

多模态深度神经网络的自监督神经架构搜索

Shota Suzuki, Satoshi Ono

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出了一种自监督学习方法,用于多模态深度神经网络的架构搜索,能够在未标记数据上有效设计DNN架构。

Journal ref IEICE Transactions on Information and Systems, Vol.E108.D, No. 6, pp. 640-643, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22102 2025-12-29 cs.LG 78%

Explainable Multimodal Regression via Information Decomposition

通过信息分解实现可解释的多模态回归

Zhaozhao Ma, Shujian Yu

机构 * Zhejiang University(浙江大学) Georgia Institute of Technology(佐治亚理工学院) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) UiT - The Arctic University of Norway(挪威北极大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出基于部分信息分解的多模态回归框架,通过分解模态特定表示为唯一、冗余和协同组件,提升预测准确性和可解释性,并在多个数据集上验证其有效性。

Comments Project Page: https://github.com/zhaozhaoma/PIDReg

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21543 2025-12-29 cs.IR 78%

CEMG: Collaborative-Enhanced Multimodal Generative Recommendation

CEMG: 基于协作增强的多模态生成推荐

Yuzhen Lin, Hongyi Chen, Xuanjing Chen, Shaowen Wang, Ivonne Xu, Dongming Jiang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 CEMG通过多模态融合层和残差量化变分自编码器,提升多模态生成推荐的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18117 2025-12-23 cs.IR 78%

Factorized Transport Alignment for Multimodal and Multiview E-commerce Representation Learning

因子化运输对多模态和多视角电商表示学习

Xiwen Chen, Yen-Chieh Lien, Susan Liu, María Castaños, Abolfazl Razi, Xiaoting Zhao, Congzhe Su

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出因子化运输框架,通过统一多模态和多视角学习,提升电商场景下的检索性能。

Comments Accepted by WSDM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10729 2025-12-23 cs.LG 78%

Using LLMs for Late Multimodal Sensor Fusion for Activity Recognition

利用大语言模型进行晚阶段多模态传感器融合以进行活动识别

Ilker Demirel, Karan Thakkar, Benjamin Elizalde, Miquel Espi Marques, Aditya Sarathy, Yang Bai, Umamahesh Srinivas, Jiajie Xu, Shirley Ren, Jaya Narain

机构 * Apple(苹果公司) MIT(麻省理工学院) Johns Hopkins(约翰霍普金斯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 利用大语言模型进行晚阶段多模态融合,实现零样本和单样本活动分类,无需特定任务训练。

Comments NeurIPS Workshop on Learning from Time Series for Health

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05037 2025-12-19 cs.LG 78%

ModalSurv: Investigating opportunities and limitations of multimodal deep survival learning in prostate and bladder cancer

ModalSurv: 探索多模态深度生存学习在前列腺和膀胱癌中的机会与局限

Noorul Wahab, Ethar Alzaid, Jiaqi Lv, Fayyaz Minhas, Adam Shephard, Shan E Ahmed Raza

机构 * TIA Centre, Department of Computer Science, University of Warwick, UK(沃里克大学计算机科学系TIA中心,英国)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 ModalSurv通过多模态数据整合提升生存预测,但在外部测试中临床特征表现更优,揭示了多模态对齐的挑战和泛化能力的限制。

Comments 4 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22780 2025-12-17 cs.LG physics.geo-ph 78%

Multimodal Atmospheric Super-Resolution With Deep Generative Models

多模态大气超分辨率与深度生成模型

Dibyajyoti Chakraborty, Haiwen Guan, Jason Stock, Troy Arcomano, Guido Cervone, Romit Maulik

机构 * Information Sciences and Technology(信息科学与技术系) The Pennsylvania State University(宾夕法尼亚州立大学) Environmental Science Division(环境科学部) Argonne National Laboratory(阿贡国家实验室) Department of Geography(地理系)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出利用基于分数的扩散模型进行多模态大气超分辨率,通过结合稀疏观测数据提升高维状态恢复精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12881 2025-12-16 cs.LG q-bio.NC stat.ML 78%

Unsupervised learning of multiscale switching dynamical system models from multimodal neural data

从多模态神经数据中无监督学习多尺度切换动力学系统模型

DongKyu Kim, Han-Lin Hsieh, Maryam M. Shanechi

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出了一种无监督学习方法,通过多尺度神经观测学习切换多尺度动力学系统模型,以更准确解码行为并提升脑机接口性能。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08071 2025-12-10 cs.LG 78%

CAMO: Causality-Guided Adversarial Multimodal Domain Generalization for Crisis Classification

CAMO:基于因果引导的对抗多模态领域泛化用于危机分类

Pingchuan Ma, Chengshuai Zhao, Bohan Jiang, Saketh Vishnubhatla, Ujun Jeong, Alimohammad Beigi, Adrienne Raglin, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 CAMO通过结合对抗去耦与统一表示学习,解决多模态危机分类中的领域泛化问题,提升模型在未见灾害场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01750 2025-12-02 eess.SP cs.LG 78%

Multimodal Mixture-of-Experts for ISAC in Low-Altitude Wireless Networks

多模态专家混合模型用于低空无线网络中的ISAC

Kai Zhang, Wentao Yu, Hengtao He, Shenghui Song, Jun Zhang, Khaled B. Letaief

机构 * IEEE

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出了一种多模态专家混合模型,用于提升低空无线网络中ISAC的性能,通过自适应融合策略提高环境感知和通信效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01858 2025-12-01 quant-ph cs.CR cs.DC cs.ET cs.LG 78%

MQFL-FHE: Multimodal Quantum Federated Learning Framework with Fully Homomorphic Encryption

MQFL-FHE: 多模态量子联邦学习框架与全同态加密

Siddhant Dutta, Nouhaila Innan, Sadok Ben Yahia, Muhammad Shafique, David Esteban Bernal Neira

机构 * SVKM's Dwarkadas J. Sanghvi College of Engineering(SVKM的达沃拉德·J·桑格维工程学院) eBRAIN Lab, Division of Engineering, New York University Abu Dhabi (NYUAD)(eBRAIN实验室,工程系,纽约大学阿布扎比分校(NYUAD)) Center for Quantum and Topological Systems (CQTS), NYUAD Research Institute(量子与拓扑系统中心(CQTS),NYUAD研究机构) The Maersk Mc-Kinney Moller Institute, University of Southern Denmark(马士克·麦克金尼·莫勒研究所,南丹麦大学) Corvinus Institute for Advanced Studies (CIAS), Budapest, Hungary(科维努斯高级研究学院(CIAS),布达佩斯,匈牙利) Davidson School of Chemical Engineering, Purdue University(戴维森化学工程学院,普渡大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种结合量子计算和全同态加密的多模态联邦学习框架,旨在提升隐私保护下的模型性能与泛化能力。

Comments 10 pages, 6 figures, 6 Tables. Accepted at IJCNN 2025

Journal ref 2025 International Joint Conference on Neural Networks (IJCNN), Rome, Italy, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00964 2025-12-01 eess.SP 78%

Multi-Modal Fusion-Based Multi-Task Semantic Communication System

基于多模态融合的多任务语义通信系统

Zengle Zhu, Rongqing Zhang, Xiang Cheng, Liuqing Yang

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出基于多模态融合的多任务语义通信系统,利用BERT融合模块提升多模态信息处理效率,实验表明其在性能和通信开销上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21889 2025-12-01 cs.LG 78%

Exploring Fusion Strategies for Multimodal Vision-Language Systems

探索多模态视觉-语言系统的融合策略

Regan Willis, Jason Bakos

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文探讨了多模态视觉-语言系统中不同数据融合策略的准确率与延迟权衡,通过三种模型架构验证了早期融合在降低延迟方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04096 2025-12-01 cs.CE 78%

Cross-Modal Alignment between Visual Stimuli and Neural Responses in the Visual Cortex

视觉皮层中视觉刺激与神经反应的跨模态对齐

Xing Gao, Dazhong Rong, Qinming He

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 本文提出视觉-神经对齐方法VNA,通过判别性编码和解码任务在视觉皮层中实现更精确的视觉刺激与神经反应映射。

Comments This paper has been accepted by 2025 International Conference on Brain-Computer Interface (ICBCI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20871 2025-11-27 cs.CY cs.LG 78%

A review on data fusion in multimodal learning analytics and educational data mining

多模态学习分析与教育数据挖掘中数据融合的综述

Wilson Chango, Juan A. Lara, Rebeca Cerezo, Cristóbal Romero

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文综述了多模态学习分析与教育数据挖掘中数据融合的应用、方法及挑战。

Journal ref WIREs Data Mining and Knowledge Discovery, 12(4), e1458 (2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20000 2025-11-26 eess.SP 78%

Cross-Modal Semantic Communication for Heterogeneous Collaborative Perception

跨模态语义通信用于异构协同感知

Mingyi Lu, Guowei Liu, Le Liang, Chongtao Guo, Hao Ye, Shi Jin

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 本文提出跨模态语义通信框架,通过统一语义空间实现异构传感器车辆间的高效协同感知,提升低信噪比环境下的感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18325 2025-11-25 q-bio.NC cs.LG 78%

Brain-MGF: Multimodal Graph Fusion Network for EEG-fMRI Brain Connectivity Analysis Under Psilocybin

Brain-MGF:多模态图融合网络用于psilocybin下EEG-fMRI脑连接分析

Sin-Yee Yap, Fuad Noman, Junn Yong Loo, Devon Stoliker, Moein Khajehnejad, Raphaël C. -W. Phan, David L. Dowe, Adeel Razi, Chee-Ming Ting

机构 * School of Information Technology, Monash University Malaysia(信息技术学院,墨尔本大学马来西亚分校) Department of Data Science and AI, Faculty of Information Technology, Monash University(数据科学与人工智能系,信息科技学院,墨尔本大学) Turner Institute for Brain and Mental Health, School of Psychological Sciences, Monash University(脑与心理健康研究所,心理学科学学院,墨尔本大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 Brain-MGF通过多模态图融合网络实现psilocybin下EEG-fMRI脑连接分析,提升冥想和休息状态下的区分准确率与F1分数。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15138 2025-11-20 cs.LG cs.HC 78%

Cross-Modal Consistency-Guided Active Learning for Affective BCI Systems

Hyo-Jeong Jang, Hye-Bin Shin, Kang Yin

机构 * Dept. of Brain and Cognitive Engineering(脑科学与认知工程系) Korea University(韩国大学) Dept. of Artificial Intelligence(人工智能系)

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10962 2025-11-18 cs.IR 78%

LEMUR: Large scale End-to-end MUltimodal Recommendation

Xintian Han, Honggang Chen, Quan Lin, Jingyue Gao, Xiangyuan Ren, Lifei Zhu, Zhisheng Ye, Shikang Wu, XiongHang Xie, Xiaochu Gan, Bingzheng Wei, Peng Xu, Zhe Wang, Yuchao Zheng, Jingjian Lin, Di Wu, Junfeng Ge

专题命中 多模态训练与对齐 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10644 2025-11-18 cs.LG 78%

Conditional Information Bottleneck for Multimodal Fusion: Overcoming Shortcut Learning in Sarcasm Detection

Yihua Wang, Qi Jia, Cong Xu, Feiyu Chen, Yuhan Liu, Haotian Zhang, Liang Jin, Lu Liu, Zhichun Wang

机构 * IEIT SYSTEMS Co., Ltd.(IEIT SYSTEMS公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

Comments Accepted at AAAI 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06452 2025-11-17 cs.LG 78%

MULTIBENCH++: A Unified and Comprehensive Multimodal Fusion Benchmarking Across Specialized Domains

Leyan Xue, Changqing Zhang, Kecheng Xue, Xiaohong Liu, Guangyu Wang, Zongbo Han

专题命中 多模态训练与对齐 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏