arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6897 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6897 篇

2605.25540 2026-05-26 cs.SD cs.LG 78%

A Multimodal Framework for Dementia Detection via Linguistic and Acoustic Representation Learning

基于语言和声学表征学习的多模态痴呆检测框架

Loukas Ilias, Dimitris Askounis

机构 * Decision Support Systems Laboratory, School of Electrical and Computer Engineering, National Technical University of Athens(决策支持系统实验室,电气与计算机工程学院,国家技术大学雅典)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出一个端到端可训练的多模态深度学习框架,通过预训练模型提取声学和文本特征,结合注意力融合与互信息最大化,实现自动痴呆检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25161 2026-05-26 physics.geo-ph 78%

FMSIM: A Multimodal Flow Matching Framework for Conditional Geomodeling

FMSIM: 一种用于条件地质建模的多模态流匹配框架

Jiayuan Huang, Suihong Song, Tapan Mukerji

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract)

AI总结 提出FMSIM多模态条件流匹配框架,通过深度学习速度场、语义表示、迭代投影和时间引导门控机制,融合概念地质描述、稀疏井观测和空间先验约束,实现高效稳定的地下相模型生成。

Comments Preprint version of a manuscript submitted to Water Resources Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20674 2026-05-21 cs.LG 78%

Modular Multimodal Classification Without Fine-Tuning: A Simple Compositional Approach

无需微调的模块化多模态分类:一种简单的组合方法

Herman Bergström, Aditya Mehrotra, Rahul G. Krishnan

机构 * Chalmers University of Technology and University of Gothenburg(查尔姆斯理工大学和哥德堡大学) Vector Institute(向量研究所) University of Toronto(多伦多大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出CoMET,一种无需微调的多模态分类方法,通过冻结预训练的backbone对每个模态进行处理,使用PCA压缩嵌入并输入到表格基础模型中进行预测,展示了PCA作为适配器在不同模态上的强大鲁棒性能,并提出了PALPooling来提升表示质量,实现了无需训练的多模态学习最佳结果。

Comments 30 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19135 2026-05-20 cs.LG 78%

Identifiable Multimodal Causal Representation Learning under Partial Latent Sharing

部分潜在变量共享下的可识别多模态因果表示学习

Manal Benhamza, Marianne Clausel, Myriam Tami

机构 * Paris-Saclay University, CentraleSupélec, MICS Lab(巴黎-萨克雷大学,中央理工-巴黎高等电力学院,MICS实验室) Lorraine University, CRAN(洛林大学,CRAN)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文研究了在部分潜在变量共享设定下多模态因果表示学习的可识别性问题,通过非线性混合函数生成各模态数据,并在不假设潜在变量分布的情况下,建立了因果潜在表示的组件可识别性保证,进一步验证了在欠定情况下方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17369 2026-05-19 astro-ph.SR 78%

The Deep Learning-Based Dual-Branch Multimodal Fusion Model for Solar Flare Prediction

基于深度学习的双分支多模态融合模型用于太阳耀斑预测

Limin Zhao, Xingyao Chen, Xiaoshuai Zhu, Dong Zhao, and Yihua Yan

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种双分支多模态融合深度学习模型,用于预测24小时内的太阳耀斑,通过交叉注意力机制整合磁图和磁参数,并在特征层面进行跨尺度交互以增强多尺度表示,同时实现了二分类和多分类任务,实验结果表明模型在预测X级耀斑方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17366 2026-05-19 cs.IR 78%

Text-Guided Visual Representation Learning for Robust Multimodal E-Commerce Recommendation

基于文本引导的视觉表示学习用于鲁棒的多模态电子商务推荐

Yufei Guo, Jing Ma, Tianlu Zhang, Shijie Yang, Yanlong Zang, Weijie Ding, Pinghua Gong, Jungong Han

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出Text-Guided Q-Former框架,通过结构化元数据指导视觉令牌提取,提升多模态检索的鲁棒性,实验表明其在电子商务数据集上显著提升了检索性能。

Comments 12 pages, 5 figures. Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026). Pre-camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16639 2026-05-19 cs.LG 78%

MedMIX: Modality-Internal Expert Fusion for Multimodal Medical Diagnosis

MedMIX:多模态医学诊断中的模态内部专家融合

Seungik Cho, Anqi Li, Wei Qiu

机构 * Department of Physics and Astronomy(物理与天文学系) Department of Electrical and Computer Engineering(电气与计算机工程系) Rice University(里奇大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 MedMIX通过融合模态内部专家、跨模态学习融合及大-小模型协作,提升多模态医学预测的鲁棒性,适用于缺失模态的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15235 2026-05-18 cs.LG 78%

MuteBench: Modality Unavailability Tolerance Evaluation for Incomplete Multimodal Fusion

MuteBench: 多模态融合不完整性容忍性评估

Wugeng Zheng, Ziwen Kan, Tianlong Chen, Chen Chen, Song Wang

机构 * University of Central Florida(中央佛罗里达大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 MuteBench评估多模态融合在模态缺失和内模态缺失下的鲁棒性,发现架构类型是预测鲁棒性的最强因素,且通道独立模型对模态缺失容忍性高但对内模态缺失敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21294 2026-05-18 cs.LG stat.ML 78%

Missing-Data-Induced Phase Transitions in Spectral PLS for Multimodal Learning

谱PLS中缺失数据诱导的相变在多模态学习中的研究

Anders Gjølbye, Ida Kargaard, Emma Kargaard, Lina Skerath, Lars Kai Hansen

机构 * Technical University of Denmark(丹麦技术大学) Department of Applied Mathematics and Computer Science(应用数学与计算机科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文研究了在高维 spiked 模型下,缺失数据对谱 PLS 的影响,揭示了信号强度与噪声阈值之间的相变现象,并通过模拟验证了理论结果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13312 2026-05-14 cs.LG 78%

Supervised Deep Multimodal Matrix Factorization for Interpretable Brain Network Analysis

监督深度多模态矩阵分解用于可解释性脑网络分析

Amjad Seyedi, Lifang He, Songlin Zhao, Akwum Onwunta, Nicolas Gillis

机构 * Dept. of Mathematics & Operational Research University of Mons(数学与运筹学系蒙斯大学) Dept. of Computer Science & Engineering Lehigh University(计算机科学与工程系莱斯大学) Dept. of Industrial & Systems Engineering Lehigh University(工业与系统工程系莱斯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出SD3MF框架,通过深度层次分解和共享潜在表示整合多模态脑网络数据,实现可解释的群体预测。实验表明SD3MF在多模态连接组数据上优于CNN和GNN等基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12852 2026-05-14 cs.LG q-bio.QM 78%

Multitask Multimodal Fusion with Tabular Foundation Models for Peak and Durability Prediction of Pertussis Booster Response

多任务多模态融合:基于表格基础模型的百日咳加强针反应峰值和持续性预测

Divya Sitani

机构 * Berlin, Germany(柏林,德国)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出多任务对比多模态融合架构,用于预测百日咳加强针反应的峰值和持续性,通过结合冻结的TabPFN-v2模态编码器、双标签监督对比损失、模态dropout和缺失性掩码注意力融合,实现了对两个任务的联合预测。

Comments 22 pages, 8 figures, 4 tables. Code available at https://github.com/Divya1205/cmi-pb-multitask

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15953 2026-05-14 cs.RO 78%

ViTacFormer: Learning Cross-Modal Representation for Visuo-Tactile Dexterous Manipulation

ViTacFormer:学习跨模态表示以实现视觉-触觉灵巧操作

Liang Heng, Haoran Geng, Kaifeng Zhang, Pieter Abbeel, Jitendra Malik

机构 * University of California, Berkeley(加州大学伯克利分校) Peking University(北京大学) Sharpa

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 本文提出ViTacFormer,通过跨注意力编码器融合高分辨率视觉与触觉,并结合自回归触觉预测头提升精度与鲁棒性,实现多指手的模仿学习,成功完成高精度灵巧操作任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09355 2026-05-12 cs.LG 78%

FLAME: Adaptive Mixture-of-Experts for Continual Multimodal Multi-Task Learning

FLAME:适应性专家混合用于连续多模态多任务学习

Xing Han, Shravan Chaudhari, Tanvi Ranade, Rama Chellappa, Suchi Saria

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 FLAME提出了一种可扩展的专家混合框架,支持多任务预训练和连续学习,通过模态特定路由器处理不同模态的任务,同时利用低秩内存子空间压缩专家知识,提升参数效率和减少灾难性遗忘。

Comments 37 pages, 25 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04323 2026-05-11 cs.LG cs.DB 78%

LUCAS-MEGA: A Large-Scale Multimodal Dataset for Representation Learning in Soil-Environment Systems

LUCAS-MEGA:一个大规模多模态数据集,用于土壤-环境系统的表示学习

Kuangdai Leng, Simon Jeffery, Panos Panagos, Tarje Nissen-Meyer

机构 * Earth Rover Program(Earth Rover项目) Centre for Crop and Environmental Science(作物与环境科学中心) European Commission Joint Research Centre(欧盟联合研究中心) Department of Mathematics and Statistics & Center for Environmental Intelligence(数学与统计系及环境智能中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 LUCAS-MEGA通过系统数据融合构建了大规模多模态数据集,用于提升土壤-环境系统的表示学习能力,通过SoilFuser管道标准化数据并生成统一特征空间,预训练SoilFormer模型实现了稳定的训练和预测性能。

Comments 27 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00699 2026-05-08 cs.CR 78%

STARE: Step-wise Temporal Alignment and Red-teaming Engine for Multi-modal Toxicity Attack

STARE:分步时间对齐与红队引擎用于多模态毒性攻击

Xutao Mao, Liangjie Zhao, Tao Liu, Xiang Zheng, Hongying Zan, Cong Wang

专题命中 多模态训练与对齐 :multi-modal(title);image-text(abstract)

AI总结 STARE通过分步时间对齐和红队引擎,提升多模态毒性攻击的成功率,揭示优化诱导的相位对齐现象,为安全机制提供理论基础。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22991 2026-05-08 cs.LG 78%

Fusion or Confusion? Multimodal Complexity Is Not All You Need

融合还是混淆?多模态复杂性并不都是你需要的

Tillmann Rheude, Roland Eils, Benjamin Wild

机构 * Berlin Institute of Health, Charité - Universitätsmedizin Berlin(柏林健康研究所,柏林查理医院) Intelligent Medicine Institute, Fudan University(复旦大学智能医学研究院) Department of Mathematics and Computer Science, Freie Universität Berlin(柏林自由大学数学与计算机科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文通过大规模实验挑战多模态学习中复杂架构提升性能的假设,发现增加复杂性常导致混淆而非有效融合,强调需转向方法论严谨性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19423 2026-05-01 cs.IR 78%

UniRec: Unified Multimodal Encoding for LLM-Based Recommendations

UniRec:基于LLM的推荐系统的统一多模态编码

Zijie Lei, Tao Feng, Zhigang Hua, Yan Xie, Guanyu Lin, Shuang Yang, Ge Liu, Jiaxuan You

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 UniRec通过统一多模态编码解决推荐系统中多模态信息的理解挑战,提出三元组表示和分层Q-Former结构,实现在多个基准测试中提升15%的性能。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26313 2026-04-30 cs.CR cs.LG 78%

VulStyle: A Multi-Modal Pre-Training for Code Stylometry-Augmented Vulnerability Detection

VulStyle:一种多模态预训练用于代码风格度量增强的漏洞检测

Chidera Biringa, Ajmal Abbas, Vishnu Selvaraj, Gokhan Kul

机构 * University of Massachusetts Dartmouth(马萨诸塞大学达特茅斯分校)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 VulStyle通过融合函数级源代码、非终端AST结构和代码风格度量特征,提升漏洞检测性能,实现BigVul和VulDeePecker上的F1指标提升。

Comments 12 pages, 2 figures. Accepted at the 56th Annual IEEE/IFIP International Conference on Dependable Systems and Networks (DSN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23112 2026-04-28 cs.LG 78%

Conditional Imputation for Within-Modality Missingness in Multi-Modal Federated Learning

多模态联邦学习中模态内缺失的条件补全

Wugeng Zheng, Ziwen Kan, Katie Wang, Chen Chen, Song Wang

机构 * University of Central Florida(佛罗里达大学)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract)

AI总结 本文提出CondI框架,通过条件扩散模型解决多模态联邦学习中的模态内缺失问题,采用两阶段训练流程提升模态特定提取器和联合嵌入空间的性能,实验表明在三个临床数据集上效果与现有方法相当。

Comments Wugeng Zheng and Ziwen Kan contributed equally to this work. Song Wang is the corresponding author. Accepted to FedVision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22763 2026-04-28 cs.HC 78%

A learning health system in Neurorehabilitation as a foundation for multimodal patient representation

神经康复中的学习健康系统作为多模态患者表示的基础

Thomas Weikert, Eljas Roellin, Lukas Heumos, Fabian J. Theis, Diego Paez-Granados, Chris Easthope Awai

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出通过整合多模态数据采集、模型计算和临床可视化,构建神经康复中的学习健康系统,以促进临床与机器学习的合作,解决数据碎片化、互操作性差和临床人员参与度低的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12938 2026-04-28 cs.LG physics.ao-ph 78%

Local Off-Grid Weather Forecasting with Multi-Modal Earth Observation Data

本地非网格天气预报与多模态地球观测数据

Qidong Yang, Jonathan Giezendanner, Daniel Salles Civitarese, Johannes Jakubik, Eric Schmitt, Anirban Chandra, Jeremy Vila, Detlef Hohl, Chris Hill, Campbell Watson, Sherrie Wang

机构 * Massachusetts Institute of Technology(麻省理工学院) IBM Research(IBM研究院) Shell Information Technology International Inc.(壳牌信息技术国际公司)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出一种多模态Transformer模型,通过端到端训练将网格化预报降尺度至非网格位置,提升局部天气预测精度,实验显示其优于多种非数据驱动和数据驱动的非网格预报方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21585 2026-04-24 eess.SP 78%

Scalable Multimodal Beam Alignment in V2X: An Anti-Imbalance Graph Learning Approach

面向V2X的可扩展多模态波束对齐:一种反不平衡图学习方法

Jiahui Liang, Shuoyao Wang, Shijian Gao

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种分布式多模态图波束对齐框架,利用车载多模态传感数据预测隐式反馈,并通过图神经网络协调多用户对齐,提升可扩展性并减少开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18460 2026-04-21 cs.LG 78%

Learning Invariant Modality Representation for Robust Multimodal Learning from a Causal Inference Perspective

从因果推断视角学习不变模态表示以实现稳健的多模态学习

Sijie Mai, Shiqin Han

机构 * School of Computer Science, South China Normal University(华南师范大学计算机学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出CmIR框架,通过因果推断分离模态中的因果不变表示与环境特定的虚假表示,提升多模态学习的鲁棒性和泛化能力。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14839 2026-04-17 cs.IR 78%

Well Begun is Half Done: Training-Free and Model-Agnostic Semantically Guaranteed User Representation Initialization for Multimodal Recommendation

万事开头难:免训练 且模型无关的语义保证用户表示初始化方法用于多模态推荐

Jinfeng Xu, Zheyu Chen, Shuo Yang, Jinze Li, Hewei Wang, Jianheng Tang, Wei Wang, Xiping Hu, Edith C. H. Ngai

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出SG-URInit方法,通过整合用户交互物品的模态特征和全局聚类特征,实现免训练且模型无关的用户表示初始化,有效提升多模态推荐性能并缓解物品冷启动问题。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11066 2026-04-17 cs.IR 78%

Decoupled Multimodal Fusion for User Interest Modeling in Click-Through Rate Prediction

解耦多模态融合用于点击通过率预测中的用户兴趣建模

Alin Fan, Hanqing Li, Sihan Lu, Jingsong Yuan, Jiandong Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出解耦多模态融合方法,通过构建目标感知特征和优化注意力机制,提升用户兴趣建模效果,实验表明在公开和工业数据集上均取得显著提升。

Comments Accepted by ICDE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13247 2026-04-16 cs.CE 78%

Cross-Platform Domain Adaptation for Multi-Modal MOOC Learner Satisfaction Prediction

跨平台领域适应用于多模态MOOC学习者满意度预测

Jakub Kowalski, Magdalena Piotrowska

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文研究了在缺乏目标平台标签的情况下,利用跨平台领域适应技术进行多模态MOOC学习者满意度预测,提出ADAPT-MS框架,通过文本编码、跨平台表征对齐、评分偏差校正和缺失行为模态处理,提升了预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10086 2026-04-14 astro-ph.IM 78%

A Multi-modal Fusion Network for Star-Galaxy Classification from CSST Simulated Datasets

基于CSST模拟数据的多模态融合网络用于星系分类

Zhuoming Han, Tianmeng Zhang, Chao Liu, Chenxiaoji Ling

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出基于ResNet-50和BiLSTM的多模态融合网络,利用CSST模拟数据提升星系和恒星分类性能,达到99.81%的召回率。

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09905 2026-04-14 cs.LG 78%

Improving Pediatric Emergency Department Triage with Modality Dropout in Late Fusion Multimodal EHR Models

通过晚期融合多模态EHR模型中的模态脱落改进儿科急诊分诊

Tyler Yang, Romal Mitr

机构 * Stanford University(斯坦福大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种晚期融合多模态架构,结合XGBoost和Bio_ClinicalBERT处理结构化数据和非结构化文本,通过逻辑回归元分类器预测急诊严重程度指数,通过模态脱落提升模型在儿科群体中的泛化能力。

Comments 10 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08971 2026-04-13 cs.LG 78%

Modality-Aware Zero-Shot Pruning and Sparse Attention for Efficient Multimodal Edge Inference

感知-aware零样本剪枝与稀疏注意力用于高效多模态边缘推断

Yueyuan Sui, Payal Mohapatra, Doğaç Eldenk, Haodong Yang, Yiting Zhang, Haoyan Zhang, Qi Zhu, Stephen Xia

机构 * Northwestern University(西北大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出SentryFuse框架,通过模态感知的剪枝和稀疏注意力机制,在无需微调的情况下提升多模态边缘推断的效率与准确性,实现12.7%的平均精度提升和28.2%的内存减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08089 2026-04-10 cs.SE 78%

GALA: Multimodal Graph Alignment for Bug Localization in Automated Program Repair

GALA: 多模态图对齐用于自动化程序修复中的缺陷定位

Zhuoyao Liu, Zhengran Zeng, Shu-Dong Huang, Yang Liu, Shikun Zhang, Wei Ye

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 GALA通过多模态图对齐方法,解决GUI截图场景下自动化程序修复的缺陷定位问题,通过结构化推理提升视觉与代码的映射精度。

Comments Code available at: https://github.com/lzyyyyy666/GALA

详情

展开后加载摘要…

URL PDF HTML 收藏