arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-03 至 2026-04-03 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 9 篇

2604.01667 2026-04-03 cs.AI cs.CV 81%

M3D-BFS: a Multi-stage Dynamic Fusion Strategy for Sample-Adaptive Multi-Modal Brain Network Analysis

M3D-BFS:一种多阶段动态融合策略用于样本自适应的多模态脑网络分析

Rui Dong, Xiaotong Zhang, Jiaxing Li, Yueying Li, Jiayin Wei, Youyong Kong

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出M3D-BFS,通过多阶段动态融合策略提升多模态脑网络分析的样本适应性,设计了不同专家模块以适应输入样本变化,并引入多模态解耦损失提升表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01924 2026-04-03 cs.CL 79%

Is Clinical Text Enough? A Multimodal Study on Mortality Prediction in Heart Failure Patients

临床文本足够吗?关于心力衰竭患者死亡预测的多模态研究

Oumaima El Khettari, Virgile Barthet, Guillaume Hocquet, Joconde Weller, Emmanuel Morin, Pierre Zweigenbaum

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究比较了文本、结构化数据和多模态方法在心力衰竭患者短期死亡预测中的表现,发现实体层面的表示能提升预测性能,而监督多模态融合表现最佳。

Comments Accepted in LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02108 2026-04-03 cs.RO cs.LG 78%

Cross-Modal Visuo-Tactile Object Perception

跨模态视觉-触觉物体感知

Anirvan Dutta, Simone Tasciotti, Claudia Cusseddu, Ang Li, Panayiota Poirazi, Julijana Gjorgjieva, Etienne Burdet, Patrick van der Smagt, Mohsen Kaboli

机构 * BMW Group AG(宝马集团) Imperial College of Science, Technology and Medicine(帝国理工学院) University of Crete(克里特大学) Institute of Molecular Biology and Biotechnology, Foundation for Research and Technology-Hellas(分子生物学与生物技术研究所,研究与技术基金会-希腊) Technical University of Munich(慕尼黑工业大学) Eötvös Loránd University(罗兰大学) Foundation Robotics Labs(基础机器人实验室) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 本文提出跨模态潜在滤波器(CMLF),通过贝叶斯推断实现视觉与触觉信息的双向传递,提升机器人在不确定性下的物理属性估计效率与鲁棒性,同时展现类人感知耦合现象。

Comments 23 pages, 8 figures, 1 table. Submitted for review to journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01579 2026-04-03 cs.CV cs.AI 73%

Harmonized Tabular-Image Fusion via Gradient-Aligned Alternating Learning

通过梯度对齐交替学习实现表-图像融合

Longfei Huang, Yang Yang

机构 * Nanjing University of Science and Technology(南京理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GAAL方法,通过对齐模态梯度解决多模态表-图像融合中的梯度冲突问题,提升融合性能。

Comments ICME 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02206 2026-04-03 cs.LG cs.AI 57%

LEO: Graph Attention Network based Hybrid Multi Sensor Extended Object Fusion and Tracking for Autonomous Driving Applications

LEO:基于图注意力网络的混合多传感器扩展物体融合与跟踪用于自动驾驶应用

Mayank Mayank, Bharanidhar Duraisamy, Florian Geiss

机构 * Research and Development, Mercedes-Benz AG, Germany(德国梅赛德斯-奔驰集团研发部)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 LEO结合图注意力网络融合多模态传感器数据,实现动态物体形状和轨迹的准确估计,具备自适应融合权重和跨传感器类型的一致性跟踪能力。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01893 2026-04-03 cs.CV 57%

ProVG: Progressive Visual Grounding via Language Decoupling for Remote Sensing Imagery

ProVG:通过语言解耦实现遥感图像的渐进式视觉定位

Ke Li, Ting Wang, Di Wang, Yongshan Zhu, Yiming Zhang, Tao Lei, Quan Wang

机构 * Xidian University(西安电子科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 ProVG通过解耦语言表达为全局上下文、空间关系和对象属性,提出一种改进遥感图像定位精度的新框架,采用渐进式跨模态调节器和跨尺度融合模块,实现更精确的视觉语言对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01498 2026-04-03 cs.MM 57%

Semantic Compensation via Adversarial Removal for Robust Zero-Shot ECG Diagnosis

通过对抗性移除实现语义补偿的鲁棒零样本ECG诊断

Hongjun Liu, Rujun Han, Leyu Zhou, Chao Yao

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.MM

AI总结 本文提出SCAR框架,通过对抗性移除提升ECG与语言预训练的鲁棒性,解决部分缺失情况下语义对齐问题,并引入CMRS评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18649 2026-04-03 cs.CR cs.AI 57%

PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality

PRISM:面向多模态集成安全的原理化推理对齐

Nanxi Li, Zhengyue Zhao, G. Edward Suh, Marco Pavone, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学) Stanford University(斯坦福大学) NVIDIA(英伟达)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 PRISM通过结构化四阶段推理过程,有效应对多模态安全违规,提升VLM的鲁棒性与安全性,同时保持模型实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01526 2026-04-03 cs.LG 50%

Learning ECG Image Representations via Dual Physiological-Aware Alignments

通过双生理感知对齐学习ECG图像表示

Hung Manh Pham, Jialu Tang, Aaqib Saeed, Dong Ma, Bin Zhu, Pan Zhou

机构 * University of Cambridge(剑桥大学) Singapore Management University(新加坡管理大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出ECG-Scan框架,通过多模态对比对齐和软导联约束,提升ECG图像表示学习效果,验证了图像模型在心血管诊断中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏