arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-15 至 2026-05-15 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 12 篇

2605.13897 2026-05-15 q-bio.QM cs.LG 88%

Attention-Based Multimodal Survival Prediction with Cross-Modal Bilinear Fusion

基于注意力的多模态生存预测与跨模态双线性融合

Hassan Keshvarikhojasteh, Josien P. W. Pluim, Mitko Veta

机构 * Department of Biomedical Engineering, Eindhoven University of Technology, Eindhoven, The Netherlands(埃因霍温理工大学生物医学工程系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract)

AI总结 本文提出一种新型多模态深度学习框架,通过整合全滑片病理特征、RNA测序表达谱和临床变量,利用双线性融合提升参数效率和可解释性,实验表明在CHIMERA数据集上优于拼接基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14710 2026-05-15 cs.CV cs.AI 84%

Vision-Core Guided Contrastive Learning for Balanced Multi-modal Prognosis Prediction of Stroke

基于视觉核心的对比学习用于脑卒中平衡多模态预后预测

Liren Chen, Lidong Sun, Mingyan Huang, Junzhe Tang, Yinghui Zhu, Guanjie Wang, Yiqing Xia, Ting Xiao

机构 * School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出三模态融合模型,通过大语言模型生成半结构化诊断文本并设计VDAFM模块,提升多模态融合鲁棒性,实现脑卒中预后预测的高精度。

Comments Corresponding author: Ting Xiao

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14654 2026-05-15 cs.CV 83%

Beyond Instance-Level Self-Supervision in 3D Multi-Modal Medical Imaging

超越实例级自监督在3D多模态医学影像中的应用

Tan Pan, Shuhao Mei, Yixuan Sun, Kaiyu Guo, Chen Jiang, Zhaorui Tan, Mengzhu Li, Limei Han, Xiang Zou, Yuan Cheng, Mahsa Baktashmotlagh

机构 * Fudan University, China(复旦大学) University of Queensland, Australia(昆士兰大学) Shanghai Academy of AI for Science, China(上海人工智能科学研究院) Huashan Hospital, National Center for Neurological Disorders, Fudan University, China(华山医院,国家神经系统疾病中心,复旦大学) Bioinformatics Institute (BII), Agency for Science, Technology and Research (A*STAR), Singapore(生物信息研究所(BII),科技研究局(A*STAR),新加坡)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出利用跨实例拓扑一致性作为监督信号,通过实例内和实例间对齐机制提升多模态医学影像的表征学习,实验显示在7个下游任务中实现了分割和分类任务的平均提升,并在模态缺失时表现出更强的鲁棒性。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14458 2026-05-15 cs.AI 83%

OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance

OmniDrop:通过查询引导的分层令牌剪枝实现多模态大语言模型

Yeo Jeong Park, Hyemi Jang, Minseo Choi, Jongsun Lee, Jooyoung Choi, Yongkweon Jeon

机构 * Samsung Research(三星研究院)

专题命中 多模态训练与对齐 :omni-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文提出OmniDrop,通过查询引导的分层令牌剪枝方法,提升多模态大语言模型的效率与性能,实验表明其在多个音频视频基准测试中表现优异,减少预填充延迟和内存使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05008 2026-05-15 cs.CV 83%

Multimodal Causal-Driven Representation Learning for Generalizable Medical Image Segmentation

多模态因果驱动表示学习用于通用化医学图像分割

Xusheng Liang, Lihua Zhou, Nianxin Li, Miao Xu, Ziyang Song, Dong Yi, Jinlin Wu, Jiawei Ma, Hongbin Liu, Zhen Lei, Jiebo Luo

机构 * City University of Hong Kong(香港城市大学) Shenzhen Loop Area Institute(深圳河套学院) CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算智能研究所) UESTC(电子科技大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MCDRL框架,结合因果推理与VLM解决医学图像分割的领域泛化问题,通过文本提示识别病变区域并消除领域特定影响,提升分割准确性与泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14650 2026-05-15 eess.SP 82%

Multimodal Learning for MIMO Beam Prediction Based on Variational Inference

基于变分推断的多模态学习用于MIMO波束预测

Zijian Zheng, Wenqiang Yi, Hyundong Shin, Arumugam Nallanathan

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出基于变分推断的多模态框架,通过模块化特征提取和跨模态语义对齐提升MIMO波束预测精度,实验表明其在仅使用20%多模态数据的情况下表现优异。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00574 2026-05-15 cs.CV cs.AI 81%

Decoupling Stability and Plasticity for Multi-Modal Test-Time Adaptation

解耦稳定性与可塑性以实现多模态测试时适应

Yongbo He, Zirun Guo, Tao Jin

机构 * Zhejiang University(浙江大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出DASP框架,通过解耦多模态测试时适应中的稳定性与可塑性,解决现有方法在无偏模态中的负迁移和有偏模态中的灾难性遗忘问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14406 2026-05-15 cs.LG cs.CV 79%

GeoViSTA: Geospatial Vision-Tabular Transformer for Multimodal Environment Representation

GeoViSTA:用于多模态环境表示的地理视觉-表格变压器

Yuhao Liu, Sadeer Al-Kindi, Ashok Veeraraghavan, Guha Balakrishnan

机构 * Department of Electrical and Computer Engineering, Rice University(理海大学电气与计算机工程系) Center for Cardiovascular Computational and Precision Health, Department of Cardiology, DeBakey Heart and Vascular Center, Houston Methodist(休斯顿方法主义医疗中心心血管计算与精准健康中心、心内科部门、德贝基心脏和血管中心)

专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract);分类 cs.CV

AI总结 GeoViSTA通过融合栅格影像与表格数据,构建统一的地理嵌入表示,提升对环境、社会和健康问题的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14327 2026-05-15 cs.LG cs.AI 79%

AIM-DDI: A Model-Agnostic Multimodal Integration Module for Drug-Drug Interaction Prediction

AIM-DDI: 一种模型无关的多模态整合模块用于药物-药物相互作用预测

Yerin Park, Sangseon Lee

机构 * Department of Artificial Intelligence, Inha University(人工智能系,Inha大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出AIM-DDI模块,通过共享潜在空间整合多模态信息,提升药物-药物相互作用预测的鲁棒性,尤其在未见过的药物情况下表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14990 2026-05-15 cs.CV 57%

Characterizing the visual representation of objects from the child's view

从儿童视角表征物体的可视化分析

Jane Yang, Tarun Sepuri, Alvin Wei Ming Tan, Khai Loong Aw, Michael C. Frank, Bria Long

机构 * Department of Psychology, University of California San Diego(加州大学圣地亚哥分校心理学系) Department of Psychology, Stanford University(斯坦福大学心理学系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究分析了儿童日常经验中物体类别表征的视觉输入,发现常见物体如杯子、椅子占据主导地位,而多数类别出现频率低。尽管物体视角多样,但检测到的类别在上位类别中表现出更强的聚类特征。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14878 2026-05-15 cs.MA 50%

Decision-Level Fusion for Robust Wearable Affect Recognition

决策级融合用于鲁棒的可穿戴情感识别

Lokesh Singh, Athina Georgara, Jayati Deshmukh, Tan Viet Tuyen Nguyen, Sarvapali D. Ramchurn

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文研究了可穿戴生理数据中情感状态自动识别的鲁棒性问题,提出结合傅里叶-贝塞尔级数展开与EWT的非稳态处理流程,通过决策级融合提升在异构和部分可靠传感下的识别鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14571 2026-05-15 cs.RO cs.LG 50%

Let Robots Feel Your Touch: Visuo-Tactile Cortical Alignment for Embodied Mirror Resonance

让机器人感受你的触摸:用于具身镜像共振的视觉-触觉皮层对齐

Tianfang Zhu, Ning An, Rui Wang, Jiasi Gao, Qingming Luo, Anan Li, Guyue Zhou

机构 * Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) Key Laboratory of Biomedical Engineering of Hainan Province, School of Biomedical Engineering, Hainan University(海南省生物医学工程重点实验室,海南大学生物医学工程学院) School of New Media Art and Design, Beihang University(北航艺术与设计学院) MoE Key Laboratory for Biomedical Photonics, Wuhan National Laboratory for Optoelectronics, Huazhong University of Science and Technology(教育部生物医学光子学重点实验室,武汉光电研究所,华中科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出镜像触觉网络,通过多级约束实现视觉与触觉表征的语义、分布和几何对齐,使机器人能从RGB图像预测毫米级触觉信号,为具身镜像共振提供可解释的机器人感知路径。

详情

展开后加载摘要…

URL PDF HTML 收藏