arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-14 至 2026-05-14 共收录 16 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 16 篇

2602.22251 2026-05-14 cs.LG cond-mat.mtrl-sci cs.AI 86%

Zatom-1: Towards a Multimodal Foundation Model for 3D Molecules and Materials

Zatom-1:迈向3D分子和材料的多模态基础模型

Alex Morehead, Miruna Cretu, Antonia Panescu, Rishabh Anand, Maurice Weiler, Tynan Perez, Samuel Blau, Steven Farrell, Wahid Bhimji, Anubhav Jain, Hrushikesh Sahasrabuddhe, Pietro Lio, Tommi Jaakkola, Rafael Gomez-Bombarelli, Rex Ying, N. Benjamin Erichson, Michael W. Mahoney

机构 * LBNL(劳伦斯伯克利国家实验室) ICSI(国际计算机科学研究所) University of Cambridge(剑桥大学) Yale University(耶鲁大学) MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(title);分类 cs.AI

AI总结 Zatom-1是一种跨领域、通用的模型架构,统一了3D分子和材料的生成与预测学习,通过多模态流匹配目标实现高效的预训练和稳定采样,提升了生成推理速度和跨领域预测性能。

Comments 38 pages, 10 figures, 15 tables. ICLR 2026 FM4Science. Code, data, and model weights are available at https://github.com/Zatom-AI/zatom

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13798 2026-05-14 cs.CV 83%

VoxCor: Training-Free Volumetric Features for Multimodal Voxel Correspondence

VoxCor:无需训练的体积分量用于多模态体素对应

Guney Tombak, Ertunc Erdil, Ender Konukoglu

机构 * Biomedical Image Computing Group, ETH Zurich(生物医学图像计算组,苏黎世联邦理工学院) The LOOP Zurich – Medical Research Center(苏黎世医疗研究中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 VoxCor通过冻结的2D Vision Transformer基础模型生成可重用的体积分量表示,无需训练即可实现跨模态和跨主体的体素对应,提升跨模态和跨主体的转换性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04804 2026-05-14 cs.CL 83%

OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models

OmniSIFT: 多模态非对称令牌压缩用于高效的多模态大语言模型

Yue Ding, Yiyan Ji, Jungang Li, Xuyang Liu, Xinlong Chen, Junfei Wu, Bozhou Li, Bohan Zeng, Yang Shi, Yushuo Guan, Yuanxing Zhang, Jiaheng Liu, Qiang Liu, Pengfei Wan, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室(NLPR)、自动化研究所、中国科学院(CASIA)) Nanjing University(南京大学) The Hong Kong University of Science(香港科学大学) Sichuan University(四川大学) Peking University(北京大学)

专题命中 多模态训练与对齐 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 OmniSIFT通过非对称令牌压缩框架提升多模态大语言模型效率,采用时空视频修剪和视觉引导音频选择模块,实现低参数高鲁棒性。

Comments [ICML 2026] Code Link: https://github.com/dingyue772/OmniSIFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13059 2026-05-14 cs.CV 83%

BrainAnytime: Anatomy-Aware Cross-Modal Pretraining for Brain Image Analysis with Arbitrary Modality Availability

BrainAnytime: 基于解剖结构的跨模态预训练用于脑图像分析,支持任意模态可用性

Guangqian Yang, Tong Ding, Wenlong Hou, Yue Xun, Ye Du, Qian Niu, Shujun Wang

机构 * Department of Biomedical Engineering, The Hong Kong Polytechnic University, Hong Kong SAR, China(生物医学工程系,香港理工大学,香港特别行政区,中国) Department of Technology Management for Innovation, The University of Tokyo, Japan(创新技术管理系,东京大学,日本) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University, Hong Kong SAR, China(数据科学与人工智能系,香港理工大学,香港特别行政区,中国)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 BrainAnytime通过跨模态蒸馏和解剖引导课程掩码,在共享的3D掩码自动编码器中学习MRI与PET的结构-分子对应关系,实现对任意模态可用性的统一预训练,提升多任务性能。

Comments Early accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11444 2026-05-14 cs.CV 83%

Leveraging Multimodal Large Language Models for All-in-One Image Restoration via a Mixture of Frequency Experts

通过混合频率专家利用多模态大语言模型实现一站式图像修复

Eunho Lee, Rei Kawakami, Youngbae Hwang

机构 * Chungbuk National University(Chungbuk国立大学) Institute of Science Tokyo(东京科学研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出一种利用多模态大语言模型指导的图像修复框架,通过混合频率专家模块提升对复合退化特征的建模能力,在多个数据集上取得优异效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03800 2026-05-14 q-bio.BM 82%

STELLA: A Multimodal LLM for Protein Functional Annotation via Unified Sequence-Structure Encoding

STELLA:一种通过统一序列-结构编码进行蛋白质功能注释的多模态大语言模型

Hongwang Xiao, Wenjun Lin, Xi Chen, Hui Wang, Kai Chen, Jiashan Li, Yuancheng Sun, Sicheng Dai, Boya Wu, Qiwei Ye

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract)

AI总结 STELLA通过统一序列-结构编码与文本模态协同,提升蛋白质功能注释的准确性,实现功能描述预测和酶促反应预测的最新成果。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05410 2026-05-14 cs.AI cs.CL 81%

ChatSR: Multimodal Large Language Models for Scientific Formula Discovery

ChatSR:用于科学公式发现的多模态大语言模型

Yanjie Li, Lina Yu, Weijun Li, Min Wu, Liping Zhang, Jingyi Liu, Yusong Deng, Mingzhu Wan, Xin Ning

机构 * AnnLab, Institute of Semiconductors, Chinese Academy of Sciences, Beijing, China(安 lab,半导体研究所,中国科学院,北京,中国) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences, Beijing, China(电子、电气与通信工程学院,中国科学院大学,北京,中国) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing 101408, China(先进交叉科学学院,中国科学院大学,北京101408,中国) College of Materials Science and Opto-Electronic Technology, University of Chinese Academy of Sciences, Beijing, 100049, China(材料科学与光电技术学院,中国科学院大学,北京100049,中国) School of Integrated Circuits, University of Chinese Academy of Sciences, Beijing 100049, China(集成电路学院,中国科学院大学,北京100049,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 ChatSR通过设计专用编码器和模态对齐机制,将科学数据映射到可被大语言模型处理的表示空间,从而生成符合领域先验的数学公式,推动科学发现自动化。

Comments 14 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22853 2026-05-14 cs.CV 79%

Inference-Time Dynamic Modality Selection for Incomplete Multimodal Classification

推理时动态模态选择用于不完整多模态分类

Siyi Du, Xinzhe Luo, Declan P. O'Regan, Chen Qin

机构 * Department of Electrical and Electronic Engineering & I-X(电气与电子工程系及I-X)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出DyMo框架,通过动态选择并融合可靠恢复的模态,解决不完整多模态学习中的丢弃或填补困境,实验显示其在多种缺失数据场景下优于现有方法。

Comments 27 pages (including appendix), accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13312 2026-05-14 cs.LG 78%

Supervised Deep Multimodal Matrix Factorization for Interpretable Brain Network Analysis

监督深度多模态矩阵分解用于可解释性脑网络分析

Amjad Seyedi, Lifang He, Songlin Zhao, Akwum Onwunta, Nicolas Gillis

机构 * Dept. of Mathematics & Operational Research University of Mons(数学与运筹学系蒙斯大学) Dept. of Computer Science & Engineering Lehigh University(计算机科学与工程系莱斯大学) Dept. of Industrial & Systems Engineering Lehigh University(工业与系统工程系莱斯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出SD3MF框架,通过深度层次分解和共享潜在表示整合多模态脑网络数据,实现可解释的群体预测。实验表明SD3MF在多模态连接组数据上优于CNN和GNN等基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12852 2026-05-14 cs.LG q-bio.QM 78%

Multitask Multimodal Fusion with Tabular Foundation Models for Peak and Durability Prediction of Pertussis Booster Response

多任务多模态融合:基于表格基础模型的百日咳加强针反应峰值和持续性预测

Divya Sitani

机构 * Berlin, Germany(柏林,德国)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出多任务对比多模态融合架构,用于预测百日咳加强针反应的峰值和持续性,通过结合冻结的TabPFN-v2模态编码器、双标签监督对比损失、模态dropout和缺失性掩码注意力融合,实现了对两个任务的联合预测。

Comments 22 pages, 8 figures, 4 tables. Code available at https://github.com/Divya1205/cmi-pb-multitask

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15953 2026-05-14 cs.RO 78%

ViTacFormer: Learning Cross-Modal Representation for Visuo-Tactile Dexterous Manipulation

ViTacFormer:学习跨模态表示以实现视觉-触觉灵巧操作

Liang Heng, Haoran Geng, Kaifeng Zhang, Pieter Abbeel, Jitendra Malik

机构 * University of California, Berkeley(加州大学伯克利分校) Peking University(北京大学) Sharpa

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 本文提出ViTacFormer,通过跨注意力编码器融合高分辨率视觉与触觉,并结合自回归触觉预测头提升精度与鲁棒性,实现多指手的模仿学习,成功完成高精度灵巧操作任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09522 2026-05-14 cs.CV cs.AI cs.CL 75%

Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding

重新审视你所见:揭示视觉语义以引导LVLM解码

Beomsik Cho, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 本文通过分析发现视觉token在幻觉中仍提供有效信息,提出ReVisiT方法通过参考视觉token引导LVLM解码,减少计算成本并提升性能。

Comments ACL 2026 Main Conference (Oral). 30 pages, 10 figures. Code: https://github.com/bscho333/ReVisiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12876 2026-05-14 cs.LG 67%

Certified Robustness under Heterogeneous Perturbations via Hybrid Randomized Smoothing

通过混合随机平滑实现异质扰动下的认证鲁棒性

Blaise Delattre, Hengyu Wu, Paul Caillon, Wei Yang Bryan Lim, Yang Cao

机构 * Department of Computer Science, School of Computing, Institute of Science Tokyo, Tokyo, Japan(东京科学研究所计算机科学系) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) PSL University, Paris, France(巴黎高等师范学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出统一的混合随机平滑框架,针对混合离散-连续输入,基于可解析的Neyman-Pearson联合最坏情况问题,提供闭式一维证书,扩展了高斯和离散随机平滑,应用于多模态安全过滤。

Comments ICML 2026. Code: https://github.com/tdsai-lab/hybrid-randomized-smoothing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13375 2026-05-14 cs.CV cs.AI 62%

GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models

GRIP-VLM:基于组相对重要性的高效视觉-语言模型压缩

Mingzhe Huang, Weijun Wang, Xin Ding, Liang Mi, Hao Wen, Yuanchun Li, Lichen Pang, Shansong Yang, Yunxin Liu, Ting Cao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Juhaokan Technology Co.,Ltd(极皓科技有限公司) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 GRIP-VLM通过强化学习框架解决视觉语言模型中大规模视觉token处理的计算瓶颈,通过组相对重要性策略优化实现高效压缩,达到15%的推理加速。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13621 2026-05-14 cs.CV 57%

WD-FQDet: Multispectral Detection Transformer via Wavelet Decomposition and Frequency-aware Query Learning

WD-FQDet:通过小波分解和频率感知查询学习的多光谱检测变换器

Chunjin Yang, Xiwei Zhang, Yiming Xiao, Fanman Meng

机构 * University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出WD-FQDet框架,通过小波分解和频率感知查询学习分离红外与可见光的共性与专用特征,提升多光谱目标检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11033 2026-05-14 physics.plasm-ph cs.AI 57%

TokaMind for Power Grid: Cross-Domain Transfer from Fusion Plasma

TokaMind用于电网:从融合等离子体的跨域迁移

JC Wu, Norton Lee, Kai Siang Chen

机构 * TaiScience Research Group(TaiScience研究组) Fu Jen Catholic University(辅仁大学) Center for Geometry and Physics(几何与物理中心) Institute for Basic Science (IBS)(基础科学研究所)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 TokaMind通过多模态Transformer模型在等离子体诊断数据上预训练,展现优于CNN的方法。研究发现其表示在物理不同但结构相似的领域有效,尤其在电网同步相位数据中表现最佳,提出跨域迁移框架和评估协议。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏