arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-15 至 2026-04-15 共收录 17 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 17 篇

2604.12630 2026-04-15 cs.CV cs.CL 91%

GeoAlign: Geometric Feature Realignment for MLLM Spatial Reasoning

GeoAlign:用于MLLM空间推理的几何特征重定位

Zhaochen Liu, Limeng Qiao, Guanglu Wan, Tingting Jiang

机构 * National Engineering Research Center of Visual Technology, National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(视觉技术国家工程研究中心、多媒体信息处理国家重点实验室、计算机学院、北京大学) Meituan Inc.(美团公司) National Biomedical Imaging Center, Peking University(生物医学成像国家中心、北京大学)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出GeoAlign框架,通过动态聚合多层几何特征以解决MLLM在空间推理中的任务对齐偏差问题,实验表明其紧凑模型在多个基准测试中达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12767 2026-04-15 cs.CV cs.AI 86%

CLASP: Class-Adaptive Layer Fusion and Dual-Stage Pruning for Multimodal Large Language Models

CLASP:面向多模态大语言模型的类适应层融合与双阶段剪枝

Yunkai Dang, Yizhu Jiang, Yifan Jiang, Qi Fan, Yinghuan Shi, Wenbin Li, Yang Gao

机构 * School of Artificial Intelligence Science and Technology(人工智能科学与技术学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 CLASP通过类适应层融合和双阶段剪枝,实现多模态大语言模型中视觉token的高效减少,提升模型鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12502 2026-04-15 cs.CV cs.AI 84%

SEATrack: Simple, Efficient, and Adaptive Multimodal Tracker

SEATrack: 简单、高效且自适应的多模态跟踪器

Junbin Su, Ziteng Xue, Shihui Zhang, Kun Chen, Weiming Hu, Zhipeng Zhang

机构 * School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) School of Software, Beihang University(北航软件学院) Hebei Key Laboratory of Computer Virtual Technology and System Integration(河北省计算机虚拟技术与系统集成重点实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), CASIA(多模态人工智能系统国家重点实验室(MAIS),CASIA) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院自动化实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 SEATrack通过跨模态对齐和层次混合专家机制,在RGB-T、RGB-D和RGB-E跟踪任务中实现性能与效率的平衡。

Comments Accepted as a CVPR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12380 2026-04-15 cs.CV 83%

Modality-Agnostic Prompt Learning for Multi-Modal Camouflaged Object Detection

多模态伪装物体检测的模态无关提示学习

Hao Wang, Jiqing Zhang, Xin Yang, Baocai Yin, Lu Jiang, Zetian Mi, Huibing Wang

机构 * Information Science and Technology College, Dalian Maritime University(大连海事大学信息科学与技术学院) Beijing University of Technology(北京理工大学) Dalian University of Technology(大连理工大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种模态无关的提示学习框架,用于多模态伪装物体检测,通过数据驱动内容域与知识驱动提示域的交互,生成统一提示以提升SAM模型性能,并引入轻量级Mask Refine模块以提高检测精度。

Comments 10

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12424 2026-04-15 cs.CL cs.AI cs.CV 82%

Decoding by Perturbation: Mitigating MLLM Hallucinations via Dynamic Textual Perturbation

解码中的扰动:通过动态文本扰动缓解多模态大语言模型的幻觉

Sihang Jia, Shuliang Liu, Songbo Yang, Yibo Yan, Xin Zou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Decoding by Perturbation方法,通过动态文本扰动缓解多模态大语言模型的幻觉问题,通过控制文本干预减少语言先验的影响,提升解码稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08291 2026-04-15 cs.AI 79%

A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning

多模态数学推理综述:从感知、对齐到推理

Tianyu Yang, Sihong Wu, Yilun Zhao, Zhenwen Liang, Lisen Dai, Chen Zhao, Minhao Cheng, Arman Cohan, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) Yale University(耶鲁大学) Columbia University(哥伦比亚大学) New York University(纽约大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文综述了多模态数学推理的研究进展,探讨了如何从多模态输入中提取信息、对齐文本与视觉信息、进行推理以及评估推理过程的正确性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11992 2026-04-15 cs.RO cs.CV 79%

ReefMapGS: Enabling Large-Scale Underwater Reconstruction by Closing the Loop Between Multimodal SLAM and Gaussian Splatting

ReefMapGS:通过多模态SLAM与高斯点云之间的闭环实现大规模水下重建

Daniel Yang, Jungseok Hong, John J. Leonard, Yogesh Girdhar

机构 * Massachusetts Institute of Technology(麻省理工学院) Woods Hole Oceanographic Institution(伍兹霍尔海洋研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出ReefMapGS框架,通过多模态传感器数据与高斯点云结合,实现水下复杂场景的增量重建与全局轨迹优化,展示无COLMAP的3D重建与高精度AUV轨迹估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11835 2026-04-15 cs.LG cs.AI 79%

Schema-Adaptive Tabular Representation Learning with LLMs for Generalizable Multimodal Clinical Reasoning

基于LLM的Schema自适应表格表示学习用于通用多模态临床推理

Hongxi Mao, Wei Zhou, Mengting Jia, Tao Fang, Huan Gao, Bin Zhang, Shangyang Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Boston University(波士顿大学) University of Southern California(南加州大学) GDIIST Renyixun Health Technology Co., Ltd.(仁心迅健康科技有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于LLM的Schema自适应表格表示学习方法,通过将结构化变量转换为语义自然语言并编码,实现零样本跨schema对齐,结合表格和MRI数据在多模态 dementia 诊断中取得优于临床基准的性能。

Comments 11 pages, 4 figures

Journal ref ACL 2026, Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12026 2026-04-15 cs.LG q-bio.BM q-bio.QM 67%

TriFit: Trimodal Fusion with Protein Dynamics for Mutation Fitness Prediction

TriFit:结合蛋白质动力学的三模态融合用于突变适应度预测

Seungik Cho

机构 * Department of Physics(物理系) Astronomy, Rice University, Texas, USA(天文学、里士满大学、德克萨斯州、美国)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

AI总结 TriFit通过三模态融合模块整合序列、结构和蛋白质动力学信息,利用四专家混合专家模型提升突变适应度预测性能,实现优于现有基线模型的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12648 2026-04-15 cs.LG cs.AI 57%

TimeSAF: Towards LLM-Guided Semantic Asynchronous Fusion for Time Series Forecasting

TimeSAF:面向时间序列预测的LLM引导语义异步融合

Fan Zhang, Shiming Fan, Hua Wang

机构 * Shandong Technology and Business University(山东技术与商业大学) Ludong University(鲁东大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出TimeSAF框架,通过层级异步融合解决LLM与时间序列语义不匹配问题,采用独立语义融合模块和分阶段语义细化解码器,提升预测性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00655 2026-04-15 cs.CV 57%

Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding

Mema:增强视觉-语言理解的内存增强适配器

Ying Liu, Yudong Han, Kean Shi, Liyuan Pan

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) Yangtze Delta Region Academy of Beijing Institude of Technology(北京理工大学长江三角洲地区研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Mema适配器,通过维护状态记忆积累层次视觉表示,提升多模态理解性能,实验验证其在复杂任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12356 2026-04-15 cs.CV 57%

OmniFood8K: Single-Image Nutrition Estimation via Hierarchical Frequency-Aligned Fusion

OmniFood8K:通过层次化频率对齐融合实现单图像营养估计

Dongjian Yu, Weiqing Min, Qian Jiang, Xing Lin, Xin Jin, Shuqiang Jiang

机构 * School of Software, Yunnan University, China(云南大学软件学院,中国) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院人工智能安全国家重点实验室,计算技术研究所,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出OmniFood8K数据集和端到端框架,通过频率对齐融合模块提升单图像营养预测精度,解决中餐营养估计不足和深度传感器限制问题。

Comments Accepted by CVPR 2026 (Highlight Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12012 2026-04-15 cs.CV 57%

TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment

TIPSv2:通过增强的补丁-文本对齐推进视觉-语言预训练

Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur, Ye Xia, Sahil Dua, Tanmaya Dabral, Guangxing Han, Bohyung Han, Joshua Ainslie, Alex Bewley, Mithun Jacob, René Wagner, Washington Ramos, Krzysztof Choromanski, Mojtaba Seyedhosseini, Howard Zhou, André Araujo

机构 * Google(谷歌) DeepMind(深度Mind)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

AI总结 本文提出TIPSv2,通过改进的预训练方法提升视觉-语言模型的补丁-文本对齐能力,实验表明其在多种任务和数据集上表现优异。

Comments CVPR2026 camera-ready + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10584 2026-04-15 cs.CV 57%

CoFusion: Multispectral and Hyperspectral Image Fusion via Spectral Coordinate Attention

CoFusion:通过光谱坐标注意力实现多谱段和超谱图像融合

Baisong Li

机构 * School of Integrated Circuits, Tsinghua University, Beijing 100084, China(集成电路学院,清华大学,北京100084,中国)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出CoFusion框架,通过建模跨尺度和跨模态依赖,提升多谱段和超谱图像融合的空谱协同效果,实现空谱细节增强与光谱保真度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10026 2026-04-15 cs.CV 57%

LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA

LaV-CoT:具有多方面奖励优化的语言感知视觉CoT

Jing Huang, Zhiya Tan, Shutao Gong, Fanwei Zeng, Joey Tianyi Zhou, Changtao Miao, Huazhe Tan, Weibin Yao, Jianshu Li

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) CFAR, Agency for Science, Technology and Research(科技研究局CFAR)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 LaV-CoT通过多阶段推理流程和多方面奖励优化,提升多语言视觉问答的准确性和泛化能力,实现在公开数据集上的9.5%准确率提升。

Comments Accepted by WWW 2026 Industry Track - Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17976 2026-04-15 stat.CO cs.LG 50%

metasnf: Meta Clustering with Similarity Network Fusion in R

metasnf:基于相似性网络融合的元聚类在R中

Prashanth S Velayudhan, Xiaoqiao Xu, Prajkta Kallurkar, Ana Patricia Balbon, Maria T Secara, Adam Taback, Denise Sabac, Nicholas Chan, Shihao Ma, Bo Wang, Daniel Felsky, Stephanie H Ameis, Brian Cox, Colin Hawco, Lauren Erdman, Anne L Wheeler

机构 * Hospital for Sick Children(Sick Children 医院) University of Toronto(多伦多大学) Centre for Addiction and Mental Health(成瘾与心理健康中心)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 metasnf包通过元聚类方法,利用相似性网络融合实现高效搜索聚类解,提供可视化、表征和验证功能,帮助研究者发现基于上下文的聚类解。

Comments 66 pages, 26 figures, provisionally accepted at Journal of Statistical Software

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09374 2026-04-15 quant-ph cs.LG 50%

Variational Quantum Physics-Informed Neural Networks for Hydrological PDE-Constrained Learning with Inherent Uncertainty Quantification

变分量子物理信息神经网络用于具有内在不确定性量化的水文PDE约束学习

Prasad Nimantha Madusanka Ukwatta Hewage, Midhun Chakkravarthy, Ruvan Kumara Abeysekara

机构 * Faculty of Computer Science and Multimedia, Lincoln University College, Petaling Jaya, Selangor, Malaysia(计算机科学与多媒体学院,林肯大学学院,Petaling Jaya,Selangor,马来西亚)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出一种融合参数化变分量子电路的混合量子-经典物理信息神经网络,用于水文PDE约束学习,通过量子态编码多源遥感特征,并利用圣文森特浅水方程和曼宁流方程作为可微物理损失项,实现不确定性量化。

Comments 25 pages, 6 tables. Code available at https://github.com/nimanpra/HQC-PINN-Flood-Prediction. v2: corrected reference attributions in Section II.B

详情

展开后加载摘要…

URL PDF HTML 收藏