arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-30 至 2026-03-30 共收录 19 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 19 篇

2603.21077 2026-03-30 cs.CV 85%

CoVFT: Context-aware Visual Fine-tuning for Multimodal Large Language Models

CoVFT:面向多模态大语言模型的上下文感知视觉微调

Nan Zhou, Huiqun Wang, Yaoyan Zheng, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment, Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出CoVFT框架,通过整合上下文向量提取和上下文混合专家模块,解决多模态任务中视觉微调的不稳定性问题,实现更稳定的视觉更新。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19660 2026-03-30 cs.CV cs.LG 84%

Towards Knowledge Guided Pretraining Approaches for Multimodal Foundation Models: Applications in Remote Sensing

面向多模态基础模型的知识引导预训练方法:遥感应用

Praveen Ravirathinam, Ajitesh Parthasarathy, Ankush Khandelwal, Rahul Ghosh, Vipin Kumar

机构 * University of Minnesota(明尼苏达大学)

专题命中 多模态训练与对齐 :multimodal(title);multimodal foundation model(title);分类 cs.CV

AI总结 本文提出KG-VSF方法,通过条件生成任务建模预测,提升遥感任务中因果关系的建模能力,提升下游任务性能。

Comments 33 pages with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26052 2026-03-30 cs.CV cs.AI 84%

Bridging Pixels and Words: Mask-Aware Local Semantic Fusion for Multimodal Media Verification

像素与词语之间的桥梁:面向多模态媒体验证的掩码感知局部语义融合

Zizhao Chen, Ping Wei, Ziyang Ren, Huan Li, Xiangru Yin

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MaLSF框架,通过主动双向验证和层次语义聚合模块,解决多模态虚假信息检测中的局部语义不一致问题,实现像素与词语的语义连接。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17528 2026-03-30 cs.CV 83%

MM-OVSeg:Multimodal Optical-SAR Fusion for Open-Vocabulary Segmentation in Remote Sensing

MM-OVSeg:多模态光学-合成孔径雷达融合用于遥感中的开放词汇分割

Yimin Wei, Aoran Xiao, Hongruixuan Chen, Junshi Xia, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所先进智能研究中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 MM-OVSeg通过融合光学和SAR数据,提升恶劣天气下的开放词汇分割鲁棒性与泛化能力,采用跨模态统一过程和双编码器融合模块实现多传感器表征对齐与多模态分割。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26393 2026-03-30 eess.IV cs.CV 79%

Adapting Frozen Mono-modal Backbones for Multi-modal Registration via Contrast-Agnostic Instance Optimization

通过对比无关实例优化适应冻结的单模背骨以实现多模注册

Yi Zhang, Yidong Zhao, Qian Tao

机构 * Department of Imaging Physics, Delft University of Technology, The Netherlands(荷兰代尔夫特理工大学成像物理系)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种结合冻结预训练单模注册模型与轻量级适应流程的多模图像注册框架,通过对比无关的表示生成与优化模块在测试时桥接模态与领域差距,提升注册鲁棒性。

Comments MICCAI Learn2Reg Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26126 2026-03-30 cs.CV 79%

Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR

超越寻找范围:用于多模态RLVR的轨迹引导强化学习

Jinda Lu, Junkang Wu, Jinghan Li, Kexin Huang, Shuo Yang, Mingzhu Chen, Jiancan Wu, Kuien Liu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Pecking University(北京大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出轨迹引导强化学习(TGRL),通过专家推理轨迹引导策略模型整合视觉证据进行精细推理,提升多模态推理性能,弥合视觉感知与逻辑推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12760 2026-03-30 cs.CV 79%

HIFICL: High-Fidelity In-Context Learning for Multimodal Tasks

HIFICL:多模态任务的高保真上下文学习

Xiaoyu Li, Yuhang Liu, Xuanshuo Kang, Zheng Luo, Fangqi Lou, Xiaohua Wu, Zihan Xiong

机构 * University of Electronic Science and Technology of China(电子科技大学) Institute of Electronics and Information Industry Technology of Kashgar(喀什电子信息产业技术研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 HIFICL通过引入虚拟键值对、低秩分解和端到端训练目标,改进多模态任务的上下文学习机制,实验表明其在多个基准上优于现有近似方法。

Comments Accepted to CVPR 2026. Code available at https://github.com/bbbandari/HiFICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12944 2026-03-30 cs.CV 79%

AMFD: Distillation via Adaptive Multimodal Fusion for Multispectral Pedestrian Detection

AMFD:基于自适应多模态融合的多光谱行人检测知识蒸馏

Zizhao Chen, Yeqiang Qian, Xiaoxiao Yang, Chunxiang Wang, Ming Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Key Laboratory of System Control and Information Processing, Ministry of Education of China(系统控制与信息处理教育部重点实验室)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 本文提出AMFD框架,通过自适应多模态融合模块有效利用教师网络的原始模态特征,提升学生网络性能,实验表明其在减少漏检率和提升平均精度方面优于现有方法。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25963 2026-03-30 cs.CV 79%

BEVMAPMATCH: Multimodal BEV Neural Map Matching for Robust Re-Localization of Autonomous Vehicles

BEVMapMatch:多模态鸟瞰神经地图匹配用于自动驾驶车辆的鲁棒重定位

Shounak Sural, Ragunathan Rajkumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出BEVMapMatch框架,利用多模态传感器融合生成鸟瞰图分割,通过交叉注意力机制检索地图片段,实现无需GNSS的鲁棒重定位,实验表明其在GNSS受限环境下的召回率显著提升。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26049 2026-03-30 cs.CV cs.AI 73%

Seeing Like Radiologists: Context- and Gaze-Guided Vision-Language Pretraining for Chest X-rays

像放射科医生一样观察:面向胸部X光片的上下文和目光引导的视觉-语言预训练

Kang Liu, Zhuoqi Ma, Siyu Liang, Yunan Li, Xiyue Gao, Chao Liang, Kun Xie, Qiguang Miao

机构 * Xidian University(西安电子科技大学) Wuhan University(武汉大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CoGaze框架,通过整合临床上下文和放射科医生目光引导,提升胸部X光片的视觉-语言预训练效果,实验显示在多个任务上均优于现有方法。

Comments Code: https://github.com/mk-runner/CoGaze

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26127 2026-03-30 cs.CV cs.AI cs.CL cs.LG cs.MM 70%

Finding Distributed Object-Centric Properties in Self-Supervised Transformers

在自监督变压器中发现分布式以对象为中心的属性

Samyak Rawlekar, Amitabh Swain, Yujun Cai, Yiwei Wang, Ming-Hsuan Yang, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Queensland(昆士兰大学) UC Merced(加州大学默塞德分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文分析了自监督视觉变压器中对象中心属性的分布式编码机制,提出Object-DINO方法通过聚类注意力头提升无监督对象发现和多模态大语言模型的视觉 grounding。

Comments Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26071 2026-03-30 cs.CV cs.LG 70%

MUST: Modality-Specific Representation-Aware Transformer for Diffusion-Enhanced Survival Prediction with Missing Modality

MUST:一种模态特定表示感知的Transformer,用于具有缺失模态的扩散增强生存预测

Kyungwon Kim, Dosik Hwang

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 MUST通过分解模态特定和跨模态上下文化组件,提高生存预测的准确性,在缺失模态情况下仍能保持稳健预测。

Comments Accepted to CVPR 2026. 10 pages, 5 figures, supplementary included

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10971 2026-03-30 cs.CV 70%

ERMoE: Eigen-Reparameterized Mixture-of-Experts for Stable Routing and Interpretable Specialization

ERMoE:基于特征的混合专家架构用于稳定路由和可解释的专业化

Anzhe Cheng, Shukai Duan, Shixuan Li, Chenzhong Yin, Mingxi Cheng, Heng Ping, Tamoghna Chattopadhyay, Sophia I Thomopoulos, Shahin Nazarian, Paul Thompson, Paul Bogdan

机构 * University of Southern California(南加州大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 ERMoE通过重新参数化专家在学习的正交特征基上,改进路由稳定性与专家专业化可解释性,无需显式平衡损失,提升ImageNet和跨模态检索任务性能。

Comments Accepted in CVPR2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18846 2026-03-30 cs.CV cs.AI 62%

DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference

DUET-VLM:双阶段统一高效令牌减少用于VLM训练和推理

Aditya Kumar Singh, Hitesh Kandala, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc. (AMD)(超威半导体公司(AMD))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DUET-VLM通过双阶段令牌压缩框架,在保持语义的同时显著减少视觉令牌数量,实现高效训练和推理。

Comments 15 Pages, 8 figures, 15 tables, CVPR 2026; Code: AGI/DUET-VLM" target="_blank" rel="noopener">https://github.com/AMD-AGI/DUET-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15613 2026-03-30 cs.CV cs.CL 62%

When to Think and When to Look: Uncertainty-Guided Lookback

何时思考,何时回顾:不确定性引导的回顾

Jing Bi, Filippos Bellos, Junjia Guo, Yayuan Li, Chao Huang, Yolo Y. Tang, Luchuan Song, Susan Liang, Zhongfei Mark Zhang, Jason J. Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Michigan(密歇根大学) Binghamton University(宾汉姆顿大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文探讨了在大视觉语言模型中思考与回顾的平衡,提出不确定性引导的回顾策略,通过大规模对比实验提升MMMU性能,并在多个基准上取得新突破。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26008 2026-03-30 cs.CV cs.AI 62%

FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants

FairLLaVA: 大规模视觉-语言助手中的公平性感知参数高效微调

Mahesh Bhosale, Abdul Wasi, Shantam Srivastava, Shifa Latif, Tianyu Luan, Mingchen Gao, David Doermann, Xuan Gong

机构 * University at Buffalo(布法罗大学) University of Kashmir(克什米尔大学) Accenture(埃森哲) Harvard Medical School(哈佛医学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FairLLaVA通过减少目标属性间的互信息,实现视觉指令微调中的公平性改进,提升医疗影像生成的公平性和自然语言生成质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13622 2026-03-30 cs.CV cs.AI 62%

CARPE: Context-Aware Image Representation Prioritization via Ensemble for Large Vision-Language Models

CARPE:通过集成实现上下文感知的图像表示优先级

Donghee Lee, Rui Cai, Zhe Zhao

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CARPE通过集成机制增强大视觉-语言模型对视觉和文本模态的自适应加权能力,提升图像分类和多模态任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26356 2026-03-30 cs.CV 57%

From Pen to Pixel: Translating Hand-Drawn Plots into Graphical APIs via a Novel Benchmark and Efficient Adapter

从笔到像素:通过新的基准和高效的适配器将手绘图表转化为图形API

Zhenghao Xu, Mengning Yang

机构 * School of Big Data & Software Engineering, Chongqing University(重庆大学大数据与软件学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出HDpy-13数据集和Plot-Adapter方法,解决手绘图表转化为图形API的难题,提升非专家用户生成图表的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17339 2026-03-30 cs.LG 50%

ReBaPL: Repulsive Bayesian Prompt Learning

ReBaPL:排斥式贝叶斯提示学习

Yassir Bendou, Omar Ezzahir, Eduardo Fernandes Montesuma, Gabriel Mahuas, Victoria Shevchenko, Mike Gartrell

机构 * Sigma Nova Rhizome Labs

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出ReBaPL,一种基于贝叶斯推理的提示学习方法,通过引入排斥力促进探索,提升模型鲁棒性和泛化能力。

Journal ref The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏