arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-26 至 2026-06-26 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 11 篇

2606.26894 2026-06-26 cs.CV 新提交 88%

Modeling Local, Global, and Cross-Modal Context in Multimodal 3D MRI

多模态3D MRI中的局部、全局和跨模态上下文建模

Minh Duc Do, Tillmann Rheude, Noel Kronenberg, Roland Eils, Benjamin Wild

机构 * Berlin Institute of Health at Charité - Universitätsmedizin Berlin(柏林健康研究所,柏林夏里特医学院) Health Data Science Unit, Heidelberg University Hospital and BioQuant(海德堡大学医院与BioQuant健康数据科学部) Intelligent Medicine Institute, Fudan University(复旦大学智能医学研究所) Department of Mathematics and Computer Science, Freie Universität Berlin(柏林自由大学数学与计算机科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV

AI总结 提出MICViT,一种3D视觉Transformer,通过四种注意力机制显式建模模态内和跨模态的局部与全局交互,在多数据集脑龄预测任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27161 2026-06-26 cs.AI 新提交 85%

TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference

TOPS:通过构建令牌最优保留集实现高效多模态大语言模型推理的第一性原理视觉令牌剪枝

Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 提出TOPS方法,基于信息论分析确立任务相关性、信息覆盖和语义多样性三大原则,无训练且模型无关地剪枝视觉令牌,在LLaVA-NeXT上剪除77.8%令牌仍保持甚至提升性能。

Comments 27 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01195 2026-06-26 cs.CV cs.AI 版本更新 81%

VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning

VisNec: 衡量和利用视觉必要性进行多模态指令微调

Mingkang Dong, Hongyi Cai, Jie Li, Sifan Zhou, Bin Ren, Kunyu Peng, Yuqian Fu

机构 * SJTU(上海交通大学) Universiti Malaya(马来亚大学) CMU(卡内基梅隆大学) MBZUAI(穆萨台普大学人工智能研究所) KIT(卡尔斯鲁厄理工学院) KAUST(王国立阿联酋科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出VisNec分数衡量视觉输入在多模态指令微调中的边际贡献,结合语义聚类选择高必要性样本,在15%数据上达到全数据性能的100.2%。

Comments Accepted at ECCV 2026. Project Page: https://dmk041218.github.io/VisNec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27317 2026-06-26 cs.CV cs.RO 新提交 79%

OctoSense: Self-Supervised Learning for Multimodal Robot Perception

OctoSense: 多模态机器人感知的自监督学习

Anthony Bisulco, Jeremy Wang, Kostas Daniilidis, Randall Balestriero, Pratik Chaudhari

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 提出OctoSense传感器平台和数据集,通过“晚融合”掩码自编码器实现多模态自监督学习,在多种退化条件下鲁棒预测光流、深度、语义分割和自运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26416 2026-06-26 cs.CV 新提交 79%

Methane-Plume Segmentation From Hyperspectral Satellite Imagery Via Multimodal Deep Learning

基于多模态深度学习的高光谱卫星图像甲烷羽流分割

Brayan Quintero, Jeferson Acevedo, Samuel Traslaviña, Hoover Rueda-Chacón

机构 * Department of Computer Science, Universidad Industrial de Santander(计算机科学系,圣安德烈斯工业大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出一种多模态深度学习模型,集成特征引导的甲烷增强机制,在MPDataset上取得优于现有方法的性能,实现高精度与高效率的甲烷羽流分割。

Comments Accepted at IEEE International Geoscience and Remote Sensing Symposium (IGARSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16203 2026-06-26 cs.CV 新提交 70%

DynFS-MoE: Dynamic Functional-Structural Mixture-of-Experts for Post-Traumatic Epilepsy Diagnosis

DynFS-MoE: 用于创伤后癫痫诊断的动态功能-结构混合专家模型

Jun-En Ding, Spencer Chen, Henry Noren, Daniel Valdivia, Christine Yohn, Suhina Patel, Taylor Zink, Hai Sun, Feng Liu

机构 * Department of Systems Engineering, Stevens Institute of Technology(史蒂文斯理工学院系统工程系) Department of Neurosurgery, Robert Wood Johnson Medical School, Rutgers University(罗格斯大学罗伯特·伍德·约翰逊医学院神经外科)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出动态多模态混合专家框架,通过时间感知功能-结构编码和类别条件专家路由,融合功能与结构MRI,在三个二分类任务中优于静态融合基线,并揭示有意义的ROI交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26387 2026-06-26 cs.CV cs.CL cs.LG 新提交 62%

Staying VIGILant: Mitigating Visual Laziness via Counterfactual Visual Alignment in MLLMs

保持VIGILant:通过多模态大语言模型中的反事实视觉对齐缓解视觉懒惰

Xi Xiao, Chen Liu, Chih-Ting Liao, Yunbei Zhang, Qizhen Lan, Yuxiang Wei, Lin Zhao, Janet Wang, Jianyang Gu, Muchao Ye, Tianyang Wang, Hao Xu

机构 * UAB(阿拉巴马大学伯明翰分校) Yale(耶鲁大学) UNSW(新南威尔士大学) Tulane(杜兰大学) Georgia Tech(佐治亚理工学院) NEU(东北大学) OSU(俄亥俄州立大学) UIowa(爱荷华大学) Harvard(哈佛大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出VIGIL框架,通过强化学习后训练最大化视觉输入与生成响应间的互信息,惩罚“盲目自信”实例,有效缓解MLLMs的视觉懒惰问题,在幻觉和推理基准上优于现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27084 2026-06-26 cs.CV eess.IV 新提交 57%

Pseudo-Text-Conditioned 3D Grounding DINO for Organ Localization in Abdominal CT

伪文本条件3D Grounding DINO用于腹部CT器官定位

Siqi Chen, Han Gong, Keyi Hou, Jingxuan Yang, Sheethal Bhat, Andreas Maier

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出CT-3GDINO,一种轻量级3D检测器,通过冻结伪文本类令牌替代真实文本编码器,实现腹部CT中五个器官的定位,在193个体积上达到0.5830 mAP。

Comments 24 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26849 2026-06-26 cs.CV 新提交 57%

Liquid Fusion of Heterogeneous Representations Towards General Salient Object Detection

异构表示的液态融合用于通用显著目标检测

Ke Chen, Ling Zhou, Guangqi Jiang, Gengshen Wu, Yi Liu, Shoukun Xu

机构 * School of Computer Science and Artificial Intelligence, Changzhou University(常州大学计算机科学与人工智能学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出液态融合网络(LFNet),通过动态门控机制融合SSM(VMamba)和CNN(ConvNeXt)的异构表示,并设计显著引导上采样(SGU)算子,在五个任务上实现SOTA性能。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26812 2026-06-26 cs.CV 新提交 57%

Multi-modality Image Fusion under Adverse Weather: Mask-Guided Feature Restoration and Interaction

恶劣天气下的多模态图像融合:掩码引导的特征恢复与交互

Xilai Li, Xiaosong Li, Haishu Tan, Tao Ye, Huafeng Li, Hongbin Wang

机构 * Foshan University(佛山大学) China University of Mining and Technology, Beijing(中国矿业大学(北京)) Kunming University of Science and Technology(昆明理工大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出一种掩码引导的多模态图像融合方法,通过伪真实标签和掩码生成机制同时实现特征恢复与跨模态交互,在合成和真实数据集上超越现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17621 2026-06-26 cs.CV 版本更新 57%

PathFLIP: Fine-grained Language-Image Pretraining for Versatile Computational Pathology

PathFLIP:面向多功能计算病理学的细粒度语言-图像预训练

Fengchun Liu, Songhan Jiang, Linghan Cai, Ziyue Wang, Yongbing Zhang

机构 * Harbin Institute of Technology, Shenzhen, School of Computer Science and Technology(哈尔滨工业大学(深圳)计算机科学与技术学院) National University of Singapore, Department of Electronic and Computer Engineering(新加坡国立大学电子与计算机工程系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出PathFLIP框架,通过将幻灯片级描述分解为区域级子描述并生成文本条件区域嵌入,实现细粒度视觉-语言对齐,在多个基准上优于现有模型且训练数据更少。

详情

展开后加载摘要…

URL PDF HTML 收藏