arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-27 至 2026-05-27 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 13 篇

2603.20020 2026-05-27 cs.CV cs.AI 86%

Detached Skip-Links and $R$-Probe: Decoupling Feature Aggregation from Gradient Propagation for MLLM OCR

分离跳跃链接与$R$-探针:解耦特征聚合与梯度传播用于MLLM OCR

Ziye Yuan, Ruchang Yao, Chengxin Zheng, Yusheng Zhao, Daxiang Dong, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,PKU-Anker LLM实验室,软件与硬件协同人工智能系统北京重点实验室,北京大学,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国) Baidu Inc, Beijing, China(百度公司,北京,中国)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型在OCR任务中因梯度干扰导致细粒度视觉信息丢失的问题,提出分离跳跃链接(Detached Skip-Links)以解耦前向特征聚合与反向梯度传播,并引入$R$-探针($R$-Probe)诊断视觉令牌的可重构性,从而提升OCR及通用多模态任务性能。

Comments Accepted by ICML 2026. Ziye Yuan and Ruchang Yao contributed equally to this work (co-first authors, listed in random order)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23910 2026-05-27 cs.CL cs.AI 81%

Document Classification Pattern Recognition via Information Fusion: A Systematic Review of Multimodal and Multiview Representation Approaches

基于信息融合的文档分类模式识别:多模态与多视角表示方法的系统综述

Marcin Michał Mirończuk

机构 * National Information Processing Institute(国家信息处理研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过系统综述和元分析,提出了统一框架,量化了多模态和多视角融合在文档分类中的性能提升,并揭示了方法学严谨性不足的问题。

Journal ref Information Fusion, 132, 2026, 104247

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02360 2026-05-27 cs.CV cs.CL 81%

LaRe: Latent Refocusing for Multimodal Reasoning

LaRe: 用于多模态推理的潜在重聚焦

Jizheng Ma, Xiaofei Zhou, Geyuan Zhang, Yanlong Song, Han Yan

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 提出LaRe范式,在潜在空间内进行视觉重聚焦,结合语义增强训练,在提升推理准确率的同时大幅减少推理所需token数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26513 2026-05-27 cs.CV 79%

Re-M3Dr: Rebalanced MultiModal Mean Deviation Regression

Re-M3Dr:重新平衡的多模态均值偏差回归

Haojie Yin, Chengcheng Feng, Tianyi Liu, Tianqi Zhang, Kaizhu Huang

机构 * Duke Kunshan University, China(杜克大学昆山学院) Xi'an Jiaotong-Liverpool University, China(西安交通大学利物浦大学) Soochow University(苏州大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对多模态医学图像融合性能反不如单模态的问题,提出Re-M3Dr框架,通过自适应边界的监督对比学习和锐度感知梯度调制,实现多模态均值偏差回归,在临床数据集上均方误差降低29%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26381 2026-05-27 cs.CV 79%

Multi-Modal Building Inspection via Perceiver IO Fusion of Satellite and Street-Level Imagery

基于Perceiver IO融合卫星和街景图像的多模态建筑检测

Niels Sombekke, Rob G. J. Wijnhoven, Martin R. Oswald

机构 * University of Amsterdam (UvA)(阿姆斯特丹大学) Spotr

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出一种通过Perceiver IO架构融合卫星和街景图像的多模态分类框架,使用共享DINOv2骨干网络的空间补丁令牌,无需填充或固定大小池化即可处理可变数量的街景视图,并联合预测屋顶元素和材料类别,在包含10个国家32135栋建筑的数据集上验证了RGB-M掩码策略和融合模型的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24785 2026-05-27 cs.AI 79%

PANDO: Efficient Multimodal AI Agents via Online Skill Distillation

PANDO: 通过在线技能蒸馏实现高效多模态AI智能体

Yubo Li, Yidi Miao, Yuntian Shen, Yuxin Liu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 提出PANDO框架,通过在线技能蒸馏、结构化技能库和缓存感知提示,在VisualWebArena任务中以更低token消耗实现更高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26656 2026-05-27 cs.CV 77%

DV-SFT: Direct Vision Supervision for Fine-Grained Visual Understanding

DV-SFT: 直接视觉监督用于细粒度视觉理解

Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng, Bing Wang, Zhixing Tan

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Zhongguancun Academy(中关村学院) Beihang University(北航) Zhongguancun Laboratory(中关村实验室) Southeast Academy of Information Technology, Beijing Institute of Technology(北京理工大学信息科学技术东南学院)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出DV-SFT方法,通过为视觉令牌构建显式令牌级监督信号,利用OCR场景中的直接视觉-文本对应关系,在不修改模型架构或增加前向传播的情况下,显著提升多模态大语言模型的细粒度视觉理解能力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26273 2026-05-27 cs.CV 70%

Frequency-Guided Fusion For RGB-Thermal Semantic Segmentation

频率引导的RGB-热红外语义分割融合

İsmail Emre Canıtez, Özgür Erkent

机构 * Hacettepe University(哈切特佩大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出一种基于双ConvNeXt V2骨干网络的多模态融合架构,通过频率分解和置信门控残差机制融合RGB与热红外特征,在MFNet和PST900上以较低参数量实现先进性能。

Comments 9 pages, 7 figures, To be Presented at Perception Beyond the Visible Spectrum workshop series (IEEE PBVS) at CVPR, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11651 2026-05-27 cs.CV cs.AI cs.CL 67%

Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation

Hide to See: 面向VLM蒸馏中视觉锚定思维的推理前缀掩码

Seonghoon Yu, Dongjun Nam, Byung-Kwan Lee, Jeany Son

机构 * KAIST(韩国科学技术院) NVIDIA(英伟达) POSTECH(POSTECH大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出一种推理前缀掩码蒸馏框架,通过掩码学生模型的显著推理前缀,迫使其在推理过程中更依赖视觉证据,从而缓解长推理轨迹中的视觉遗忘问题,提升多模态推理性能。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06843 2026-05-27 cs.CL cs.AI 62%

Self-signals Driven Multi-LLM Debate for Efficient and Accurate Reasoning

自信号驱动的多LLM辩论以实现高效准确的推理

Xuhang Chen, Zhifan Song, Deyi Ji, Shuo Gao, Lanyun Zhu

机构 * University of Cambridge(剑桥大学) Sorbonne Université(索邦大学) University of Science and Technology of China(中国科学技术大学) Beihang University(北航大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出一种利用模型级置信度和token级语义焦点两种自信号来自适应引导多LLM辩论过程的方法,在提高准确性的同时减少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26382 2026-05-27 cs.CV 57%

Detail Consistent Stage-Wise Distillation for Efficient 3D MRI Segmentation

细节一致的分阶段蒸馏用于高效3D MRI分割

Mengchen Fan, Baocheng Geng, Xi Xiao, Tianyang Wang, Siyuan Mei, Pulin Che, Xiaoqian Jiang, Qizhen Lan

机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔兰根-纽伦堡弗里德里希-亚历山大大学) UTHealth Houston(休斯顿UT健康)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出细节一致蒸馏(DCD)框架,通过小波分解对齐教师-学生特征,在分阶段蒸馏中保留多尺度结构细节,实现高效3D MRI分割。

Comments Accepted by MICCAI 2026. 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19602 2026-05-27 cs.CV 57%

No Data? No Problem: Robust Vision-Tabular Learning with Missing Values

无数据?没问题:面向缺失值的鲁棒视觉-表格学习

Marta Hasny, Laura Daza, Keno Bressem, Maxime Di Folco, Julia Schnabel

机构 * School of Computation, Information and Technology, Technical University of Munich, Germany(计算、信息与技术学院,慕尼黑技术大学,德国) Institute of Machine Learning in Biomedical Imaging, Helmholtz Munich, Germany(生物医学成像中的机器学习研究所,海德堡慕尼黑,德国) School of Biomedical Engineering and Imaging Sciences, King’s College London, UK(生物医学工程与成像科学学院,伦敦国王学院,英国) Department of Diagnostic and Interventional Radiology, TUM University Hospital, Technical University of Munich, Germany(诊断与介入放射科,慕尼黑技术大学医院,德国) Munich Center for Machine Learning, Germany(慕尼黑机器学习中心,德国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出RoVTL框架,通过对比预训练中的表格属性缺失增强和下游任务中的Tabular More vs. Fewer损失,实现从0%到100%表格数据可用性下的鲁棒多模态学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26821 2026-05-27 hep-ph cs.LG hep-ex 50%

Particle-Lund Multimodality in Jet Taggers

喷注标记器中的粒子-拉普兰多模态

Loukas Gouskos, Benedikt Maier

机构 * Brown University(布朗大学) Imperial College of Science, Technology and Medicine(帝国理工学院科学、技术与医学学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出PLuM多模态架构,联合处理粒子成分与拉普兰平面分裂,通过交叉注意力机制研究显式QCD层次结构是否补充原始粒子表示,发现对顶夸克和H→bb标记有系统性提升,在HH(4b)分析中背景抑制提高25%。

详情

展开后加载摘要…

URL PDF HTML 收藏