arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-18 至 2026-05-18 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 13 篇

2605.16179 2026-05-18 cs.CV 85%

MAgSeg: Segmentation of Agricultural Landscapes in High-Resolution Satellite Imagery using Multimodal Large Language Models

MAgSeg:利用多模态大语言模型对高分辨率卫星图像进行农业景观分割

Piyush Tiwary, Utkarsh Ahuja, Depanshu Sani, Aishwarya Jayagopal, Sagar Gubbi, Subhashini Venugopalan, Alok Talekar, Vaibhav Rajan

机构 * Google DeepMind(谷歌DeepMind) Google(谷歌) Indian Institute of Science(印度科学研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出MAgSeg,一种无需视觉解码器的多模态大语言模型分割方法,有效解决南半球农业景观分割中的碎片化地块、高类内方差和标注数据稀缺问题,实现高效农业环境制图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01201 2026-05-18 cs.LG cs.CV 81%

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models

走出洞穴:JAM用于对齐独立训练的视觉和语言模型

Lauren Hyoseo Yoon, Yisong Yue, Been Kim

机构 * Computation and Neural Systems(计算与神经系统) California Institute of Technology(加利福尼亚理工学院) Computation and Mathematical Sciences(计算与数学科学) Google DeepMind(谷歌DeepMind)

专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);cross-modal(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出JAM方法,通过联合训练模态特定的自编码器,优化视觉和语言模型的对齐,提升细粒度上下文区分能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15736 2026-05-18 cs.CV cs.AI 81%

BiomedAP: A Vision-Informed Dual-Anchor Framework with Gated Cross-Modal Fusion for Robust Medical Vision-Language Adaptation

BiomedAP: 一种基于视觉的双锚框架与门控跨模态融合用于鲁棒的医学视觉-语言适应

Huanyang Tong, Kai Liu, Fangjun Kuang, Huiling Chen

机构 * Wenzhou University(温州大学) Wenzhou Business College(温州商务学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 BiomedAP通过门控跨模态融合和双锚约束机制,提升医学视觉-语言模型在提示变化下的鲁棒性,实验显示其在多个基准上均优于基线方法。

Comments CVPR2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15460 2026-05-18 cs.IR cs.AI 79%

Differentially Private Motif-Preserving Multi-modal Hashing

差分隐私的动机保持多模态哈希

Zehua Cheng, Wei Dai, Jiahao Sun

机构 * Department of Computer Science\ of Oxford Oxford United Kingdom Department of Computer Science\ of Oxford

专题命中 多模态训练与对齐 :multi-modal(title);cross-modal(abstract);分类 cs.AI

AI总结 本文提出DMP-MH框架,通过去噪后蒸馏方法在保证隐私的前提下保留多模态数据的结构特征,实验表明其在保持隐私的同时提升了检索性能。

Comments 9 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15235 2026-05-18 cs.LG 78%

MuteBench: Modality Unavailability Tolerance Evaluation for Incomplete Multimodal Fusion

MuteBench: 多模态融合不完整性容忍性评估

Wugeng Zheng, Ziwen Kan, Tianlong Chen, Chen Chen, Song Wang

机构 * University of Central Florida(中央佛罗里达大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 MuteBench评估多模态融合在模态缺失和内模态缺失下的鲁棒性,发现架构类型是预测鲁棒性的最强因素,且通道独立模型对模态缺失容忍性高但对内模态缺失敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21294 2026-05-18 cs.LG stat.ML 78%

Missing-Data-Induced Phase Transitions in Spectral PLS for Multimodal Learning

谱PLS中缺失数据诱导的相变在多模态学习中的研究

Anders Gjølbye, Ida Kargaard, Emma Kargaard, Lina Skerath, Lars Kai Hansen

机构 * Technical University of Denmark(丹麦技术大学) Department of Applied Mathematics and Computer Science(应用数学与计算机科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文研究了在高维 spiked 模型下,缺失数据对谱 PLS 的影响,揭示了信号强度与噪声阈值之间的相变现象,并通过模拟验证了理论结果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15942 2026-05-18 cs.CV cs.AI 62%

Decomposed Vision-Language Alignment for Fine-Grained Open-Vocabulary Segmentation

分解式视觉-语言对齐用于细粒度开放词汇分割

Chenhao Wang, Yingrui Ji, Yu Meng, Yao Zhu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出分解式视觉-语言对齐框架,通过将文本提示分解为概念令牌和多个属性令牌,实现细粒度开放词汇分割中对未见属性-类别组合的泛化提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16080 2026-05-18 cs.CV 57%

ReAlign: Generalizable Image Forgery Detection via Reasoning-Aligned Representation

ReAlign:通过推理对齐表示实现通用图像伪造检测

Qing Huang, Zhipei Xu, Xuanyu Zhang, Xiangyu Yu, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东省超高清沉浸媒体技术重点实验室,北京大学深圳研究生院)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

AI总结 本文提出ReAlign框架,通过对比学习将LLM生成的高质量推理文本转化为轻量级AIGI检测器,提升检测准确性和泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15621 2026-05-18 cs.CV 57%

LRCP: Low-Rank Compressibility Guided Visual Token Pruning for Efficient LVLMs

LRCP: 低秩压缩性引导的视觉标记修剪用于高效的LVLMs

Hongyu Lu, Feng Zhang, Wenwei Jin, Huanling Hu, Tianjun Shi, Shikai Jiang, Yao Hu, Jiawei Li

机构 * Xiaohongshu(小红书) Harbin Institute of Technology(哈尔滨工业大学) Fudan University(复旦大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出LRCP,通过低秩压缩性引导视觉标记修剪,有效减少视觉语言模型的推理成本,实现94.7%的图像理解性能保留和88.9%的标记减少。

Comments The paper includes 11 figures, multiple tables, comprehensive experimental results on 11 image understanding benchmarks and 3 video benchmarks, with extensive ablation studies and qualitative visualizations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15300 2026-05-18 cs.CV 57%

Deep Pre-Alignment for VLMs

视觉语言模型的深度预对齐

Tianyu Yu, Kechen Fang, Zihao Wan, Kaidong Zhang, Yicheng Zhang, Jun Song, Bo Zheng, Yuan Yao

机构 * Tsinghua University Shanghai Qi Zhi Institute Taobao \& Tmall Group of Alibaba

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出深度预对齐(DPA),通过替换传统ViT编码器为小型VLM作为感知器,实现视觉特征与目标大语言模型文本空间的深度对齐,提升了多模态基准性能,并降低了语言能力遗忘。

Comments Accepted by ICML 2026. Project Website: https://github.com/THUMAI-Lab/Deep-Pre-Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15252 2026-05-18 cs.LG cs.AI eess.SP 57%

PDRNN: Modular Data-driven Pedestrian Dead Reckoning on Loosely Coupled Radio- and Inertial-Signalstreams

PDRNN:模块化数据驱动的行人死记生忘在松散耦合的无线电和惯性信号流中

Peter Bauer, Andreas Porada, Felix Ott, Christopher Mutschler, Tobias Feigl

机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫集成电路研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出PDRNN,一种模块化混合AI辅助PDR系统,通过独立的机器学习模型估计关键参数均值和方差,提升动态运动中的定位精度与鲁棒性。

Comments 12 pages

Journal ref IEEE/ION Position, Location and Navigation Symposium (PLANS), Salt Lake City, UT, May 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16069 2026-05-18 cs.LG 50%

ITGPT: Generative Pretraining on Irregular Timeseries

ITGPT:对不规则时间序列的生成预训练

Antoine Honoré, Ming Xiao

机构 * Division of Information Science and Engineering, KTH Royal Institute of Technology(信息科学与工程系,皇家理工学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出ITGPT,一种针对多模态不规则时间序列的注意力架构,通过自监督学习和生成预训练目标处理不规则采样数据,在医疗和预测维护任务中实现SOTA性能。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15291 2026-05-18 stat.AP 50%

BaySC: Uncovering Tissue Architecture in Spatial Multi-Omics via Probabilistic Spatial Clustering

BaySC:通过概率空间聚类揭示空间多组学中的组织结构

Xin Li, Xiaofei Dong, Zhenke Duan, Lulu Shang, Xiao Wang, Xinyuan Song, Hanwen Ning, Guanyu Hu

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 BaySC通过概率空间聚类框架整合多组学数据,自动学习空间域数量,利用马尔可夫随机场保证局部空间一致性,提升空间拓扑结构的保持能力。

详情

展开后加载摘要…

URL PDF HTML 收藏