arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-06 至 2026-03-06 共收录 72 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 10 篇

2506.23508 2026-03-06 cs.CL cs.AI 62%

Why Reinforcement Fine-Tuning Enables MLLMs Preserve Prior Knowledge Better: A Data Perspective

为何强化微调能更好地使大语言模型保留先验知识:从数据角度出发

Zhihao Zhang, Qiaole Dong, Qi Zhang, Jun Zhao, Enyu Zhou, Zhiheng Xi, Senjie Jin, Xiaoran Fan, Yuhao Zhou, Mingqi Wu, Yanwei Fu, Tao Ji, Tao Gui, Xuanjing Huang, Kai Chen

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文通过数据视角揭示强化微调(RFT)相较于监督微调(SFT)在保留大语言模型先验知识方面的优势,发现RFT通过强化正确样本与基模型对齐,有效减少对先验知识的干扰。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05465 2026-03-06 cs.CV 57%

HALP: Detecting Hallucinations in Vision-Language Models without Generating a Single Token

在不生成单个标记的情况下检测视觉-语言模型中的幻觉

Sai Akhil Kogilathota, Sripadha Vallabha E G, Luzhe Sun, Jiawei Zhou

机构 * Stony Brook University(石英溪大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 通过探测模型内部表示在生成前检测视觉-语言模型的幻觉风险,展示不同架构中信息丰富的层和模态差异,并验证轻量级探测器在提升安全性和效率方面的潜力。

Journal ref The 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22091 2026-03-06 cs.CV 57%

Learning to Drive is a Free Gift: Large-Scale Label-Free Autonomy Pretraining from Unposed In-The-Wild Videos

学习驾驶是免费礼物:从未经处理的现实视频中进行大规模无标签自主性预训练

Matthew Strong, Wei-Jer Chang, Quentin Herau, Jiezhi Yang, Yihan Hu, Chensheng Peng, Wei Zhan

机构 * Applied Intuition Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种无标签、教师引导的框架,通过未经处理的现实视频学习自动驾驶表示,无需姿态、标签或LiDAR,实现高效的自动驾驶感知和规划。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17488 2026-03-06 cs.CV 57%

Optimizing Multi-Modality Trackers via Significance-Regularized Tuning

通过显著性正则化调优优化多模态跟踪器

Zhiwen Chen, Jinjian Wu, Zhiyu Zhu, Yifan Zhang, Guangming Shi, Junhui Hou

机构 * School of Artificial Intelligence, Xidian University(电子科技大学人工智能学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) School of Mechatronic Engineering and Automation, Shanghai University(上海大学机电工程与自动化学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出显著性正则化微调框架,通过引入参数显著性提升多模态跟踪器的跨模态可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06515 2026-03-06 cs.CV 57%

RESAR-BEV: An Explainable Progressive Residual Autoregressive Approach for Camera-Radar Fusion in BEV Segmentation

RESAR-BEV:一种可解释的逐步残差自回归方法用于摄像头-雷达融合的鸟瞰图分割

Zhiwen Zeng, Yunfei Yin, Zheng Yuan, Argho Dey, Xianjian Bao

机构 * College of Computer Science, Chongqing University(重庆大学计算机学院) Department of Computer Science, Maharishi University of Management(Maharishi大学管理学院计算机系)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 RESAR-BEV通过残差自回归学习和双路径特征编码,实现摄像头-雷达融合的鸟瞰图分割,取得7类驾驶场景54.0% mIoU的最优性能并保持实时处理能力。

Comments This work was submitted to IEEE Transactions on Intelligent Transportation Systems (T-ITS) on 09-May-2025; revised 5 October 2025 and 26 January 2026; accepted 1 March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04606 2026-03-06 cs.LG physics.plasm-ph 50%

PDE foundation model-accelerated inverse estimation of system parameters in inertial confinement fusion

偏微分方程基础模型加速惯性约束聚变系统参数反演

Mahindra Rautela, Alexander Scheinker, Bradley Love, Diane Oyen, Nathan DeBardeleben, Earl Lawrence, Ayan Biswas

机构 * AOT-IC Group, Los Alamos National Laboratory(AOT-IC组,洛斯阿拉莫斯国家实验室) CAI Division, Los Alamos National Laboratory(CAI部门,洛斯阿拉莫斯国家实验室) HPC Division, Los Alamos National Laboratory(HPC部门,洛斯阿拉莫斯国家实验室)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本研究利用偏微分方程基础模型加速惯性约束聚变系统参数反演,通过微调和轻量级头部训练实现高精度超光谱重建与参数回归。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 6 篇

2603.04800 2026-03-06 cs.CV 85%

MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models

MASQuant: 多模态大语言模型的模态感知平滑量化

Lulu Hu, Wenhu Xiao, Xin Chen, Xinhua Xu, Bowen Xu, Kun Li, Yongliang Tao

机构 * Alibaba Cloud Computing, Alibaba Group(阿里巴巴云 computing,阿里巴巴集团)

专题命中 其他多模态 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 MASQuant通过模态感知平滑和跨模态补偿技术,解决多模态大语言模型的量化问题,实现稳定且高效的量化性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09995 2026-03-06 eess.IV cs.CV 83%

Graph-Based Multi-Modal Light-weight Network for Adaptive Brain Tumor Segmentation

基于图的多模态轻量网络用于自适应脑肿瘤分割

Guohao Huo, Ruiting Dai, Zitong Wang, Junxin Kong, Hao Tang

机构 * University of Electronic Science and Technology of China(电子科技大学) Peking University(北京大学)

专题命中 其他多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于图的多模态轻量网络GMLN-BTS,通过多尺度语义提取、图结构建模和体素细化上采样模块,实现高精度且资源高效的脑肿瘤分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16786 2026-03-06 cs.LG cs.AI cs.CV 81%

Revisiting Multimodal KV Cache Compression: A Frequency-Domain-Guided Outlier-KV-Aware Approach

重新审视多模态KV缓存压缩:一种基于频域的异常KV感知方法

Yaoxin Yang, Peng Ye, Xudong Tan, Chongjun Tu, Maosen Zhao, Jia Hao, Tao Chen

机构 * College of Future Information Technology, Fudan University(未来信息科技学院,复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhangjiang Laboratory(张江实验室)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出FlashCache,一种基于频域的异常KV感知KV缓存压缩框架,通过保留关键KV对提升解码效率并降低内存使用。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04453 2026-03-06 cs.CL cs.AI cs.LG 81%

Induced Numerical Instability: Hidden Costs in Multimodal Large Language Models

诱导的数值不稳定性:多模态大语言模型中的隐藏成本

Wai Tuck Wong, Jun Sun, Arunesh Sinha

机构 * School of Computing(计算学院) Information Systems, Singapore Management University, Singapore(信息系统,新加坡管理大学,新加坡) Information Systems Department, Rutgers Business School, New Jersey, USA(信息系统系,罗格斯商学院,新泽西,美国)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究揭示多模态大语言模型在推理阶段因优化数值不稳定性导致性能退化的新故障模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04461 2026-03-06 cs.LG cs.AI 79%

MAD-SmaAt-GNet: A Multimodal Advection-Guided Neural Network for Precipitation Nowcasting

MAD-SmaAt-GNet:一种多模态输运引导的神经网络用于降水nowcasting

Samuel van Wonderen, Siamak Mehrkanoon

机构 * Department of Information and Computing Sciences, Utrecht University, Utrecht, The Netherlands(信息与计算科学系,乌特勒支大学,乌特勒支,荷兰)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 MAD-SmaAt-GNet通过多模态输入和物理输运组件提升降水nowcasting的准确性与效率

Comments 12 pages, 5 figs

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04007 2026-03-06 stat.ML cs.LG 50%

Variational Formulation of Particle Flow

粒子流的变分公式

Yinzhuang Yi, Jorge Cortés, Nikolay Atanasov

机构 * Contextual Robotics Institute University of California, San Diego(情境机器人研究所 加州大学圣地亚哥分校)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出了一种基于变分推断的粒子流公式,通过高斯近似和混合模型提升了模型的表达能力,并在不同维度的估计问题中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏