arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-23 至 2026-03-23 共收录 73 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 12 篇

2511.17885 2026-03-23 cs.CV cs.LG 83%

FastMMoE: Accelerating Multimodal Large Language Models through Dynamic Expert Activation and Routing-Aware Token Pruning

FastMMoE:通过动态专家激活和路由感知的标记剪枝加速多模态大语言模型

Guoyang Xia, Yifeng Ding, Fengfa Li, Lei Ren, Wei Chen, Fangxiang Feng, Xiaojie Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Li Auto(利亚自动化)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出FastMMoE,一种无需训练的加速框架,通过动态专家激活和路由感知标记剪枝,显著降低计算量并保持性能,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17343 2026-03-23 cs.CV cs.LG cs.MM 81%

Principled Multimodal Representation Learning

原理化的多模态表征学习

Xiaohao Liu, Xiaobo Xia, See-Kiong Ng, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出PMRL框架,通过优化表示矩阵的主导奇异值实现多模态的同时对齐,采用基于softmax的损失函数和实例对比正则化,提升表征稳定性与分离性,在多种任务中优于基线方法。

Comments Accepted by IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19718 2026-03-23 cs.CV 79%

BALM: A Model-Agnostic Framework for Balanced Multimodal Learning under Imbalanced Missing Rates

BALM:一种面向不平衡缺失率下平衡多模态学习的模型无关框架

Phuong-Anh Nguyen, Tien Anh Pham, Duc-Trong Le, Cam-Van Thi Nguyen

机构 * VNU University of Engineering and Technology(越南工程与技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出BALM框架,通过特征校准模块和梯度重平衡模块解决多模态学习中因不平衡缺失率导致的不平衡问题,提升模型鲁棒性和性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19681 2026-03-23 cs.CV 79%

Unbiased Dynamic Multimodal Fusion

无偏动态多模态融合

Shicai Wei, Kaijie Zhang, Luyi Chen, Tao He, Guiduo Duan

机构 * University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出UDML框架,通过引入噪声感知不确定性估计器和模态dropout量化模态依赖偏置,解决动态多模态融合中模态质量评估不准确和模态贡献分配不合理的问题。

Comments CVPR2026 Findings, 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15164 2026-03-23 cs.CV 79%

Multimodal Continual Instruction Tuning with Dynamic Gradient Guidance

多模态持续指令微调与动态梯度指导

Songze Li, Mingyu Gao, Tonghua Su, Xu-Yao Zhang, Zhongjie Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济发展实验室) Chongqing Research Institute of HIT(重庆哈工大研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出通过几何参数空间方向向量近似缺失梯度,结合有限回放缓冲区和伯努利采样策略,有效缓解多模态持续指令微调中的灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19293 2026-03-23 cs.CL cs.AI 73%

LLM-MRD: LLM-Guided Multi-View Reasoning Distillation for Fake News Detection

LLM-MRD: 基于大语言模型的多视角推理蒸馏用于虚假新闻检测

Weilin Zhou, Shanwen Tan, Enhao Gu, Yurong Qian

机构 * Xinjiang University, Urumqi, China(新疆大学) Sichuan University, Chengdu, China(四川大学) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University, Urumqi, China(丝绸之路多语种认知计算国际联合实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM-MRD框架,通过多视角推理蒸馏提升虚假新闻检测性能,实验显示在准确率和F1-Fake指标上均优于现有方法。

Comments Accepted at DASFAA 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23508 2026-03-23 cs.CV 70%

Hyperbolic Cycle Alignment for Infrared-Visible Image Fusion

双曲循环对齐用于红外-可见图像融合

Timing Li, Bing Cao, Jiahe Feng, Haifang Cao, Qinghau Hu, Pengfei Zhu

机构 * College of Intelligence and Computing(智能与计算学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于双曲空间的双曲循环对齐网络,通过双路径交叉模态循环对齐框架和双曲层次对比对齐模块,实现更有效的多模态图像对齐与融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02142 2026-03-23 cs.RO cs.CV 57%

FD-VLA: Force-Distilled Vision-Language-Action Model for Contact-Rich Manipulation

FD-VLA:力感知的视觉-语言-动作模型用于接触密集的 manipulation

Ruiteng Zhao, Wenshuo Wang, Yicheng Ma, Xiaocong Li, Francis E. H. Tay, Marcelo H. Ang, Haiyue Zhu

机构 * Advanced Robotics Centre, National University of Singapore(新加坡国立大学先进机器人中心) School of Electrical & Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) College of Information Science and Technology, Eastern Institute of Technology(东部技术学院信息科学与技术学院) John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Advanced Robotics Centre at National University of Singapore(新加坡国立大学先进机器人中心) Singapore Institute of Manufacturing Technology, Agency for Science, Technology and Research (A*STAR)(新加坡制造技术研究所,科技研究局(A*STAR))

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出FD-VLA模型,通过力蒸馏模块在不依赖物理力传感器的情况下实现接触密集任务的力感知,提升机器人视觉-语言-动作的鲁棒性与实用性。

Comments ICRA 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15160 2026-03-23 cs.CV 57%

EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence

EagleVision:基于BEV的双阶段框架用于空间智能

Jiaxu Wan, Xu Wang, Mengwei Xie, Hang Zhang, Mu Xu, Yang Han, Hong Zhang, Ding Yuan, Yifan Yang

机构 * Atlas Lab(Atlas实验室) School of Aerospace, BUAA(北京航空航天大学航空学院) School of Software, BUAA(北京航空航天大学软件学院) State Key Laboratory of HERATT(HERATT国家重点实验室) Key Laboratory of SDODS (MOE) Project(SDODS重点实验室(教育部))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 EagleVision通过结合几何感知帧选择与主动BEV推理,提升视频空间推理能力,实现空间感知与验证的闭环循环。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07558 2026-03-23 cs.LG cs.CV 57%

ReLaX: Reasoning with Latent Exploration for Large Reasoning Models

ReLaX:基于潜在探索的大型推理模型推理

Shimin Zhang, Xianwei Chen, Yufan Shen, Ziyuan Ye, Jibin Wu

机构 * Hong Kong Polytechnic University(香港理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 ReLaX通过引入潜在动态分析,提升大型推理模型的探索与利用平衡,通过动态谱分散度度量潜在动态异质性,优于现有token级方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 3 篇

2603.19371 2026-03-23 cs.CV 57%

Factored Levenberg-Marquardt for Diffeomorphic Image Registration: An efficient optimizer for FireANTs

因子化Levenberg-马夸尔特法用于可微同构图像配准:一种高效的优化器用于FireANTs

Rohit Jena, Pratik Chaudhari, James C. Gee

机构 * Department of Computer and Information Science(计算机与信息科学系) University of Pennsylvania(宾夕法尼亚大学) Department of Electrical and Systems Engineering(电气与系统工程系) Department of Radiology & Penn Image Computing and Science Laboratory (PICSL)(放射科及宾夕法尼亚大学图像计算与科学实验室(PICSL)) Perelman School of Medicine, University of Pennsylvania(佩尔曼医学学院,宾夕法尼亚大学)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种改进的Levenberg-马夸尔特优化器,通过信任区域方法自适应调整单个标量阻尼参数,减少内存消耗并保持性能,适用于大体积图像和跨模态配准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19593 2026-03-23 physics.app-ph physics.optics 50%

Widefield Nanodiamond Quantum Sensing Based on Light-Sheet Microscopy

基于光片显微镜的宽场纳米钻石量子传感

Shuo Wang, Ming-Zhong Ai, Jing-Wei Fan, Junchen Ye, Chao Lin, Quan Li, Ren-Bao Liu

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出基于光片显微镜的宽场纳米钻石量子传感方法,通过垂直移动激光光片实现高通量、高灵敏度和低光毒性生物传感。

Comments Comments are welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19486 2026-03-23 cs.LG 50%

Any-Subgroup Equivariant Networks via Symmetry Breaking

通过破译对称性构建任意子群等变网络

Abhinav Goel, Derek Lim, Hannah Lawrence, Stefanie Jegelka, Ningyuan Huang

机构 * MIT(麻省理工学院) TUM(技术大学慕尼黑) Flatiron Institute(Flatiron研究院)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出Any-Subgroup Equivariant Network,通过调节辅助输入特征实现多组等变,理论证明其能模拟等变MLP,实验验证其在图、图像及序列任务中优于单独等变模型。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏