arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-06 至 2026-08-06 共收录 17 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 17 篇

2608.04548 2026-08-06 cs.LG cs.AI 新提交 91%

A Model Merging Approach for Continual MLLM Unlearning

面向持续多模态大语言模型(MLLM)遗忘的模型合并方法

Yuhang Wang, Linlin Zhang, Haoxuan Ji, Xianmin Ye, Zhenxing Niu, Haichang Gao

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.AI

AI总结 针对现有MLLM遗忘方法无法应对持续场景的问题,本文提出MCU方法,通过动态合并遗忘适配器缓解跨任务依赖的干扰,在多个基准测试中实现了更优的遗忘效果与知识保留。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04949 2026-08-06 cs.CV cs.CL cs.IT cs.MM math.IT 新提交 87%

UG-UMRE: Uncertainty-Guided Modality Augmentation and Distributional Calibration for Unified Multimodal Relation Extraction

UG-UMRE:面向统一多模态关系抽取的不确定性引导模态增强与分布校准

Bo Kong, Liruiz Jia, Yi Liang, Chao Liu, Dongfang Han, Tianwei Yan, Yuan Liu, Shengquan Liu

机构 * Xinjiang University(新疆大学) Chongqing Jiaotong University(重庆交通大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 针对统一多模态关系抽取的噪声传播与模态分布异质性问题,提出含UDUA和JAUA模块的UG-UMRE网络,在UMRE等三个基准数据集上实现最优性能,模块可插拔且有效。

Comments Accepted at ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00513 2026-08-06 cs.LG cs.AI cs.CV cs.IR 版本更新 86%

MOON3.0: Reasoning-aware Multimodal Representation Learning for E-commerce Product Understanding

MOON3.0: 基于推理的多模态表示学习用于电商产品理解

Junxian Wu, Chenghan Fu, Zhanheng Nie, Daoze Zhang, Bowen Wan, Wanxian Guan, Chuan Yu, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 MOON3.0通过多头模态融合、联合对比与强化学习框架及细粒度残差增强模块,提升电商产品细粒度属性建模能力,并在大规模多模态电商基准MBe3.0上实现零样本最优性能。

Comments Accepted by the 34th ACM International Conference on Multimedia (ACM MM), 2026. 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04013 2026-08-06 cs.LG cs.AI 新提交 85%

C$^2$MOE: Consistency and Complementarity-guided Mixture of Experts for Incomplete Multimodal Emotion Learning

C²MOE:面向不完整多模态情感学习的一致性与互补性引导的混合专家模型

Yuntao Shou, Tao Meng, Wei Ai, Keqin Li

机构 * Central South University of Forestry and Technology(中南林业科技大学) State University of New York, New Paltz(纽约州立大学新帕尔茨分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对多模态情感识别中模态缺失导致性能下降的问题,本文提出C²MOE框架,通过分解多模态知识为一致性与互补性分量、引入双分支预测机制及可学习重加权模块,在多个基准上实现了优于现有方法的性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04054 2026-08-06 cs.MM cs.AI cs.CL cs.LG 新提交 85%

Modality Agreement- and Conflict-Aware Prototype Hypergraph Learning for Multimodal Intent Understanding

面向多模态意图理解的模态一致与冲突感知原型超图学习

Mohnish Raj, Suraj Kumar, Soumi Chattopadhayay, Chandranath Adak, Ayan Dutta

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 针对多模态意图理解中分歧信息被多数融合方法忽略的问题,提出MACH框架,通过分层一致与冲突原型超图及自适应仲裁机制,在基准数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08324 2026-08-06 cs.NE cs.AI 版本更新 83%

Multi-Modal Learning meets Genetic Programming: Analyzing Alignment in Latent Space Optimization

多模态学习遇见遗传编程:分析潜在空间优化中的对齐

Benjamin Léger, Kazem Meidani, Christian Gagné

机构 * Mila, Université Laval(Mila,拉瓦尔大学) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学) Canada-CIFAR AI Chair(加拿大-卡内基梅隆人工智能主席)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文研究SNIP方法在符号回归中多模态潜在空间优化的对齐效果,发现跨模态对齐在优化过程中未改善且过于粗糙,导致有效对齐引导的优化尚未实现。

Comments Accepted at PPSN 2026 (Trento, Italy). To appear in Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02778 2026-08-06 cs.CL 版本更新 83%

When Modalities Remember: Continual Learning for Multimodal Knowledge Graphs

当模态记住:多模态知识图谱的持续学习

Linyu Li, Zhi Jin, Yichi Zhang, Dongming Jin, Yuanpeng He, Haoran Duan, Gadeng Luosang, Nyima Tashi

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Computer Science, Zhejiang University(浙江大学计算机科学学院) School of Cyber Science and Engineering, Wuhan University(武汉大学网络科学与工程学院) School of Information Science and Technology, Tibet University(西藏大学信息科学与技术学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本文提出MRCKG模型,通过多模态-结构协同课程和跨模态知识保存机制,解决多模态知识图谱的持续学习问题,提升新知识学习能力。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04452 2026-08-06 cs.CV cs.AI cs.CL 新提交 82%

Q-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning

Q-CueGraph:用于多模态推理的查询条件化视觉证据图

Pengcheng Pan, Xinfang Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Q-CueGraph是一种用于多模态推理的查询条件化视觉证据图,它为冻结读取器生成受预算约束的坐标级观测,在多个基准测试中显著提升了推理性能,尤其适用于证据可定位、问题能区分位置且分辨率受限的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04234 2026-08-06 math.ST cs.LG stat.ML stat.TH 新提交 82%

Multimodal Alignment Through Joint Kernel Entropic Gromov--Wasserstein Optimal Transport

基于联合核熵 gromov-wasserstein 最优传输的多模态对齐

Yixuan Florence Wu, Yilun Zhu, Naichen Shi

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对跨模态配对数据稀缺的场景,提出 JK-EGW 框架实现多模态对齐,理论样本复杂度匹配标准最优传输,实验中在数据稀缺的预训练编码器嵌入对齐任务上性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04016 2026-08-06 cs.CY cs.AI cs.LG stat.AP 新提交 79%

AI-driven Multimodal Representation Learning for Latent Mediation Structure Discovery of Socioeconomic Disadvantage, Psychosocial Factors, and Cardiometabolic Multimorbidity: Insights from the All of Us Research Program

人工智能驱动的多模态表征学习用于发现社会经济劣势、心理社会因素与心脏代谢共病的潜在中介结构:来自All of Us研究计划的见解

Cong Cao, Shuangge Ma

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究基于All of Us研究计划数据,开发AI驱动的多模态中介框架,通过变分自编码器推导潜在表征,发现心理社会脆弱性是连接社会经济劣势与心脏代谢共病的关键中介通路,为探究健康相关复杂关系提供了新方法。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21343 2026-08-06 cs.CV 版本更新 79%

Latent Denoising Improves Visual Alignment in Large Multimodal Models

潜在去噪提升大多模态模型的视觉对齐

Dhruv Parikh, Jacob Fein-Ashley, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL Army Research Office(DEVCOM ARL陆军研究办公室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出通过潜在去噪框架改进大多模态模型的内部视觉特征对齐和多模态理解,采用掩码和高斯噪声混合腐蚀视觉token,并利用解码器恢复教师特征,提升模型在分布偏移下的鲁棒性。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04698 2026-08-06 cs.CV cs.AI 新提交 62%

Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

训练多模态大语言模型(MLLMs)说“不”:基于拒绝校准GRPO的广义指代表达理解

Xuzheng Yang, Jun Ling, Tao Huang, Caiyan Qin, Peng Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对MLLMs因训练缺负样本导致无法拒绝不存在对象的问题,提出RC-GRPO方法,在保持定位精度的同时增强拒绝能力,在三个GREC基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04833 2026-08-06 cs.CV 新提交 57%

RegisterBridgeMM: A Register-Centric Framework for RGB-Infrared Object Detection

RegisterBridgeMM:一种以寄存器为核心的RGB-红外目标检测框架

Zian Wang, Hangchuan Liang, Yuehua Chen, Changchun Li, Chaoyi Guo, Mingzhe Liu, Fangming Gu

机构 * Jilin University(吉林大学) Taiyuan University of Technology(太原理工大学) Shenzhen University(深圳大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 针对RGB-红外目标检测的跨模态融合难题,提出以寄存器为核心的RegisterBridgeMM框架,通过三阶段寄存器生命周期实现高效融合,在四个基准数据集上取得最高mAP50-95性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04132 2026-08-06 cs.CV 新提交 57%

RUTA: Principled Visual Token Allocation via Rate-Utility Optimization

RUTA:基于率-效用优化的原则性视觉令牌分配方法

Jian Zou, Xiaoyu Xu, Zhihua Wang, Yilin Wang, Balu Adsumilli, Kede Ma

机构 * City University of Hong Kong(香港城市大学) Google Inc.(谷歌公司)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对视觉语言模型因长视觉令牌序列导致的LLM侧计算和内存成本过高问题,提出RUTA方法,仅用2.0%、4.2%的视觉令牌,分别在LLaVA-NeXT-7B、Qwen3-VL-8B上保留88.2%、94.4%的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28750 2026-08-06 cs.SE cs.AI 版本更新 57%

DragonCrawl: A Generative, Intent-Based Framework for Scalable Mobile End-to-End Testing

DragonCrawl:一种用于可扩展移动端到端测试的生成式意图框架

Sowjanya Puligadda, Mengdie Zhang, Ali Zamani, Dhruva Dixith Kurra, Eric Chen, Juan Marcano

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 DragonCrawl是基于GPT-4o多模态的移动端到端测试框架,通过验证用户流程阻止问题提交,缩短测试入门时间,节省大量维护工作量,实现规模化持续质量保证。

Comments 12 pages, 6 figures, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20113 2026-08-06 cs.CV eess.IV 版本更新 57%

Attention Fusion for Bridge Deck Delamination Detection

多传感器注意力网络用于混凝土桥面亚表面脱层自动检测

Alireza Moayedikia, Amirhossein Moayedikia

机构 * Department of Business Technology and Entrepreneurship, Swinburne University of Technology(斯winburne技术大学商业技术与创业系) Swinburne University of Technology(斯winburne技术大学) University of Sydney(悉尼大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出多传感器注意力网络用于混凝土桥面亚表面脱层检测,通过整合GPR和IRT数据,提升自动化检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22874 2026-08-06 cs.CV 版本更新 57%

Deformable Medical Image Registration with KAN-based Implicit Neural Representations

基于KAN的隐式神经表示的可变形医学图像配准

Nikita Drozdov, Marat Zinovev, Dmitry Sorokin

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出基于KAN的INR框架KAN-IDIR与RandKAN-IDIR,用于无需数据集级训练的逐对优化可变形医学图像配准,在多模态医学图像上实现高准确性、低开销与稳定性,适用于临床研究。

Comments Accepted at Machine Learning and Knowledge Extraction

详情

展开后加载摘要…

URL PDF HTML 收藏