arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-31 至 2026-07-31 共收录 17 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 17 篇

2607.27952 2026-07-31 cs.CV cs.AI 新提交 90%

LAST: The Last Query Token Guides Visual Token Pruning for Edge-Cloud Collaborative MLLM Inference

LAST:最后一个查询令牌指导视觉令牌剪枝用于边缘-云协作多模态大语言模型(MLLM)推理

Feng Yang, Xinrui Ju, Keyang Zhang, Xiandong Meng, Rongqun Lin, Howard Leung, Shiqi Wang, Haoliang Li, Chris Xing Tian

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出无训练框架LAST,利用边缘侧VLM的最后查询令牌注意力实现查询感知视觉令牌剪枝,在11个多模态基准上以12.5%视觉令牌保留率维持95.4%全令牌准确率,降低边缘和云侧开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12449 2026-07-31 cs.CV cs.AI cs.IR cs.LG 版本更新 88%

MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding

MOON2.0:动态模态平衡多模态表示学习用于电商产品理解

Zhanheng Nie, Chenghan Fu, Daoze Zhang, Junxian Wu, Wanxian Guan, Pengjie Wang, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);image-text(abstract);分类 cs.CV、cs.AI

AI总结 MOON2.0通过动态模态平衡框架解决电商多模态数据中的模态不平衡、信息对齐不足和噪声处理问题,提出MoE、双层对齐和图像-文本共增强策略,提升零样本性能和多模态对齐质量。

Comments Accepted by the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28006 2026-07-31 cs.AI 新提交 85%

MMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware

MMLDSum-LLM:结合视觉对齐与关键词感知的多模态长文档摘要方法

Xianpeng Zhang, Jiahua Yang, Dongyu Chen, Lei zhang, Jian Ma, Xu guohuan, Haonan Lu, Tianhuang Su, Chuangchuang Wang, Kai Tang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.AI

AI总结 针对多模态长文档摘要的关键信息遗漏与跨模态幻觉问题,提出结合视觉对齐与关键词感知的两阶段训练框架MMLDSum-LLM,在自研基准MMLDSum-Bench上验证了其性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02916 2026-07-31 cs.IR 版本更新 85%

Towards Transfer-Efficient Multi-modal Sequential Recommendation with State Space Duality

面向高效多模态序列推荐的态空间双重视角

Hao Fan, Qingyang Liu, Hongjiu Liu, Yanrong Hu, Kai Fang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract)

AI总结 本文提出MMM4Rec模型,通过结合态空间双重视角和全局时间建模,提升多模态序列推荐的迁移效率与准确性,实验表明其在大规模下游数据集上收敛速度提升10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28341 2026-07-31 cs.CV 新提交 83%

Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models

捕捉令牌趋势以实现多模态大语言模型中无需训练的令牌剪枝

Jie Ma, Zhike Qiu, Jie Gao, Jiayi Ji, Qian Chen, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学) Xiamen Ocean Vocational College(厦门海洋职业技术学院) Sino-Russian Research Center for Digital Economy(中俄数字经济研究中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对多模态大语言模型现有无训练剪枝方法忽略令牌重要性动态变化的问题,提出趋势感知剪枝框架,通过捕捉注意力流动量实现动态修正,大幅减少视觉令牌且保持性能,实现高效多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27289 2026-07-31 cs.LG 新提交 82%

TIER-MoE: Trust-Informed Expert Routing via Conditional Modality Risk for Multimodal Fusion in Biomedical Classification

TIER-MoE:用于生物医学分类多模态融合的、基于条件模态风险的信任感知专家路由

Yu Chang, Anzhe Cheng, Chenwei Wu, Zhuoran Wang, Jiahao Chen, Tamoghna Chattopadhyay, Sophia I. Thomopoulos, Paul M. Thompson, Liyue Shen, Paul Bogdan

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 该研究提出TIER-MoE风险引导子空间混合专家模型,用于生物医学分类多模态融合,可提升预测性能与概率校准,在多数据集上优于现有最优方法且具备强零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27260 2026-07-31 cs.LG 新提交 82%

Regularizing modality contribution drift in multimodal continual learning

多模态持续学习中模态贡献漂移的正则化

Zhen Zhang, Jielei Chu, Bin Liu, Tianrui Li

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对多模态持续学习中的模态贡献漂移问题,提出含基于重放和无重放版本的CMCDR方法,经实验验证其通用性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28590 2026-07-31 cs.CV cs.CL 新提交 82%

VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

VAD:为多模态在线策略蒸馏中的目标重建归因视觉证据

Kangning Zhang, Yixing Li, Shuai Shao, Qingyao Li, Zhengxi Lu, Zhiyuan Yao, Jianghao Lin, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Southeast University(东南大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 该研究提出视觉归因蒸馏(VAD)算法,通过反事实目标重建分离教师校正中的视觉证据分量,在6个4B/9B规模的细粒度视觉基准上,性能优于现有蒸馏方法。

Comments The project is accessible at https://github.com/DeepExperience/VAD_Multimodal_OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28154 2026-07-31 cs.CV cs.AI 新提交 81%

OPLD: On-Policy Latent Distillation for Multimodal Reasoning

OPLD:用于多模态推理的在线策略隐层蒸馏

Shoutai Zhu, Tianyang Xu, Bin Sun, Mingyuan Xu, Yu Liu, Qinzhen Guo

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出OPLD框架,将多模态CoT的推理能力迁移至隐层表征,经多模态基准实验,其性能优于现有隐层推理方法,达到当前最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28565 2026-07-31 cs.CV 新提交 79%

MIND: Multimodal Intent-Driven Network via Diffusion Transformers for Medical Image Fusion

MIND:基于扩散Transformer的多模态意图驱动网络用于医学图像融合

Yunzhan Fu, Xiangyu Shen, Yifei Sun, Yuhan Chen, Jian Wu, Hongxia Xu

机构 * Transvascular Implantation Devices Research Institute, Zhejiang University(浙江大学血管内植入器械研究院) Zhejiang University(浙江大学) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对现有医学图像融合方法缺乏对诊断意图深度理解的问题,提出基于DiTs的MIND网络,通过BioMedGPT、多尺度潜在适配器和医学语义一致性损失优化,在多数据集上取得优异效果,可提升脑肿瘤分割精度并支持交互式融合。

Comments 14pages, 14 figures, accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27917 2026-07-31 cs.AI 新提交 79%

One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs

统一多语言多模态的LVLM安全对齐:一个通用锚点

Enyi Shi, Fei Shen, Chuancheng Shi, Linxia Zhu, Shuyi Miao, Jinhui Tang, Tat-Seng Chua

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对LVLM面临的多语言多模态复合攻击防御难题,提出MLS-Neurons驱动的跨维度安全对齐框架,仅更新约0.03%参数实现安全监督迁移,在多语言多模态安全基准上性能优于SOTA且保留通用实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12268 2026-07-31 eess.IV cs.CV 版本更新 79%

Uncertainty-Aware Multimodal Fusion for Oral Lesion Classification

面向口腔病变分类的患者感知多模态RGB-HSI融合:通过增量启发式元学习

Soujanya Hazra, Rupam Mukherjee, Rajkumar Daniel, Shirin Dasgupta, Subhamoy Mandal

机构 * 1 School of Medical Science \& Technology, IIT Kharagpur, India 2 Department of Electrical Engineering, IIT Kharagpur, India 3 Dr. B.C. Roy Multispeciality Medical Research Centre, IIT Kharagpur, India

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种面向口腔病变分类的患者感知多模态RGB-HSI融合方法,结合深度学习、光谱分析和人口统计数据,通过增量启发式元学习提升诊断鲁棒性。

Comments Accepted at MICCAI MultiTab Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28446 2026-07-31 cs.CE 新提交 78%

CoLAS: Multimodal Corroboration of Latent Asset Signals for Financial Trading

CoLAS:面向金融交易的潜在资产信号多模态确证

Yanzheng Jin, Pengyang Shao, Xiaohao Liu, Xi Ai, Fei Shen, Kenji Kawaguchi

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究针对金融交易中异构模态信号不可靠的问题,提出CoLAS多模态确证框架,通过增强共享分量与鲁棒一致性目标,在股票和加密货币数据集上实现年化收益率和夏普比率的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27660 2026-07-31 cs.LG cs.AI cs.CV 新提交 62%

Understanding Submodular Information Measure Based Objectives for Representation Learning: A Variance and Separation Perspective

基于表示学习的子模信息测度目标:方差与分离视角的理解

Rishabh Iyer, Truong Pham, Anay Majee

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Adobe(奥多比公司)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究构建统一理论框架揭示子模信息测度(SIMs)的几何与统计特性,通过控制合成实验验证,为选择设计基于SIMs的表示学习目标提供原则性指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27614 2026-07-31 cs.CL cs.AI 新提交 62%

DualAnchor: Preserving Language Priors and Improving Lexical Fidelity in Gloss-Free Sign Language Translation

DualAnchor:无注释手语翻译中保留语言先验并提升词汇保真度

Hongbin Zhang, Junhao Liu, Xuefeng Bai, Youcheng Pan, Yang Xiang, Kehai Chen

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对现有无注释手语翻译方法的语言先验退化与词汇保真度差距问题,提出结合TPA和OTA的DualAnchor框架,在两个基准数据集上取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27843 2026-07-31 cs.CV 新提交 57%

VCP-DCN: Beyond Visual Concealed Property via Depth Collaborative Network for Camouflaged Object Detection

VCP-DCN:超越视觉隐蔽属性的深度协作网络用于伪装目标检测

Songsong Duan, Xi Yang, Nannan Wang

机构 * Xidian University(西安电子科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 针对现有伪装目标检测方法忽略深度域隐蔽目标模态特性的问题,提出VCP-DCN网络,通过SPE、MDA、DAI模块逐步实现多模态对齐、交互与融合,在三个权威数据集上验证了有效性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06299 2026-07-31 cs.CV cs.LG stat.AP 57%

Scalable deep fusion of spaceborne lidar and synthetic aperture radar for global forest structural complexity mapping

Tiago de Conto, John Armston, Ralph Dubayah

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏