arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-31 至 2026-07-31 共收录 84 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 17 篇

2511.12449 2026-07-31 cs.CV cs.AI cs.IR cs.LG 版本更新 88%

MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding

MOON2.0:动态模态平衡多模态表示学习用于电商产品理解

Zhanheng Nie, Chenghan Fu, Daoze Zhang, Junxian Wu, Wanxian Guan, Pengjie Wang, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);image-text(abstract);分类 cs.CV、cs.AI

AI总结 MOON2.0通过动态模态平衡框架解决电商多模态数据中的模态不平衡、信息对齐不足和噪声处理问题,提出MoE、双层对齐和图像-文本共增强策略,提升零样本性能和多模态对齐质量。

Comments Accepted by the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28006 2026-07-31 cs.AI 新提交 85%

MMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware

MMLDSum-LLM:结合视觉对齐与关键词感知的多模态长文档摘要方法

Xianpeng Zhang, Jiahua Yang, Dongyu Chen, Lei zhang, Jian Ma, Xu guohuan, Haonan Lu, Tianhuang Su, Chuangchuang Wang, Kai Tang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.AI

AI总结 针对多模态长文档摘要的关键信息遗漏与跨模态幻觉问题,提出结合视觉对齐与关键词感知的两阶段训练框架MMLDSum-LLM,在自研基准MMLDSum-Bench上验证了其性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02916 2026-07-31 cs.IR 版本更新 85%

Towards Transfer-Efficient Multi-modal Sequential Recommendation with State Space Duality

面向高效多模态序列推荐的态空间双重视角

Hao Fan, Qingyang Liu, Hongjiu Liu, Yanrong Hu, Kai Fang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract)

AI总结 本文提出MMM4Rec模型,通过结合态空间双重视角和全局时间建模,提升多模态序列推荐的迁移效率与准确性,实验表明其在大规模下游数据集上收敛速度提升10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28341 2026-07-31 cs.CV 新提交 83%

Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models

捕捉令牌趋势以实现多模态大语言模型中无需训练的令牌剪枝

Jie Ma, Zhike Qiu, Jie Gao, Jiayi Ji, Qian Chen, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学) Xiamen Ocean Vocational College(厦门海洋职业技术学院) Sino-Russian Research Center for Digital Economy(中俄数字经济研究中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对多模态大语言模型现有无训练剪枝方法忽略令牌重要性动态变化的问题,提出趋势感知剪枝框架,通过捕捉注意力流动量实现动态修正,大幅减少视觉令牌且保持性能,实现高效多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27289 2026-07-31 cs.LG 新提交 82%

TIER-MoE: Trust-Informed Expert Routing via Conditional Modality Risk for Multimodal Fusion in Biomedical Classification

TIER-MoE:用于生物医学分类多模态融合的、基于条件模态风险的信任感知专家路由

Yu Chang, Anzhe Cheng, Chenwei Wu, Zhuoran Wang, Jiahao Chen, Tamoghna Chattopadhyay, Sophia I. Thomopoulos, Paul M. Thompson, Liyue Shen, Paul Bogdan

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 该研究提出TIER-MoE风险引导子空间混合专家模型,用于生物医学分类多模态融合,可提升预测性能与概率校准,在多数据集上优于现有最优方法且具备强零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27260 2026-07-31 cs.LG 新提交 82%

Regularizing modality contribution drift in multimodal continual learning

多模态持续学习中模态贡献漂移的正则化

Zhen Zhang, Jielei Chu, Bin Liu, Tianrui Li

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对多模态持续学习中的模态贡献漂移问题,提出含基于重放和无重放版本的CMCDR方法,经实验验证其通用性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28590 2026-07-31 cs.CV cs.CL 新提交 82%

VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

VAD:为多模态在线策略蒸馏中的目标重建归因视觉证据

Kangning Zhang, Yixing Li, Shuai Shao, Qingyao Li, Zhengxi Lu, Zhiyuan Yao, Jianghao Lin, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Southeast University(东南大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 该研究提出视觉归因蒸馏(VAD)算法,通过反事实目标重建分离教师校正中的视觉证据分量,在6个4B/9B规模的细粒度视觉基准上,性能优于现有蒸馏方法。

Comments The project is accessible at https://github.com/DeepExperience/VAD_Multimodal_OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28154 2026-07-31 cs.CV cs.AI 新提交 81%

OPLD: On-Policy Latent Distillation for Multimodal Reasoning

OPLD:用于多模态推理的在线策略隐层蒸馏

Shoutai Zhu, Tianyang Xu, Bin Sun, Mingyuan Xu, Yu Liu, Qinzhen Guo

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出OPLD框架,将多模态CoT的推理能力迁移至隐层表征,经多模态基准实验,其性能优于现有隐层推理方法,达到当前最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28565 2026-07-31 cs.CV 新提交 79%

MIND: Multimodal Intent-Driven Network via Diffusion Transformers for Medical Image Fusion

MIND:基于扩散Transformer的多模态意图驱动网络用于医学图像融合

Yunzhan Fu, Xiangyu Shen, Yifei Sun, Yuhan Chen, Jian Wu, Hongxia Xu

机构 * Transvascular Implantation Devices Research Institute, Zhejiang University(浙江大学血管内植入器械研究院) Zhejiang University(浙江大学) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对现有医学图像融合方法缺乏对诊断意图深度理解的问题,提出基于DiTs的MIND网络,通过BioMedGPT、多尺度潜在适配器和医学语义一致性损失优化,在多数据集上取得优异效果,可提升脑肿瘤分割精度并支持交互式融合。

Comments 14pages, 14 figures, accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27917 2026-07-31 cs.AI 新提交 79%

One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs

统一多语言多模态的LVLM安全对齐:一个通用锚点

Enyi Shi, Fei Shen, Chuancheng Shi, Linxia Zhu, Shuyi Miao, Jinhui Tang, Tat-Seng Chua

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对LVLM面临的多语言多模态复合攻击防御难题,提出MLS-Neurons驱动的跨维度安全对齐框架,仅更新约0.03%参数实现安全监督迁移,在多语言多模态安全基准上性能优于SOTA且保留通用实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12268 2026-07-31 eess.IV cs.CV 版本更新 79%

Uncertainty-Aware Multimodal Fusion for Oral Lesion Classification

面向口腔病变分类的患者感知多模态RGB-HSI融合:通过增量启发式元学习

Soujanya Hazra, Rupam Mukherjee, Rajkumar Daniel, Shirin Dasgupta, Subhamoy Mandal

机构 * 1 School of Medical Science \& Technology, IIT Kharagpur, India 2 Department of Electrical Engineering, IIT Kharagpur, India 3 Dr. B.C. Roy Multispeciality Medical Research Centre, IIT Kharagpur, India

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种面向口腔病变分类的患者感知多模态RGB-HSI融合方法,结合深度学习、光谱分析和人口统计数据,通过增量启发式元学习提升诊断鲁棒性。

Comments Accepted at MICCAI MultiTab Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28446 2026-07-31 cs.CE 新提交 78%

CoLAS: Multimodal Corroboration of Latent Asset Signals for Financial Trading

CoLAS:面向金融交易的潜在资产信号多模态确证

Yanzheng Jin, Pengyang Shao, Xiaohao Liu, Xi Ai, Fei Shen, Kenji Kawaguchi

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究针对金融交易中异构模态信号不可靠的问题,提出CoLAS多模态确证框架,通过增强共享分量与鲁棒一致性目标,在股票和加密货币数据集上实现年化收益率和夏普比率的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27660 2026-07-31 cs.LG cs.AI cs.CV 新提交 62%

Understanding Submodular Information Measure Based Objectives for Representation Learning: A Variance and Separation Perspective

基于表示学习的子模信息测度目标:方差与分离视角的理解

Rishabh Iyer, Truong Pham, Anay Majee

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Adobe(奥多比公司)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究构建统一理论框架揭示子模信息测度(SIMs)的几何与统计特性,通过控制合成实验验证,为选择设计基于SIMs的表示学习目标提供原则性指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27614 2026-07-31 cs.CL cs.AI 新提交 62%

DualAnchor: Preserving Language Priors and Improving Lexical Fidelity in Gloss-Free Sign Language Translation

DualAnchor:无注释手语翻译中保留语言先验并提升词汇保真度

Hongbin Zhang, Junhao Liu, Xuefeng Bai, Youcheng Pan, Yang Xiang, Kehai Chen

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对现有无注释手语翻译方法的语言先验退化与词汇保真度差距问题,提出结合TPA和OTA的DualAnchor框架,在两个基准数据集上取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27843 2026-07-31 cs.CV 新提交 57%

VCP-DCN: Beyond Visual Concealed Property via Depth Collaborative Network for Camouflaged Object Detection

VCP-DCN:超越视觉隐蔽属性的深度协作网络用于伪装目标检测

Songsong Duan, Xi Yang, Nannan Wang

机构 * Xidian University(西安电子科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 针对现有伪装目标检测方法忽略深度域隐蔽目标模态特性的问题,提出VCP-DCN网络,通过SPE、MDA、DAI模块逐步实现多模态对齐、交互与融合,在三个权威数据集上验证了有效性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06299 2026-07-31 cs.CV cs.LG stat.AP 57%

Scalable deep fusion of spaceborne lidar and synthetic aperture radar for global forest structural complexity mapping

Tiago de Conto, John Armston, Ralph Dubayah

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 8 篇

2607.27790 2026-07-31 cs.CL cs.AI 新提交 84%

Semantic-Aligned Structural Abstraction for Multimodal Sentiment Analysis

面向多模态情感分析的语义对齐结构抽象

Wei Chen, Junkai Li, Tongguan Wang, Hui Liu, Feiyue Xue, Chuanxiang Ma, Ying Sha

机构 * Huazhong Agricultural University(华中农业大学) Hubei University(湖北大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对现有多模态情感分析方法无法建模情感语义的局限,提出SentiLLM框架,通过双流显著性-上下文校准机制实现语义对齐结构抽象,在四个数据集上取得优异性能。

Comments Accepted by MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27938 2026-07-31 cs.HC 新提交 82%

VizPilot: Automated Onboarding for SVG-based Composite Visualizations using Multimodal LLMs

VizPilot:基于多模态大语言模型的SVG复合可视化自动引导系统

Nishaanthini Gnanavel, Yong Wang

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 VizPilot是基于多模态大语言模型的SVG复合可视化自动引导工具,通过双模块实现自动生成交互式引导,经评估可降低创作工作量并减轻用户认知负荷,提升复合可视化可用性。

Comments Accepted by IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27286 2026-07-31 eess.IV cs.CV 新提交 79%

Toward Multi-Modal Deep Learning for Pulmonary Disease Classification: A Texture-Based Machine Learning Pilot Study on Public Chest X-Ray Data

面向肺部疾病分类的多模态深度学习:基于公开胸部X线数据的纹理机器学习试点研究

Yogisri Pujitha Chinthoti

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本研究通过公开胸部X线数据开展试点,用HOG、GLCM等特征结合经典分类器区分COVID-19与其他肺炎,为未来多模态深度学习架构研究提供方向。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27665 2026-07-31 cs.LG 新提交 78%

FedOGL: Combating Catastrophic Forgetting in Federated Open-World Multimodal Graph Learning

FedOGL:联邦开放世界多模态图学习中灾难性遗忘的应对

Zekai Chen, Haodong Lu, Shihao Li, Weiwei Ji, Xunkai Li, Xun Wu, Yinlin Zhu, Rong-Hua Li

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对联邦开放世界多模态图学习的灾难性遗忘问题,本文提出FedOGL框架,通过客户端记忆保留与服务器原型共享,使性能下降降低42.67%,同时维持或提升下游任务性能。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28492 2026-07-31 physics.app-ph 新提交 78%

Matching Trace Element Distribution to Mineralogical Phases in Ancient Biotechnology-Derived Metallic Salts: a Multimodal Analysis

古代生物技术衍生金属盐中痕量元素分布与矿物相的匹配:多模态分析

Sumera Rehman, Spyridon Panagiotopoulos, Georgios E Christidis, Athena Athanassiadou, Alessandro Olivo, Effie Photos-Jones, Silvia Cipiccia

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文针对古代金属盐痕量元素空间分布研究的不足,提出整合空间分辨XRF、XRD和纳米级X射线成像的多模态方法,实现了痕量元素与矿物相的可靠匹配,可用于追踪文物化学组成变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27428 2026-07-31 physics.med-ph cs.AI 新提交 57%

Rethinking Artificial Intelligence in Medical Imaging: Assumptions, Reality, and Reframing

重新思考医学影像中的人工智能:假设、现实与重构

Arman Rahmim, Nourhan Bayasi, Xiaoxiao Li, Babak Saboury, Fereshteh Yousefirizi

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文指出医学影像AI研究转化不足源于结构性错位,明确六大错位维度并提出重构路径,最终愿景是开发与医生对齐、扩展而非替代临床判断的智能体AI。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13174 2026-07-31 eess.IV cs.CV cs.LG 版本更新 57%

Scalable Drift Monitoring in Medical Imaging AI

医学影像AI中的可扩展漂移监测

Jameson Merkow, Felix J. Dorfner, Xiyu Yang, Alexander Ersoy, Giridhar Dasegowda, Mannudeep Kalra, Matthew P. Lungren, Christopher P. Bridge, Ivan Tarapov

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本研究针对医学影像AI的模型漂移与可靠性问题,开发了基于CheXstray框架的增强型可扩展漂移监测框架MMC+,经真实世界数据验证可有效检测数据偏移并预警性能偏差,助力AI在临床场景的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02943 2026-07-31 stat.ME 版本更新 50%

Geometric Information Decomposition for Weighted Empirical Measures on the Sphere

球面上加权经验测度的几何信息分解

Kisung You, Boram Cho

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究单位球面上加权概率测度的方向不确定性,传统方法用von Mises-Fisher分布不完整,引入几何信息分解(GID),通过球面特征拟合最大熵投影序列,证明相关性质,实验展示不同情况下GID作用。

详情

展开后加载摘要…

URL PDF HTML 收藏