arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-03 至 2026-07-03 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 13 篇

2606.23041 2026-07-03 cs.CV 新提交 85%

SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models

SPAR: 语义-像素自对齐与自适应路由的统一多模态模型

Hongxiang Li, Hongxu Chen, Chenyang Zhu, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaohongshu Inc.(小红书公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出SPAR框架,通过非对称双流统一分词器协调语义感知与像素重建,利用自对齐生成范式消除外部依赖,并引入动态令牌路由实现灵活多模态交互,在统一架构中达到生成、重建与视觉理解的最优性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01390 2026-07-03 cs.CV cs.AI cs.MM 版本更新 85%

SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment

SEPS:面向细粒度跨模态对齐的语义增强补丁精简框架

Xinyu Mao, Junsi Li, Haoji Zhang, Yu Liang, Ming Sun

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出SEPS框架,通过两阶段机制整合稠密与稀疏文本语义,识别显著视觉补丁,并利用相关性感知选择与均值计算突出关键补丁-词对应,提升跨模态相似度评估,在Flickr30K和MS-COCO上rSum提升23%-86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02091 2026-07-03 cs.CV 新提交 83%

Multimodal Fusion for Fine-Grained Classification of Breast Fibroadenoma and Phyllodes Tumors

乳腺纤维腺瘤与叶状肿瘤细粒度分类的多模态融合

Chuxi Nan, Di Wu, Hongming Guo, Ning Cao, Xiaohui Zhu, Zhaoting Shi, Jiawei Li

机构 * School of Integrated Circuits, Wuxi Vocational College of Science and Technology(集成电路学院,无锡科学技术职业技术学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(先进科技学院,西安交通大学利物浦大学) Shanghai Gem Science and Technology Co., Ltd.(上海 gems 科技有限公司) Department of Oncology, Shanghai Medical College, Fudan University(肿瘤科,复旦大学上海医学院) Department of Medical Ultrasound, Fudan University Shanghai Cancer Center(医学超声科,复旦大学上海癌症中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对B超下乳腺纤维腺瘤和叶状肿瘤高度重叠导致误诊的问题,构建FAPT-M多模态数据集,提出临床引导的多模态框架,集成视觉、文本和临床特征,通过自适应调制、跨模态Transformer和双路径表示学习,实现细粒度分类,准确率77.64%,AUC 89.74%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02372 2026-07-03 cs.CV 新提交 79%

Learning Spectral and Polarimetric Clues for One-to-Multimodal Novel View Synthesis

学习光谱和偏振线索用于一对多模态新视角合成

Federico Lincetto, Gianluca Agresti, Mattia Rossi, Piergiorgio Sartor, Pietro Zanuttigh

机构 * MEDIA Lab(媒体实验室) University of Padova(帕多瓦大学) Sony EUISPC(索尼欧洲影像处理中心) Sony Semiconductor Solutions Europe(索尼半导体解决方案欧洲分公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出SPoILeR方法,通过多模态预训练学习模态间相关性,在仅RGB监督下实现未见场景的多模态新视角渲染。

Comments Accepted at ECCV 2026. Project page: https://medialab.dei.unipd.it/paper_data/SPoILeR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01627 2026-07-03 cs.LG cs.AI 新提交 79%

MKGR: Multimodal Knowledge-Graph Representation Learning for Cold-Start Protein-Protein Interaction Prediction

MKGR: 面向冷启动蛋白质-蛋白质相互作用预测的多模态知识图谱表示学习

Wenbo Zhang

机构 * College of Computer and Information Science, Southwest University(西南大学计算机与信息科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 提出MKGR框架,结合区域感知蛋白质序列编码与四个生物医学知识图谱,通过桥接重建目标和成对门控模块,在冷启动场景下显著提升PPI预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01821 2026-07-03 stat.ME 新提交 78%

Pattern-Calibrated Multimodal Prediction under Blockwise Missingness

分块缺失下的模式校准多模态预测

Junhan Yu, Kejian Zhang, Doudou Zhou, Guojun Zhu

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态数据分块缺失问题,提出MOSAIC框架,通过共享与特定模态表示学习及跨模式校准,在不混淆预测规则的前提下实现跨缺失模式信息借用,理论证明误差分解并验证其在有限目标样本或规则差异场景下的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01656 2026-07-03 cs.LG 新提交 78%

CALM: Interpretable Cross-Modal Alignment for Biomarker Discovery from Unpaired Data

CALM: 可解释的跨模态对齐用于从非配对数据中发现生物标志物

Jueqi Wang, Zachary Jacokes, John Darrell Van Horn, Kevin A. Pelphrey, Michael C. Schatz, Archana Venkataraman

机构 * Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院) Department of Psychology, University of Virginia(弗吉尼亚大学心理学系) Department of Neurology, University of Virginia(弗吉尼亚大学神经病学系) Departments of Computer Science and Biology, Johns Hopkins University(约翰霍普金斯大学计算机科学与生物学系)

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 提出CALM框架,通过线性投影对齐脑区和遗传通路的潜在分布,从完全不相交的人群中学习可解释的跨模态关联,在自闭症谱系障碍数据上优于现有方法。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31394 2026-07-03 cs.LG cs.AI cs.CV q-bio.QM 新提交 76%

Resolving superposition in AI for interpretability and cross-modal alignment in patient-neuronal images

解决AI中的叠加问题以实现可解释性与患者-神经元图像的跨模态对齐

Jisung Park, Seohyeon Kang, Daeun Yoo, Eunsu Lee, Seoin Cho, Wooyeop Choi, Ian Choi, James R. Evan, Daesoo Kim, Sonia Gandhi, Minee L. Choi

机构 * KAIST(韩国科学技术院) Konyang University(建阳大学) Chang Gung University(长庚大学) UCL Queen Square Institute of Neurology & The Francis Crick Institute(伦敦大学学院皇后广场神经病学研究所与弗朗西斯·克里克研究所)

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV、cs.AI

AI总结 利用稀疏自编码器解决高维生物数据中神经网络表示空间的叠加问题,恢复几何保真度,并通过Gromov-Wasserstein最优传输实现图像与单细胞RNA测序数据的跨模态对齐。

Comments 10 pages, 7 figures (plus 14 in appendix), 1 table, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01772 2026-07-03 cs.CV eess.SP 新提交 74%

LLM-Empowered Multimodal Fusion Framework for Autonomous Driving: Semantic Enhancement and Channel-Adaptive Design

LLM赋能的自动驾驶多模态融合框架:语义增强与信道自适应设计

Wen Wang, Yaping Sun, Yejun He, Hao Chen, Zhiyong Chen, Xiaodong Xu, Nan Ma, Shuguang Cui

机构 * National Natural Science Foundation of China(国家自然科学基金) Shenzhen Natural Science Foundation(深圳市自然科学基金) Shenzhen Key Laboratory Evaluation(深圳市重点实验室评估)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

AI总结 提出LM-SCIP框架,以LLM为核心推理中枢,通过信道自适应语义模块动态融合视觉与雷达特征,实现低信噪比下的视觉主导回退和高信噪比下的协同融合,在nuScenes和VIRAT数据集上显著提升定位精度。

Comments 6 pages, 4 figures. Accepted by 2026 IEEE 37th International Symposium on Personal, Indoor and Mobile Radio Communications (PIMRC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02484 2026-07-03 cs.CV cs.AI 新提交 73%

Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning

对抗文本噪声与冗余:熵感知的密集视觉令牌剪枝

Xuehui Wang, Xuankun Yang, Wei Shen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出熵感知密集剪枝(EADP)框架,通过熵过滤文本噪声并利用子模最大化选择令牌,在严格预算下保留细粒度视觉线索,提升VLM精度-效率权衡。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30217 2026-07-03 cs.CL 版本更新 57%

Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning

在思考之前,先学会决策:面向高效视觉推理的主动路由

Yinan Zhou, Haokun Lin, Yichen Wu, Yuxin Chen, Teng Wang, Caifeng Shan, Zhenan Sun, Chen Ma, Li Zhu, Ying Shan

机构 * Xi’an Jiaotong University(西安交通大学) ARC Lab, Tencent IEG(腾讯IEG ARC实验室) City University of Hong Kong(香港城市大学) Institute of Automation, CAS(中国科学院自动化研究所) Harvard University(哈佛大学) Nanjing University(南京大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 提出主动路由范式PRP,通过联合评估草稿模型和目标模型的能力,实现早期决策,加速多模态推理而不牺牲性能。

Comments 36 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31285 2026-07-03 cs.AI 新提交 57%

Spatial Reasoning via Modality Switching Between Language and Symbolic Representation

通过语言与符号表示之间的模态切换进行空间推理

Shreya Rajpal, Tanawan Premsri, Parisa Kordjamshidi

机构 * Michigan State University(密歇根州立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 研究多跳文本空间故事中,将语言推理切换到几何感知模态(如布局或网格)能否提升推理性能,并提出基于可信度和复杂度的切换指标,实现原则性模态选择,使LLM性能提升高达42%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10710 2026-07-03 cs.CV 版本更新 57%

From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion

从一对一到多对多:面向深度视觉-语言融合的动态跨层注入

Cheng Chen, Yuyu Guo, Pengpeng Zeng, Jingkuan Song, Peng Di, Hang Yu, Lianli Gao

机构 * Tongji University(同济大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院) Independent Researcher(独立研究者)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出跨层注入框架,通过自适应多投影模块和自适应门控融合机制实现视觉层与LLM的动态多对多连接,显著提升多模态理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏