arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-05 至 2026-03-05 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 10 篇

2603.04320 2026-03-05 cs.IR cs.MM 83%

CAMMSR: Category-Guided Attentive Mixture of Experts for Multimodal Sequential Recommendation

CAMMSR: 基于类别的注意力混合专家多模态序列推荐

Jinfeng Xu, Zheyu Chen, Shuo Yang, Jinze Li, Hewei Wang, Yijie Li, Jianheng Tang, Yunhuai Liu, Edith C. H. Ngai

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 CAMMSR通过引入基于类别的注意力混合专家模块,实现多模态序列推荐的自适应、协同和用户中心化

Comments Accepted by ICDE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03827 2026-03-05 cs.MM 83%

Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognition

通过层次语义表示进行进化多模态推理以实现意图识别

Qianrui Zhou, Hua Xu, Yunjin Gu, Yifan Wang, Songze Li, Hanlei Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.MM

AI总结 HIER通过层次语义表示与进化推理提升多模态意图识别性能,实现更准确的意图推断。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03544 2026-03-05 cs.CV 83%

PinCLIP: Large-scale Foundational Multimodal Representation at Pinterest

PinCLIP:Pinterest的规模化多模态基础表示

Josh Beal, Eric Kim, Jinfeng Rao, Rex Wu, Dmitry Kislyuk, Charles Rosenberg

机构 * Pinterest Inc.(Pinterest公司)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 PinCLIP通过多模态表示学习提升Pinterest的检索和排序模型,解决冷启动问题并提高用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17204 2026-03-05 cs.LG cs.CE 78%

SpecBridge: Bridging Mass Spectrometry and Molecular Representations via Cross-Modal Alignment

SpecBridge: 通过跨模态对齐弥合质谱与分子表示

Yinkai Wang, Yan Zhou Chen, Xiaohui Chen, Li-Ping Liu, Soha Hassoun

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 SpecBridge通过跨模态对齐方法提升质谱数据中分子鉴定的准确性,利用冻结的基础模型实现高效检索。

Comments We have found a problem in the preprocessing/evaluation pipeline

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03681 2026-03-05 cs.CV cs.AI 73%

EvoPrune: Early-Stage Visual Token Pruning for Efficient MLLMs

EvoPrune:面向高效MLLMs的早期阶段视觉标记剪枝

Yuhao Chen, Bin Shan, Xin Ye, Cheng Chen

机构 * ByteDance(字节跳动)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 EvoPrune通过在视觉编码早期阶段剪枝视觉标记,提升多模态大语言模型的推理效率,实现在VideoMME数据集上2倍加速且性能损失低于1%。

Comments 16 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04267 2026-03-05 cs.CV 70%

UniLight: A Unified Representation for Lighting

UniLight: 一种统一的光照表示

Zitian Zhang, Iliyan Georgiev, Michael Fischer, Yannick Hold-Geoffroy, Jean-François Lalonde, Valentin Deschaintre

机构 * Université Laval(拉瓦尔大学) Adobe Research(Adobe研究)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 UniLight通过联合潜在空间统一多种光照表示,实现跨模态的光照特征提取与迁移,支持光照检索、环境映射生成和扩散模型中的光照控制。

Comments Project page: https://lvsn.github.io/UniLight

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03739 2026-03-05 cs.CV cs.AI 62%

PROSPECT: Unified Streaming Vision-Language Navigation via Semantic--Spatial Fusion and Latent Predictive Representation

PROSPECT:通过语义-空间融合和潜在预测表示实现统一的流式视觉-语言导航

Zehua Fan, Wenqi Lyu, Wenxuan Song, Linge Zhao, Yifei Yang, Xi Wang, Junjie He, Lida Huang, Haiyan Liu, Bingchuan Sun, Guangjun Bao, Xuanyao Mao, Liang Xu, Yan Wang, Feng Gao

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) University of Adelaide(阿德莱德大学) Wuhan University(武汉大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Jiaotong University(北京交通大学) AIR Wuxi Innovation Center, Tsinghua University(清华大学无锡创新中心) Lenovo(联想集团)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PROSPECT通过语义-空间融合和潜在预测表示,实现统一的流式视觉-语言导航,提升环境动态和空间结构的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10619 2026-03-05 cs.CV cs.AI 62%

Improving Medical Visual Reinforcement Fine-Tuning via Perception and Reasoning Augmentation

通过感知与推理增强改进医疗视觉强化微调

Guangjing Yang, ZhangYuan Yu, Ziyuan Qin, Xinyuan Song, Huahui Yi, Qingbo Kang, Jun Gao, Yiyue Li, Chenlin Du, Qicheng Lao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Emory University(埃默里大学) Sichuan University(四川大学) Peking University(北京大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出VRFT-Aug框架,通过增强感知与推理能力,改进医疗影像领域的强化微调效果,提升模型在医学应用中的可靠性与推理能力。

Comments CPAL 2026

Journal ref 2026 Conference on Parsimony and Learning (CPAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20704 2026-03-05 cs.CL cs.AI cs.CR 62%

Text2VLM: Adapting Text-Only Datasets to Evaluate Alignment Training in Visual Language Models

Text2VLM: 将文本-only数据集适应于评估视觉语言模型对齐训练

Gabriel Downer, Sean Craven, Damian Ruck, Jake Thomas

机构 * Advai

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 Text2VLM通过将文本-only数据集转换为多模态格式,评估VLMs对提示注入攻击的鲁棒性,并揭示模型对齐中的关键弱点。

Comments 9 pages, 9 figures. Jake Thomas served as Editor for this manuscript

Journal ref Proceedings of the 2025 Conference on Applied Machine Learning for Information Security, Proceedings of Machine Learning Research PMLR Vol 299 pp 28 41

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03969 2026-03-05 cs.CV 57%

Scaling Dense Event-Stream Pretraining from Visual Foundation Models

从视觉基础模型扩展密集事件流预训练

Zhiwen Chen, Junhui Hou, Zhiyu Zhu, Jinjian Wu, Guangming Shi

机构 * City University of Hong Kong(香港城市大学) Xidian University(西安电子科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于视觉基础模型的自监督预训练方法,通过结构感知的蒸馏损失优化密集事件表示,显著提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏