arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-05 至 2026-05-05 共收录 40 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 8 篇

2605.01325 2026-05-05 cs.CV cs.LG 91%

Rethinking Model Selection in VLM Through the Lens of Gromov-Wasserstein Distance

通过格罗莫夫-瓦瑟斯坦距离重新思考VLM中的模型选择

Muyang Li, Yucheng Liu, Jianbo Ma, Elliot Osborne, Bo Han, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Dolby Laboratories(杜比实验室) TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文通过系统实验探讨视觉编码器选择的关键因素,发现模态间结构相似性通过格罗莫夫-瓦瑟斯坦距离衡量能提升VLM性能预测。

Comments Accepted as Highlight publication for CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01024 2026-05-05 cs.CV cs.AI 91%

EmoMM: Benchmarking and Steering MLLM for Multimodal Emotion Recognition under Conflict and Missingness

EmoMM:针对冲突和缺失性下的多模态情绪识别的MLLM基准测试与引导

Yueru Sun, Yimeng Zhang, Haoyu Gu, Nuo Chen, Dong She, Xianrong Yao, Yang Gao, Zhanpeng Jin

机构 * School of Future Technology, South China University of Technology(华南理工大学未来技术学院)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EmoMM基准,用于研究多模态情绪识别中模态冲突和缺失性下的MLLM决策机制,发现视频贡献崩溃现象,并提出CHASE机制减轻决策偏差,提升模型在复杂情感场景中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00876 2026-05-05 cs.LG cs.CV 85%

GAZE: Grounded Agentic Zero-shot Evaluation with Viewer-Level Tools and Literature Retrieval on Rare Brain MRI

GAZE:基于视图级工具和文献检索的 grounded 零样本评估

Duaa Alim, Mogtaba Alim, Liam Chalcroft

机构 * Imperial College London, UK(伦敦帝国学院) University of Toronto, Canada(多伦多大学) University College London, UK(伦敦大学学院)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 GAZE框架通过调用视图级工具和文献检索工具,使医学VLM在迭代方式下工作,实现对罕见脑MRI的零样本评估,提升病变定位和诊断准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12539 2026-05-05 cs.AI cs.CL 77%

MemeLens: Multilingual Multitask VLMs for Memes

MemeLens:多语言多任务VLMs用于表情包

Ali Ezzat Shahroor, Mohamed Bayan Kmainasi, Abul Hasnat, Dimitar Dimitrov, Giovanni Da San Martino, Preslav Nakov, Firoj Alam

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱孟·奥赫里迪斯") University of Padova(帕多瓦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.AI

AI总结 本文提出MemeLens,一种统一的多语言多任务解释增强视觉语言模型,用于表情包理解。通过整合38个公开数据集,建立20个任务的共享分类体系,并分析不同模型范式和数据集的表现,发现多模态训练和统一训练对表情包理解至关重要。

Comments disinformation, misinformation, factuality, harmfulness, fake news, propaganda, hateful meme, multimodality, text, images

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01061 2026-05-05 cs.MM 67%

PRISM: Exposing and Resolving Spurious Isolation in Federated Multimodal Continual Learning

PRISM:揭示并解决联邦多模态持续学习中的虚假隔离

Beining Wu, Zihao Ding, Jun Huang

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn)

AI总结 本文提出PRISM方法,通过维护专家梯度子空间基底和重新解释MoE路由,解决联邦多模态持续学习中路由隔离失效、遗忘积累和梯度冲突问题,实验表明其在多个数据集上优于现有基线。

Comments submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00877 2026-05-05 cs.MM cs.AI cs.CL cs.CV cs.LG 67%

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

OceanPile:一个大规模多模态海洋语料库用于基础模型

Yida Xue, Ningyu Zhang, Tingwei Wu, Zhe Ma, Daxiong Ji, Zhao Wang, Guozhou Zheng, Huajun Chen

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou 310027, China(浙江大学计算机科学与技术学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Hangzhou 311200, China(浙江大学杭州全球科技创新中心) School of Software Technology, Zhejiang University, Ningbo 315048, China(浙江大学软件学院) Ocean College, Zhejiang University, Zhoushan 316021, China(浙江大学海洋学院) State Key Laboratory of Ocean Sensing, Hangzhou 311200, China(杭州海洋传感国家重点实验室) Ocean Research Center of Zhoushan, Zhejiang University, Zhoushan 316021, China(舟山海洋研究中心)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出OceanPile,一个用于海洋基础模型的多模态语料库,整合了声呐数据、水下图像、海洋科学图像和科学文本,通过高质量指令数据集和评估基准提升海洋领域模型性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05109 2026-05-05 cs.DC cs.AI cs.CL eess.SP 57%

Tiny but Mighty: A Software-Hardware Co-Design Approach for Efficient Multimodal Inference on Battery-Powered Small Devices

小巧但强大:一种软件硬件协同设计方法,用于电池供电小型设备上的高效多模态推理

Yilong Li, Shuai Zhang, Yijing Zeng, Hao Zhang, Xinmiao Xiong, Jingyu Liu, Pan Hu, Suman Banerjee

机构 * University of Wisconsin – Madison(威斯康星大学麦迪逊分校) Amazon Web Services AI(亚马逊网络服务人工智能) Uber(优步)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.AI

AI总结 本文提出Nanomind框架,通过将多模态模型分解为模块化组件并分配到最佳计算单元,从而降低能耗并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12778 2026-05-05 cs.CL 50%

HeteroRAG: A Heterogeneous Retrieval-Augmented Generation Framework for Medical Vision Language Tasks

HeteroRAG:一种用于医疗视觉语言任务的异构检索增强生成框架

Zhe Chen, Yusheng Liao, Zhiyuan Zhu, Haolin Li, Hongcheng Liu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文提出HeteroRAG框架,通过异构知识源增强医疗大视觉语言模型,解决异构数据检索问题,提升事实准确性与可靠性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 2 篇

2605.00906 2026-05-05 cs.CV cs.AI cs.LG 82%

Generalized Category Discovery under Domain Shifts: From Vision to Vision-Language Models

在域偏移下进行广义类别发现:从视觉模型到视觉-语言模型

Hongjun Wang, Po Hu, Kai Han

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文研究在域偏移下的广义类别发现问题,提出三种适应基础模型的框架,从自监督视觉模型到视觉-语言模型,通过多级特征提取和互信息最小化等方法提升性能。

Comments Submission to TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01272 2026-05-05 cs.CV eess.IV 57%

GameScope: A Multi-Attribute, Multi-Codec Benchmark Dataset for Gaming Video Quality Assessment

GameScope:一个多属性、多编码器的视频游戏质量评估基准数据集

Rajesh Sureddi, Shreshth Saini, Avinab Saha, Alan C. Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

AI总结 GameScope是首个多编码器、多属性的视频游戏质量评估数据集,包含4048个视频样本,涵盖H.264、H.265和AV1等主流编码,提供细粒度质量属性,评估了多个视频质量方法,包括超越所有基准的视觉语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏