arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-05 至 2026-05-05 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 2 篇

2605.00906 2026-05-05 cs.CV cs.AI cs.LG 82%

Generalized Category Discovery under Domain Shifts: From Vision to Vision-Language Models

在域偏移下进行广义类别发现:从视觉模型到视觉-语言模型

Hongjun Wang, Po Hu, Kai Han

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文研究在域偏移下的广义类别发现问题,提出三种适应基础模型的框架,从自监督视觉模型到视觉-语言模型,通过多级特征提取和互信息最小化等方法提升性能。

Comments Submission to TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01272 2026-05-05 cs.CV eess.IV 57%

GameScope: A Multi-Attribute, Multi-Codec Benchmark Dataset for Gaming Video Quality Assessment

GameScope:一个多属性、多编码器的视频游戏质量评估基准数据集

Rajesh Sureddi, Shreshth Saini, Avinab Saha, Alan C. Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

AI总结 GameScope是首个多编码器、多属性的视频游戏质量评估数据集,包含4048个视频样本,涵盖H.264、H.265和AV1等主流编码,提供细粒度质量属性,评估了多个视频质量方法,包括超越所有基准的视觉语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏