arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-13 至 2026-03-13 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2603.12254 2026-03-13 cs.CV 57%

Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing

先关注再注意:通过自回归注视实现高效的可扩展视频理解

Baifeng Shi, Stephanie Fu, Long Lian, Hanrong Ye, David Eigen, Aaron Reite, Boyi Li, Jan Kautz, Song Han, David M. Chan, Pavlo Molchanov, Trevor Darrell, Hongxu Yin

机构 * UC Berkeley(伯克利大学) MIT(麻省理工学院) Clarifai(Clarifai公司) NVIDIA(英伟达公司)

专题命中 视觉问答 :MLLM(abstract);分类 cs.CV

AI总结 AutoGaze通过自回归选择视频中的关键块,减少冗余并提升处理效率,使大语言模型能处理长视频并取得更优表现。

Comments CVPR 2026. Project page: https://autogaze.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12117 2026-03-13 cs.CL cs.AI 57%

SommBench: Assessing Sommelier Expertise of Language Models

SommBench:评估语言模型的品酒师专业能力

William Brach, Tomas Bedej, Jacob Nielsen, Jacob Pichna, Juraj Bedej, Eemeli Saarensilta, Julie Dupouy, Gianluca Barmina, Andrea Blasi Núñez, Peter Schneider-Kamp, Kristian Košťál, Michal Ries, Lukas Galke Poech

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 SommBench是一个多语言基准,用于评估语言模型的品酒师专业能力,包含三个任务:葡萄酒理论问答、葡萄酒特征补全和食物-葡萄酒配对,测试模型在感官判断上的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏