arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4454 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4454 篇

2310.02569 2023-10-18 cs.CV 79%

ReForm-Eval: Evaluating Large Vision Language Models via Unified Re-Formulation of Task-Oriented Benchmarks

Zejun Li, Ye Wang, Mengfei Du, Qingwen Liu, Binhao Wu, Jiwen Zhang, Chengxing Zhou, Zhihao Fan, Jie Fu, Jingjing Chen, Xuanjing Huang, Zhongyu Wei

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV

Comments 38 pages, 11 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01155 2023-09-25 cs.CV 79%

LoGoPrompt: Synthetic Text Images Can Be Good Visual Prompts for Vision-Language Models

Cheng Shi, Sibei Yang

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments ICCV 2023; Project Page:https://chengshiest.github.io/logo

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16890 2023-09-06 cs.CV cs.CL 79%

TouchStone: Evaluating Vision-Language Models by Language Models

Shuai Bai, Shusheng Yang, Jinze Bai, Peng Wang, Xingxuan Zhang, Junyang Lin, Xinggang Wang, Chang Zhou, Jingren Zhou

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments https://github.com/OFA-Sys/TouchStone

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.00259 2023-06-02 cs.CV cs.CL 79%

Super-CLEVR: A Virtual Benchmark to Diagnose Domain Robustness in Visual Reasoning

Zhuowan Li, Xingrui Wang, Elias Stengel-Eskin, Adam Kortylewski, Wufei Ma, Benjamin Van Durme, Alan Yuille

专题命中 视觉推理 :visual reasoning(title);visual question answering(abstract);分类 cs.CV

Comments Published in CVPR 2023 as Highlight. Data and code are released at https://github.com/Lizw14/Super-CLEVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18373 2023-05-31 cs.CV cs.CL 79%

KAFA: Rethinking Image Ad Understanding with Knowledge-Augmented Feature Adaptation of Vision-Language Models

Zhiwei Jia, Pradyumna Narayana, Arjun R. Akula, Garima Pruthi, Hao Su, Sugato Basu, Varun Jampani

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03318 2023-04-10 cs.HC cs.AI 79%

Explainable AI And Visual Reasoning: Insights From Radiology

Robert Kaufman, David Kirsh

专题命中 视觉推理 :visual reasoning(title);grounding(abstract);分类 cs.AI

Comments Accepted to 2023 Conference on Computer-Human Interaction (CHI) Human-Centered Explainable AI Workshop, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.13296 2023-01-02 cs.CV 79%

VQA and Visual Reasoning: An Overview of Recent Datasets, Methods and Challenges

Rufai Yusuf Zakari, Jim Wilson Owusu, Hailin Wang, Ke Qin, Zaharaddeen Karami Lawal, Yuezhou Dong

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.06971 2022-12-15 cs.CV cs.CL 79%

Find Someone Who: Visual Commonsense Understanding in Human-Centric Grounding

Haoxuan You, Rui Sun, Zhecan Wang, Kai-Wei Chang, Shih-Fu Chang

专题命中 视觉推理 :grounding(title,abstract);分类 cs.CV

Comments 11 pages, 7 figures. EMNLP 2022-findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.11514 2022-12-07 cs.CV cs.RO 79%

Semantic Abstraction: Open-World 3D Scene Understanding from 2D Vision-Language Models

Huy Ha, Shuran Song

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments 16 pages, 9 figures, project website at https://semantic-abstraction.cs.columbia.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.00262 2022-11-02 cs.CL cs.CV 79%

Training Vision-Language Models with Less Bimodal Supervision

Elad Segal, Ben Bogin, Jonathan Berant

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments AKBC 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09265 2022-06-23 cs.CV 79%

SAViR-T: Spatially Attentive Visual Reasoning with Transformers

Pritish Sahu, Kalliopi Basioti, Vladimir Pavlovic

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.03075 2022-05-09 cs.CV cs.CL 79%

QLEVR: A Diagnostic Dataset for Quantificational Language and Elementary Visual Reasoning

Zechen Li, Anders Søgaard

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

Comments To appear at Findings of NAACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.02380 2022-04-06 cs.CV cs.CL 79%

CLEVR-X: A Visual Reasoning Dataset for Natural Language Explanations

Leonard Salewski, A. Sophia Koepke, Hendrik P. A. Lensch, Zeynep Akata

专题命中 视觉推理 :visual reasoning(title);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.12301 2022-01-06 cs.CV 79%

Two-stage Rule-induction Visual Reasoning on RPMs with an Application to Video Prediction

Wentao He, Jianfeng Ren, Ruibin Bai, Xudong Jiang

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.14666 2021-11-30 cs.AI cs.RO 79%

An in-depth experimental study of sensor usage and visual reasoning of robots navigating in real environments

Assem Sadek, Guillaume Bono, Boris Chidlovskii, Christian Wolf

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.14576 2021-11-30 cs.CV 79%

Recurrent Vision Transformer for Solving Visual Reasoning Problems

Nicola Messina, Giuseppe Amato, Fabio Carrara, Claudio Gennaro, Fabrizio Falchi

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.07721 2019-11-20 cs.LG stat.ML 79%

Program synthesis performance constrained by non-linear spatial relations in Synthetic Visual Reasoning Test

Lu Yihe, Scott C. Lowe, Penelope A. Lewis, Mark C. W. van Rossum

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.05990 2019-11-15 cs.LG stat.ML 79%

Attention on Abstract Visual Reasoning

Lukas Hahne, Timo Lüddecke, Florentin Wörgötter, David Kappel

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.01855 2019-03-20 cs.CV 79%

Explainable and Explicit Visual Reasoning over Scene Graphs

Jiaxin Shi, Hanwang Zhang, Juanzi Li

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

Comments CVPR2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.02453 2018-10-01 cs.CV 79%

Visual Reasoning by Progressive Module Networks

Seung Wook Kim, Makarand Tapaswi, Sanja Fidler

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.11189 2018-03-30 cs.CV 79%

Iterative Visual Reasoning Beyond Convolutions

Xinlei Chen, Li-Jia Li, Li Fei-Fei, Abhinav Gupta

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

Comments CVPR 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.07300 2018-02-26 cs.CV 79%

FigureQA: An Annotated Figure Dataset for Visual Reasoning

Samira Ebrahimi Kahou, Vincent Michalski, Adam Atkinson, Akos Kadar, Adam Trischler, Yoshua Bengio

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

Comments workshop paper at ICLR 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13460 2026-08-18 cs.CV cs.AI 79%

Chain-of-Evidence Multimodal Reasoning for Few-shot Temporal Action Localization

基于证据链的多模态推理用于少样本时序动作定位

Mengshi Qi, Hongwei Ji, Wulian Yun, Xianlin Zhang, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于证据链的多模态推理方法,通过结合文本和视觉信息提升少样本时序动作定位的性能。

Comments Accepted by TIP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13210 2026-08-14 cs.CV cs.AI cs.MM 新提交 79%

NARU: A Benchmark for NARrative Evolution and Cultural Nuance Understanding in Japanese Extreme Long Video

NARU:用于理解日语超长视频中叙事演变与文化细微差别的基准

Yuheng Huang, Jianlang Chen, Jiayang Song, Hua Qi, Aza Kai, Vincent Markert, Edison Marrese-Taylor, Jianjun Zhao, Lei Ma

机构 * The University of Tokyo(东京大学) Kyushu University(九州大学) Macau University of Science and Technology(澳门科技大学) Infinimind Japan Inc.(Infinimind日本公司) University of Alberta(阿尔伯塔大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究推出NARU基准,涵盖155个146.8小时日语视频的1481个问题,评估模型在长程叙事整合与文化推理上的局限,为MLLM开发提供测试平台。

Comments Yuheng Huang and Jianlang Chen contributed equally to this work. More details available on the project's website https://ma-labo.github.io/naru/ and https://infinimind.io/en/company/news/2026/narubench-release

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12290 2026-08-13 cs.CV cs.AI cs.MM 新提交 79%

Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence

超越试错:面向图像到视频一致性的智能体优化

Aman Tyagi, Hemanth Boinpally, Jonathan Chen, Douglas Gebert, Steven Hickson

机构 * Google Cloud(谷歌云) Google DeepMind(谷歌DeepMind)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对图像到视频模型试错效率低的问题,提出Agentic Self-Improvement框架,通过两阶段优化提升视频与文本一致性,生成视频胜率达69%,为视频生成模型提供实用可控的优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09873 2026-08-11 cs.CV cs.AI 新提交 79%

Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

Sci-VBench:面向科学领域知识与推理密集型视频生成的评估

Diandian Zhang, Tingyu Song, Lin Fu, Zheyuan Yang, Yilun Zhao

机构 * Zhejiang University(浙江大学) UCAS(中国科学院大学) Tongji University(同济大学) Yale University(耶鲁大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.AI

AI总结 该研究推出Sci-VBench基准,评估科学领域视频生成,测试16个模型后发现,视觉真实感提升未转化为科学与因果动态建模能力,且专有模型性能优于开源模型。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02927 2026-08-11 cs.CV cs.AI 79%

PrismVAU: Prompt-Refined Inference System for Multimodal Video Anomaly Understanding

PrismVAU: 用于多模态视频异常理解的提示优化推理系统

Iñaki Erregue, Kamal Nasrollahi, Sergio Escalera

机构 * Universitat de Barcelona(巴塞罗那大学) Computer Vision Center(计算机视觉中心) Aalborg University(奥胡斯大学) Milestone Systems(Milestone系统)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 PrismVAU通过轻量级系统和自动提示工程实现高效的多模态视频异常理解,无需复杂标注和外部模块。

Comments This paper has been accepted to the 6th Workshop on Real-World Surveillance: Applications and Challenges (WACV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07417 2026-08-10 cs.CV cs.AI 新提交 79%

I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning

我在视频中寻找你:面向以人为中心的视频推理的身份条件查询

Shibo Gao, Chongxiao Wang, Chenglong Huang, Jie Ma, Haolin Shi, Fei Ding, Jing Li, Qiang Lyu, Yangyang Liu, Yang Liu, Jun Liu, Linlin Huang, Peipei Yang

机构 * Beijing Jiaotong University(北京交通大学) HUJING Digital Media & Entertainment Group(汇晶数字媒体与娱乐集团) MAIS Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)

专题命中 视觉推理 :grounding(abstract,abstract_cn);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究提出了身份条件查询(ICQ)任务,构建了ISYV基准、训练集与框架,实验显示主流多模态大语言模型在该任务上表现不佳,ISYV模型性能优于强基线且接近闭源模型。

Comments Accepted to ACM Multimedia 2026 (MM '26). 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04575 2026-08-06 cs.CV cs.AI 新提交 79%

PhysMind: From Video to Executable Worlds for Training-Free Physical Reasoning

PhysMind:从视频到可执行世界的无训练物理推理框架

Chen Yang, Shenxiang Zeng, Haoyang Zhao, Zhouyuan Xu, Youquan He, Haoyu Li, Mingyi Deng, Jiansheng Fan, Chen Wang

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 PhysMind是无训练的智能体框架,为每个视频构建可执行世界,在CLEVRER、Physion++数据集及反事实问题上的物理推理准确率显著优于现有视觉语言模型。

Comments 27 pages, 18 figures. Project page: https://physmind.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02833 2026-08-05 cs.CV cs.AI cs.CL 新提交 79%

CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning

CURV:通过课程可视化接地推理增强图表理解

Xuehang Guo, Pingyue Zhang, Ruiyi Zhang, Zhenhailong Wang, Hanrui Lyu, Heng Ji, Tong Sun, Qingyun Wang, Manling Li

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型视觉接地与推理不足的问题,提出CURV课程学习框架,结合CCQA数据集,在图表问答任务中实现显著性能提升并具备良好泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏