arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3129 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3129 篇

2312.17235 2024-10-11 cs.CV 57%

A Simple LLM Framework for Long-Range Video Question-Answering

Ce Zhang, Taixi Lu, Md Mohaiminul Islam, Ziyang Wang, Shoubin Yu, Mohit Bansal, Gedas Bertasius

专题命中 视觉问答 :LLaVA(abstract);分类 cs.CV

Comments EMNLP 2024 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13947 2024-10-10 cs.CV 57%

Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering

Dongze Hao, Qunbo Wang, Longteng Guo, Jie Jiang, Jing Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted to EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19734 2024-10-03 cs.CV 57%

T2Vs Meet VLMs: A Scalable Multimodal Dataset for Visual Harmfulness Recognition

Chen Yeh, You-Ming Chang, Wei-Chen Chiu, Ning Yu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted to NeurIPS'24 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08367 2024-10-02 cs.CV 57%

ViLA: Efficient Video-Language Alignment for Video Question Answering

Xijun Wang, Junbang Liang, Chun-Kai Wang, Kenan Deng, Yu Lou, Ming Lin, Shan Yang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18764 2024-09-30 cs.CV cs.CL 57%

Charting the Future: Using Chart Question-Answering for Scalable Evaluation of LLM-Driven Data Visualizations

James Ford, Xingmeng Zhao, Dan Schumacher, Anthony Rios

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10484 2024-09-30 cs.CV 57%

Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model

Lu Xu, Sijie Zhu, Chunyuan Li, Chia-Wen Kuo, Fan Chen, Xinyao Wang, Guang Chen, Dawei Du, Ye Yuan, Longyin Wen

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16662 2024-09-17 cs.CV 57%

Space3D-Bench: Spatial 3D Question Answering Benchmark

Emilia Szymanska, Mihai Dusmanu, Jan-Willem Buurlage, Mahdi Rad, Marc Pollefeys

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.11795 2024-09-11 cs.CV 57%

PoseScript: Linking 3D Human Poses and Natural Language

Ginger Delmas, Philippe Weinzaepfel, Thomas Lucas, Francesc Moreno-Noguer, Grégory Rogez

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments TPAMI 2024, extended version of the ECCV 2022 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04958 2024-09-04 cs.CV cs.RO 57%

Surgical-VQLA++: Adversarial Contrastive Learning for Calibrated Robust Visual Question-Localized Answering in Robotic Surgery

Long Bai, Guankun Wang, Mobarakol Islam, Lalithkumar Seenivasan, An Wang, Hongliang Ren

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by Information Fusion. Code and data availability: https://github.com/longbai1006/Surgical-VQLAPlus

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17363 2024-09-02 cs.CV 57%

Look, Learn and Leverage (L$^3$): Mitigating Visual-Domain Shift and Discovering Intrinsic Relations via Symbolic Alignment

Hanchen Xie, Jiageng Zhu, Mahyar Khayatkhoei, Jiazhi Li, Wael AbdAlmageed

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 17 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15642 2024-08-29 cs.CV 57%

Can SAR improve RSVQA performance?

Lucrezia Tosato, Sylvain Lobry, Flora Weissgerber, Laurent Wendling

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 6 pages, 4 figures

Journal ref 15th European Conference on Synthetic Aperture Radar, April 23 26, 2024, Munich, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14469 2024-08-27 cs.CV 57%

Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos

Qirui Chen, Shangzhe Di, Weidi Xie

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10942 2024-08-22 cs.CV 57%

UNK-VQA: A Dataset and a Probe into the Abstention Ability of Multi-modal Large Models

Yangyang Guo, Fangkai Jiao, Zhiqi Shen, Liqiang Nie, Mohan Kankanhalli

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11419 2024-08-22 cs.CL cs.CV 57%

KOSMOS-2.5: A Multimodal Literate Model

Tengchao Lv, Yupan Huang, Jingye Chen, Yuzhong Zhao, Yilin Jia, Lei Cui, Shuming Ma, Yaoyao Chang, Shaohan Huang, Wenhui Wang, Li Dong, Weiyao Luo, Shaoxiang Wu, Guoxin Wang, Cha Zhang, Furu Wei

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09227 2024-08-20 cs.AI 57%

FEDMEKI: A Benchmark for Scaling Medical Foundation Models via Federated Knowledge Injection

Jiaqi Wang, Xiaochen Wang, Lingjuan Lyu, Jinghui Chen, Fenglong Ma

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

Comments Submitted to Neurips 2024 DB Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07116 2024-08-13 cs.CV 57%

Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs

Zicheng Zhang, Haoning Wu, Erli Zhang, Guangtao Zhai, Weisi Lin

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by TPAMI. arXiv admin note: substantial text overlap with arXiv:2309.14181

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17100 2024-08-13 cs.CL cs.AI 57%

BiomedGPT: A Generalist Vision-Language Foundation Model for Diverse Biomedical Tasks

Kai Zhang, Rong Zhou, Eashan Adhikarla, Zhiling Yan, Yixin Liu, Jun Yu, Zhengliang Liu, Xun Chen, Brian D. Davison, Hui Ren, Jing Huang, Chen Chen, Yuyin Zhou, Sunyang Fu, Wei Liu, Tianming Liu, Xiang Li, Yong Chen, Lifang He, James Zou, Quanzheng Li, Hongfang Liu, Lichao Sun

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

Comments Fix incorrect citations and add journal reference for the published version. Nat Med (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01651 2024-08-05 cs.LG 57%

Fool Your (Vision and) Language Model With Embarrassingly Simple Permutations

Yongshuo Zong, Tingyang Yu, Ruchika Chavhan, Bingchen Zhao, Timothy Hospedales

专题命中 视觉问答 :vision-language model(abstract);分类 cs.LG

Comments ICML 2024; v3 fix typo

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10698 2024-07-23 cs.CV 57%

Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering

David Romero, Thamar Solorio

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13216 2024-07-19 cs.CV 57%

QuIIL at T3 challenge: Towards Automation in Life-Saving Intervention Procedures from First-Person View

Trinh T. L. Vuong, Doanh C. Bui, Jin Tae Kwak

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments MICCAI-Thompson Challenge 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02774 2024-07-19 cs.CV 57%

Diffusion-Refined VQA Annotations for Semi-Supervised Gaze Following

Qiaomu Miao, Alexandros Graikos, Jingwei Zhang, Sounak Mondal, Minh Hoai, Dimitris Samaras

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11481 2024-07-16 cs.CV 57%

VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding

Yue Fan, Xiaojian Ma, Rujie Wu, Yuntao Du, Jiaqi Li, Zhi Gao, Qing Li

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

Comments ECCV-24; Project page: videoagent.github.io; First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06516 2024-07-12 cs.CV 57%

VQA-Diff: Exploiting VQA and Diffusion for Zero-Shot Image-to-3D Vehicle Asset Generation in Autonomous Driving

Yibo Liu, Zheyuan Yang, Guile Wu, Yuan Ren, Kejian Lin, Bingbing Liu, Yang Liu, Jinjun Shan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02249 2024-07-11 cs.CV cs.CL 57%

Recursive Visual Programming

Jiaxin Ge, Sanjay Subramanian, Baifeng Shi, Roei Herzig, Trevor Darrell

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06852 2024-07-10 cs.CL cs.AI cs.IR 57%

Overview of BioASQ 2022: The tenth BioASQ challenge on Large-Scale Biomedical Semantic Indexing and Question Answering

Anastasios Nentidis, Georgios Katsimpras, Eirini Vandorou, Anastasia Krithara, Antonio Miranda-Escalada, Luis Gasco, Martin Krallinger, Georgios Paliouras

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

Comments 25 pages, 14 tables, 4 figures. arXiv admin note: substantial text overlap with arXiv:2106.14885

Journal ref Experimental IR Meets Multilinguality, Multimodality, and Interaction. CLEF 2022. Lecture Notes in Computer Science, vol 13390. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01983 2024-07-03 cs.CV 57%

SADL: An Effective In-Context Learning Method for Compositional Visual QA

Long Hoang Dang, Thao Minh Le, Vuong Le, Tu Minh Phuong, Truyen Tran

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00466 2024-07-02 cs.CL cs.AI 57%

BioKGBench: A Knowledge Graph Checking Benchmark of AI Agent for Biomedical Science

Xinna Lin, Siqi Ma, Junjie Shan, Xiaojing Zhang, Shell Xu Hu, Tiannan Guo, Stan Z. Li, Kaicheng Yu

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00252 2024-07-02 cs.CV cs.ET 57%

Assistive Image Annotation Systems with Deep Learning and Natural Language Capabilities: A Review

Moseli Mots'oehli

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted IEEE ETNCC 2024, 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00980 2024-06-04 cs.CL cs.CV 57%

Selectively Answering Visual Questions

Julian Martin Eisenschlos, Hernán Maina, Guido Ivetta, Luciana Benotti

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments To be published in the findings of the 2024 Annual Meeting of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19794 2024-05-31 cs.CV 57%

Video Question Answering for People with Visual Impairments Using an Egocentric 360-Degree Camera

Inpyo Song, Minjun Joo, Joonhyung Kwon, Jangwon Lee

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments CVPR2024 EgoVis Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏