arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3129 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3129 篇

2412.14880 2024-12-20 cs.CV 57%

Multimodal Hypothetical Summary for Retrieval-based Multi-image Question Answering

Peize Li, Qingyi Si, Peng Fu, Zheng Lin, Yan Wang

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13736 2024-12-19 cs.CV 57%

MedCoT: Medical Chain of Thought via Hierarchical Expert

Jiaxiang Liu, Yuan Wang, Jiawei Du, Joey Tianyi Zhou, Zuozhu Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Journal ref EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12502 2024-12-18 cs.CV 57%

Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal Clues

Yan Zhang, Gangyan Zeng, Huawen Shen, Daiqing Wu, Yu Zhou, Can Ma

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12077 2024-12-17 cs.CV 57%

CPath-Omni: A Unified Multimodal Foundation Model for Patch and Whole Slide Image Analysis in Computational Pathology

Yuxuan Sun, Yixuan Si, Chenglu Zhu, Xuan Gong, Kai Zhang, Pingyi Chen, Ye Zhang, Zhongyi Shui, Tao Lin, Lin Yang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 22 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12075 2024-12-17 cs.CV 57%

CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding

Guo Chen, Yicheng Liu, Yifei Huang, Yuping He, Baoqi Pei, Jilan Xu, Yali Wang, Tong Lu, Limin Wang

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11453 2024-12-17 cs.CL cs.AI 57%

ACE-$M^3$: Automatic Capability Evaluator for Multimodal Medical Models

Xiechi Zhang, Shunfan Zheng, Linlin Wang, Gerard de Melo, Zhu Cao, Xiaoling Wang, Liang He

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11056 2024-12-17 cs.CV 57%

Overview of TREC 2024 Medical Video Question Answering (MedVidQA) Track

Deepak Gupta, Dina Demner-Fushman

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08169 2024-12-12 cs.CV cs.CL 57%

Illusory VQA: Benchmarking and Enhancing Multimodal Models on Visual Illusions

Mohammadmostafa Rostamkhani, Baktash Ansari, Hoorieh Sabzevari, Farzan Rahmani, Sauleh Eetemadi

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03220 2024-12-05 cs.LG 57%

Survey of different Large Language Model Architectures: Trends, Benchmarks, and Challenges

Minghao Shao, Abdul Basit, Ramesh Karri, Muhammad Shafique

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01132 2024-12-03 cs.CV 57%

Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks

Joseph Raj Vishal, Divesh Basina, Aarya Choudhary, Bharatesh Chakravarthi

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12735 2024-12-03 cs.CV 57%

EchoSight: Advancing Visual-Language Models with Wiki Knowledge

Yibin Yan, Weidi Xie

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by EMNLP 2024 findings; Project Page: https://go2heart.github.io/echosight

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11217 2024-12-02 cs.CL cs.CV 57%

A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models

Jie Liu, Wenxuan Wang, Yihang Su, Jingyuan Huan, Wenting Chen, Yudi Zhang, Cheng-Yi Li, Kao-Jung Chang, Xiaohan Xin, Linlin Shen, Michael R. Lyu

专题命中 视觉问答 :MLLM(abstract);分类 cs.CV

Comments 20 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18138 2024-11-28 eess.AS cs.AI cs.CL cs.SD 57%

SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation

Wenyi Yu, Siyin Wang, Xiaoyu Yang, Xianzhao Chen, Xiaohai Tian, Jun Zhang, Guangzhi Sun, Lu Lu, Yuxuan Wang, Chao Zhang

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12195 2024-11-20 cs.CV 57%

A Survey of Medical Vision-and-Language Applications and Their Techniques

Qi Chen, Ruoshan Zhao, Sinuo Wang, Vu Minh Hieu Phan, Anton van den Hengel, Johan Verjans, Zhibin Liao, Minh-Son To, Yong Xia, Jian Chen, Yutong Xie, Qi Wu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13653 2024-11-20 cs.LG 57%

PQA: Zero-shot Protein Question Answering for Free-form Scientific Enquiry with Large Language Models

Eli M Carrami, Sahand Sharifzadeh

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10937 2024-11-19 cs.CV cs.CL 57%

Memory-Augmented Multimodal LLMs for Surgical VQA via Self-Contained Inquiry

Wenjun Hou, Yi Cheng, Kaishuai Xu, Yan Hu, Wenjie Li, Jiang Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20092 2024-11-19 cs.CV 57%

Efficient Large Multi-modal Models via Visual Context Compression

Jieneng Chen, Luoxin Ye, Ju He, Zhao-Yang Wang, Daniel Khashabi, Alan Yuille

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments NeurIPS 2024 Camera Ready; Code is available at https://github.com/Beckschen/LLaVolta

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07516 2024-11-13 cs.CV cs.CL 57%

SparrowVQE: Visual Question Explanation for Course Content Understanding

Jialu Li, Manish Kumar Thota, Ruslan Gokhman, Radek Holik, Youshan Zhang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05734 2024-11-11 cs.CV 57%

Poze: Sports Technique Feedback under Data Constraints

Agamdeep Singh, Sujit PB, Mayank Vatsa

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05056 2024-11-11 cs.CR cs.AI 57%

Seeing is Deceiving: Exploitation of Visual Pathways in Multi-Modal Language Models

Pete Janowczyk, Linda Laurier, Ave Giulietta, Arlo Octavia, Meade Cleti

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03314 2024-11-06 cs.CV cs.CL 57%

MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning

Ziliang Gan, Yu Lu, Dong Zhang, Haohan Li, Che Liu, Jian Liu, Ji Liu, Haipang Wu, Chaoyou Fu, Zenglin Xu, Rongjunchen Zhang, Yong Dai

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Project Page: https://hithink-research.github.io/MME-Finance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00485 2024-10-31 cs.CV 57%

A Hitchhikers Guide to Fine-Grained Face Forgery Detection Using Common Sense Reasoning

Niki Maria Foteinopoulou, Enjie Ghorbel, Djamila Aouada

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted at NeurIPS'2024 (D&B)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21943 2024-10-30 cs.CL cs.AI 57%

Beyond Text: Optimizing RAG with Multimodal Inputs for Industrial Applications

Monica Riedler, Stefan Langer

专题命中 视觉问答 :LLaVA(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17779 2024-10-24 cs.CV 57%

ADEM-VL: Adaptive and Embedded Fusion for Efficient Vision-Language Tuning

Zhiwei Hao, Jianyuan Guo, Li Shen, Yong Luo, Han Hu, Yonggang Wen

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14948 2024-10-22 cs.CL cs.CV 57%

SemiHVision: Enhancing Medical Multimodal Models with a Semi-Human Annotated Dataset and Fine-Tuned Instruction Generation

Junda Wang, Yujan Ting, Eric Z. Chen, Hieu Tran, Hong Yu, Weijing Huang, Terrence Chen

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14154 2024-10-21 cs.MM cs.AI 57%

RA-BLIP: Multimodal Adaptive Retrieval-Augmented Bootstrapping Language-Image Pre-training

Muhe Ding, Yang Ma, Pengda Qin, Jianlong Wu, Yuhong Li, Liqiang Nie

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI

Comments 10 pages, 6 figures, Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13651 2024-10-18 cs.CV 57%

Help Me Identify: Is an LLM+VQA System All We Need to Identify Visual Concepts?

Shailaja Keyur Sampat, Maitreya Patel, Yezhou Yang, Chitta Baral

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03544 2024-10-16 cs.CL cs.AI 57%

NatLan: Native Language Prompting Facilitates Knowledge Elicitation Through Language Trigger Provision and Domain Trigger Retention

Baixuan Li, Yunlong Fan, Tianyi Ma, Zhiqiang Gao

专题命中 视觉问答 :MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01326 2024-10-14 cs.CV 57%

TabPedia: Towards Comprehensive Visual Table Understanding with Concept Synergy

Weichao Zhao, Hao Feng, Qi Liu, Jingqun Tang, Shu Wei, Binghong Wu, Lei Liao, Yongjie Ye, Hao Liu, Wengang Zhou, Houqiang Li, Can Huang

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03788 2024-10-11 cs.CV cs.CL 57%

MAMA: Meta-optimized Angular Margin Contrastive Framework for Video-Language Representation Learning

Thong Nguyen, Yi Bin, Xiaobao Wu, Xinshuai Dong, Zhiyuan Hu, Khoi Le, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏