arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2503.15948 2025-03-21 cs.CV cs.AI cs.CL 62%

Don't Fight Hallucinations, Use Them: Estimating Image Realism using NLI over Atomic Facts

Elisei Rykov, Kseniia Petrushina, Kseniia Titova, Alexander Panchenko, Vasily Konovalov

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Proceedings of De-Factify 4: 4nd Workshop on Multimodal Fact Checking and Hate Speech Detection, co-located with AAAI-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12225 2025-03-21 cs.LG cs.AI 62%

Subjective Logic Encodings

Jake Vasilakes, Chrysoula Zerva, Sophia Ananiadou

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments We make our code publicly available at https://github.com/jvasilakes/SLEncodings

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18212 2025-03-21 cs.CV cs.AI 62%

Paint by Inpaint: Learning to Add Image Objects by Removing Them First

Navve Wasserman, Noam Rotstein, Roy Ganz, Ron Kimmel

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15342 2025-03-20 cs.CV cs.AI 62%

TruthLens:A Training-Free Paradigm for DeepFake Detection

Ritabrata Chakraborty, Rajatsubhra Chakraborty, Ali Khaleghi Rahimian, Thomas MacDougall

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10941 2025-03-17 cs.AI cs.LG cs.RO 62%

Graph-Grounded LLMs: Leveraging Graphical Function Calling to Minimize LLM Hallucinations

Piyush Gupta, Sangjae Bae, David Isele

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07911 2025-03-12 cs.MM cs.AI cs.CV eess.IV 62%

Visual and Text Prompt Segmentation: A Novel Multi-Model Framework for Remote Sensing

Xing Zi, Kairui Jin, Xian Tao, Jun Li, Ali Braytee, Rajiv Ratn Shah, Mukesh Prasad

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments Under Review - IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06074 2025-03-11 cs.CL cs.AI cs.LG 62%

Towards Conversational AI for Disease Management

Anil Palepu, Valentin Liévin, Wei-Hung Weng, Khaled Saab, David Stutz, Yong Cheng, Kavita Kulkarni, S. Sara Mahdavi, Joëlle Barral, Dale R. Webster, Katherine Chou, Avinatan Hassidim, Yossi Matias, James Manyika, Ryutaro Tanno, Vivek Natarajan, Adam Rodman, Tao Tu, Alan Karthikesalingam, Mike Schaekermann

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments 62 pages, 7 figures in main text, 36 figures in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06030 2025-03-11 cs.CV cs.AI 62%

Towards Universal Text-driven CT Image Segmentation

Yuheng Li, Yuxiang Lai, Maria Thor, Deborah Marshall, Zachary Buchwald, David S. Yu, Xiaofeng Yang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04639 2025-03-07 cs.CV cs.LG 62%

Enhancing SAM with Efficient Prompting and Preference Optimization for Semi-supervised Medical Image Segmentation

Aishik Konwer, Zhijian Yang, Erhan Bas, Cao Xiao, Prateek Prasanna, Parminder Bhatia, Taha Kass-Hout

专题命中 视觉定位与Grounding :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04176 2025-03-07 cs.AI cs.CE cs.CL cs.LG 62%

TIMER: Temporal Instruction Modeling and Evaluation for Longitudinal Clinical Records

Hejie Cui, Alyssa Unell, Bowen Chen, Jason Alan Fries, Emily Alsentzer, Sanmi Koyejo, Nigam Shah

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01184 2025-03-04 cs.LG cs.CV 62%

Language-Assisted Feature Transformation for Anomaly Detection

EungGu Yun, Heonjin Ha, Yeongwoo Nam, Bryan Dongik Lee

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13523 2025-02-26 cs.CV cs.AI 62%

Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?

Che Liu, Zhongwei Wan, Haozhe Wang, Yinda Chen, Talha Qaiser, Chen Jin, Fariba Yousefi, Nikolay Burlutskiy, Rossella Arcucci

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15869 2025-02-25 cs.GR cs.AI cs.CV cs.HC 62%

Generative AI Framework for 3D Object Generation in Augmented Reality

Majid Behravan

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14786 2025-02-21 cs.CV cs.AI 62%

SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features

Michael Tschannen, Alexey Gritsenko, Xiao Wang, Muhammad Ferjad Naeem, Ibrahim Alabdulmohsin, Nikhil Parthasarathy, Talfan Evans, Lucas Beyer, Ye Xia, Basil Mustafa, Olivier Hénaff, Jeremiah Harmsen, Andreas Steiner, Xiaohua Zhai

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Model checkpoints are available at https://github.com/google-research/big_vision/tree/main/big_vision/configs/proj/image_text/README_siglip2.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06303 2025-02-19 cs.LG cs.AI 62%

DSAI: Unbiased and Interpretable Latent Feature Extraction for Data-Centric AI

Hyowon Cho, Soonwon Ka, Daechul Park, Jaewook Kang, Minjoon Seo, Bokyung Son

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14750 2025-02-18 cs.CV cs.AI 62%

Grounded Knowledge-Enhanced Medical Vision-Language Pre-training for Chest X-Ray

Qiao Deng, Zhongzhen Huang, Yunqi Wang, Zhichuan Wang, Zhao Wang, Xiaofan Zhang, Qi Dou, Yeung Yu Hui, Edward S. Hui

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07344 2025-02-12 cs.LG cs.AI cs.CE 62%

Integrating Physics and Data-Driven Approaches: An Explainable and Uncertainty-Aware Hybrid Model for Wind Turbine Power Prediction

Alfonso Gijón, Simone Eiraudo, Antonio Manjavacas, Daniele Salvatore Schiera, Miguel Molina-Solana, Juan Gómez-Romero

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02762 2025-02-12 cs.CV cs.LG 62%

Interpreting and Editing Vision-Language Representations to Mitigate Hallucinations

Nick Jiang, Anish Kachinthaya, Suzie Petryk, Yossi Gandelsman

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Accepted to ICLR '25. Project page: http://anishk23733.github.io/vl-interp/. V2 added more experiments in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10076 2025-02-11 cs.AI cs.LG 62%

VideoAgent: Self-Improving Video Generation

Achint Soni, Sreyas Venkataraman, Abhranil Chandra, Sebastian Fischmeister, Percy Liang, Bo Dai, Sherry Yang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04356 2025-02-10 cs.CL cs.AI cs.LG 62%

Open Foundation Models in Healthcare: Challenges, Paradoxes, and Opportunities with GenAI Driven Personalized Prescription

Mahdi Alkaeed, Sofiat Abioye, Adnan Qayyum, Yosra Magdi Mekki, Ilhem Berrou, Mohamad Abdallah, Ala Al-Fuqaha, Muhammad Bilal, Junaid Qadir

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02804 2025-02-10 cs.AI cs.CL cs.LG 62%

ACCORD: Closing the Commonsense Measurability Gap

François Roewer-Després, Jinyue Feng, Zining Zhu, Frank Rudzicz

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments For leaderboard and dataset download, see https://www.codabench.org/competitions/3160/ For source code, see https://github.com/francois-rd/accord/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01785 2025-02-05 cs.CV cs.AI 62%

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis

Basit Alawode, Iyyakutti Iyappan Ganapathi, Sajid Javed, Naoufel Werghi, Mohammed Bennamoun, Arif Mahmood

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01549 2025-02-04 cs.IR cs.AI cs.CV 62%

VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos

Xubin Ren, Lingrui Xu, Long Xia, Shuaiqiang Wang, Dawei Yin, Chao Huang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15270 2025-01-28 cs.LG cs.AI cs.CL 62%

Inductive Biases for Zero-shot Systematic Generalization in Language-informed Reinforcement Learning

Negin Hashemi Dijujin, Seyed Roozbeh Razavi Rohani, Mohammad Mahdi Samiei, Mahdieh Soleymani Baghshah

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments Under review at Machine Learning (Springer Nature)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07647 2025-01-15 cs.CV cs.AI 62%

BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations

Weixi Feng, Chao Liu, Sifei Liu, William Yang Wang, Arash Vahdat, Weili Nie

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments Project page: https://blobgen-vid2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13536 2025-01-10 cs.LG cs.AI cs.CL 62%

Attention Mechanisms Don't Learn Additive Models: Rethinking Feature Importance for Transformers

Tobias Leemann, Alina Fastowski, Felix Pfeiffer, Gjergji Kasneci

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments TMLR Camera-Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04302 2025-01-09 cs.CV cs.AI 62%

H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving

Siran Chen, Yuxiao Luo, Yue Ma, Yu Qiao, Yali Wang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14526 2024-12-30 cs.RO cs.AI cs.CV 62%

Click to Grasp: Zero-Shot Precise Manipulation via Visual Diffusion Descriptors

Nikolaos Tsagkas, Jack Rome, Subramanian Ramamoorthy, Oisin Mac Aodha, Chris Xiaoxuan Lu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18273 2024-12-25 cs.CV cs.AI 62%

Sampling Bag of Views for Open-Vocabulary Object Detection

Hojun Choi, Junsuk Choe, Hyunjung Shim

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV、cs.AI

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17589 2024-12-24 cs.AI cs.LG 62%

PC Agent: While You Sleep, AI Works -- A Cognitive Journey into Digital World

Yanheng He, Jiahe Jin, Shijie Xia, Jiadi Su, Runze Fan, Haoyang Zou, Xiangkun Hu, Pengfei Liu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏