arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7348 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7348 篇

2501.06680 2025-07-31 cs.CV cs.AI cs.LG cs.RO 82%

Application of Vision-Language Model to Pedestrians Behavior and Scene Understanding in Autonomous Driving

Haoxiang Gao, Li Zhang, Yu Zhao, Zhou Yang, Jinghan Cao

机构 * ECE Department(电子工程系) Carnegie Mellon University(卡内基梅隆大学) Computer Science Department(计算机科学系) Columbia University(哥伦比亚大学) Rotman School of Management(罗特曼管理学院) University of Toronto(多伦多大学) Department of Statistics(统计学系) George Washington University(乔治华盛顿大学) Department of Computer Science(计算机科学系) San Francisco State University(旧金山州立大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15846 2025-07-29 cs.LG cs.AI cs.CL cs.CV cs.HC 82%

GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding

Fei Tang, Zhangxuan Gu, Zhengxi Lu, Xuyang Liu, Shuheng Shen, Changhua Meng, Wen Wang, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08049 2025-07-08 cs.CL 82%

EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding

Ao Li, Longwei Xu, Chen Ling, Jinghui Zhang, Pengwei Wang

机构 * Shandong University(山东大学) Xi’an Jiaotong University(西安交通大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17328 2025-06-24 cs.RO 82%

Reflective VLM Planning for Dual-Arm Desktop Cleaning: Bridging Open-Vocabulary Perception and Precise Manipulation

Yufan Liu, Yi Wu, Gweneth Ge, Haoliang Cheng, Rui Liu

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系) College of Aeronautics & Engineering, Kent State University(肯特州立大学航空与工程学院)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06752 2025-06-18 cs.RO 82%

Semantic Enhancement for Object SLAM with Heterogeneous Multimodal Large Language Model Agents

Jungseok Hong, Ran Choi, John J. Leonard

机构 * Computer Science and Artificial Intelligence Laboratory (CSAIL) at the Massachusetts Institute of Technology (MIT)(麻省理工学院计算机科学与人工智能实验室)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01377 2025-06-03 cs.CL cs.AI cs.CV cs.LG 82%

Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback

Yucheng Zhou, Lingran Song, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(SKL-IOTSC、CIS、澳门大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22517 2025-05-29 cs.CL cs.MM 82%

Multi-MLLM Knowledge Distillation for Out-of-Context News Detection

Yimeng Gu, Zhao Tong, Ignacio Castro, Shu Wu, Gareth Tyson

机构 * Queen Mary University of London(伦敦玛丽女王大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06832 2025-05-13 cs.RO 82%

UniDiffGrasp: A Unified Framework Integrating VLM Reasoning and VLM-Guided Part Diffusion for Open-Vocabulary Constrained Grasping with Dual Arms

Xueyang Guo, Hongwei Hu, Chengye Song, Jiale Chen, Zilin Zhao, Yu Fu, Bowen Guan, Zhenze Liu

机构 * School of Communication Engineering, Jilin University(吉林大学通信工程学院) College of Software Engineering, Jilin University(吉林大学软件工程学院) School of Mathematics, Jilin University(吉林大学数学学院) College of Electronic Science and Engineering, Jilin University(吉林大学电子科学工程学院)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract)

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00684 2025-04-22 cs.CV cs.AI cs.LG 82%

Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding

Zilin Du, Haoxin Li, Jianfei Yu, Boyang Li

机构 * Nanyang Technological University(南洋理工大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12137 2025-04-17 cs.CV cs.AI cs.CL cs.LG 82%

Efficient Contrastive Decoding with Probabilistic Hallucination Detection - Mitigating Hallucinations in Large Vision Language Models -

Laura Fieback, Nishilkumar Balar, Jakob Spiegelberg, Hanno Gottschalk

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09439 2025-04-15 cs.MM 82%

Identity-Aware Vision-Language Model for Explainable Face Forgery Detection

Junhao Xu, Jingjing Chen, Yang Jiao, Jiacheng Zhang, Zhiyu Tan, Hao Li, Yu-Gang Jiang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19331 2025-04-07 cs.CV cs.AI cs.LG 82%

CALICO: Part-Focused Semantic Co-Segmentation with Large Vision-Language Models

Kiet A. Nguyen, Adheesh Juvekar, Tianjiao Yu, Muntasir Wahed, Ismini Lourentzou

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to CVPR 2025. Project page: https://plan-lab.github.io/calico/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01095 2025-04-02 cs.AI cs.CV cs.LG 82%

VERA: Explainable Video Anomaly Detection via Verbalized Learning of Vision-Language Models

Muchao Ye, Weiyang Liu, Pan He

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24219 2025-04-01 cs.CV cs.AI cs.CL cs.LG cs.MM 82%

MB-ORES: A Multi-Branch Object Reasoner for Visual Grounding in Remote Sensing

Karim Radouane, Hanane Azzag, Mustapha lebbah

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20348 2025-03-27 cs.CV cs.AI cs.CL cs.LG 82%

VideoGEM: Training-free Action Grounding in Videos

Felix Vogel, Walid Bousselham, Anna Kukleva, Nina Shvetsova, Hilde Kuehne

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16632 2025-03-24 cs.HC 82%

Benchmarking Visual Language Models on Standardized Visualization Literacy Tests

Saugat Pandey, Alvitta Ottley

专题命中 视觉定位与Grounding :visual language model(title,abstract);VLM(abstract)

Journal ref Computer Graphics forum Volume 44 (2025), Number 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05132 2025-03-24 cs.CV cs.AI cs.CL cs.LG cs.RO 82%

3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less Hallucination

Jianing Yang, Xuweiyi Chen, Nikhil Madaan, Madhavan Iyengar, Shengyi Qian, David F. Fouhey, Joyce Chai

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR 2025. Project website: https://3d-grand.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05991 2025-03-11 eess.IV cs.AI cs.CV cs.LG 82%

GrInAdapt: Scaling Retinal Vessel Structural Map Segmentation Through Grounding, Integrating and Adapting Multi-device, Multi-site, and Multi-modal Fundus Domains

Zixuan Liu, Aaron Honjaya, Yuekai Xu, Yi Zhang, Hefu Pan, Xin Wang, Linda G Shapiro, Sheng Wang, Ruikang K Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02897 2025-03-06 cs.CV cs.AI cs.LG 82%

ClipGrader: Leveraging Vision-Language Models for Robust Label Quality Assessment in Object Detection

Hong Lu, Yali Bian, Rahul C. Shah

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19542 2025-02-25 cs.CV cs.AI cs.LG 82%

Interacted Object Grounding in Spatio-Temporal Human-Object Interactions

Xiaoyang Liu, Boran Wen, Xinpeng Liu, Zizheng Zhou, Hongwei Fan, Cewu Lu, Lizhuang Ma, Yulong Chen, Yong-Lu Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments To be published in the Proceedings of AAAI 2025. The first three authors contributed equally. Project: https://github.com/DirtyHarryLYL/HAKE-AVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19187 2025-02-20 cs.CL 82%

Beyond Logit Lens: Contextual Embeddings for Robust Hallucination Detection & Grounding in VLMs

Anirudh Phukan, Divyansh, Harshit Kumar Morj, Vaishnavi, Apoorv Saxena, Koustava Goswami

专题命中 视觉定位与Grounding :grounding(title,abstract);visual question answering(abstract)

Comments Accepted to NAACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19457 2025-02-10 cs.RO 82%

A Parameter-Efficient Tuning Framework for Language-guided Object Grounding and Robot Grasping

Houjian Yu, Mingen Li, Alireza Rezazadeh, Yang Yang, Changhyun Choi

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract)

Comments Accepted for ICRA 2025. Project page: https://sites.google.com/umn.edu/etog-etrg/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05155 2024-12-09 cs.CL 82%

Multimodal Fact-Checking with Vision Language Models: A Probing Classifier based Solution with Embedding Strategies

Recep Firat Cekinel, Pinar Karagoz, Cagri Coltekin

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract)

Comments Accepted to COLING2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14832 2024-11-25 cs.CV cs.AI cs.CL cs.LG 82%

VisGraphVar: A Benchmark Generator for Assessing Variability in Graph Analysis Using Large Vision-Language Models

Camilo Chacón Sartori, Christian Blum, Filippo Bistaffa

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11409 2024-11-19 cs.CV cs.AI cs.LG cs.RO 82%

IKEA Manuals at Work: 4D Grounding of Assembly Instructions on Internet Videos

Yunong Liu, Cristobal Eyzaguirre, Manling Li, Shubh Khanna, Juan Carlos Niebles, Vineeth Ravi, Saumitra Mishra, Weiyu Liu, Jiajun Wu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments NeurIPS 2024 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02902 2024-11-06 cs.CV cs.AI cs.CL cs.CR cs.LG 82%

Membership Inference Attacks against Large Vision-Language Models

Zhan Li, Yongtao Wu, Yihang Chen, Francesco Tonin, Elias Abad Rocamora, Volkan Cevher

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09874 2024-10-15 cs.RO 82%

ImagineNav: Prompting Vision-Language Models as Embodied Navigator through Scene Imagination

Xinxin Zhao, Wenzhe Cai, Likun Tang, Teng Wang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract)

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14096 2024-09-24 cs.RO 82%

VLM-Vac: Enhancing Smart Vacuums through VLM Knowledge Distillation and Language-Guided Experience Replay

Reihaneh Mirjalili, Michael Krawez, Florian Walter, Wolfram Burgard

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08966 2024-07-15 cs.CV cs.AI cs.LG 82%

LAPT: Label-driven Automated Prompt Tuning for OOD Detection with Vision-Language Models

Yabin Zhang, Wenjie Zhu, Chenhang He, Lei Zhang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments ECCV2024; Codes and Supp. are available at: https://github.com/YBZh/LAPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01851 2024-07-04 cs.CV cs.AI cs.LG eess.AS 82%

Meerkat: Audio-Visual Large Language Model for Grounding in Space and Time

Sanjoy Chowdhury, Sayan Nag, Subhrajyoti Dasgupta, Jun Chen, Mohamed Elhoseiny, Ruohan Gao, Dinesh Manocha

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏