arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2505.18291 2025-05-28 cs.CV cs.CL cs.RO 70%

InstructPart: Task-Oriented Part Segmentation with Instruction Reasoning

Zifu Wan, Yaqi Xie, Ce Zhang, Zhiqiu Lin, Zihan Wang, Simon Stepputtis, Deva Ramanan, Katia Sycara

机构 * Robotics Institute, Carnegie Mellon University(机器人研究所,卡内基梅隆大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments Accepted by ACL 2025 Main. Project page: https://zifuwan.github.io/InstructPart/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20275 2025-05-27 cs.CV 70%

ImgEdit: A Unified Image Editing Dataset and Benchmark

Yang Ye, Xianyi He, Zongjian Li, Bin Lin, Shenghai Yuan, Zhiyuan Yan, Bohan Hou, Li Yuan

机构 * Peking University(北京大学) Shenzhen Graduate School(深圳研究生院) Peng Cheng Laboratory(鹏城实验室) Rabbitpre AI

专题命中 视觉定位与Grounding :vision-language model(abstract);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19569 2025-05-27 cs.CV 70%

What You Perceive Is What You Conceive: A Cognition-Inspired Framework for Open Vocabulary Image Segmentation

Jianghang Lin, Yue Hu, Jiangtao Shen, Yunhang Shen, Liujuan Cao, Shengchuan Zhang, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, China(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19503 2025-05-27 cs.CV 70%

Locality-Aware Zero-Shot Human-Object Interaction Detection

Sanghyun Kim, Deunsol Jung, Minsu Cho

机构 * Pohang University of Science and Technology (POSTECH)(釜山科学技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted to CVPR2025; Code is available at: https://github.com/OreoChocolate/LAIN

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18525 2025-05-27 cs.CV 70%

Explanatory Instructions: Towards Unified Vision Tasks Understanding and Zero-shot Generalization

Yang Shen, Xiu-Shen Wei, Yifan Sun, Yuxin Song, Tao Yuan, Jian Jin, Heyang Xu, Yazhou Yao, Errui Ding

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments ICML'25, 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17761 2025-05-27 cs.CV 70%

OpenAD: Open-World Autonomous Driving Benchmark for 3D Object Detection

Zhongyu Xia, Jishuo Li, Zhiwei Lin, Xinhao Wang, Yongtao Wang, Ming-Hsuan Yang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院) University of California, Merced(加州大学梅尔德分校)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11815 2025-05-20 cs.CV 70%

UniMoCo: Unified Modality Completion for Robust Multi-Modal Embeddings

Jiajun Qin, Yuan Pu, Zhuolun He, Seunggeun Kim, David Z. Pan, Bei Yu

机构 * The Chinese University of Hong Kong, China(香港中文大学) ChatEDA Tech(ChatEDA科技) University of Texas at Austin, USA(德克萨斯大学奥斯汀分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10672 2025-05-19 eess.IV cs.CV 70%

MOSAIC: A Multi-View 2.5D Organ Slice Selector with Cross-Attentional Reasoning for Anatomically-Aware CT Localization in Medical Organ Segmentation

Hania Ghouse, Muzammil Behzad

机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油和矿产大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07236 2025-05-13 cs.RO cs.AI 70%

UAV-CodeAgents: Scalable UAV Mission Planning via Multi-Agent ReAct and Vision-Language Reasoning

Oleg Sautenkov, Yasheerah Yaqoot, Muhammad Ahsan Mustafa, Faryal Batool, Jeffrin Sam, Artem Lykov, Chih-Yung Wen, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

Comments Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07219 2025-05-13 cs.CV cs.RO eess.IV 70%

Language-Driven Dual Style Mixing for Single-Domain Generalized Object Detection

Hongda Qin, Xiao Lu, Zhiyong Wei, Yihong Cao, Kailun Yang, Ningjiang Chen

机构 * Guangxi University(广西大学) Hunan Normal University(湖南师范大学) Hunan University(湖南大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments The source code and pre-trained models will be publicly available at https://github.com/qinhongda8/LDDS

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21530 2025-05-01 cs.RO cs.CV 70%

RoboGround: Robotic Manipulation with Grounded Vision-Language Priors

Haifeng Huang, Xinyi Chen, Yilun Chen, Hao Li, Xiaoshen Han, Zehan Wang, Tai Wang, Jiangmiao Pang, Zhou Zhao

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19524 2025-04-29 cs.CV 70%

LR-IAD:Mask-Free Industrial Anomaly Detection with Logical Reasoning

Peijian Zeng, Feiyan Pang, Zhanbo Wang, Aimin Yang

机构 * School of Computer Science and Technology, Guangdong University of Technology(广东技术大学计算机科学与技术学院) School of Computer Science and Intelligence Education, Lingnan Normal University(岭南师范学院计算机科学与智能教育学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10727 2025-04-16 cs.CV 70%

Foundation Models for Remote Sensing: An Analysis of MLLMs for Object Localization

Darryl Hannan, John Cooper, Dylan White, Timothy Doster, Henry Kvinge, Yijing Watkins

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments 26 pages, CVPR MORSE Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13341 2025-04-15 cs.CV 70%

Multi-aspect Knowledge Distillation with Large Language Model

Taegyeong Lee, Jinsik Bang, Soyeong Kwon, Taehwan Kim

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accept to CVPRW2025 (FGVC12)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02664 2025-04-14 cs.CV 70%

Standing on the Shoulders of Giants: Reprogramming Visual-Language Model for General Deepfake Detection

Kaiqing Lin, Yuzhen Lin, Weixiang Li, Taiping Yao, Bin Li

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06613 2025-04-07 cs.CV 70%

3D Spatial Understanding in MLLMs: Disambiguation and Evaluation

Chun-Peng Chang, Alain Pagani, Didier Stricker

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

Comments ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09754 2025-04-04 cs.CV 70%

ViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded Segmentation

Ali Athar, Xueqing Deng, Liang-Chieh Chen

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted to CVPR 2025. Project page: https://ali2500.github.io/vicas-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06965 2025-04-04 cs.CV 70%

Evolving from Single-modal to Multi-modal Facial Deepfake Detection: Progress and Challenges

Ping Liu, Qiqi Tao, Joey Tianyi Zhou

专题命中 视觉定位与Grounding :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

Comments P. Liu is with the Department of Computer Science and Engineering, University of Nevada, Reno, NV, 89512. Q. Tao and J. Zhou are with Centre for Frontier AI Research (CFAR), and Institute of High Performance Computing (IHPC), A*STAR, Singapore. J. Zhou is also with Centre for Advanced Technologies in Online Safety (CATOS), A*STAR, Singapore. J. Zhou is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01954 2025-04-03 cs.CV 70%

Towards Unified Referring Expression Segmentation Across Omni-Level Visual Target Granularities

Jing Liu, Wenxuan Wang, Yisi Zhang, Yepeng Tang, Xingjian He, Longteng Guo, Tongtian Yue, Xinlong Wang

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23344 2025-04-01 cs.CV 70%

From Panels to Prose: Generating Literary Narratives from Comics

Ragav Sachdeva, Andrew Zisserman

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23330 2025-04-01 cs.CV 70%

EagleVision: Object-level Attribute Multimodal LLM for Remote Sensing

Hongxiang Jiang, Jihao Yin, Qixiong Wang, Jiaqi Feng, Guo Chen

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23024 2025-04-01 cs.CV 70%

Empowering Large Language Models with 3D Situation Awareness

Zhihao Yuan, Yibo Peng, Jinke Ren, Yinghong Liao, Yatong Han, Chun-Mei Feng, Hengshuang Zhao, Guanbin Li, Shuguang Cui, Zhen Li

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21904 2025-03-31 cs.CV 70%

AssistPDA: An Online Video Surveillance Assistant for Video Anomaly Prediction, Detection, and Analysis

Zhiwei Yang, Chen Gao, Jing Liu, Peng Wu, Guansong Pang, Mike Zheng Shou

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16707 2025-03-31 cs.CV 70%

Cross-Modal and Uncertainty-Aware Agglomeration for Open-Vocabulary 3D Scene Understanding

Jinlong Li, Cristiano Saltori, Fabio Poiesi, Nicu Sebe

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01180 2025-03-24 cs.CV cs.CL 70%

UAL-Bench: The First Comprehensive Unusual Activity Localization Benchmark

Hasnat Md Abdullah, Tian Liu, Kangda Wei, Shu Kong, Ruihong Huang

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

Journal ref wacv(2025) 5801-5811

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15264 2025-03-20 cs.CV 70%

LEGION: Learning to Ground and Explain for Synthetic Image Detection

Hengrui Kang, Siwei Wen, Zichen Wen, Junyan Ye, Weijia Li, Peilin Feng, Baichuan Zhou, Bin Wang, Dahua Lin, Linfeng Zhang, Conghui He

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Project Page: https://opendatalab.github.io/LEGION

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10546 2025-03-14 cs.RO cs.AI 70%

KUDA: Keypoints to Unify Dynamics Learning and Visual Prompting for Open-Vocabulary Robotic Manipulation

Zixian Liu, Mingtong Zhang, Yunzhu Li

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.AI

Comments Project website: http://kuda-dynamics.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09416 2025-03-13 cs.CV 70%

OpenVidVRD: Open-Vocabulary Video Visual Relation Detection via Prompt-Driven Semantic Space Alignment

Qi Liu, Weiying Xue, Yuxiao Wang, Zhenao Wei

专题命中 视觉定位与Grounding :VLM(abstract);visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18363 2025-03-12 cs.CV 70%

ChatRex: Taming Multimodal LLM for Joint Perception and Understanding

Qing Jiang, Gen Luo, Yuqin Yang, Yuda Xiong, Yihao Chen, Zhaoyang Zeng, Tianhe Ren, Lei Zhang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments 35 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07593 2025-03-11 cs.CV 70%

Hierarchical Cross-Modal Alignment for Open-Vocabulary 3D Object Detection

Youjun Zhao, Jiaying Lin, Rynson W. H. Lau

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments AAAI 2025 (Extented Version). Project Page: https://youjunzhao.github.io/HCMA/

详情

展开后加载摘要…

URL PDF HTML 收藏