arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7360 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7360 篇

2505.12370 2025-05-27 cs.AI 79%

Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement Learning

Xinbin Yuan, Jian Zhang, Kaixin Li, Zhuoxuan Cai, Lujian Yao, Jie Chen, Enguang Wang, Qibin Hou, Jinwei Chen, Peng-Tao Jiang, Bo Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15332 2025-05-22 cs.CV 79%

Towards Zero-Shot Differential Morphing Attack Detection with Multimodal Large Language Models

Ria Shekhawat, Hailin Li, Raghavendra Ramachandra, Sushma Venkatesh

机构 * Norwegian University of Science and Technology (NTNU)(挪威科学与技术大学) MOBAI AS(MOBAI公司)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted at IEEE International Conference on Automatic Face and Gesture Recognition (FG 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16282 2025-05-21 cs.CV 79%

Generalized Few-shot 3D Point Cloud Segmentation with Vision-Language Model

Zhaochong An, Guolei Sun, Yun Liu, Runjia Li, Junlin Han, Ender Konukoglu, Serge Belongie

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) Computer Vision Laboratory, ETH Zurich(苏黎世联邦理工学院计算机视觉实验室) College of Computer Science, Nankai University(南开大学计算机学院) Department of Engineering Science, University of Oxford(牛津大学工程科学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.07407 2025-05-21 cs.CV 79%

SemAug: Semantically Meaningful Image Augmentations for Object Detection Through Language Grounding

Morgan Heisler, Amin Banitalebi-Dehkordi, Yong Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09990 2025-05-20 cs.CV 79%

PointArena: Probing Multimodal Grounding Through Language-Guided Pointing

Long Cheng, Jiafei Duan, Yi Ru Wang, Haoquan Fang, Boyang Li, Yushan Huang, Elvis Wang, Ainaz Eftekhar, Jason Lee, Wentao Yuan, Rose Hendrix, Noah A. Smith, Fei Xia, Dieter Fox, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能 Allen 机构) Anderson Collegiate Vocational Institute(安德森职业学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 10 Pages, Dataset and code:https://pointarena.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08725 2025-05-14 cs.CV 79%

Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous Driving

Zongchuang Zhao, Haoyu Fu, Dingkang Liang, Xin Zhou, Dingyuan Zhang, Hongwei Xie, Bing Wang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车)

专题命中 视觉定位与Grounding :vision-language model(title);grounding(abstract);分类 cs.CV

Comments The dataset and code will be released at https://github.com/zc-zhao/DriveMonkey

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04830 2025-05-14 cs.CL cs.AI 79%

Cite Before You Speak: Enhancing Context-Response Grounding in E-commerce Conversational LLM-Agents

Jingying Zeng, Hui Liu, Zhenwei Dai, Xianfeng Tang, Chen Luo, Samarth Varshney, Zhen Li, Qi He

机构 * Amazon(亚马逊)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07768 2025-05-13 cs.SE cs.AI cs.CL 79%

Enhancing Code Generation via Bidirectional Comment-Level Mutual Grounding

Yifeng Di, Tianyi Zhang

机构 * Purdue University(普渡大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments Accepted to ICSE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06557 2025-05-13 cs.CV 79%

Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining

Lu Dong, Haiyu Zhang, Hongjie Zhang, Yifei Huang, Zhen-Hua Ling, Yu Qiao, Limin Wang, Yali Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学) State Key Laboratory for Novel Software Technology(国家软件创新科技重点实验室) Nanjing University(南京大学) Shenzhen Key Laboratory of Computer Vision and Pattern Recognition(深圳计算机视觉与模式识别重点实验室) Shenzhen Institute of Advanced Technology(深圳先进技术研究院) Chinese Academy of Sciences(中国科学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments TCSVT 2025, doi at https://ieeexplore.ieee.org/document/10970001

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04965 2025-05-09 cs.CV 79%

DenseGrounding: Improving Dense Language-Vision Semantics for Ego-Centric 3D Visual Grounding

Henry Zheng, Hao Shi, Qihang Peng, Yong Xien Chng, Rui Huang, Yepeng Weng, Zhongchao Shi, Gao Huang

机构 * Department of Automation, BNRist, Tsinghua University(自动化系、BNRist、清华大学) AI Lab, Lenovo Research(联想研究院人工智能实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01809 2025-05-06 cs.CV 79%

3DWG: 3D Weakly Supervised Visual Grounding via Category and Instance-Level Alignment

Xiaoqi Li, Jiaming Liu, Nuowei Han, Liang Heng, Yandong Guo, Hao Dong, Yang Liu

机构 * School of CS, Peking University(计算机科学系,北京大学) AI2Robotic Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23668 2025-05-02 cs.AI 79%

MolGround: A Benchmark for Molecular Grounding

Jiaxin Wu, Ting Zhang, Rubing Chen, Wengyu Zhang, Chen Jason Zhang, Xiao-Yong Wei, Li Qing

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.11564 2025-05-01 cs.RO cs.CL cs.CV cs.HC 79%

Learning 6-DoF Fine-grained Grasp Detection Based on Part Affordance Grounding

Yaoxian Song, Penglei Sun, Piaopiao Jin, Yi Ren, Yu Zheng, Zhixu Li, Xiaowen Chu, Yue Zhang, Tiefeng Li, Jason Gu

机构 * Center for X-Mechanics, School of Aeronautics and Astronautics, Zhejiang University(浙江大学航空航天学院X力学中心) Information Hub, Data Science and Analytics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心、数据科学与分析方向) Advanced Manufacturing Lab, Huawei Technologies(华为技术先进制造实验室) Research Institute, UBTECH Robotics Inc.(UBTECH机器人研究院) School of Information and School of Smart Governance, Renmin University of China(中国人民大学信息学院和智能治理学院) School of Engineering, Westlake University and the Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖大学工程学院和西湖先进科技研究院) Department of Electrical and Computer Engineering, Dalhousie University(达尔豪斯大学电气与计算机工程系)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 15 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18738 2025-04-29 cs.CV 79%

A Review of 3D Object Detection with Vision-Language Models

Ranjan Sapkota, Konstantinos I Roumeliotis, Rahul Harsha Cheppally, Marco Flores Calero, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of Peloponnese(希腊皮洛斯大学) Kansas State University(堪萨斯州立大学) Universidad de las Fuerzas Armadas(武装力量大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05091 2025-04-28 cs.CV 79%

DCFormer: Efficient 3D Vision-Language Modeling with Decomposed Convolutions

Gorkem Can Ates, Yu Xin, Kuang Gong, Wei Shao

机构 * Department of Medicine, University of Florida(医学系,佛罗里达大学) Department of Electrical and Computer Engineering, University of Florida(电气与计算机工程系,佛罗里达大学) Department of Biomedical Engineering, University of Florida(生物医学工程系,佛罗里达大学) Intelligent Clinical Care Center, University of Florida(智能临床护理中心,佛罗里达大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15545 2025-04-23 eess.IV cs.CV 79%

VLM-based Prompts as the Optimal Assistant for Unpaired Histopathology Virtual Staining

Zizhi Chen, Xinyu Zhang, Minghao Han, Yizhou Liu, Ziyun Qian, Weifeng Zhang, Xukun Zhang, Jingwei Wei, Lihua Zhang

机构 * Fudan University(复旦大学) Central South University(中南大学) Harbin Institute of Technology(哈尔滨工业大学) Chinese Academy of Sciences(中国科学院)

专题命中 视觉定位与Grounding :VLM(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14553 2025-04-22 cs.CV 79%

Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection

Weijun Zhuang, Qizhang Li, Xin Li, Ming Liu, Xiaopeng Hong, Feng Gao, Fan Yang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03193 2025-04-16 cs.CV 79%

Mamba as a Bridge: Where Vision Foundation Models Meet Vision Language Models for Domain-Generalized Semantic Segmentation

Xin Zhang, Robby T. Tan

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);分类 cs.CV

Comments Accepted to CVPR 2025 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04918 2025-04-16 cs.CV 79%

Fine-Tuning Florence2 for Enhanced Object Detection in Un-constructed Environments: Vision-Language Model Approach

Aysegul Ucar, Soumyadeep Ro, Sanapala Satwika, Pamarthi Yasoda Gayathri, Mohmmad Ghaith Balsha

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments 22 pages, 13 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10048 2025-04-15 cs.CV 79%

Multi-Object Grounding via Hierarchical Contrastive Siamese Transformers

Chengyi Du, Keyan Jin

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05821 2025-04-14 cs.CV 79%

F-LMM: Grounding Frozen Large Multimodal Models

Size Wu, Sheng Jin, Wenwei Zhang, Lumin Xu, Wentao Liu, Wei Li, Chen Change Loy

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Project Page: https://github.com/wusize/F-LMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14174 2025-04-14 cs.CV 79%

Unified Static and Dynamic Network: Efficient Temporal Filtering for Video Grounding

Jingjing Hu, Dan Guo, Kun Li, Zhan Si, Xun Yang, Xiaojun Chang, Meng Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to IEEE TPAMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07252 2025-04-11 cs.CV 79%

Few-Shot Adaptation of Grounding DINO for Agricultural Domain

Rajhans Singh, Rafael Bidese Puhl, Kshitiz Dhakal, Sudhir Sornapudi

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20678 2025-04-08 cs.CV 79%

STPro: Spatial and Temporal Progressive Learning for Weakly Supervised Spatio-Temporal Grounding

Aaryan Garg, Akash Kumar, Yogesh S Rawat

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments CVPR'25 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14604 2025-04-08 cs.LG 79%

Noisy Test-Time Adaptation in Vision-Language Models

Chentao Cao, Zhun Zhong, Zhanke Zhou, Tongliang Liu, Yang Liu, Kun Zhang, Bo Han

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02286 2025-04-04 cs.CV 79%

Moment Quantization for Video Temporal Grounding

Xiaolong Sun, Le Wang, Sanping Zhou, Liushuai Shi, Kun Xia, Mengnan Liu, Yabing Wang, Gang Hua

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01952 2025-04-03 cs.CV 79%

Image Difference Grounding with Natural Language

Wenxuan Wang, Zijia Zhao, Yisi Zhang, Yepeng Tang, Erdong Hu, Xinlong Wang, Jing Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00019 2025-04-02 cs.CL cs.AI cs.SE 79%

ObscuraCoder: Powering Efficient Code LM Pre-Training Via Obfuscation Grounding

Indraneil Paul, Haoyi Yang, Goran Glavaš, Kristian Kersting, Iryna Gurevych

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10437 2025-04-02 cs.CV 79%

4D LangSplat: 4D Language Gaussian Splatting via Multimodal Large Language Models

Wanhua Li, Renping Zhou, Jiawei Zhou, Yingwei Song, Johannes Herter, Minghan Qin, Gao Huang, Hanspeter Pfister

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

Comments CVPR 2025. Project Page: https://4d-langsplat.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23181 2025-04-01 cs.CV 79%

Enhancing Weakly Supervised Video Grounding via Diverse Inference Strategies for Boundary and Prediction Selection

Sunoh Kim, Daeho Um

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏