arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7348 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7348 篇

2511.17053 2025-11-24 cs.CV cs.AI 81%

OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Understanding

OmniPT:释放大型视觉语言模型在行人跟踪与理解中的潜力

Teng Fu, Mengyang Zhao, Ke Niu, Kaixin Peng, Bin Li

专题命中 视觉定位与Grounding :vision language model(title);grounding(abstract);分类 cs.CV、cs.AI

AI总结 OmniPT 通过结合强化学习和微调方法,提升大型视觉语言模型在行人跟踪和语义理解中的性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14086 2025-11-19 cs.CV cs.AI cs.CL 81%

Error-Driven Scene Editing for 3D Grounding in Large Language Models

Yue Zhang, Zun Wang, Han Lin, Jialu Li, Jianing Yang, Yonatan Bitton, Idan Szpektor, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Michigan(密歇根大学) Google Research(谷歌研究)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Code: https://github.com/zhangyuejoslin/Deer-3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05615 2025-11-14 cs.CV cs.AI cs.CL 81%

Test-Time Reinforcement Learning for GUI Grounding via Region Consistency

Yong Du, Yuchen Yan, Fei Tang, Zhengxi Lu, Chang Zong, Weiming Lu, Shengpei Jiang, Yongliang Shen

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments [Accepted by AAAI2026] Project Page: https://zju-real.github.io/gui-rcpo Code: https://github.com/zju-real/gui-rcpo

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00879 2025-11-04 cs.CL cs.AI cs.LG 81%

Assessing LLM Reasoning Steps via Principal Knowledge Grounding

Hyeon Hwang, Yewon Cho, Chanwoong Yoon, Yein Park, Minju Song, Kyungjae Lee, Gangwoo Kim, Jaewoo Kang

机构 * Korea University(韩国大学) University of Seoul(首尔大学) AWS AI Labs(AWS人工智能实验室) AIGEN Sciences(AIGEN科学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10741 2025-10-28 cs.LG cs.AI 81%

Ground-Compose-Reinforce: Grounding Language in Agentic Behaviours using Limited Data

Andrew C. Li, Toryn Q. Klassen, Andrew Wang, Parand A. Alamdari, Sheila A. McIlraith

机构 * Department of Computer Science, University of Toronto(计算机科学系,多伦多大学) Vector Institute for Artificial Intelligence(人工智能矢量研究所) Schwartz Reisman Institute for Technology and Society(技术与社会施瓦茨-雷曼研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22194 2025-10-28 cs.CV cs.LG 81%

ORIGEN: Zero-Shot 3D Orientation Grounding in Text-to-Image Generation

Yunhong Min, Daehyeon Choi, Kyeongmin Yeo, Jihyun Lee, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

Comments Project Page: https://origen2025.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13227 2025-10-28 cs.AI cs.CL cs.CV cs.HC 81%

Scaling Computer-Use Grounding via User Interface Decomposition and Synthesis

Tianbao Xie, Jiaqi Deng, Xiaochuan Li, Junlin Yang, Haoyuan Wu, Jixuan Chen, Wenjing Hu, Xinyuan Wang, Yuhui Xu, Zekun Wang, Yiheng Xu, Junli Wang, Doyen Sahoo, Tao Yu, Caiming Xiong

机构 * The University of Hong Kong(香港大学) Salesforce AI Research(Salesforce AI研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments 49 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05404 2025-10-13 cs.CV cs.AI 81%

AD-EE: Early Exiting for Fast and Reliable Vision-Language Models in Autonomous Driving

Lianming Huang, Haibo Hu, Yufei Cui, Jiacheng Zuo, Shangyu Wu, Nan Guan, Chun Jason Xue

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments We believe that the contribution of this paper is not enough, so we integrated it into another new paper. The arXiv ID of the new paper is arXiv:2510.01795

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07836 2025-10-09 cs.CV cs.AI 81%

AerialVG: A Challenging Benchmark for Aerial Visual Grounding by Exploring Positional Relations

Junli Liu, Qizhi Chen, Zhigang Wang, Yiwen Tang, Yiting Zhang, Chi Yan, Dong Wang, Xuelong Li, Bin Zhao

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) TeleAI

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03230 2025-10-06 cs.CV cs.AI 81%

Improving GUI Grounding with Explicit Position-to-Coordinate Mapping

Suyuchen Wang, Tianyu Zhang, Ahmed Masry, Christopher Pal, Spandana Gella, Bang Liu, Perouz Taslakian

机构 * ServiceNow Mila - Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) York University(约克大学) Polytechnique Montréal(蒙特利尔理工学院) McGill University(麦吉尔大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02403 2025-10-06 q-bio.QM cs.AI cs.CV 81%

Glaucoma Detection and Structured OCT Report Generation via a Fine-tuned Multimodal Large Language Model

Jalil Jalili, Yashraj Gavhane, Evan Walker, Anna Heinke, Christopher Bowd, Akram Belghith, Massimo A. Fazio, Christopher A. Girkin, C. Gustavo De Moraes, Jeffrey M. Liebmann, Sally L. Baxter, Robert N. Weinreb, Linda M. Zangwill, Mark Christopher

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21500 2025-10-01 cs.CV cs.AI cs.CL 81%

ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models

Dingming Li, Hongxing Li, Zixuan Wang, Yuchen Yan, Hang Zhang, Siqi Chen, Guiyang Hou, Shengpei Jiang, Wenqi Zhang, Yongliang Shen, Weiming Lu, Yueting Zhuang

机构 * Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Project: https://zju-real.github.io/ViewSpatial-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14314 2025-09-30 cs.AI cs.CL cs.LG cs.MA cs.RO 81%

Towards Efficient LLM Grounding for Embodied Multi-Agent Collaboration

Yang Zhang, Shixin Yang, Chenjia Bai, Fei Wu, Xiu Li, Zhen Wang, Xuelong Li

机构 * Tsinghua University(清华大学) Northwestern Polytechnical University(西北工业大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所) China Telecom(中国电信) Zhejiang University(浙江大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

Comments accepted by ACL'2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19090 2025-09-25 cs.CV cs.AI cs.CL 81%

Citrus-V: Advancing Medical Foundation Models with Unified Medical Image Grounding for Clinical Reasoning

Guoxin Wang, Jun Zhao, Xinyi Liu, Yanbo Liu, Xuyang Cao, Chao Li, Zhuoyun Liu, Qintian Sun, Fangru Zhou, Haoqiang Xing, Zhenhong Yang

机构 * JDH Algo(京东健康算法)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15532 2025-09-22 cs.CV cs.AI 81%

GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents

Xianhang Ye, Yiqing Li, Wei Dai, Miancan Liu, Ziyuan Chen, Zhangye Han, Hongbo Min, Jinkui Ren, Xiantao Zhang, Wen Yang, Zhi Jin

机构 * Wuhan University(武汉大学) Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) East China Normal University(华东师范大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12653 2025-09-17 cs.CV cs.AI 81%

Beyond Artificial Misalignment: Detecting and Grounding Semantic-Coordinated Multimodal Manipulations

Jinjie Shen, Yaxiong Wang, Lechao Cheng, Nan Pu, Zhun Zhong

机构 * Hefei University of Technology(合肥工业大学) University of Trento(特伦托大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08490 2025-09-11 cs.CV cs.AI 81%

A Structured Review of Underwater Object Detection Challenges and Solutions: From Traditional to Large Vision Language Models

Edwine Nabahirwa, Wei Song, Minghua Zhang, Yi Fang, Zhou Ni

机构 * Shanghai Ocean University(上海海洋大学)

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments 72 Pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04833 2025-09-08 cs.CV cs.AI 81%

PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination

Ming Dai, Wenxuan Cheng, Jiedong Zhuang, Jiang-jiang Liu, Hongshen Zhao, Zhenhua Feng, Wankou Yang

机构 * Southeast University(东南大学) Zhejiang University(浙江大学) Baidu VIS(百度视觉) Jiangnan University(江南大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03025 2025-09-08 cs.CV cs.AI 81%

Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens

Sohee Kim, Soohyun Ryu, Joonhyung Park, Eunho Yang

机构 * KAIST AI(韩国科学技术院人工智能研究所) AITRICS(人工智能与机器人技术研究所在线)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14904 2025-09-05 cs.CV cs.AI 81%

TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP

Fan Li, Zanyi Wang, Zeyi Huang, Guang Dai, Jingdong Wang, Mengmeng Wang

机构 * Xi’an Jiaotong University(西安交通大学) SGIT AI Lab(SGIT人工智能实验室) Zhejiang University of Technology(浙江工业大学) Huawei(华为)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16647 2025-09-03 cs.CV cs.AI 81%

Point, Detect, Count: Multi-Task Medical Image Understanding with Instruction-Tuned Vision-Language Models

Sushant Gautam, Michael A. Riegler, Pål Halvorsen

机构 * Simula Metropolitan Center for Digital Engineering (SimulaMet), Norway(Simula数字工程中心(SimulaMet)) Oslo Metropolitan University (OsloMet), Norway(奥斯陆 Metropolitan 大学(OsloMet)) Simula Research Laboratory, Norway(Simula研究实验室)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted as a full paper at the 38th IEEE International Symposium on Computer-Based Medical Systems (CBMS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19573 2025-08-29 cs.CV cs.AI 81%

See then Tell: Enhancing Key Information Extraction with Vision Grounding

Shuhang Liu, Zhenrong Zhang, Pengfei Hu, Jiefeng Ma, Jun Du, Qing Wang, Jianshu Zhang, Chenyu Liu

机构 * University of Science and Technology of China(科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19204 2025-08-27 cs.CV cs.AI cs.GR 81%

LSD-3D: Large-Scale 3D Driving Scene Generation with Geometry Grounding

Julian Ost, Andrea Ramazzina, Amogh Joshi, Maximilian Bömer, Mario Bijelic, Felix Heide

机构 * Julian Ost(未知) Andrea Ramazzina(未知) Amogh Joshi(未知) Maximilian Bömer(未知) Mario Bijelic(未知) Felix Heide(未知)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Project webpage: https://light.princeton.edu/LSD-3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02943 2025-08-26 cs.CR cs.AI cs.CL cs.LG 81%

PII-Compass: Guiding LLM training data extraction prompts towards the target PII via grounding

Krishna Kanth Nakka, Ahmed Frikha, Ricardo Mendes, Xue Jiang, Xuebing Zhou

机构 * Huawei Munich Research Center(华为慕尼黑研究中心)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

Comments Accepted at PrivateNLP Workshop at ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03290 2025-08-22 cs.CV cs.AI 81%

Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models

Haibo Wang, Zhiyang Xu, Yu Cheng, Shizhe Diao, Yufan Zhou, Yixin Cao, Qifan Wang, Weifeng Ge, Lifu Huang

机构 * University of California, Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) The Chinese University of Hong Kong(香港中文大学) NVIDIA Adobe Research(Adobe研究) Fudan University(复旦大学) Meta AI

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05123 2025-08-19 cs.CV cs.AI 81%

Latent Expression Generation for Referring Image Segmentation and Grounding

Seonghoon Yu, Junbeom Hong, Joonseok Lee, Jeany Son

机构 * GIST(韩国科学技术院) Seoul National University(首尔国立大学) POSTECH

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10667 2025-08-15 cs.CV cs.AI 81%

AddressVLM: Cross-view Alignment Tuning for Image Address Localization using Large Vision-Language Models

Shixiong Xu, Chenghao Zhang, Lubin Fan, Yuan Zhou, Bin Fan, Shiming Xiang, Gaofeng Meng, Jieping Ye

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) CASIA(中国科学院自动化所) Alibaba Cloud(阿里云) School of Intelligence Science and Technology(智能科学与技术学院) CAIR(中国科学院香港创新研究院)

专题命中 视觉定位与Grounding :vision-language model(title);visual language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07877 2025-08-12 cs.CV cs.AI 81%

Selective Contrastive Learning for Weakly Supervised Affordance Grounding

WonJun Moon, Hyun Seok Seong, Jae-Pil Heo

机构 * Sungkyunkwan University(全北大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18659 2025-08-01 cs.CV cs.AI 81%

DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models

Yudong Zhang, Ruobing Xie, Xingwu Sun, Yiqing Huang, Jiansheng Chen, Zhanhui Kang, Di Wang, Yu Wang

机构 * Tsinghua University, Tencent(清华大学、腾讯) Tencent(腾讯) Tencent, University of Macau(腾讯、澳门大学) University of Science and Technology Beijing(北京科技大学) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18552 2025-07-25 cs.CV cs.AI 81%

VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding

Baoyao Yang, Wanyun Li, Dixin Chen, Junxiang Chen, Wenbin Yao, Haifeng Lin

机构 * Guangdong University of Technology(广东工业大学) Wechat, Tencent(微信、腾讯)

专题命中 视觉定位与Grounding :grounding(title);MLLM(abstract);分类 cs.CV、cs.AI

Comments 7 pages; 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏