arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7314 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7314 篇

2603.14880 2026-03-17 cs.CV 83%

RealVLG-R1: A Large-Scale Real-World Visual-Language Grounding Benchmark for Robotic Perception and Manipulation

RealVLG-R1: 一个大规模真实世界视觉-语言接地基准,用于机器人感知与操作

Linfei Li, Lin Zhang, Ying Shen

机构 * School of Computer Science and Technology, Tongji University, China(同济大学计算机科学与技术学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出RealVLG框架,结合RealVLG-11B数据集和RealVLG-R1模型,统一了真实世界视觉-语言接地与抓取任务,支持零样本感知与操作,提供全面的数据与评估平台。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17130 2026-03-17 cs.CV 83%

Structural Damage Detection Using AI Super Resolution and Visual Language Model

利用人工智能超分辨率和视觉语言模型进行结构损伤检测

Catherine Hoier, Khandaker Mamun Ahmed

专题命中 视觉定位与Grounding :visual language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种低成本框架,结合无人机视频、AI超分辨率模型和视觉语言模型,用于快速准确评估自然灾害中的结构损伤,实现84.5%的分类准确率。

Journal ref International Conference on Machine Learning and Applications, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14367 2026-03-17 cs.CV 83%

HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task

HomeGuard: 基于视觉-语言模型的具身安全防护系统用于识别家庭任务中的上下文风险

Xiaoya Lu, Yijin Zhou, Zeren Chen, Ruocheng Wang, Bingrui Sima, Enshen Zhou, Lu Sheng, Dongrui Liu, Jing Shao

专题命中 视觉定位与Grounding :VLM(title);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出HomeGuard系统,通过Context-Guided Chain-of-Thought机制,结合定制数据集和强化微调策略,提升家庭任务中风险识别精度,减少误判,同时为后续规划提供空间约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09471 2026-03-11 cs.CV 83%

OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks

OmniEarth:一个评估遥感任务中视觉-语言模型的基准

Ronghao Fu, Haoran Liu, Weijie Zhang, Zhiwen Lin, Xiao Yang, Peng Zhang, Bo Yang

机构 * Jilin University(吉林大学) Chang Guang Satellite Technology(长光卫星技术)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 OmniEarth是一个评估遥感任务中视觉-语言模型性能的基准,通过多维任务和严格测试协议,揭示现有模型在复杂地理任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08564 2026-03-10 cs.CV 83%

BioGait-VLM: A Tri-Modal Vision-Language-Biomechanics Framework for Interpretable Clinical Gait Assessment

BioGait-VLM:一种多模态视觉-语言-生物力学框架用于可解释的临床步态评估

Erdong Chen, Yuyang Ji, Jacob K. Greenberg, Benjamin Steel, Faraz Arkam, Abigail Lewis, Pranay Singh, Feng Liu

机构 * Department of Computer Science, Drexel University(德克萨斯大学计算机科学系) Department of Neurological Surgery, Washington University(华盛顿大学神经外科系) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :VLM(title,abstract);grounding(abstract);分类 cs.CV

AI总结 BioGait-VLM通过多模态框架提升临床步态评估的可解释性和准确性,结合生物力学标记与时间动态分析,实现更可靠的病理运动识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19300 2026-03-10 cs.CV 83%

Open-Vocabulary Camouflaged Object Segmentation with Cascaded Vision Language Models

开放词汇伪装物体分割与级联视觉语言模型

Kai Zhao, Wubang Yuan, Zheng Wang, Guanyi Li, Xiaoqiang Zhu, Deng-ping Fan, Dan Zeng

机构 * Shanghai University(上海大学) UCLA(美国大学联盟) Nankai University(南开大学)

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出了一种基于视觉语言模型的级联框架,用于解决开放词汇伪装物体分割中的领域差距和分割精度问题,通过共享VLM实现高效且语义一致的分割与分类。

Comments Accepted to Computational Visual Media (CVMJ) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06699 2026-03-10 cs.CV 83%

Multi-label Instance-level Generalised Visual Grounding in Agriculture

多标签实例级农业通用视觉 grounding

Mohammadreza Haghighat, Alzayat Saleh, Mostafa Rahimi Azghadi

机构 * College of Science and Engineering(科学与工程学院) James Cook University(詹姆斯库克大学) Centre for AI and Data Science Innovation(人工智能与数据科学创新中心)

专题命中 视觉定位与Grounding :grounding(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出 Weed-VG 框架,通过多标签层次相关性评分和插值驱动回归,提升农业实例级视觉 grounding 能力,并提供精准农业中的 VG 方法基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16538 2026-03-09 cs.CV 83%

OnlineSI: Taming Large Language Model for Online 3D Understanding and Grounding

OnlineSI: 通过大规模语言模型实现在线3D理解和定位

Zixian Liu, Zhaoxi Chen, Liang Pan, Ziwei Liu

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 视觉定位与Grounding :grounding(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 OnlineSI通过整合3D点云与语义信息,提升大规模语言模型在动态环境中的空间理解和物体识别能力。

Comments Project Page: https://onlinesi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03437 2026-03-05 cs.CV 83%

Beyond Accuracy: Evaluating Visual Grounding In Multimodal Medical Reasoning

超越准确率:评估多模态医学推理中的视觉语义

Anas Zafar, Leema Krishna Murali, Ashish Vashist

机构 * The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) Cohere Labs(Cohere实验室) Eisai Inc.(艾伯维公司) Indian Institute of Science, Bangalore(班加罗尔印度科学研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 该研究提出反事实评估框架,通过测量视觉依赖性得分和幻觉视觉推理率,揭示仅文本强化学习在多模态医学推理中降低视觉依赖性的问题。

Comments 12 pages, 2 figures, 2 tables, medical VQA / multimodal reasoning evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00437 2026-03-03 cs.CV 83%

Self-Correction Inside the Model: Leveraging Layer Attention to Mitigate Hallucinations in Large Vision Language Models

模型内部的自我校正:利用层注意力缓解大视觉语言模型中的幻觉

April Fu

机构 * Independent Researcher(独立研究者)

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出了一种利用层注意力的内部自我校正机制,通过自我细化提高大视觉语言模型的视觉接地性,有效缓解幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22727 2026-02-27 cs.CV 83%

HulluEdit: Single-Pass Evidence-Consistent Subspace Editing for Mitigating Hallucinations in Large Vision-Language Models

HulluEdit: 单次通过证据一致子空间编辑用于缓解大视觉-语言模型中的幻觉

Yangguang Lin, Quan Fang, Yufei Li, Jiachen Sun, Junyu Gao, Jitao Sang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Jiaotong University(北京交通大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 HulluEdit通过单次通过的正交子空间编辑方法,有效缓解大视觉-语言模型中的幻觉问题,实现了最先进的幻觉减少效果。

Comments accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20608 2026-02-25 cs.CV 83%

VAGNet: Grounding 3D Affordance from Human-Object Interactions in Videos

VAGNet: 从视频中的人-物体交互中接地3D affordance

Aihua Mao, Kaihang Huang, Yong-Jin Liu, Chee Seng Chan, Ying He

机构 * SCUT(华南理工大学) THU(清华大学) NTU(国立新加坡大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 VAGNet通过视频引导的动态交互序列,实现3D affordance接地,提出PVAD数据集并取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09980 2026-02-17 cs.CV cs.RO 83%

V2V-LLM: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models

V2V-LLM:基于多模态大语言模型的车与车协同自动驾驶

Hsu-kuang Chiu, Ryo Hachiuma, Chien-Yi Wang, Stephen F. Smith, Yu-Chiang Frank Wang, Min-Hung Chen

机构 * NVIDIA Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出基于多模态大语言模型的V2V-LLM,通过车与车协同感知提升自动驾驶安全性和性能。

Comments Accepted by ICRA 2026 (IEEE International Conference on Robotics and Automation). Project: https://eddyhkchiu.github.io/v2vllm.github.io/ Code: https://github.com/eddyhkchiu/V2V-LLM Dataset: https://huggingface.co/datasets/eddyhkchiu/V2V-GoT-QA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13028 2026-02-16 cs.CV cs.CL 83%

Human-Aligned MLLM Judges for Fine-Grained Image Editing Evaluation: A Benchmark, Framework, and Analysis

面向细粒度图像编辑评估的人类对齐MLLM评判:一个基准、框架和分析

Runzhou Liu, Hailey Weingord, Sejal Mittal, Prakhar Dungarwal, Anusha Nandula, Bo Ni, Samyadeep Basu, Hongjie Chen, Nesreen K. Ahmed, Li Li, Jiayi Zhang, Koustava Goswami, Subhojyoti Mukherjee, Branislav Kveton, Puneet Mathur, Franck Dernoncourt, Yue Zhao, Yu Wang, Ryan A. Rossi, Zhengzhong Tu, Hongru Du

机构 * University of Virginia(弗吉尼亚大学) Columbia University(哥伦比亚大学) Vanderbilt University(范德比大学) Adobe Research(Adobe研究) Dolby Laboratories(杜比实验室) Cisco Research(思科研究) University of Southern California(南加州大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Oregon(俄勒冈大学) Texas A&M University(德克萨斯大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出细粒度MLLM评判框架,通过分解十二个可解释因素,提升图像编辑评估的精度与实用性,为研究和改进图像编辑方法提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11730 2026-02-13 cs.CV 83%

STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning

STVG-R1: 通过强化学习激励视频中实例级推理与 grounding

Xiaowen Zhang, Zhi Gao, Licheng Jiao, Lingling Li, Qing Li

机构 * Xidian University(西电大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Beijing Institute of Technology(北京理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 STVG-R1通过强化学习框架提升视频中实例级推理与 grounding 的准确性,实现显著的性能提升和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07815 2026-02-12 cs.CV 83%

Out of the box age estimation through facial imagery: A Comprehensive Benchmark of Vision-Language Models vs. out-of-the-box Traditional Architectures

走出盒子进行年龄估计:一种视觉-语言模型与传统架构全面基准的比较

Simiao Ren, Xingyu Shen, Ankit Raj, Albert Dai, Caroline, Zhang, Yuan Xu, Zexi Chen, Siqi Wu, Chen Gong, Yuxin Zhang

机构 * Reality Inc Duke University(杜克大学) New York University(纽约大学) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文通过对比视觉-语言模型与传统架构,发现零样本VLM在面部年龄估计中表现优于专门模型,且在年龄验证中显著降低误判率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16944 2026-02-12 cs.CV 83%

Catching the Details: Self-Distilled RoI Predictors for Fine-Grained MLLM Perception

捕捉细节:用于细粒度MLLM感知的自蒸馏RoI预测器

Yuheng Shi, Xiaohuan Pei, Minjing Dong, Chang Xu

机构 * University of Sydney(悉尼大学) City University of Hong Kong(香港城市大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出SD-RPN,通过自蒸馏方法提升MLLM细粒度感知的效率和准确性。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08211 2026-02-10 cs.CV 83%

Chain-of-Caption: Training-free improvement of multimodal large language model on referring expression comprehension

Chain-of-Caption: 无需训练提升多模态大语言模型的指称表达理解

Yik Lung Pang, Changjae Oh

机构 * Queen Mary University of London(伦敦女王学院)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出无需训练的Chain-of-Caption框架,通过结合多种上下文提升多模态大语言模型在指称表达理解任务中的性能。

Comments 4 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04699 2026-02-05 cs.CV 83%

Annotation Free Spacecraft Detection and Segmentation using Vision Language Models

无需标注的空间目标检测与分割使用视觉语言模型

Samet Hicsonmez, Jose Sosa, Dan Pineau, Inder Pal Singh, Arunkumar Rathinam, Abd El Rahman Shabayek, Djamila Aouada

机构 * Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(安全、可靠性与信任跨学科研究中心(SnT),卢森堡大学)

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出了一种基于视觉语言模型的无标注空间目标检测与分割方法,通过伪标签蒸馏提升性能,实现在多个数据集上的精度提升。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03742 2026-02-04 cs.CV 83%

Edge-Optimized Vision-Language Models for Underground Infrastructure Assessment

边缘优化的视觉-语言模型用于地下基础设施评估

Johny J. Lopez, Md Meftahul Ferdaus, Mahdi Abdelguerfi

机构 * Canizaro Livingston Gulf States Center for Environmental Informatics(卡尼扎罗利文斯顿海湾州环境信息中心) University of New Orleans(新奥尔良大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出边缘优化的视觉-语言模型,用于高效生成地下基础设施缺陷的摘要,结合轻量级分割模型与微调VLM,实现资源受限设备上的实时检测与总结。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03119 2026-02-04 cs.LG eess.SP 83%

Function-Space Empirical Bayes Regularisation with Large Vision-Language Model Priors

函数空间经验贝叶斯正则化与大视觉-语言模型先验

Pengcheng Hao, Huaze Tang, Ercan Engin Kuruoglu, Wenbo Ding

机构 * Institute of Data and Information, Tsinghua Shenzhen International Graduate School, Shenzhen, China(数据与信息研究所,清华大学深圳国际研究生院,深圳,中国)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.LG

AI总结 本文提出VLM-FS-EB框架,利用大视觉-语言模型生成语义上下文点,构建高效功能先验,提升预测性能和不确定性估计,尤其在异常检测和数据稀缺场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02468 2026-02-03 cs.AI cs.CL 83%

Avenir-Web: Human-Experience-Imitating Multimodal Web Agents with Mixture of Grounding Experts

Avenir-Web: 人类经验模拟的多模态网络代理与接地专家混合

Aiden Yiliu Li, Xinyue Hao, Shilong Liu, Mengdi Wang

机构 * University College London(伦敦大学学院) The University of Edinburgh(爱丁堡大学) Princeton University(普林斯顿大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 Avenir-Web通过融合接地专家与经验模仿规划,实现了在复杂网络界面中可靠执行长周期任务的开源网络代理新纪录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22738 2026-02-02 cs.CV 83%

StreamSense: Streaming Social Task Detection with Selective Vision-Language Model Routing

StreamSense: 基于选择性视觉-语言模型路由的流式社交任务检测

Han Wang, Deyi Ji, Lanyun Zhu, Jiebo Luo, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) University of Rochester(罗切斯特大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 StreamSense通过轻量级编码器与选择性路由结合VLM专家,提升流式社交任务检测的准确性和效率。

Comments 10 pages, 4 figures, The Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21634 2026-01-30 cs.CV 83%

RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning

RSGround-R1: 重新思考通过空间推理的遥感视觉定位

Shiqi Huang, Shuting He, Bihan Wen

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(电气电子工程学院,南洋理工大学) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics, Shanghai University of Finance and Economics(教育部计算与经济交叉学科重点实验室,上海财经大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 RSGround-R1通过引入空间推理引导的后训练框架,提升遥感图像中目标物体的定位精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20707 2026-01-29 cs.CV 83%

Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models

融合重要性与多样性:KV缓存压缩的联合优化

Xuyang Liu, Xiyan Gui, Yuchao Zhang, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 MixKV通过融合重要性与多样性,优化KV缓存压缩,提升多模态模型的存储效率与推理性能。

Comments Accepted by ICLR 2026. Our code is available at https://github.com/xuyang-liu16/MixKV

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11910 2026-01-22 cs.CV 83%

A Training-Free Guess What Vision Language Model from Snippets to Open-Vocabulary Object Detection

无需训练的Guess What视觉语言模型:从片段到开放词汇物体检测

Guiying Zhu, Bowen Yang, Yin Zhuang, Tong Zhang, Guanqun Wang, Zhihao Che, He Chen, Lianlin Li

机构 * Aerospace and Informatics Domain(航空航天与信息领域) National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing(空间智能信息处理国家级重点实验室) School of Electronic(电子学院)

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出无需训练的Guess What视觉语言模型GW-VLM,通过多尺度视觉语言搜索与上下文概念提示实现开放词汇物体检测的高效检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13440 2026-01-21 cs.CV 83%

Analyzing VLM-Based Approaches for Anomaly Classification and Segmentation

分析基于视觉语言模型的异常分类和分割方法

Mohit Kakda, Mirudula Shri Muthukumaran, Uttapreksha Patel, Lawrence Swaminathan Xavier Prince

机构 * Northeastern University(东北大学)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文分析了基于视觉语言模型的异常分类和分割方法,探讨了其架构范式、对齐策略及性能评估,为工业质量控制提供了方法选择和未来研究方向的指导。

Comments 10 pages,4 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07413 2026-01-21 cs.CV 83%

REF-VLM: Triplet-Based Referring Paradigm for Unified Visual Decoding

基于三元组的引用范式用于统一视觉解码

Yan Tai, Luhao Zhu, Yunan Ding, Yiying Dong, Guangtao Zhai, Xiaohong Liu, Guodong Guo

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, 200240, China(上海交通大学计算机科学学院) Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo, China(宁波数字孪生研究院) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University, Shanghai, 200240, China(上海交通大学信息科学与电子工程学院)

专题命中 视觉定位与Grounding :VLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 REF-VLM通过引入基于三元组的引用范式,提升多任务视觉解码的性能和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10551 2026-01-16 cs.CV 83%

Unleashing the Capabilities of Large Vision-Language Models for Intelligent Perception of Roadside Infrastructure

释放大型视觉-语言模型的能力以实现道路基础设施的智能感知

Luxuan Fu, Chong Liu, Bisheng Yang, Zhen Dong

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS)(信息工程测绘遥感国家重点实验室) Wuhan University(武汉大学) Hubei Luojia Laboratory(湖北珞珈实验室)

专题命中 视觉定位与Grounding :vision-language model(title);vision language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出一种领域适应框架,通过数据高效微调和知识引导推理,提升大型视觉语言模型在城市道路基础设施感知中的性能和专业合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09770 2026-01-16 cs.AI 83%

GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents

GUI-Eyes: 用于GUI代理视觉接地的工具增强感知

Chen Chen, Jiawei Shao, Dakuan Lu, Haoyi Hu, Xiangcheng Liu, Hantao Yao, Wu Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 GUI-Eyes通过分阶段策略推理和细粒度奖励反馈实现工具感知主动感知,显著提升GUI代理的接地准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏