arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-17 至 2026-03-17 共收录 39 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 39 篇

2506.21509 2026-03-17 cs.CV 88%

Curing Semantic Drift: A Dynamic Approach to Grounding Generation in Large Vision-Language Models

消除语义漂移:一种动态方法用于在大视觉-语言模型中进行生成基础

Jiahe Chen, Jiaying He, Qiyuan Chen, Qian Shao, Jiahe Ying, Hongxia Xu, Jintai Chen, Jianwei Zheng, Jian Wu

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);分类 cs.CV

AI总结 本文提出DLC方法,通过动态校准logits来减少大视觉-语言模型中的语义漂移,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12071 2026-03-17 cs.CV cs.AI 86%

LoV3D: Grounding Cognitive Prognosis Reasoning in Longitudinal 3D Brain MRI via Regional Volume Assessments

LoV3D:通过区域体积评估在纵向3D脑MRI中实现认知预后推理

Zhaoyang Jiang, Zhizhong Fu, David McAllister, Yunsoo Kim, Honghan Wu

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 LoV3D通过纵向3D脑MRI的区域体积评估,实现认知预后推理,其核心方法是结合3D视觉-语言模型,通过区域解剖评估、纵向对比和诊断输出,提高诊断准确性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14448 2026-03-17 cs.LG 85%

Zoom to Essence: Trainless GUI Grounding by Inferring upon Interface Elements

聚焦本质:通过推断界面元素实现无训练GUI接地

Ziwei Liu, Tao Feng, Borui Kang, Yanbing Yang, Jun Luo

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

AI总结 本文提出ZoomUI,通过推断界面元素实现无训练GUI接地,利用推理缩放引导常见MLLM逐步锚定指令元素到更详细的界面元素,提升GUI代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14323 2026-03-17 cs.CV cs.AI 84%

How Do Medical MLLMs Fail? A Study on Visual Grounding in Medical Images

医学 MLLMs 如何失效?对医学图像中视觉语义关联的探讨

Guimeng Liu, Tianze Yu, Somayeh Ebrahimkhani, Lin Zhi Zheng Shawn, Kok Pin Ng, Ngai-Man Cheung

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了医学 MLLMs 在视觉关联上的不足,通过设计 VGMED 数据集和 VGRefine 方法,验证了其在医学图像任务中的性能瓶颈。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06348 2026-03-17 cs.CV cs.AI 84%

GazeVLM: A Vision-Language Model for Multi-Task Gaze Understanding

GazeVLM:一种多任务眼动理解的视觉-语言模型

Athul M. Mathew, Haithem Hermassi, Thariq Khalid, Arshad Ali Khan

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GazeVLM,一种多任务眼动理解的视觉-语言模型,通过融合视觉和文本模态,实现目标检测、眼动目标检测和眼动物体识别,取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13628 2026-03-17 cs.CV cs.AI 84%

Locatability-Guided Adaptive Reasoning for Image Geo-Localization with Vision-Language Models

基于可定位性的自适应推理图像地理定位方法

Bo Yu, Fengze Yang, Yiming Liu, Chao Wang, Xuewen Luo, Taozhe Li, Ruimin Ke, Xiaofan Zhou, Chenxi Liu

机构 * The University of Utah(犹他大学) The University of Oklahoma(俄克拉荷马大学) Worcester Polytechnic Institute(沃斯特理工学院) Rensselaer Polytechnic Institute(雷士利理工学院) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Geo-ADAPT框架,通过优化可定位性评分和两阶段分组相对策略优化,提升图像地理定位的适应性和准确性,减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14880 2026-03-17 cs.CV 83%

RealVLG-R1: A Large-Scale Real-World Visual-Language Grounding Benchmark for Robotic Perception and Manipulation

RealVLG-R1: 一个大规模真实世界视觉-语言接地基准,用于机器人感知与操作

Linfei Li, Lin Zhang, Ying Shen

机构 * School of Computer Science and Technology, Tongji University, China(同济大学计算机科学与技术学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出RealVLG框架,结合RealVLG-11B数据集和RealVLG-R1模型,统一了真实世界视觉-语言接地与抓取任务,支持零样本感知与操作,提供全面的数据与评估平台。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17130 2026-03-17 cs.CV 83%

Structural Damage Detection Using AI Super Resolution and Visual Language Model

利用人工智能超分辨率和视觉语言模型进行结构损伤检测

Catherine Hoier, Khandaker Mamun Ahmed

专题命中 视觉定位与Grounding :visual language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种低成本框架,结合无人机视频、AI超分辨率模型和视觉语言模型,用于快速准确评估自然灾害中的结构损伤,实现84.5%的分类准确率。

Journal ref International Conference on Machine Learning and Applications, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14367 2026-03-17 cs.CV 83%

HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task

HomeGuard: 基于视觉-语言模型的具身安全防护系统用于识别家庭任务中的上下文风险

Xiaoya Lu, Yijin Zhou, Zeren Chen, Ruocheng Wang, Bingrui Sima, Enshen Zhou, Lu Sheng, Dongrui Liu, Jing Shao

专题命中 视觉定位与Grounding :VLM(title);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出HomeGuard系统,通过Context-Guided Chain-of-Thought机制,结合定制数据集和强化微调策略,提升家庭任务中风险识别精度,减少误判,同时为后续规划提供空间约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15134 2026-03-17 cs.RO 82%

Confusion-Aware In-Context-Learning for Vision-Language Models in Robotic Manipulation

面向机器人操作的上下文学习:考虑混淆的视觉语言模型

Yayun He, Zuheng Kang, Botao Zhao, Zhouyin Wu, Junqing Peng, Jianzong Wang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) Shenzhen Bao'an Middle School(深圳宝安中学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract)

AI总结 本文提出CAICL方法,通过混淆定位与分析提升视觉语言模型在机器人操作中处理混淆场景的能力,实验显示其在VIMA-Bench上成功率达85.5%。

Comments Accepted by the 29th International Conference on Computer Supported Cooperative Work in Design (CSCWD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05791 2026-03-17 cs.RO cs.AI cs.LG 81%

VLAD-Grasp: Zero-shot Grasp Detection via Vision-Language Models

VLAD-Grasp:基于视觉-语言模型的零样本抓取检测

Manav Kulshrestha, S. Talha Bukhari, Damon Conover, Aniket Bera

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出VLAD-Grasp,一种基于视觉-语言模型的零样本抓取检测方法,通过生成目标图像、预测深度和分割、对齐点云来恢复可执行抓取姿态,无需训练数据,性能与最新方法相当。

Comments 8 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15583 2026-03-17 cs.CV 79%

Grounding World Simulation Models in a Real-World Metropolis

将世界模拟模型扎根于现实世界中的城市

Junyoung Seo, Hyunwook Choi, Minkyung Kwon, Jinhyeok Choi, Siyoon Jin, Gayoung Lee, Junho Kim, JoungBin Lee, Geonmo Gu, Dongyoon Han, Sangdoo Yun, Seungryong Kim, Jin-Hwa Kim

机构 * KAIST AI(韩国科学技术院人工智能研究中心) NAVER AI Lab(NAVER人工智能实验室) SNU AIIS(成均馆大学人工智能研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出Seoul World Model,通过检索增强的条件生成真实城市场景,解决时间错位和轨迹多样性问题,生成高保真、时序一致的长时景视频。

Comments project page: https://seoul-world-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15237 2026-03-17 cs.CV 79%

Multi-turn Physics-informed Vision-language Model for Physics-grounded Anomaly Detection

多轮物理引导的视觉-语言模型用于物理基础的异常检测

Yao Gu, Xiaohao Xu, Yingna Wu

机构 * Shanghaitech University(上海科技大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出一种多轮物理引导的视觉-语言模型,通过编码物体属性和动态约束提升物理基础异常检测性能,实验显示其在视频级检测中达到96.7%的AUROC,优于现有最佳方法。

Comments Accepted by IEEE ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13024 2026-03-17 cs.CV 79%

Learning 2D Invariant Affordance Knowledge for 3D Affordance Grounding

学习2D不变的可供性知识以实现3D可供性定位

Xianqiang Gao, Pingrui Zhang, Delin Qu, Dong Wang, Zhigang Wang, Yan Ding, Bin Zhao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出MIFAG框架,通过多视角交互图像提取不变可供性知识,提升3D对象可供性定位的泛化能力。

Comments Accepted by AAAI 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01960 2026-03-17 cs.LG 79%

Grounding Generated Videos in Feasible Plans via World Models

通过世界模型将生成视频接地到可行计划中

Christos Ziakas, Amir Bar, Alessandra Russo

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 本文提出GVP-WM方法,通过学习动作条件的世界模型,将生成视频计划接地为可行动作序列,解决视频生成计划在时间一致性和物理约束上的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07685 2026-03-17 cs.CV cs.AI cs.LG 75%

Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought

增强推理的多模态链式推理

Shin'ya Yamaguchi, Kosuke Nishida, Daiki Chijiwa

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出RED方法,通过KL约束奖励最大化提升多模态链式推理的准确性和忠实度,实验表明其在多个基准和模型上显著优于传统方法。

Comments Accepted to CVPR 2026 (Main); Code is available at https://github.com/yshinya6/red/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02046 2026-03-17 cs.CV cs.AI 73%

Agentic Retoucher for Text-To-Image Generation

面向文本到图像生成的代理修复器

Shaocheng Shen, Jianfeng Liang, Chunlei Cai, Cong Geng, Huiyu Duan, Xiaoyun Zhang, Qiang Hu, Guangtao Zhai

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Agentic Retoucher框架,通过感知-推理-行动循环改进文本到图像生成的质量,引入GenBlemish-27K数据集进行评估,提升图像真实感与局部修正可靠性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13306 2026-03-17 cs.CV cs.LG 73%

Benchmarking Compact VLMs for Clip-Level Surveillance Anomaly Detection Under Weak Supervision

对弱监督条件下Clip级监控异常检测的紧凑视觉语言模型进行基准测试

Kirill Borodin, Kirill Kondrashov, Nikita Vasiliev, Ksenia Gladkova, Inna Larina, Mikhail Gorodnichev, Grach Mkrtchian

机构 * Faculty of Information Technology, Moscow Technical University of Communication

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文研究了在弱监督条件下,紧凑型视觉语言模型在Clip级监控异常检测中的性能,通过统一评估协议比较了参数高效适应的紧凑VLMs与无训练VLM流水线和弱监督基线,展示了在准确率和效率上的平衡。

Comments Published ad MDPI Journal of Imaging (see at https://www.mdpi.com/2313-433X/11/11/400)

Journal ref Journal of Imaging. 2025; 11(11):400

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14426 2026-03-17 cs.CV cs.IR cs.MM 70%

GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos

GenState-AI:面向AI生成视频的基于状态的文本到视频检索数据集

Minghan Li, Tongna Chen, Tianrui Lv, Yishuai Zhang, Suchao An, Guodong Zhou

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出GenState-AI数据集,通过可控状态转换和显式端状态标注,解决文本到视频检索中时间推理和端状态定位不足的问题,评估两种基线模型并分析时间与语义混淆源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13507 2026-03-17 cs.CV 70%

MIRAGE: Model-agnostic Industrial Realistic Anomaly Generation and Evaluation for Visual Anomaly Detection

MIRAGE:模型无关的工业真实异常生成与评估用于视觉异常检测

Jinwei Hu, Francesco Borsatti, Arianna Stropeni, Davide Dalle Pezze, Manuel Barusco, Gian Antonio Susto

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 MIRAGE提出了一种无需训练和真实异常数据的自动化流程,通过API调用生成模型生成真实异常图像并生成像素级掩码,结合CLIP质量过滤器和轻量级双分支语义变化检测模块,评估生成图像的质量和异常分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13437 2026-03-17 cs.CV eess.SP 70%

Vision-Language Based Expert Reporting for Painting Authentication and Defect Detection

基于视觉-语言的专家报告用于绘画认证和缺陷检测

Eman Ouda, Mohammed Salah, Arsenii O. Chulkov, Gianfranco Gargiulo, Gian Luca Tartaglia, Stefano Sfarra, Yusra Abdulrahman

机构 * organization= Khalifa University of Science Technology, Department of Aerospace Engineering , city= Abu Dhabi , country= United Arab Emirates organization= National Research Tomsk Polytechnic University , country= Russia organization= Academy of Fine Arts of Naples , city= Naples , country= Italy organization= Academy of Fine Arts of Sassari , city= Sassari , country= Italy organization= Department of Industrial Economics (DIIIE), University of L’Aquila , city= L'Aquila I-67100 , country= Italy organization= Advanced Research Innovation Center (ARIC), Khalifa University of Science \& Technology , city= Abu Dhabi , country= UAE

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种自动化的热成像-视觉-语言模型框架,用于绘画认证和缺陷检测,通过多模态分析与结构化文本报告生成,提高评估的可解释性和一致性。

Comments Submitted to Journal of Cultural Heritage

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13433 2026-03-17 cs.RO cs.AI 70%

Spatially Grounded Long-Horizon Task Planning in the Wild

在真实环境中进行具有长时域的任务规划

Sehun Jung, HyunJee Song, Dong-Hee Kim, Reuben Tan, Jianfeng Gao, Yong Jae Lee, Donghyun Kim

机构 * Korea University(韩国大学) Microsoft Research(微软研究院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出了一种基于空间的规划任务,引入了GroundedPlanBench基准,评估机器人在真实环境中的长时域动作规划能力,并通过V2GP框架提升空间接地规划性能。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13993 2026-03-17 cs.CV cs.AI 62%

VAD4Space: Visual Anomaly Detection for Planetary Surface Imagery

VAD4Space:行星表面影像的视觉异常检测

Fabrizio Genilotti, Arianna Stropeni, Francesco Borsatti, Manuel Barusco, Davide Dalle Pezze, Gian Antonio Susto

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VAD4Space框架,用于自动化发现行星探索中的异常现象,通过实测评估了最先进的基于特征的VAD方法,并建立了两个基准数据集以支持行星科学中的异常检测应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13241 2026-03-17 stat.ML cs.AI cs.LG 62%

A Hybrid Tsallis-Polarization Impurity Measure for Decision Trees: Theoretical Foundations and Empirical Evaluation

一种混合的Tsallis-极化杂质度量用于决策树:理论基础和经验评估

Edouard Lansiaux, Idriss Jairi, Hayfa Zgaya-Biau

机构 * Emergency Department, Lille University Hospital(里尔大学医院急诊科) Lille University(里尔大学) LIRMM Montpellier University(蒙彼利埃大学LIRMM) UMontpellier(蒙彼利埃大学) CRISTAL UMR CNRS 9189 Lille University(里尔大学CRISTAL UMR CNRS 9189)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种结合归一化Tsallis熵与指数极化成分的混合杂质度量ITC,理论分析与实验验证显示其在决策树学习中具有良好的理论基础和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15558 2026-03-17 cs.CV cs.RO 57%

Panoramic Affordance Prediction

全景 affordance 预测

Zixin Zhang, Chenfei Liao, Hongfei Zhang, Harold Haodong Chen, Kanghao Chen, Zichen Wen, Litao Guo, Bin Ren, Xu Zheng, Yinchuan Li, Xuming Hu, Nicu Sebe, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SJTU(上海交通大学) MBZUAI(慕尼黑工业大学人工智能研究所) UniTrento(特伦特大学) Knowin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出全景 affordance 预测,利用 360 度影像捕捉全局空间关系,通过 PAP-12K 数据集和 PAP 框架解决超高清影像的高分辨率和畸变问题,展现全景感知在具身智能中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15555 2026-03-17 cs.CV 57%

Learning Latent Proxies for Controllable Single-Image Relighting

学习可控的单图像照明代理

Haoze Zheng, Zihao Wang, Xianfeng Wu, Yajing Bai, Yexin Liu, Yun Li, Xiaogang Xu, Harry Yang

机构 * HKUST(香港科技大学) HKPolyU(香港理工大学) CUHK(香港中文大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出LightCtrl,通过物理先验和稀疏提示实现可控单图像照明,利用DPO优化和ScaLight数据集提升光照控制精度与PSNR表现。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14992 2026-03-17 cs.AI cs.MM 57%

Exposing Cross-Modal Consistency for Fake News Detection in Short-Form Videos

揭示短视频中跨模态一致性以检测虚假新闻

Chong Tian, Yu Wang, Chenxu Yang, Junyi Guan, Zheng Lin, Yuhan Liu, Xiuying Chen, Qirong Ho

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽亚德人工智能大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.AI

AI总结 本文提出MAGIC3模型,通过多粒度跨模态一致性建模提升虚假新闻检测性能,实现高准确率与低成本的平衡。

Comments 16 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03718 2026-03-17 cs.CL cs.AI 57%

Grounded Misunderstandings in Asymmetric Dialogue: A Perspectivist Annotation Scheme for MapTask

对话中的基础误解:一种面向MapTask的视角主义标注方案

Nan Li, Albert Gatt, Massimo Poesio

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种视角主义标注方案,用于分析MapTask中对话参与者对参照表达的 grounded 解释差异,揭示理解如何演变并修复,评估LLM对视角依赖性 grounding 的建模能力。

Comments 14 pages, 5 figures, 6 tables; Camera-ready Version; Accepted by LREC 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14770 2026-03-17 cs.CV 57%

AnyPhoto: Multi-Person Identity Preserving Image Generation with ID Adaptive Modulation on Location Canvas

AnyPhoto: 多人身份保持图像生成与基于ID自适应调制的定位画布

Longhui Yuan

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 AnyPhoto通过定位画布和身份自适应调制实现多人身份保持生成,提升可控性和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22436 2026-03-17 cs.CV 57%

ABounD: Adversarial Boundary-Driven Few-Shot Learning for Multi-Class Anomaly Detection

ABounD:面向多类异常检测的对抗边界驱动少样本学习

Runzhi Deng, Yundi Hu, Xinshuang Zhang, Zhao Wang, Xixi Liu, Wang-Zhou Dai, Caifeng Shan, Fang Zhao

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出ABounD框架,通过语义概念锚定与几何边界优化,解决多类异常检测中特征空间塌陷和跨类干扰问题,实现高效准确的少样本学习。

详情

展开后加载摘要…

URL PDF HTML 收藏