Anomalous Frame Detection Using VLM-Based Description Comparison for Extracting Expert-Specific Actions and Contextual Decision-Making Scenes with Intra-Video Self-Similarity
基于VLM描述比较的异常帧检测,用于提取特定专家操作和具有视频内自相似性的上下文决策场景
专题命中 视觉定位与Grounding :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV
AI总结 本文针对关键基础设施维护中专家知识传承问题,提出基于VLM描述比较检测异常帧的方法,可提取特定专家操作及上下文决策场景,在模拟实验中该方法的提取率高于传统方法,有效发现含专家知识的候选场景。
Comments 17 pages, 11 figures, 2 tables