Malicious Image Analysis via Vision-Language Segmentation Fusion: Detection, Element, and Location in One-shot
通过视觉-语言分割融合进行恶意图像分析:一次检测、元素识别与定位
机构 * Shanghai Jiao Tong University(上海交通大学) ; Microsoft Corporation(微软公司)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 本文提出一种零样本方法,通过视觉-语言分割融合实现恶意图像的检测、元素识别与定位,提升细粒度审核的准确性和鲁棒性。