From Bounding Boxes to Visual Reasoning: An On-Policy Data Annotation Tool for Vision-Language Models
从边界框到视觉推理:一种用于视觉语言模型的在线策略数据标注工具
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; College of Computer Science, Jilin University(吉林大学计算机科学与技术学院) ; OPPO
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出ScreenAnnotator,通过统一标注原子模式、在线策略循环与贝叶斯验证器,解决现有工具表达力不足、标注-训练脱节和数据复用性差的问题,实现高效多任务数据生成。
Comments 14 pages, 7 figures