VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images
VisionFoundry: 通过合成图像教授VLMs的视觉感知
机构 * Princeton University(普林斯顿大学) ; New York University(纽约大学)
AI总结 本文提出VisionFoundry,通过任务关键词生成合成数据,提升VLMs在空间理解和视角识别等视觉感知任务上的性能,构建了包含10k图像-问题-答案三元组的VQA数据集,并在多个基准测试中取得显著提升。
Comments Project Page: https://zlab-princeton.github.io/VisionFoundry/