BOP-ASK: Object-Interaction Reasoning for Vision-Language Models
BOP-ASK:面向视觉-语言模型的对象交互推理
机构 * New York University(纽约大学) ; NVIDIA(英伟达)
专题命中 感知 :trajectory planning(abstract);分类 cs.RO、cs.CV
AI总结 本文提出BOP-ASK数据集,用于训练和评估视觉-语言模型的对象交互推理能力,包含15万张图像和3300万对问题答案,涵盖六个任务,验证了模型在复杂环境中的空间推理能力。
Comments Accepted at CVPR 2026. Code, Datasets & Benchmark available at https://bop-ask.github.io/