ViPlan: A Benchmark for Visual Planning with Symbolic Predicates and Vision-Language Models
ViPlan:一个用于视觉规划的基准,结合符号谓词和视觉-语言模型
机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) ; Department of Computer Science, Aalto University(艾尔沃斯大学计算机科学系) ; Department of Mathematics, Università degli Studi di Padova(帕多瓦大学数学系)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);visual reasoning(abstract);grounding(abstract)
AI总结 ViPlan是一个用于视觉规划的基准,比较基于VLMs的符号方法与直接VLM规划方法,发现不同方法在不同任务中的表现差异。
Comments 8 pages, 5 figures and 1 table in the main text; 50 pages, 16 figures and 19 tables including supplementary material