How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing
模型能多好地遵循视觉指令?VIBE:一个系统性的视觉指令驱动图像编辑基准
机构 * School of Artificial Intelligence, University of Chinese Academy of Science(中国科学院大学人工智能学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) ; Peking University(北京大学) ; South China University of Technology(华南理工大学) ; Nanjing University(南京大学)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 本文提出VIBE基准,用于评估视觉指令驱动的图像编辑模型,通过三级交互层次评估指涉 grounding、形态操作和因果推理,并发现专有模型在早期阶段表现优异但随着任务难度增加性能下降。
Comments https://vibe-benchmark.github.io/