ImagenWorld: Stress-Testing Image Generation Models with Explainable Human Evaluation on Open-ended Real-World Tasks
ImagenWorld: 通过可解释的人类评估对图像生成模型进行压力测试,针对开放性现实任务
机构 * University of Waterloo(滑铁卢大学) ; G-G-G ; Comfy Org ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Independent(独立研究者)
专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)
AI总结 ImagenWorld通过3600个条件集评估14个模型,揭示编辑任务比生成任务更难,艺术和照片实感领域表现优异,但符号和文本密集领域表现较差,现代VLM指标在Kendall准确性上达0.79,但无法实现细粒度可解释性误差归因。
Comments Published in ICLR 2026