arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-30 至 2026-06-30 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 6 篇

2606.28406 2026-06-30 cs.LG cs.CV cs.GR 81%

Can AI Draw Science? A Benchmark for Evaluating Scientific Figure Generation by Text-to-Image and Multimodal Models

AI能绘制科学吗?评估文本到图像和多模态模型生成科学图形的基准

Davie Chen

专题命中 图像生成评测 :text-to-image(title,abstract);分类 cs.CV、cs.GR

AI总结 提出SciDraw-Bench基准,通过32个结构化任务和四维评估协议(文本保真度、语义正确性、结构质量、惯例遵循),评估文本到图像模型生成科学图形的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11734 2026-06-30 cs.CV 79%

VTEdit-Bench: A Comprehensive Benchmark for Multi-Reference Image Editing Models in Virtual Try-On

VTEdit-Bench:多参考图像编辑模型在虚拟试穿中的综合基准

Xiaoye Liang, Zhiyuan Qu, Mingye Zou, Jiaxin Liu, Lai Jiang, Mai Xu, Yiheng Zhu

专题命中 图像生成评测 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出VTEdit-Bench基准,用于评估多参考图像编辑模型在虚拟试穿中的性能,包含24220对测试图像,涵盖五个代表性任务,通过VTEdit-QA评估模型一致性、布料一致性和图像质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30124 2026-06-30 cs.CV 70%

SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation

SciIR:面向科学图像推理生成的大规模训练数据集与基准

Zhiyuan Ma, Zhengfeng Shi, Yuning An, Peize Li, Jiabao Wei, Ruijie Li, Junhao Xiao, Jianjun Li, Bowen Zhou

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology, China(华中科技大学计算机科学与技术学院,中国) School of Airspace Science and Engineering, Shandong University, China(山东大学航空航天科学与工程学院,中国) Department of Electronic Engineering, Tsinghua University, China(清华大学电子工程系,中国)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 为解决文本到图像模型在科学图像生成中语义对齐与逻辑推理不足的问题,构建了包含8万+高质量科学图像-文本对的SciIR-82k数据集,并提出三层次科学推理框架及可验证评估基准SciIR-Bench,微调模型Qwen-Image-SciIR在基准上得分从35%提升至43%。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02459 2026-06-30 cs.CV 57%

ReSpace: Text-Driven Autoregressive 3D Indoor Scene Synthesis and Editing

ReSpace:基于文本的自回归3D室内场景合成与编辑

Martin JJ. Bucher, Iro Armeni

机构 * Stanford University(斯坦福大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 ReSpace通过自回归方法实现文本驱动的3D室内场景合成与编辑,具备明确房间边界和资产无关部署能力,支持通过自然语言添加、移除和交换物体,实验在物体添加和完整场景合成质量上超越现有方法。

Comments 23 pages, 17 figures, 11 tables (incl. appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29172 2026-06-30 physics.ao-ph 50%

CORDEX-ML-Bench: A Benchmark for Data-Driven Regional Climate Downscaling -Experiment Design and Overview

CORDEX-ML-Bench: 数据驱动区域气候降尺度的基准测试——实验设计与概述

Neelesh Rampal, José González-Abad, Henry Addison, Jorge Baño-Medina, Maria Laura Bettolli, Valentina Blasone, Ben Booth, Erika Coppola, Serafina Di Gioia, Joshua Oldham-Dorrington, Antoine Doury, Francois Engelbrecht, Ramón Fuentes-Franco, Peter B. Gibson, Luca Glawion, Caroline Hardy, Mikhail Ivanov, Hugo Kyo Lee, Mikel N. Legasa, Matias Olmo, Andrew Orr, Julius Polz, Martin S. J. Rogers, Maybritt Schillinger, Shivani Sharma, Pedro M. M. Soares, Stefan Sobolowski, Jessica Steinkopf, Wenchang Tang, Jr-Ben Tian, Ricardo Tomé, Ko-Chih Wang, Yi-Chi Wang, Peter A. G. Watson, Tom Wetherell, Martin Widmann, José M. Gutiérrez

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出CORDEX-ML-Bench基准,在三个区域以10公里分辨率降尺度温度和降水,评估40种ML配置,发现生成模型在降水上优于确定性方法,但历史训练模型低估未来信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12957 2026-06-30 cs.LG cs.AI 50%

Attribution Graphs and Causal Probing for Mechanistic Discovery and Bias Repair in Multimodal Generative Learning

揭示-修订:具有多模态注意力的可解释性偏见感知生成建模

Noor Islam S. Mohammad, Uluğ Bayazıt

专题命中 图像生成评测 :image generation(abstract)

AI总结 本文提出一个统一了跨模态注意力融合、Grad-CAM++属性分析和揭示-修订反馈循环的可解释性偏见感知生成框架,通过多模态MNIST和Fashion MNIST数据集验证了其在图像生成和子组审计中的性能。

Comments We are recently authors in conflict with this work; I am heartily requesting to withdraw this paper as soon as possible

详情

展开后加载摘要…

URL PDF HTML 收藏