arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1204 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1204 篇

2403.12052 2024-06-24 cs.CV 90%

A Dataset and Benchmark for Copyright Infringement Unlearning from Text-to-Image Diffusion Models

Rui Ma, Qiang Zhou, Yizhu Jin, Daquan Zhou, Bangjun Xiao, Xiuyu Li, Yi Qu, Aishani Singh, Kurt Keutzer, Jingtong Hu, Xiaodong Xie, Zhen Dong, Shanghang Zhang, Shiji Zhou

专题命中 图像生成评测 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);image synthesis(abstract)

Comments 20 pages, 7 figures, 3 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09832 2026-03-11 cs.GR cs.HC 89%

Prompt-Driven Color Accessibility Evaluation in Diffusion-based Image Generation Models

基于提示的扩散图像生成模型颜色可访问性评估

Xinyao Zhuang, Jose Echevarria, Kaan Akşit

专题命中 图像生成评测 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.GR

AI总结 本文提出CVDLoss指标,评估扩散模型在不同类别中对颜色可访问性提示的响应能力,揭示现有模型在可访问性方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13352 2025-01-03 cs.CV 89%

AGFSync: Leveraging AI-Generated Feedback for Preference Optimization in Text-to-Image Generation

Jingkun An, Yinghao Zhu, Zongjian Li, Enshen Zhou, Haoran Feng, Xijie Huang, Bohua Chen, Yemin Shi, Chengwei Pan

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by AAAI-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15488 2024-11-26 cs.CL cs.AI cs.CV 89%

Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation Benchmark

Rong-Cheng Tu, Zi-Ao Ma, Tian Lan, Yuehao Zhao, Heyan Huang, Xian-Ling Mao

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05706 2024-11-11 cs.CV cs.CL 89%

Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models

Jia-Hong Huang, Hongyi Zhu, Yixian Shen, Stevan Rudinac, Evangelos Kanoulas

专题命中 图像生成评测 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2408.01723

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17245 2024-02-28 cs.CV cs.AI 89%

Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation

Daiqing Li, Aleks Kamko, Ehsan Akhgari, Ali Sabet, Linmiao Xu, Suhail Doshi

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Model weights: https://huggingface.co/playgroundai/playground-v2.5-1024px-aesthetic

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10843 2023-05-29 cs.CV cs.AI 89%

X-IQE: eXplainable Image Quality Evaluation for Text-to-Image Generation with Visual Large Language Models

Yixiong Chen, Li Liu, Chris Ding

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments 18 pages, 6 tables, 11 figures, NeurIPS 2023 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07265 2026-06-03 cs.CV cs.AI cs.CL 88%

WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation

WISE: 一种基于世界知识的文本到图像生成语义评估方法

Yuwei Niu, Munan Ning, Mengren Zheng, Weiyang Jin, Bin Lin, Peng Jin, Jiaqi Liao, Chaoran Feng, Fanqing Meng, Kunpeng Ning, Bin Zhu, Li Yuan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 针对现有文本到图像生成模型缺乏复杂语义理解和世界知识整合评估的问题,提出WISE基准,包含25个子领域的1000个精心设计的提示,并引入WiScore指标评估知识-图像对齐,实验表明当前模型在整合世界知识方面存在显著局限。

Comments Accepted to ICML 2026. We have also released an updated version of the benchmark, WISE_Verified. Please refer to https://github.com/PKU-YuanGroup/WISE for the latest version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13953 2026-03-31 cs.CV 88%

From Unlearning to UNBRANDING: A Benchmark for Trademark-Safe Text-to-Image Generation

从去学习到去品牌化:一个商标安全的文本到图像生成基准测试

Dawid Malarz, Filip Manjak, Maciej Zięba, Przemysław Spurek, Artur Kasymov

机构 * Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究所)

专题命中 图像生成评测 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出去品牌化任务,通过细粒度去除商标和隐含结构特征,同时保持语义连贯性,并构建基准数据集和评估框架,解决现有品牌检测器无法捕捉抽象商标的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19632 2025-12-23 cs.CV 88%

Generative diffusion models for agricultural AI: plant image generation, indoor-to-outdoor translation, and expert preference alignment

生成扩散模型在农业AI中的应用:植物图像生成、室内外转换以及专家偏好对齐

Da Tan, Michael Beck, Christopher P. Bidinosti, Robert H. Gulden, Christopher J. Henry

机构 * University of Manitoba(曼尼托巴大学) University of Winnipeg(温哥华大学)

专题命中 图像生成评测 :diffusion(title,abstract);image generation(title);image synthesis(abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的生成方法,通过合成植物图像、室内外转换和专家偏好对齐,提升农业AI的数据效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05664 2025-11-11 cs.CV cs.LG 88%

Holistic Unlearning Benchmark: A Multi-Faceted Evaluation for Text-to-Image Diffusion Model Unlearning

Saemi Moon, Minjong Lee, Sangdon Park, Dongwoo Kim

机构 * CSE, POSTECH(POSTECH 计算科学与工程系) GSAI, POSTECH(POSTECH 人工智能研究所)

专题命中 图像生成评测 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20586 2025-10-24 cs.CV 88%

GenColorBench: A Color Evaluation Benchmark for Text-to-Image Generation Models

Muhammad Atif Butt, Alexandra Gomez-Villa, Tao Wu, Javier Vazquez-Corral, Joost Van De Weijer, Kai Wang

机构 * Computer Vision Center, Spain(西班牙计算机视觉中心) Computer Sciences Department, Universitat Autònoma de Barcelona, Spain(西班牙巴塞罗那自治大学计算机科学系) Program of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学项目) City University of Hong Kong(香港城市大学)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11178 2025-05-19 cs.CV cs.AI cs.CL 88%

CompAlign: Improving Compositional Text-to-Image Generation with a Complex Benchmark and Fine-Grained Feedback

Yixin Wan, Kai-Wei Chang

机构 * Department of Computer Science University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(title);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06350 2025-03-19 cs.CV 88%

T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation

Kaiyi Huang, Chengqi Duan, Kaiyue Sun, Enze Xie, Zhenguo Li, Xihui Liu

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

Comments This is the journal version. For conference version (T2I-CompBench): arXiv:2307.06350v2. Project page: https://karine-h.github.io/T2I-CompBench-new/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07455 2025-02-12 cs.CV cs.AI cs.CL 88%

RusCode: Russian Cultural Code Benchmark for Text-to-Image Generation

Viacheslav Vasilev, Julia Agafonova, Nikolai Gerasimenko, Alexander Kapitanov, Polina Mikhailova, Evelina Mironova, Denis Dimitrov

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

Comments Accepted for NAACL 2025 Findings, GitHub: https://github.com/ai-forever/RusCode

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10183 2024-11-18 cs.CV 88%

Visual question answering based evaluation metrics for text-to-image generation

Mizuki Miyamoto, Ryugo Morita, Jinjia Zhou

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

Comments Accepted to ISCAS2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21966 2024-11-05 cs.CV 88%

PrefPaint: Aligning Image Inpainting Diffusion Model with Human Preference

Kendong Liu, Zhiyu Zhu, Chuanhao Li, Hui Liu, Huanqiang Zeng, Junhui Hou

专题命中 图像生成评测 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14705 2024-05-24 cs.CV 88%

Learning Multi-dimensional Human Preference for Text-to-Image Generation

Sixian Zhang, Bohan Wang, Junqiang Wu, Yan Li, Tingting Gao, Di Zhang, Zhongyuan Wang

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27862 2026-03-31 cs.GR cs.AI cs.CV cs.LG 88%

ImagenWorld: Stress-Testing Image Generation Models with Explainable Human Evaluation on Open-ended Real-World Tasks

ImagenWorld: 通过可解释的人类评估对图像生成模型进行压力测试,针对开放性现实任务

Samin Mahdizadeh Sani, Max Ku, Nima Jamali, Matina Mahdizadeh Sani, Paria Khoshtab, Wei-Chieh Sun, Parnian Fazel, Zhi Rui Tam, Thomas Chong, Edisy Kin Wai Chan, Donald Wai Tong Tsang, Chiao-Wei Hsu, Ting Wai Lam, Ho Yin Sam Ng, Chiafeng Chu, Chak-Wing Mak, Keming Wu, Hiu Tung Wong, Yik Chun Ho, Chi Ruan, Zhuofeng Li, I-Sheng Fang, Shih-Ying Yeh, Ho Kei Cheng, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) G-G-G Comfy Org University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Independent(独立研究者)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 ImagenWorld通过3600个条件集评估14个模型,揭示编辑任务比生成任务更难,艺术和照片实感领域表现优异,但符号和文本密集领域表现较差,现代VLM指标在Kendall准确性上达0.79,但无法实现细粒度可解释性误差归因。

Comments Published in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09313 2026-06-17 cs.CV 版本更新 87%

Attention Sinks in Diffusion Transformers: A Causal Analysis

扩散变换器中的注意力 sinks:一种因果分析

Fangzheng Wu, Brian Summa

机构 * Department of Computer Science, Tulane University, New Orleans, LA, USA(路易斯安那州新奥尔良大学计算机科学系)

专题命中 图像生成评测 :diffusion(title,abstract);text-to-image(abstract,abstract_cn);分类 cs.CV

AI总结 研究探讨了扩散变换器中注意力 sinks 的作用,通过动态识别并抑制注意力接收者,发现其对文本-图像对齐和偏好代理影响有限,但强干预下出现特定边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09156 2026-06-09 cs.CV 新提交 87%

OmniGen-AR: AutoRegressive Any-to-Image Generation

OmniGen-AR: 自回归任意到图像生成

Junke Wang, Xun Wang, Qiushan Guo, Peize Sun, Weilin Huang, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) Bytedance Seed(字节跳动Seed) The University of Hong Kong(香港大学)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);image synthesis(abstract)

AI总结 提出统一自回归框架OmniGen-AR,通过共享视觉分词器和解耦因果注意力,支持文本、空间信号和视觉上下文等多种条件输入,在多项基准上达到最优或竞争性能。

Comments Accepted by NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22877 2025-12-30 cs.CV 87%

M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models

M-ErasureBench:一种全面的多模态评估基准,用于扩散模型的概念擦除

Ju-Hsuan Weng, Jia-Wei Liao, Cheng-Fu Chou, Jun-Cheng Chen

机构 * National Taiwan University(国立台湾大学) Research Center for Information Technology Innovation, Academia Sinica(学术院资讯技术创新研究中心)

专题命中 图像生成评测 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);personalized generation(abstract)

AI总结 M-ErasureBench提出一种多模态评估框架,评估扩散模型的概念擦除方法,并提出IRECE模块提升擦除鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01596 2024-03-12 cs.CV cs.GR cs.MM 87%

ImagenHub: Standardizing the evaluation of conditional image generation models

Max Ku, Tianle Li, Kai Zhang, Yujie Lu, Xingyu Fu, Wenwen Zhuang, Wenhu Chen

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV、cs.GR、cs.MM

Comments Accepted to ICLR2024 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22570 2026-02-27 cs.CV cs.AI 86%

Guidance Matters: Rethinking the Evaluation Pitfall for Text-to-Image Generation

引导至关重要:重新审视文本到图像生成中的评估误区

Dian Xie, Shitong Shao, Lichen Bai, Zikai Zhou, Bojun Cheng, Shuo Yang, Jun Wu, Zeke Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Cogniser Information Technology(Cogniser信息科技)

专题命中 图像生成评测 :image generation(title);text-to-image(title);diffusion(abstract);分类 cs.CV

AI总结 本文重新审视文本到图像生成中的评估误区,提出引导感知评估框架,并设计超越扩散引导方法以提升人类偏好评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18701 2026-02-25 cs.CV 86%

UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation

UniGenBench++: 一个统一的语义评估基准用于文本到图像生成

Yibin Wang, Zhimin Li, Yuhang Zang, Jiazi Bu, Yujie Zhou, Yi Xin, Junjun He, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang

专题命中 图像生成评测 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 UniGenBench++ 提出一个统一的语义评估基准,涵盖多样化的现实场景和多语言支持,用于评估文本到图像生成模型的语义一致性。

Comments Project page: codegoat24.github.io/UniGenBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14290 2025-11-18 cs.CV 86%

The Path to Reconciling Quality and Safety in Text-to-Image Generation: Dataset, Method, and Evaluation

Shouwei Ruan, Zhenyu Wu, Yao Huang, Ruochen Zhang, Yitong Sun, Caixin Kang, Shiji Zhao, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室)

专题命中 图像生成评测 :text-to-image(title,abstract);image generation(title);分类 cs.CV

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18150 2024-12-30 cs.CV cs.AI 86%

EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation

Shuhao Han, Haotian Fan, Jiachen Fu, Liang Li, Tao Li, Junhui Cui, Yunqiu Wang, Yang Tai, Jingwei Sun, Chunle Guo, Chongyi Li

专题命中 图像生成评测 :text-to-image(title,abstract);image generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04086 2024-12-09 cs.CV cs.AI 86%

BodyMetric: Evaluating the Realism of Human Bodies in Text-to-Image Generation

Nefeli Andreou, Varsha Vivek, Ying Wang, Alex Vorobiov, Tiffany Deng, Raja Bala, Larry Davis, Betty Mohler Tesch

专题命中 图像生成评测 :text-to-image(title,abstract);image generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18013 2024-10-31 cs.CV 86%

Scalable Ranked Preference Optimization for Text-to-Image Generation

Shyamgopal Karthik, Huseyin Coskun, Zeynep Akata, Sergey Tulyakov, Jian Ren, Anil Kag

专题命中 图像生成评测 :text-to-image(title,abstract);image generation(title);分类 cs.CV

Comments Project Page: https://snap-research.github.io/RankDPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17331 2024-10-24 cs.CV cs.IR 86%

Offline Evaluation of Set-Based Text-to-Image Generation

Negar Arabzadeh, Fernando Diaz, Junfeng He

专题命中 图像生成评测 :text-to-image(title,abstract);image generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏