arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1204 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1204 篇

2306.09341 2023-09-26 cs.CV cs.AI cs.DB 86%

Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis

Xiaoshi Wu, Yiming Hao, Keqiang Sun, Yixiong Chen, Feng Zhu, Rui Zhao, Hongsheng Li

专题命中 图像生成评测 :text-to-image(title,abstract);image synthesis(title);分类 cs.CV

Comments Revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.12330 2022-09-27 cs.CV cs.LG 86%

Personalizing Text-to-Image Generation via Aesthetic Gradients

Victor Gallego

专题命中 图像生成评测 :image generation(title);text-to-image(title);diffusion(abstract);分类 cs.CV

Comments Submitted to NeurIPS 2022 Machine Learning for Creativity and Design Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13131 2026-02-16 cs.HC 86%

Preference-Guided Prompt Optimization for Text-to-Image Generation

基于偏好的提示优化用于文本到图像生成

Zhipeng Li, Yi-Chi Liao, Christian Holz

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(title)

AI总结 APPO通过用户偏好反馈实现高效提示优化,减少迭代次数和认知负担,提升人机协作生成任务的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06440 2026-07-08 cs.CV 新提交 85%

PIPBench: A Profile-Inclusive Framework for Personalized Image Generation Evaluation

PIPBench:用于个性化图像生成评估的包含个人资料的框架

Yuhang Wu, Shuxiang Zhang, Wee Hian Ching, Chi Zhang, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 研究个性化图像生成问题,引入PIPBench基准及新数据构建管道,利用心理和人口统计学资料维度收集数据,全面评估代表性方法,揭示现有方法局限,为个性化文本到图像合成带来新挑战与机遇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15867 2026-06-16 cs.CV 新提交 85%

CogCanvas: A Benchmark for Evaluating Multi-Subject Reference-Based Image Generation

CogCanvas: 用于评估多主体参考图像生成的基准

Long-Bao Nguyen, Quang-Khai Tran, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City, Vietnam(胡志明市理科大学) University of Dayton, Ohio, United States(代顿大学) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学胡志明市分校)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出CogCanvas基准,包含1952张参考图像和1361个组合提示,评估多身份、对象绑定和背景场景的生成,引入BG-Sim和Attr-VQA指标,发现现有模型在超过3个主体时性能严重下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12163 2026-04-15 cs.CV 85%

Nucleus-Image: Sparse MoE for Image Generation

Nucleus-Image:稀疏MoE用于图像生成

Chandan Akiti, Ajay Modukuri, Murali Nandan Nagarapu, Gunavardhan Akiti, Haozhe Liu

机构 * Nucleus AI Team(Nucleus AI 团队)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 Nucleus-Image通过稀疏MoE架构在质量与效率上实现新的帕累托前沿,仅使用约2B参数即可达到领先模型性能,无需后训练优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10963 2026-01-07 cs.CV cs.CL 85%

MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning

MMMG:大规模、跨学科、多层级的文本到图像推理生成基准

Yuxuan Luo, Yuhui Yuan, Junwen Chen, Haonan Cai, Ziyi Yue, Yuwei Yang, Fatima Zohra Daha, Ji Li, Zhouhui Lian

专题命中 图像生成评测 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出MMMG基准,用于评估文本到图像生成模型的推理能力,揭示现有模型在知识图像生成中的不足,并发布FLUX-Reason作为开放基线。

Comments 85 pages, 70 figures, code: https://github.com/MMMGBench/MMMG, project page: https://mmmgbench.github.io/

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025) Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06020 2025-12-09 cs.CV cs.AI 85%

PrefGen: Multimodal Preference Learning for Preference-Conditioned Image Generation

PrefGen: 多模态偏好学习用于偏好条件下的图像生成

Wenyi Mo, Tianyu Zhang, Yalong Bai, Ligong Han, Ying Ba, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) iN2X MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Red Hat AI Innovation(红帽人工智能创新)

专题命中 图像生成评测 :image generation(title,abstract);diffusion(abstract);personalized generation(abstract);分类 cs.CV

AI总结 PrefGen通过多模态大语言模型提取用户偏好并注入扩散模型,实现个性化图像生成,优于现有方法。

Comments Project Page: \href{https://prefgen.github.io/}{\texttt{https://prefgen.github.io}}

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23020 2025-10-28 cs.CV cs.CL 85%

M$^{3}$T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark

Huixuan Zhang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(计算机技术研究所,北京大学)

专题命中 图像生成评测 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22126 2025-05-29 cs.CV cs.AI 85%

SridBench: Benchmark of Scientific Research Illustration Drawing of Image Generation Model

Yifan Chang, Yukang Feng, Jianwen Sun, Jiaxin Ai, Chuanhao Li, S. Kevin Zhou, Kaipeng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) Wuhan University(武汉大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 图像生成评测 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02782 2025-05-05 cs.CV 85%

GPT-ImgEval: A Comprehensive Benchmark for Diagnosing GPT4o in Image Generation

Zhiyuan Yan, Junyan Ye, Weijia Li, Zilong Huang, Shenghai Yuan, Xiangyang He, Kaiqing Lin, Jun He, Conghui He, Li Yuan

机构 * Peking University(北京大学) Shenzhen Graduate School(深圳研究生院) Sun Yat-sen University(中山大学) Rabbitpre AI Shanghai AI Laboratory(上海人工智能实验室) Shenzhen University(深圳大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 图像生成评测 :image generation(title,abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20216 2025-04-10 cs.CV cs.AI cs.LG 85%

Boost Your Human Image Generation Model via Direct Preference Optimization

Sanghyeon Na, Yonggyu Kim, Hyunjoon Lee

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted to CVPR 2025 as a highlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04314 2025-03-26 cs.CV 85%

Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference Optimization

Zhanhao Liang, Yuhui Yuan, Shuyang Gu, Bohan Chen, Tiankai Hang, Mingxi Cheng, Ji Li, Liang Zheng

专题命中 图像生成评测 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments CVPR 2025. Project Page: https://rockeycoss.github.io/spo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04746 2025-03-19 cs.CV cs.AI cs.CL cs.LG 85%

PQPP: A Joint Benchmark for Text-to-Image Prompt and Query Performance Prediction

Eduard Poesina, Adriana Valentina Costache, Adrian-Gabriel Chifu, Josiane Mothe, Radu Tudor Ionescu

专题命中 图像生成评测 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11846 2024-10-31 cs.CV 85%

UnlearnCanvas: Stylized Image Dataset for Enhanced Machine Unlearning Evaluation in Diffusion Models

Yihua Zhang, Chongyu Fan, Yimeng Zhang, Yuguang Yao, Jinghan Jia, Jiancheng Liu, Gaoyuan Zhang, Gaowen Liu, Ramana Rao Kompella, Xiaoming Liu, Sijia Liu

专题命中 图像生成评测 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments NeurIPS 2024 Dataset & Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11897 2023-08-21 cs.CV 85%

TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question Answering

Yushi Hu, Benlin Liu, Jungo Kasai, Yizhong Wang, Mari Ostendorf, Ranjay Krishna, Noah A Smith

专题命中 图像生成评测 :text-to-image(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted to ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.12112 2022-11-23 cs.CV cs.AI cs.LG 85%

Human Evaluation of Text-to-Image Models on a Multi-Task Benchmark

Vitali Petsiuk, Alexander E. Siemenn, Saisamrit Surbehera, Zad Chin, Keith Tyser, Gregory Hunter, Arvind Raghavan, Yann Hicke, Bryan A. Plummer, Ori Kerret, Tonio Buonassisi, Kate Saenko, Armando Solar-Lezama, Iddo Drori

专题命中 图像生成评测 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

Comments NeurIPS 2022 Workshop on Human Evaluation of Generative Models (HEGM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.15235 2022-12-06 cs.CV 84%

SSD: Towards Better Text-Image Consistency Metric in Text-to-Image Generation

Zhaorui Tan, Xi Yang, Zihan Ye, Qiufeng Wang, Yuyao Yan, Anh Nguyen, Kaizhu Huang

专题命中 图像生成评测 :image generation(title);text-to-image(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10426 2025-10-17 cs.CV cs.CL cs.GR 84%

CAP: Evaluation of Persuasive and Creative Image Generation

Aysan Aghazadeh, Adriana Kovashka

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12908 2023-11-23 cs.CV cs.AI cs.GR cs.LG 84%

Diffusion Model Alignment Using Direct Preference Optimization

Bram Wallace, Meihua Dang, Rafael Rafailov, Linqi Zhou, Aaron Lou, Senthil Purushwalkam, Stefano Ermon, Caiming Xiong, Shafiq Joty, Nikhil Naik

专题命中 图像生成评测 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03317 2025-12-03 cs.CV 84%

Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models

Diffusion-SDPO:用于扩散模型的受保护直接偏好优化

Minghao Fu, Guo-Hua Wang, Tianyu Cui, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 图像生成评测 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 Diffusion-SDPO通过保护性更新规则提升扩散模型对人类偏好的对齐效果。

Comments The code is publicly available at https://github.com/AIDC-AI/Diffusion-SDPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23044 2025-07-02 cs.CV cs.AI 84%

Ovis-U1 Technical Report

Guo-Hua Wang, Shanshan Zhao, Xinjie Zhang, Liangfu Cao, Pengxin Zhan, Lunhao Duan, Shiyin Lu, Minghao Fu, Xiaohao Chen, Jianshan Zhao, Yang Li, Qing-Guo Chen

专题命中 图像生成评测 :image generation(abstract,comments);text-to-image(abstract,comments);image editing(abstract,comments);diffusion(abstract)

Comments An unified model for multimodal understanding, text-to-image generation, and image editing. GitHub: https://github.com/AIDC-AI/Ovis-U1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20100 2026-06-19 cs.CV 新提交 83%

WeGenBench: A Multidimensional Diagnostic Benchmark towards Text-to-Image Model Optimization

WeGenBench:面向文本到图像模型优化的多维诊断基准

Qian Liang, Xiaomin Li, Ying Zhang, Jia Xu, Lihao Ni, Hongrui Li, Jingjing Li, Jing Lyu, Chen Li

机构 * University of Electronic Science and Technology of China(电子科技大学) Dalian University of Technology(大连理工大学) Weixin, Tencent(腾讯微信)

专题命中 图像生成评测 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出WeGenBench基准,包含4000个中英双语提示,通过场景分类和多维标签实现跨维度评估,并设计基于视觉语言模型的新颖指标,精准定位模型在特定生成类别中的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12134 2026-05-13 cs.CV cs.LG 83%

MULTI: Disentangling Camera Lens, Sensor, View, and Domain for Novel Image Generation

MULTI: 解构相机镜头、传感器、视角和领域以实现新图像生成

Sonali Godavarthy, Matthias Neuwirth-Trapp, Tim-Felix Faasch, Maarten Bieshaar, Michael Moeller, Danda Pani Paudel

机构 * Bosch Research(博世研究) ETH Zürich(苏黎世联邦理工学院) University of Siegen(锡根大学)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 MULTI通过文本逆向学习解构图像生成中的多因素,提升对特定风格和对象的控制能力,并通过DF-RICO基准验证其有效性。

Comments Accepted at ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01864 2026-04-03 cs.CV 83%

MAR-MAER: Metric-Aware and Ambiguity-Adaptive Autoregressive Image Generation

MAR-MAER:具有度量意识和模糊适应性的自回归图像生成

Kai Dong, Tingting Bai

机构 * Lanzhou Vocational Technical College(兰州职业技术学院)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 MAR-MAER通过引入度量意识嵌入正则化和概率潜在模型,提升自回归图像生成的质量和语义灵活性,实验表明其在CLIPScore和HPSv2指标上优于基线模型。

Comments Accepted by AMME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12220 2026-03-19 cs.CV 83%

TechImage-Bench: Rubric-Based Evaluation for Technical Image Generation

TechImage-Bench: 基于评分标准的技术图像生成评估

Minheng Ni, Zhengyuan Yang, Yaowen Zhang, Linjie Li, Chung-Ching Lin, Kevin Lin, Zhendong Wang, Xiaofei Wang, Shujie Liu, Lei Zhang, Wangmeng Zuo, Lijuan Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) Microsoft Project Website(微软项目网站)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出TechImage-Bench,通过评分标准评估技术图像生成,发现现有模型在科学准确性上存在显著差距,并展示评分标准对改进图像生成的监督作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24146 2026-03-11 cs.CV 83%

Taming Preference Mode Collapse via Directional Decoupling Alignment in Diffusion Reinforcement Learning

通过方向解耦对齐缓解偏好模式崩溃在扩散强化学习中

Chubin Chen, Sujie Hu, Jiashu Zhu, Meiqi Wu, Jintao Chen, Yanxun Li, Nisha Huang, Chengyu Fang, Jiahong Wu, Xiangxiang Chu, Xiu Li

机构 * Tsinghua University(清华大学) AMAP, Alibaba Group(阿里云实验室,阿里巴巴集团)

专题命中 图像生成评测 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出D²-Align框架,通过方向解耦对齐缓解扩散强化学习中的偏好模式崩溃,提升生成多样性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24233 2026-03-02 cs.CV 83%

Enhancing Spatial Understanding in Image Generation via Reward Modeling

通过奖励建模增强图像生成中的空间理解

Zhenyu Tang, Chaoran Feng, Yufan Deng, Jie Wu, Xiaojie Li, Rui Wang, Yunpeng Chen, Daquan Zhou

机构 * Peking University(北京大学) ByteDance Seed(字节跳动种子)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出SpatialScore奖励模型,通过增强空间理解能力提升图像生成的质量和效果。

Comments Accepted at CVPR 2026. Github: https://github.com/DAGroup-PKU/SpatialT2I Project website: https://dagroup-pku.github.io/SpatialT2I/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10061 2026-01-21 cs.CV cs.AI 83%

DiffusionAgent: Navigating Expert Models for Agentic Image Generation

DiffusionAgent: 专家模型导航用于代理图像生成

Jie Qin, Jie Wu, Weifeng Chen, Yueming Lyu

机构 * Meituan(美团) ByteDance(字节跳动) Nanjing University(南京大学)

专题命中 图像生成评测 :image generation(title);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 DiffusionAgent通过统一代理框架实现多领域图像生成,结合树状思维导航和优势数据库提升生成质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18736 2025-12-25 cs.CV 83%

Rethinking Direct Preference Optimization in Diffusion Models

重新思考扩散模型中的直接偏好优化

Junyong Kang, Seohyun Lim, Kyungjune Baek, Hyunjung Shim

专题命中 图像生成评测 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种改进扩散模型偏好优化的方法,通过稳定参考模型更新和时间步感知训练策略,提升模型在人类偏好评估中的性能。

Comments Accepted by SPIGM@NeurIPS 2025 and AAAI-26 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏