arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1204 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1204 篇

2502.06023 2025-10-21 cs.CV 83%

Dual Caption Preference Optimization for Diffusion Models

Amir Saeidi, Yiran Luo, Agneet Chatterjee, Shamanthak Hegde, Bimsara Pathiraja, Yezhou Yang, Chitta Baral

机构 * School of Computing and Augmented Intelligence(计算与增强智能学院) Arizona State University(亚利桑那州立大学)

专题命中 图像生成评测 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02588 2025-09-29 cs.CV 83%

Calibrated Multi-Preference Optimization for Aligning Diffusion Models

Kyungmin Lee, Xiaohang Li, Qifei Wang, Junfeng He, Junjie Ke, Ming-Hsuan Yang, Irfan Essa, Jinwoo Shin, Feng Yang, Yinxiao Li

机构 * Google DeepMind(谷歌DeepMind) KAIST(韩国科学技术院) Google(谷歌) Google Research(谷歌研究) Georgia Institute of Technology(佐治亚理工学院)

专题命中 图像生成评测 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments CVPR 2025, Project page: https://kyungmnlee.github.io/capo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09987 2025-08-14 cs.CV cs.AI cs.CL 83%

Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation

Junyan Ye, Dongzhi Jiang, Zihao Wang, Leqi Zhu, Zhenghao Hu, Zilong Huang, Jun He, Zhiyuan Yan, Jinghua Yu, Hongsheng Li, Conghui He, Weijia Li

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) CUHK MMLab(香港中文大学多模态实验室) Peking University(北京大学)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11824 2025-07-29 cs.CV 83%

KITTEN: A Knowledge-Intensive Evaluation of Image Generation on Visual Entities

Hsin-Ping Huang, Xinyi Wang, Yonatan Bitton, Hagai Taitelbaum, Gaurav Singh Tomar, Ming-Wei Chang, Xuhui Jia, Kelvin C. K. Chan, Hexiang Hu, Yu-Chuan Su, Ming-Hsuan Yang

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Project page: https://kitten-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19002 2025-07-28 cs.CV 83%

Enhancing Reward Models for High-quality Image Generation: Beyond Text-Image Alignment

Ying Ba, Tianyu Zhang, Yalong Bai, Wenyi Mo, Tao Liang, Bing Su, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence(中关村人工智能学院) Renmin University of China(中国人民大学) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心,教育部) iN2X

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13926 2025-07-24 cs.CV cs.AI cs.CL 83%

Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step

Ziyu Guo, Renrui Zhang, Chengzhuo Tong, Zhizheng Zhao, Rui Huang, Haoquan Zhang, Manyuan Zhang, Jiaming Liu, Shanghang Zhang, Peng Gao, Hongsheng Li, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Shanghai AI Laboratory(上海人工智能实验室) University of Electronic Science and Technology of China(电子科技大学)

专题命中 图像生成评测 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

Comments Journal Version. Code and models are released at https://github.com/ZiyuGuo99/Image-Generation-CoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07977 2025-06-27 cs.CV 83%

OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation

Jingjing Chang, Yixiao Fang, Peng Xing, Shuhan Wu, Wei Cheng, Rui Wang, Xianfang Zeng, Gang Yu, Hai-Bao Chen

机构 * SJTU(上海交通大学) StepFun

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19360 2025-06-27 cs.CR cs.CV 83%

SoK: Can Synthetic Images Replace Real Data? A Survey of Utility and Privacy of Synthetic Image Generation

Yunsung Chung, Yunbei Zhang, Nassir Marrouche, Jihun Hamm

机构 * Tulane University(Tulane大学)

专题命中 图像生成评测 :image generation(title,abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted at the 34th USENIX Security Symposium (USENIX Security '25). 21 pages, plus a 6-page appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14903 2025-06-19 cs.CV 83%

DETONATE: A Benchmark for Text-to-Image Alignment and Kernelized Direct Preference Optimization

Renjith Prasad, Abhilekh Borah, Hasnat Md Abdullah, Chathurangi Shyalika, Gurpreet Singh, Ritvik Garimella, Rajarshi Roy, Harshul Surana, Nasrin Imanpour, Suranjana Trivedy, Amit Sheth, Amitava Das

专题命中 图像生成评测 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments 59 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02698 2025-06-09 cs.CV 83%

Smoothed Preference Optimization via ReNoise Inversion for Aligning Diffusion Models with Varied Human Preferences

Yunhong Lu, Qichao Wang, Hengyuan Cao, Xiaoyin Xu, Min Zhang

专题命中 图像生成评测 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01331 2025-06-03 cs.CV 83%

Ultra-High-Resolution Image Synthesis: Data, Method and Evaluation

Jinjin Zhang, Qiuyu Huang, Junjie Liu, Xiefan Guo, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science and Engineering(计算机科学与工程学院) Beihang University(北京航空航天大学)

专题命中 图像生成评测 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24787 2025-06-02 cs.CV cs.CL 83%

Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation

Yucheng Zhou, Jiahao Yuan, Qianning Wang

机构 * University of Macau China(澳门大学) East China Normal University China(华东师范大学) Auckland University of Technology New Zealand(技术大学)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19415 2025-05-29 cs.CV 83%

MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models

Hang Hua, Ziyun Zeng, Yizhi Song, Yunlong Tang, Liu He, Daniel Aliaga, Wei Xiong, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) Purdue University(普渡大学) NVIDIA(英伟达)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08542 2025-04-14 cs.CV 83%

Discriminator-Free Direct Preference Optimization for Video Diffusion

Haoran Cheng, Qide Dong, Liang Peng, Zhizhou Sha, Weiguo Feng, Jinghui Xie, Zhao Song, Shilei Wen, Xiaofei He, Boxi Wu

专题命中 图像生成评测 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2412.14167 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08358 2025-04-14 cs.CV 83%

LMM4LMM: Benchmarking and Evaluating Large-multimodal Image Generation with LMMs

Jiarui Wang, Huiyu Duan, Yu Zhao, Juntong Wang, Guangtao Zhai, Xiongkuo Min

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18454 2025-03-25 cs.CV cs.LG 83%

InPO: Inversion Preference Optimization with Reparametrized DDIM for Efficient Diffusion Model Alignment

Yunhong Lu, Qichao Wang, Hengyuan Cao, Xierui Wang, Xiaoyin Xu, Min Zhang

专题命中 图像生成评测 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10357 2025-03-14 cs.CL cs.CV 83%

Do I look like a `cat.n.01` to you? A Taxonomy Image Generation Benchmark

Viktor Moskvoretskii, Alina Lobanova, Ekaterina Neminova, Chris Biemann, Alexander Panchenko, Irina Nikishina

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Labeled data and generated image Wordnet are published at https://huggingface.co/collections/VityaVitalich/generated-image-wordnet-67d2c868ff1414ec2f8e0d3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08677 2025-03-13 cs.CV 83%

OmniPaint: Mastering Object-Oriented Editing via Disentangled Insertion-Removal Inpainting

Yongsheng Yu, Ziyun Zeng, Haitian Zheng, Jiebo Luo

专题命中 图像生成评测 :inpainting(title);diffusion(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20287 2025-01-14 cs.CV cs.LG 83%

Benchmarking Counterfactual Image Generation

Thomas Melistas, Nikos Spyrou, Nefeli Gkouti, Pedro Sanchez, Athanasios Vlontzos, Yannis Panagakis, Giorgos Papanastasiou, Sotirios A. Tsaftaris

专题命中 图像生成评测 :image generation(title,abstract);image editing(abstract);分类 cs.CV

Comments Published as a conference paper at NeurIPS 2024 Datasets and Benchmarks Track https://openreview.net/forum?id=0T8xRFrScB Project page: https://gulnazaki.github.io/counterfactual-benchmark

Journal ref The Thirty-eight Conference on Neural Information Processing Systems Datasets and Benchmarks Track (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01284 2024-08-13 cs.CV 83%

Stable Messenger: Steganography for Message-Concealed Image Generation

Quang Nguyen, Truong Vu, Cuong Pham, Anh Tran, Khoi Nguyen

专题命中 图像生成评测 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06382 2024-06-11 cs.CV cs.CL cs.LG 83%

Diffusion-RPO: Aligning Diffusion Models through Relative Preference Optimization

Yi Gu, Zhendong Wang, Yueqin Yin, Yujia Xie, Mingyuan Zhou

专题命中 图像生成评测 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09603 2024-01-29 cs.CV 83%

Rethinking FID: Towards a Better Evaluation Metric for Image Generation

Sadeep Jayasumana, Srikumar Ramalingam, Andreas Veit, Daniel Glasner, Ayan Chakrabarti, Sanjiv Kumar

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Code is available at: https://github.com/google-research/google-research/tree/master/cmmd

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10995 2023-11-21 cs.CV cs.CL 83%

Behavior Optimized Image Generation

Varun Khurana, Yaman K Singla, Jayakumar Subramanian, Rajiv Ratn Shah, Changyou Chen, Zhiqiang Xu, Balaji Krishnamurthy

专题命中 图像生成评测 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.04441 2023-10-26 cs.CV 83%

Txt2Img-MHN: Remote Sensing Image Generation from Text Using Modern Hopfield Networks

Yonghao Xu, Weikang Yu, Pedram Ghamisi, Michael Kopp, Sepp Hochreiter

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

Journal ref IEEE Trans. Image Process., vol. 32, pp. 5737-5750, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11513 2023-10-19 cs.CV cs.LG 83%

GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment

Dhruba Ghosh, Hanna Hajishirzi, Ludwig Schmidt

专题命中 图像生成评测 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14420 2023-08-23 cs.CV cs.AI 83%

Human Preference Score: Better Aligning Text-to-Image Models with Human Preference

Xiaoshi Wu, Keqiang Sun, Feng Zhu, Rui Zhao, Hongsheng Li

专题命中 图像生成评测 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.07839 2022-12-16 cs.CV cs.CL cs.LG 83%

TeTIm-Eval: a novel curated evaluation data set for comparing text-to-image models

Federico A. Galatolo, Mario G. C. A. Cimino, Edoardo Cogotti

专题命中 图像生成评测 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27374 2026-05-28 cs.CL 82%

ICG: Improving Cover Image Generation via MLLM-based Prompting and Personalized Preference Alignment

ICG: 通过基于MLLM的提示和个性化偏好对齐改进封面图像生成

Zhipeng Bian, Jieming Zhu, Qijiong Liu, Wang Lin, Guohao Cai, Zhaocheng Du, Jiacheng Sun, Zhou Zhao, Zhenhua Dong

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学)

专题命中 图像生成评测 :image generation(title,abstract);diffusion(abstract)

AI总结 提出ICG框架,利用多模态大语言模型和扩散模型,通过元标记提取语义特征、用户嵌入个性化对齐及多奖励学习策略,实现高质量、个性化封面图像生成。

Comments Published in Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 12268-12278, EMNLP 2025. Official version: https://doi.org/10.18653/v1/2025.emnlp-main.617

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (Main Track) EMNLP 2025 12268-12278

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12612 2025-07-28 cs.CL cs.CR 82%

T2ISafety: Benchmark for Assessing Fairness, Toxicity, and Privacy in Image Generation

Lijun Li, Zhelun Shi, Xuhao Hu, Bowen Dong, Yiran Qin, Xihui Liu, Lu Sheng, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北航) Harbin Institute of Technology(哈尔滨工业大学) Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) The University of Hong Kong(香港大学)

专题命中 图像生成评测 :image generation(title);text-to-image(abstract);diffusion(abstract)

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17801 2025-07-25 cs.CV 81%

Lumina-mGPT 2.0: Stand-Alone AutoRegressive Image Modeling

Yi Xin, Juncheng Yan, Qi Qin, Zhen Li, Dongyang Liu, Shicheng Li, Victor Shea-Jay Huang, Yupeng Zhou, Renrui Zhang, Le Zhuo, Tiancheng Han, Xiaoqing Sun, Siqi Luo, Mengmeng Wang, Bin Fu, Yuewen Cao, Hongsheng Li, Guangtao Zhai, Xiaohong Liu, Yu Qiao, Peng Gao

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University of Technology(浙江工业大学)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

Comments Tech Report, 23 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏