arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1204 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1204 篇

2512.15110 2025-12-22 cs.CV 70%

Is Nano Banana Pro a Low-Level Vision All-Rounder? A Comprehensive Evaluation on 14 Tasks and 40 Datasets

Nano Banana Pro是否是低级视觉的全能选手?对14项任务和40个数据集的全面评估

Jialong Zuo, Haoyou Deng, Hanyu Zhou, Jiaxin Zhu, Yicheng Zhang, Yiwei Zhang, Yongxin Yan, Kaixing Huang, Weisen Chen, Yongtai Deng, Rui Jin, Nong Sang, Changxin Gao

机构 * National Key Laboratory of Multispectral Information Intelligent Processing Technology(多谱信息智能处理技术国家重点实验室) School of Artificial Intelligence and Automation(人工智能与自动化学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文评估了Nano Banana Pro在14项低级视觉任务上的表现,发现其在主观视觉质量上优于专业模型,但在定量指标上表现欠佳,揭示了生成模型在保持像素一致性方面的挑战。

Comments Technical Report; 65 Pages, 36 Figures, 17 Tables; Poject Page: https://lowlevelbanana.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01816 2025-12-02 cs.CV cs.AI 70%

Envision: Benchmarking Unified Understanding & Generation for Causal World Process Insights

Envision:基于因果世界过程洞察的统一理解和生成基准测试

Juanxi Tian, Siyuan Li, Conghui He, Lijun Wu, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 Envision通过因果事件进程基准测试,评估统一模型在动态时空一致性上的表现,揭示其在因果叙事一致性上的优势及仍需改进的时空一致性挑战。

Comments 35 pages, 12 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20513 2025-11-26 cs.CV cs.AI cs.CL cs.HC 70%

DesignPref: Capturing Personal Preferences in Visual Design Generation

DesignPref: 在视觉设计生成中捕捉个人偏好

Yi-Hao Peng, Jeffrey P. Bigham, Jason Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Apple(苹果公司)

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 DesignPref通过引入包含20名专业设计师多级评分的12,000对UI设计比较数据集,研究个性化视觉设计评估,展示个性化模型在预测个体偏好上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13135 2025-11-19 cs.CV 70%

MedGEN-Bench: Contextually entangled benchmark for open-ended multimodal medical generation

Junjie Yang, Yuhao Yan, Gang Wu, Yuxuan Wang, Ruoyu Liang, Xinjie Jiang, Xiang Wan, Fenglei Fan, Yongquan Zhang, Feiwei Qin, Changmiao Wang

机构 * South China University of Technology(华南理工大学) Sun Yat-sen University(中山大学) Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University of Finance & Economics(浙江财经大学) National University of Singapore(新加坡国立大学) Shenzhen Research Institute of Big Data(深圳大数据研究院) City University of Hong Kong(香港城市大学)

专题命中 图像生成评测 :image generation(abstract);image editing(abstract);分类 cs.CV

Comments CVPR 2026 Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11434 2025-11-17 cs.CV 70%

WEAVE: Unleashing and Benchmarking the In-context Interleaved Comprehension and Generation

Wei Chow, Jiachun Pan, Yongyuan Liang, Mingze Zhou, Xue Song, Liyu Jia, Saining Zhang, Siliang Tang, Juncheng Li, Fengda Zhang, Weijia Wu, Hanwang Zhang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) University of Maryland, College Park(马里兰大学学院公园分校) Zhejiang University(浙江大学)

专题命中 图像生成评测 :image generation(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16754 2025-11-13 cs.CV cs.AI 70%

The Visual Counter Turing Test (VCT2): A Benchmark for Evaluating AI-Generated Image Detection and the Visual AI Index (VAI)

Nasrin Imanpour, Abhilekh Borah, Shashwat Bajpai, Subhankar Ghosh, Sainath Reddy Sankepally, Hasnat Md Abdullah, Nishoak Kosaraju, Shreyas Dixit, Ashhar Aziz, Shwetangshu Biswas, Vinija Jain, Aman Chadha, Song Wang, Amit Sheth, Amitava Das

机构 * University of South Carolina(南卡罗来纳大学) Manipal University Jaipur(贾伊普尔Manipal大学) BITS Pilani(比斯-皮尔尼大学) Xpectrum AI(Xpectrum人工智能) International Institute of Information Technology(国际信息科技研究所) Texas A&M University(德克萨斯农工大学) Carnegie Mellon University(卡内基梅隆大学) Vishwakarma Institute of Information Technology(维什瓦克arma信息科技研究所) IIIT Delhi(德里IIIT) National Institute of Technology, Silchar(锡拉char国家理工学院) Amazon AI(亚马逊人工智能) Stanford University(斯坦福大学) Amazon GenAI(亚马逊生成人工智能) Shenzhen University of Advanced Technology(深圳先进技术大学) BITS Pilani, Goa(果阿BITS Pilani大学)

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12335 2025-10-21 cs.CV cs.CR 70%

Is Artificial Intelligence Generated Image Detection a Solved Problem?

Ziqiang Li, Jiazhen Yan, Ziwen He, Kai Zeng, Weiwei Jiang, Lizhi Xiong, Zhangjie Fu

机构 * School of Computer Science, Nanjing University of Information Science and Technology(南京信息工程大学计算机学院) University of Siena(锡耶纳大学)

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08978 2025-10-13 cs.CV 70%

HandEval: Taking the First Step Towards Hand Quality Evaluation in Generated Images

Zichuan Wang, Bo Peng, Songlin Yang, Zhenchen Tang, Jing Dong

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07721 2025-10-10 cs.CV 70%

RePainter: Empowering E-commerce Object Removal via Spatial-matting Reinforcement Learning

Zipeng Guo, Lichen Ma, Xiaolong Fu, Gaojing Zhou, Lan Yang, Yuchen Zhou, Linkai Liu, Yu He, Ximan Liu, Shiping Dong, Jingling Fu, Zhen Chen, Yu Shi, Junshi Huang, Jason Li, Chao Gou

机构 * Sun Yat-sen University(中山大学) Beijing University of Chemical Technology(北京化工大学) Hunan University(湖南大学)

专题命中 图像生成评测 :diffusion(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07631 2025-10-10 cs.CV 70%

Rectified-CFG++ for Flow Based Models

Shreshth Saini, Shashank Gupta, Alan C. Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19568 2025-10-07 cs.CV cs.AI 70%

How Far are AI-generated Videos from Simulating the 3D Visual World: A Learned 3D Evaluation Approach

Chirui Chang, Jiahui Liu, Zhengzhe Liu, Xiaoyang Lyu, Yi-Hua Huang, Xin Tao, Pengfei Wan, Di Zhang, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Lingnan University(岭大)

专题命中 图像生成评测 :diffusion(abstract);inpainting(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23275 2025-09-26 cs.CV cs.AI 70%

Why Settle for One? Text-to-ImageSet Generation and Evaluation

Chengyou Jia, Xin Shen, Zhuohang Dang, Zhuohang Dang, Changliang Xia, Weijia Wu, Xinyu Zhang, Hangwei Qian, Ivor W. Tsang, Minnan Luo

机构 * Xi’an Jiaotong University(西安交通大学) National University of Singapore(新加坡国立大学) A*STAR(新加坡科技研究局)

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07050 2025-09-10 cs.CV cs.AI cs.CY 70%

Automated Evaluation of Gender Bias Across 13 Large Multimodal Models

Juan Manuel Contreras

机构 * Aymara

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03006 2025-09-04 cs.CV 70%

Enhancing Robustness in Post-Processing Watermarking: An Ensemble Attack Network Using CNNs and Transformers

Tzuhsuan Huang, Cheng Yu Yeo, Tsai-Ling Huang, Hong-Han Shuai, Wen-Huang Cheng, Jun-Cheng Chen

机构 * National Yang Ming Chiao Tung University(国家阳明交通大学) National Taiwan University(国立台湾大学)

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18633 2025-08-27 cs.CV cs.AI cs.LG 70%

ROSE: Remove Objects with Side Effects in Videos

Chenxuan Miao, Yutong Feng, Jianshu Zeng, Zixiang Gao, Hantang Liu, Yunfeng Yan, Donglian Qi, Xi Chen, Bin Wang, Hengshuang Zhao

机构 * Zhejiang University(浙江大学) KunByte AI Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 图像生成评测 :diffusion(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03789 2025-08-25 cs.CV 70%

HPSv3: Towards Wide-Spectrum Human Preference Score

Yuhang Ma, Yunhao Shui, Xiaoshi Wu, Keqiang Sun, Hongsheng Li

机构 * Mizzen AI CUHK MMLab(香港大学MMLab) King’s College London(伦敦国王学院) Shanghai Jiaotong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CPII, InnoHK(创新香港科技促进会)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14482 2025-08-19 cs.CV 70%

ICE-Bench: A Unified and Comprehensive Benchmark for Image Creating and Editing

Yulin Pan, Xiangteng He, Chaojie Mao, Zhen Han, Zeyinzi Jiang, Jingfeng Zhang, Yu Liu

专题命中 图像生成评测 :image generation(abstract);image editing(abstract);分类 cs.CV

Comments 17 pages. Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03328 2025-07-29 cs.CV cs.AI cs.NE 70%

Visual Enumeration Remains Challenging for Multimodal Generative AI

Alberto Testolin, Kuinan Hou, Marco Zorzi

机构 * Department of General Psychology and Department of Mathematics University of Padova(帕多瓦大学心理学系和数学系) Department of General Psychology University of Padova(帕多瓦大学心理学系) Department of General Psychology and Padova Neuroscience Center University of Padova(帕多瓦大学心理学系和帕多瓦神经科学中心) IRCSS San Camillo Hospital, Venice-Lido(威尼斯利多医院IRCSS桑卡莫医院)

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06137 2025-07-09 cs.CL cs.AI cs.CV 70%

NeoBabel: A Multilingual Open Tower for Visual Generation

Mohammad Mahdi Derakhshani, Dheeraj Varghese, Marzieh Fadaee, Cees G. M. Snoek

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 34 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23751 2025-07-01 cs.CV 70%

Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?

Annika Mütze, Sadia Ilyas, Christian Dörpelkus, Matthias Rottmann

机构 * University of Wuppertal(乌珀塔尔大学) Aptiv Services Deutschland GmbH(Aptiv Services 德国分公司)

专题命中 图像生成评测 :diffusion(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15435 2025-05-27 cs.CV 70%

What Makes a Scene ? Scene Graph-based Evaluation and Feedback for Controllable Generation

Zuyao Chen, Jinlin Wu, Zhen Lei, Chang Wen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) Institute of Automation, CAS(中国科学院自动化研究所)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06800 2025-04-10 cs.CV 70%

A Meaningful Perturbation Metric for Evaluating Explainability Methods

Danielle Cohen, Hila Chefer, Lior Wolf

专题命中 图像生成评测 :image generation(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03641 2025-04-08 cs.CV 70%

MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models

Wulin Xie, Yi-Fan Zhang, Chaoyou Fu, Yang Shi, Bingyan Nie, Hongkai Chen, Zhang Zhang, Liang Wang, Tieniu Tan

专题命中 图像生成评测 :image generation(abstract);image editing(abstract);分类 cs.CV

Comments Project page: https://mme-unify.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22658 2025-03-31 eess.IV cs.AI cs.CV cs.LG 70%

Evaluation of Machine-generated Biomedical Images via A Tally-based Similarity Measure

Frank J. Brooks, Rucha Deshpande

专题命中 图像生成评测 :image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments 13 pages. Manuscript under review at IEEE. Data available at https://doi.org/10.13012/B2IDB-2642688_V1

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21749 2025-03-28 cs.CV 70%

LeX-Art: Rethinking Text Generation via Scalable High-Quality Data Synthesis

Shitian Zhao, Qilong Wu, Xinyue Li, Bo Zhang, Ming Li, Qi Qin, Dongyang Liu, Kaipeng Zhang, Hongsheng Li, Yu Qiao, Peng Gao, Bin Fu, Zhen Li

专题命中 图像生成评测 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments Project page: https://zhaoshitian.github.io/lexart/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13730 2025-03-19 cs.CV cs.CL 70%

TextInVision: Text and Prompt Complexity Driven Visual Text Generation Benchmark

Forouzan Fallah, Maitreya Patel, Agneet Chatterjee, Vlad I. Morariu, Chitta Baral, Yezhou Yang

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01690 2025-02-05 cs.CV 70%

HuViDPO:Enhancing Video Generation through Direct Preference Optimization for Human-Centric Alignment

Lifan Jiang, Boxi Wu, Jiahui Zhang, Xiaotong Guan, Shuang Chen

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09668 2025-01-22 cs.CV 70%

EditBoard: Towards a Comprehensive Evaluation Benchmark for Text-Based Video Editing Models

Yupeng Chen, Penglin Chen, Xiaoyu Zhang, Yixian Huang, Qian Xie

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01034 2025-01-06 eess.IV cs.AI cs.CV cs.LG q-bio.QM 70%

Evaluation Metric for Quality Control and Generative Models in Histopathology Images

Pranav Jeevan, Neeraj Nixon, Abhijeet Patil, Amit Sethi

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments 7 pages, 5 figures. Accepted in ISBI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10429 2024-12-17 cs.CV cs.AI 70%

GPTDrawer: Enhancing Visual Synthesis through ChatGPT

Kun Li, Xinwei Chen, Tianyou Song, Hansong Zhang, Wenzhe Zhang, Qing Shan

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏