arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1204 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1204 篇

2412.13989 2024-12-19 cs.CL 78%

What makes a good metric? Evaluating automatic metrics for text-to-image consistency

Candace Ross, Melissa Hall, Adriana Romero Soriano, Adina Williams

专题命中 图像生成评测 :text-to-image(title,abstract)

Comments Accepted and presented at COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11867 2024-10-25 q-bio.NC 78%

A psychophysical evaluation of techniques for Mooney image generation

Lars C. Reining, Thomas S. A. Wallis

专题命中 图像生成评测 :image generation(title,abstract)

Journal ref PeerJ 12:e18059 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00105 2024-09-05 cs.CL cs.AI cs.LG 78%

Negation Blindness in Large Language Models: Unveiling the NO Syndrome in Image Generation

Mohammad Nadeem, Shahab Saquib Sohail, Erik Cambria, Björn W. Schuller, Amir Hussain

专题命中 图像生成评测 :image generation(title,abstract)

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09956 2024-07-18 cs.SD cs.AI cs.CL eess.AS 78%

Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization

Navonil Majumder, Chia-Yu Hung, Deepanway Ghosal, Wei-Ning Hsu, Rada Mihalcea, Soujanya Poria

专题命中 图像生成评测 :diffusion(title,abstract)

Comments Accepted at ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03560 2024-06-07 physics.med-ph 78%

Anatomy-based quality metric of diffusion-weighted MRI data for accurate derivation of muscle fiber orientation

Nadya Shusharina, Xiaofeng Liu, Evangelia Kaza, Miranda Lam, Stephan Maier, Jonghye Woo

专题命中 图像生成评测 :diffusion(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.11989 2023-02-24 cs.SD cs.CL eess.AS 78%

Metric-oriented Speech Enhancement using Diffusion Probabilistic Model

Chen Chen, Yuchen Hu, Weiwei Weng, Eng Siong Chng

专题命中 图像生成评测 :diffusion(title,abstract)

Comments Accepted by ICASSP2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.06816 2020-12-15 cs.SI cs.NI 78%

Evaluation and Comparison of Diffusion Models with Motif Features

Fangqi Li

专题命中 图像生成评测 :diffusion(title,abstract)

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.00271 2020-07-23 stat.ML cs.LG 78%

Generative Modeling by Inclusive Neural Random Fields with Applications in Image Generation and Anomaly Detection

Yunfu Song, Zhijian Ou

专题命中 图像生成评测 :image generation(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19341 2026-08-11 cs.CV 版本更新 77%

ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis

ExpertVerse:知识密集型视觉合成中专家级推理的通用基准

Yuan Wang, Yongchao Du, Mengting Chen, Jinsong Lan, Jiaxuan Luo, Xuetao Feng, Xiaoyong Zhu

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 研究针对多模态生成模型在知识密集型生成的不足,开发ExpertVerse基准,涵盖多种认知能力和专家学科,生成相关数据集,训练KnowThinker并提出BPPO优化方法,揭示模型推理缺陷,强调知识密集型基准对下一代视觉生成的重要性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08841 2026-06-09 cs.AI cs.CV 新提交 77%

ZIPP:Zero-shot Image Personalization from Personas

ZIPP:基于人物画像的零样本图像个性化生成

Harini SI, Somesh Singh, Yaman Kumar Singla, David Doermann, Rajiv Ratn Shah

机构 * Adobe Media and Data Science Research (MDSR)(Adobe媒体与数据科学研究(MDSR)) IIIT-Delhi(德里印度理工学院) SUNY at Buffalo(纽约州立大学布法罗分校)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出ZIPP方法,利用自然语言人物画像通过LLM改写提示词实现零样本图像个性化生成,无需用户数据或微调;引入ZIPBench基准,在多个评测中取得13-20%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08063 2026-05-26 cs.CV cs.AI 77%

Flow-OPD: On-Policy Distillation for Flow Matching Models

Flow-OPD:面向流匹配模型的在线策略蒸馏

Zhen Fang, Wenxuan Huang, Yu Zeng, Yiming Zhao, Shuang Chen, Kaituo Feng, Yunlong Lin, Lin Chen, Zehui Chen, Shaosheng Cao, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) University of California, Los Angeles(加州大学洛杉矶分校) The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司)

专题命中 图像生成评测 :diffusion(abstract,abstract_cn);text-to-image(abstract);分类 cs.CV

AI总结 提出Flow-OPD框架,通过两阶段对齐策略(单奖励GRPO微调专家+流式冷启动与在线策略蒸馏)解决流匹配模型在多任务对齐中的奖励稀疏和梯度干扰问题,并引入流形锚点正则化抑制美学退化,在GenEval和OCR指标上显著提升。

Comments Project Page: https://costaliya.github.io/Flow-OPD/ , Code: https://github.com/CostaliyA/Flow-OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07210 2026-04-09 cs.CV 77%

VersaVogue: Visual Expert Orchestration and Preference Alignment for Unified Fashion Synthesis

VersaVogue: 视觉专家协作与偏好对齐的统一时尚合成

Jian Yu, Fei Shen, Cong Wang, Yi Xin, Si Shen, Xiaoyu Du, Jinhui Tang

机构 * Nanjing University of Science and Technology(南京理工大学) National University of Singapore(新加坡国立大学) Nanjing University(南京大学) Nanjing Forestry University(南京林业大学)

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出VersaVogue框架,通过 trait-routing attention 模块和自动化多视角偏好优化管道,实现多条件可控的时尚合成,提升视觉真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12575 2026-04-07 cs.CV cs.AI 77%

BalancedDPO: Adaptive Multi-Metric Alignment

BalancedDPO:适应性多指标对齐

Dipesh Tamboli, Souradip Chakraborty, Aditya Malusare, Biplab Banerjee, Amrit Singh Bedi, Vaneet Aggarwal

机构 * Purdue University(普渡大学) University of Maryland(马里兰大学) Indian Institute of Technology Bombay(印度理工学院孟买分校) University of Central Florida(中佛罗里达大学)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 BalancedDPO通过多指标共识和动态参考模型更新,在DPO框架中实现多指标偏好对齐,提升模型在不同评估标准下的稳定性与性能。

Comments Transactions on Machine Learning Research, Apr 2026

Journal ref Transactions on Machine Learning Research, Apr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20629 2026-03-17 cs.CV cs.AI cs.LG 77%

MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Models

MapReduce LoRA:在生成模型多偏好优化中推进帕累托前沿

Chieh-Yun Chen, Zhonghao Wang, Qi Chen, Zhifan Ye, Min Shi, Yue Zhao, Yinan Zhao, Hui Qu, Wei-An Lin, Yiru Shen, Ajinkya Kale, Irfan Essa, Humphrey Shi

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出MapReduce LoRA和RaTE方法,通过并行训练偏好特定的LoRA专家和学习奖励特定的token嵌入,提升生成模型在多偏好优化中的性能,实验显示在文本到图像、文本到视频及语言任务中均取得显著改进。

Comments CVPR 2026; Code: https://github.com/SHI-Labs/MapReduce-LoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23023 2025-10-28 cs.CV cs.CL 77%

UniAIDet: A Unified and Universal Benchmark for AI-Generated Image Content Detection and Localization

Huixuan Zhang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology(计算机技术研究所)

专题命中 图像生成评测 :text-to-image(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04712 2025-10-07 cs.CV cs.LG 77%

SEE-DPO: Self Entropy Enhanced Direct Preference Optimization

Shivanshu Shekhar, Shreyas Singh, Tong Zhang

机构 * Siebel School of Computing and Data Science(计算与数据科学学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Fractal AI Research(Fractal AI研究院)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18985 2025-09-16 cs.LG cs.CL cs.CV 77%

STRICT: Stress Test of Rendering Images Containing Text

Tianyu Zhang, Xinyu Wang, Lu Li, Zhenghan Tai, Jijun Chi, Jingrui Tian, Hailin He, Suyuchen Wang

机构 * Mila, University of Montreal(蒙特利尔大学Mila) McGill University(麦吉尔大学) University of Pennsylvania(宾夕法尼亚大学) University of Toronto(多伦多大学) University of California, Los Angeles(加州大学洛杉矶分校) Southwestern University of Finance and Economics(西南财经大学)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted as a main conference paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04485 2024-11-12 cs.AI cs.CV 77%

GenAI Arena: An Open Evaluation Platform for Generative Models

Dongfu Jiang, Max Ku, Tianle Li, Yuansheng Ni, Shizhuo Sun, Rongqi Fan, Wenhu Chen

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

Comments 9 pages,7 figures

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01545 2024-11-05 cs.CV 77%

Towards Small Object Editing: A Benchmark Dataset and A Training-Free Approach

Qihe Pan, Zhen Zhao, Zicheng Wang, Sifan Long, Yiming Wu, Wei Ji, Haoran Liang, Ronghua Liang

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

Comments 9 pages, 8 figures, Accepted by ACMMM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11904 2024-10-16 cs.CV cs.AI 77%

Finding the Subjective Truth: Collecting 2 Million Votes for Comprehensive Gen-AI Model Evaluation

Dimitrios Christodoulou, Mads Kuhlmann-Jørgensen

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12579 2024-07-18 cs.CV cs.AI 77%

The Fabrication of Reality and Fantasy: Scene Generation with LLM-Assisted Prompt Interpretation

Yi Yao, Chan-Feng Hsu, Jhe-Hao Lin, Hongxia Xie, Terence Lin, Yi-Ning Huang, Hong-Han Shuai, Wen-Huang Cheng

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15504 2024-02-26 cs.CV cs.AI 77%

Gen4Gen: Generative Data Pipeline for Generative Multi-Concept Composition

Chun-Hsiao Yeh, Ta-Ying Cheng, He-Yen Hsieh, Chuan-En Lin, Yi Ma, Andrew Markham, Niki Trigoni, H. T. Kung, Yubei Chen

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Preprint; Project Page: https://danielchyeh.github.io/Gen4Gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26860 2026-07-30 cs.LG 新提交 75%

Amortized Moment Matching for Visual Generation

用于视觉生成的摊销矩匹配

Wenze Liu, Xintao Wang, Pengfei Wan, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手科技影幻团队)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 该研究提出摊销矩匹配方法,构建AMFD损失,用于视觉生成,在ImageNet、GenEval等基准上性能优于FD基线及FLUX.2 4B模型,实现高效高维数据生成。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08525 2026-06-16 cs.CV 新提交 74%

DriveReward: A Comprehensive Dataset and Generative Vision-Language Reward Model for Autonomous Driving

DriveReward:面向自动驾驶的综合数据集与生成式视觉语言奖励模型

Qimao Chen, Fang Li, Yuechen Luo, Zehan Zhang, Haiyang Sun, Fangzhen Li, Bing Wang, Guang Chen, Yang Ji, Jiong Deng, Hongwei Xie, Hangjun Ye, Long Chen, Yi Zhang

机构 * Tsinghua University(清华大学) Xiaomi EV(小米汽车)

专题命中 图像生成评测 :generative vision(title);分类 cs.CV

AI总结 提出DriveReward数据集和专用视觉语言奖励模型,通过反事实标注和时序视觉引导,解决自动驾驶中奖励获取的泛化问题,在强化学习和轨迹选择中取得与基于规则方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05214 2026-06-16 eess.IV cs.AI cs.CV 74%

CoRPA: Adversarial Image Generation for Chest X-rays Using Concept Vector Perturbations and Generative Models

CoRPA: 基于概念向量扰动和生成模型的胸部X光图像对抗生成

Amy Rafferty, Rishi Ramaesh, Ajitha Rajan

机构 * School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) NHS Lothian(NHS洛锡安)

专题命中 图像生成评测 :image generation(title);分类 cs.CV

AI总结 本文提出CoRPA,一种针对医学影像领域的临床聚焦对抗攻击框架,通过概念向量扰动生成对抗性影像报告和图像,揭示医疗AI在真实临床场景下的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19712 2026-05-20 cs.CV 74%

Physics-informed simulation framework for realistic sonar image generation and statistical validation

具有物理信息的模拟框架用于真实声纳图像生成和统计验证

Kamal Basha S, Athira Nambiar

机构 * Department of Computational Intelligence, SRM Institute of Science

专题命中 图像生成评测 :image generation(title);分类 cs.CV

AI总结 本文提出了一种基于物理的模拟框架ACOUSIM,用于生成真实声纳图像并进行统计验证,通过比较合成与真实声纳图像的统计特性,建立了可重复的分布级基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15884 2026-05-11 cs.CV 74%

Contrast-X: A Multi-Modal Contrast Image Synthesis Benchmark and Universal Modality Flow Matching

Contrast-X:一个多模态对比图像合成基准及通用模态流匹配

Yifan Chen, Fei Yin, Hao Chen, Jia Wu, Chao Li

机构 * University of Cambridge(剑桥大学) MD Anderson Cancer Center(MD安德森癌症中心) University of Dundee(邓迪大学)

专题命中 图像生成评测 :image synthesis(title);分类 cs.CV

AI总结 Contrast-X通过多器官CT和乳腺DCE-MRI数据,提出FlowMI模型解决多模态缺失问题,评估合成图像质量及跨器官泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25319 2026-03-27 cs.CV 74%

MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context Data

MACRO:通过结构化长上下文数据推进多参考图像生成

Zhekai Chen, Yuqing Wang, Manyuan Zhang, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) Meituan(美团)

专题命中 图像生成评测 :image generation(title);分类 cs.CV

AI总结 本文提出MACRO数据集和基准,解决多参考图像生成中参考数量增加导致性能下降的问题,通过结构化长上下文数据提升生成质量。

Comments Project Page: https://macro400k.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05469 2026-03-18 cs.AI cs.CV cs.CY cs.HC 74%

From Image Generation to Infrastructure Design: a Multi-agent Pipeline for Street Design Generation

从图像生成到基础设施设计:一种多智能体管道用于街道设计生成

Chenguang Wang, Xiang Yan, Yilong Dai, Ziyi Wang, Susu Xu

机构 * Johns Hopkins University(约翰霍普金斯大学) Stony Brook University(石溪大学) University of Florida(佛罗里达大学) University of Maryland(马里兰大学)

专题命中 图像生成评测 :image generation(title);分类 cs.CV

AI总结 本文提出一种多智能体系统,直接在真实街道视图上编辑和重新设计自行车设施,整合车道定位、提示优化、设计生成和自动评估,生成符合情境的街道设计。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13497 2026-03-17 cs.CV cs.LG 74%

Synthetic Melanoma Image Generation and Evaluation Using Generative Adversarial Networks

利用生成对抗网络合成黑色素瘤图像及其评估

Pei-Yu Lin, Yidan Shen, Neville Mathew, Renjie Hu, Siyu Huang, Courtney M. Queen, Cameron E. West, Ana Ciurea, George Zouridakis

机构 * Department of Engineering Technology, University of Houston(休斯顿大学工程技术系) Department of Electrical and Computer Engineering, University of Houston(休斯顿大学电气与计算机工程系) Department of Information Science Technology, University of Houston(休斯顿大学信息科学与技术系) School of Computing, Clemson University(克莱姆斯大学计算学院) Department of Public Health, Texas Tech University(德克萨斯技术大学公共卫生系) Department of Dermatology and Pathology, Texas Tech University(德克萨斯技术大学皮肤科与病理学系) Department of Dermatology, University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心皮肤科) Department of Biomedical Engineering, University of Houston(休斯顿大学生物医学工程系)

专题命中 图像生成评测 :image generation(title);分类 cs.CV

AI总结 本文通过比较四种GAN架构,生成高分辨率黑色素瘤图像,发现StyleGAN2在定量性能和感知质量上表现最佳,且能有效缓解黑色素瘤数据集中的类别不平衡问题。

Comments 18 pages, 7 figures. already accepted to MDPI bioengineering

Journal ref Bioengineering 2026, 13, 245

详情

展开后加载摘要…

URL PDF HTML 收藏