Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis
专题命中 图像生成评测 :text-to-image(title,abstract);image synthesis(title);分类 cs.CV
Comments Revision
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 图像生成评测 :text-to-image(title,abstract);image synthesis(title);分类 cs.CV
Comments Revision
专题命中 图像生成评测 :image generation(title);text-to-image(title);diffusion(abstract);分类 cs.CV
Comments Submitted to NeurIPS 2022 Machine Learning for Creativity and Design Workshop
基于偏好的提示优化用于文本到图像生成
专题命中 图像生成评测 :image generation(title,abstract);text-to-image(title)
AI总结 APPO通过用户偏好反馈实现高效提示优化,减少迭代次数和认知负担,提升人机协作生成任务的效果。
PIPBench:用于个性化图像生成评估的包含个人资料的框架
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; Shanghai Qi Zhi Institute(上海启智研究院)
专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV
AI总结 研究个性化图像生成问题,引入PIPBench基准及新数据构建管道,利用心理和人口统计学资料维度收集数据,全面评估代表性方法,揭示现有方法局限,为个性化文本到图像合成带来新挑战与机遇。
CogCanvas: 用于评估多主体参考图像生成的基准
机构 * University of Science, Ho Chi Minh City, Vietnam(胡志明市理科大学) ; University of Dayton, Ohio, United States(代顿大学) ; Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学胡志明市分校)
专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 提出CogCanvas基准,包含1952张参考图像和1361个组合提示,评估多身份、对象绑定和背景场景的生成,引入BG-Sim和Attr-VQA指标,发现现有模型在超过3个主体时性能严重下降。
Nucleus-Image:稀疏MoE用于图像生成
机构 * Nucleus AI Team(Nucleus AI 团队)
专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 Nucleus-Image通过稀疏MoE架构在质量与效率上实现新的帕累托前沿,仅使用约2B参数即可达到领先模型性能,无需后训练优化。
MMMG:大规模、跨学科、多层级的文本到图像推理生成基准
专题命中 图像生成评测 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出MMMG基准,用于评估文本到图像生成模型的推理能力,揭示现有模型在知识图像生成中的不足,并发布FLUX-Reason作为开放基线。
Comments 85 pages, 70 figures, code: https://github.com/MMMGBench/MMMG, project page: https://mmmgbench.github.io/
Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025) Datasets and Benchmarks Track
PrefGen: 多模态偏好学习用于偏好条件下的图像生成
机构 * Rutgers University(罗格斯大学) ; iN2X ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) ; Red Hat AI Innovation(红帽人工智能创新)
专题命中 图像生成评测 :image generation(title,abstract);diffusion(abstract);personalized generation(abstract);分类 cs.CV
AI总结 PrefGen通过多模态大语言模型提取用户偏好并注入扩散模型,实现个性化图像生成,优于现有方法。
Comments Project Page: \href{https://prefgen.github.io/}{\texttt{https://prefgen.github.io}}
机构 * Wangxuan Institute of Computer Technology, Peking University(计算机技术研究所,北京大学)
专题命中 图像生成评测 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Innovation Institute(上海创新研究院) ; Nankai University(南开大学) ; Wuhan University(武汉大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 图像生成评测 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
机构 * Peking University(北京大学) ; Shenzhen Graduate School(深圳研究生院) ; Sun Yat-sen University(中山大学) ; Rabbitpre AI ; Shanghai AI Laboratory(上海人工智能实验室) ; Shenzhen University(深圳大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))
专题命中 图像生成评测 :image generation(title,abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV
Comments Accepted to CVPR 2025 as a highlight paper
专题命中 图像生成评测 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV
Comments CVPR 2025. Project Page: https://rockeycoss.github.io/spo.github.io/
专题命中 图像生成评测 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV
Comments Accepted at CVPR 2025
专题命中 图像生成评测 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV
Comments NeurIPS 2024 Dataset & Benchmark Track
专题命中 图像生成评测 :text-to-image(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV
Comments Accepted to ICCV 2023
专题命中 图像生成评测 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV
Comments NeurIPS 2022 Workshop on Human Evaluation of Generative Models (HEGM)
专题命中 图像生成评测 :image generation(title);text-to-image(title);分类 cs.CV
机构 * University of Pittsburgh(匹兹堡大学)
专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR
专题命中 图像生成评测 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR
Diffusion-SDPO:用于扩散模型的受保护直接偏好优化
机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) ; National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) ; Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)
专题命中 图像生成评测 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 Diffusion-SDPO通过保护性更新规则提升扩散模型对人类偏好的对齐效果。
Comments The code is publicly available at https://github.com/AIDC-AI/Diffusion-SDPO
专题命中 图像生成评测 :image generation(abstract,comments);text-to-image(abstract,comments);image editing(abstract,comments);diffusion(abstract)
Comments An unified model for multimodal understanding, text-to-image generation, and image editing. GitHub: https://github.com/AIDC-AI/Ovis-U1
WeGenBench:面向文本到图像模型优化的多维诊断基准
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Dalian University of Technology(大连理工大学) ; Weixin, Tencent(腾讯微信)
专题命中 图像生成评测 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV
AI总结 提出WeGenBench基准,包含4000个中英双语提示,通过场景分类和多维标签实现跨维度评估,并设计基于视觉语言模型的新颖指标,精准定位模型在特定生成类别中的缺陷。
MULTI: 解构相机镜头、传感器、视角和领域以实现新图像生成
机构 * Bosch Research(博世研究) ; ETH Zürich(苏黎世联邦理工学院) ; University of Siegen(锡根大学)
专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 MULTI通过文本逆向学习解构图像生成中的多因素,提升对特定风格和对象的控制能力,并通过DF-RICO基准验证其有效性。
Comments Accepted at ICPR 2026
MAR-MAER:具有度量意识和模糊适应性的自回归图像生成
机构 * Lanzhou Vocational Technical College(兰州职业技术学院)
专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 MAR-MAER通过引入度量意识嵌入正则化和概率潜在模型,提升自回归图像生成的质量和语义灵活性,实验表明其在CLIPScore和HPSv2指标上优于基线模型。
Comments Accepted by AMME 2025
TechImage-Bench: 基于评分标准的技术图像生成评估
机构 * Hong Kong Polytechnic University(香港理工大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Microsoft Project Website(微软项目网站)
专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出TechImage-Bench,通过评分标准评估技术图像生成,发现现有模型在科学准确性上存在显著差距,并展示评分标准对改进图像生成的监督作用。
通过方向解耦对齐缓解偏好模式崩溃在扩散强化学习中
机构 * Tsinghua University(清华大学) ; AMAP, Alibaba Group(阿里云实验室,阿里巴巴集团)
专题命中 图像生成评测 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出D²-Align框架,通过方向解耦对齐缓解扩散强化学习中的偏好模式崩溃,提升生成多样性。
Comments Accepted by CVPR 2026
通过奖励建模增强图像生成中的空间理解
机构 * Peking University(北京大学) ; ByteDance Seed(字节跳动种子)
专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出SpatialScore奖励模型,通过增强空间理解能力提升图像生成的质量和效果。
Comments Accepted at CVPR 2026. Github: https://github.com/DAGroup-PKU/SpatialT2I Project website: https://dagroup-pku.github.io/SpatialT2I/
DiffusionAgent: 专家模型导航用于代理图像生成
机构 * Meituan(美团) ; ByteDance(字节跳动) ; Nanjing University(南京大学)
专题命中 图像生成评测 :image generation(title);diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 DiffusionAgent通过统一代理框架实现多领域图像生成,结合树状思维导航和优势数据库提升生成质量与泛化能力。
重新思考扩散模型中的直接偏好优化
专题命中 图像生成评测 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出了一种改进扩散模型偏好优化的方法,通过稳定参考模型更新和时间步感知训练策略,提升模型在人类偏好评估中的性能。
Comments Accepted by SPIGM@NeurIPS 2025 and AAAI-26 (Oral)