What makes a good metric? Evaluating automatic metrics for text-to-image consistency
专题命中 图像生成评测 :text-to-image(title,abstract)
Comments Accepted and presented at COLM 2024
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 图像生成评测 :text-to-image(title,abstract)
Comments Accepted and presented at COLM 2024
专题命中 图像生成评测 :image generation(title,abstract)
Journal ref PeerJ 12:e18059 (2024)
专题命中 图像生成评测 :image generation(title,abstract)
Comments 15 pages, 7 figures
专题命中 图像生成评测 :diffusion(title,abstract)
Comments Accepted at ACM MM 2024
专题命中 图像生成评测 :diffusion(title,abstract)
专题命中 图像生成评测 :diffusion(title,abstract)
Comments Accepted by ICASSP2023
专题命中 图像生成评测 :diffusion(title,abstract)
Comments 7 pages, 3 figures
专题命中 图像生成评测 :image generation(title,abstract)
ExpertVerse:知识密集型视觉合成中专家级推理的通用基准
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV
AI总结 研究针对多模态生成模型在知识密集型生成的不足,开发ExpertVerse基准,涵盖多种认知能力和专家学科,生成相关数据集,训练KnowThinker并提出BPPO优化方法,揭示模型推理缺陷,强调知识密集型基准对下一代视觉生成的重要性。
Comments 14 pages, 6 figures
ZIPP:基于人物画像的零样本图像个性化生成
机构 * Adobe Media and Data Science Research (MDSR)(Adobe媒体与数据科学研究(MDSR)) ; IIIT-Delhi(德里印度理工学院) ; SUNY at Buffalo(纽约州立大学布法罗分校)
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 提出ZIPP方法,利用自然语言人物画像通过LLM改写提示词实现零样本图像个性化生成,无需用户数据或微调;引入ZIPBench基准,在多个评测中取得13-20%的提升。
Flow-OPD:面向流匹配模型的在线策略蒸馏
机构 * University of Science and Technology of China(中国科学技术大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; The Chinese University of Hong Kong(香港中文大学) ; Xiaohongshu Inc.(小红书公司)
专题命中 图像生成评测 :diffusion(abstract,abstract_cn);text-to-image(abstract);分类 cs.CV
AI总结 提出Flow-OPD框架,通过两阶段对齐策略(单奖励GRPO微调专家+流式冷启动与在线策略蒸馏)解决流匹配模型在多任务对齐中的奖励稀疏和梯度干扰问题,并引入流形锚点正则化抑制美学退化,在GenEval和OCR指标上显著提升。
Comments Project Page: https://costaliya.github.io/Flow-OPD/ , Code: https://github.com/CostaliyA/Flow-OPD
VersaVogue: 视觉专家协作与偏好对齐的统一时尚合成
机构 * Nanjing University of Science and Technology(南京理工大学) ; National University of Singapore(新加坡国立大学) ; Nanjing University(南京大学) ; Nanjing Forestry University(南京林业大学)
专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 本文提出VersaVogue框架,通过 trait-routing attention 模块和自动化多视角偏好优化管道,实现多条件可控的时尚合成,提升视觉真实性和可控性。
BalancedDPO:适应性多指标对齐
机构 * Purdue University(普渡大学) ; University of Maryland(马里兰大学) ; Indian Institute of Technology Bombay(印度理工学院孟买分校) ; University of Central Florida(中佛罗里达大学)
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 BalancedDPO通过多指标共识和动态参考模型更新,在DPO框架中实现多指标偏好对齐,提升模型在不同评估标准下的稳定性与性能。
Comments Transactions on Machine Learning Research, Apr 2026
Journal ref Transactions on Machine Learning Research, Apr 2026
MapReduce LoRA:在生成模型多偏好优化中推进帕累托前沿
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出MapReduce LoRA和RaTE方法,通过并行训练偏好特定的LoRA专家和学习奖励特定的token嵌入,提升生成模型在多偏好优化中的性能,实验显示在文本到图像、文本到视频及语言任务中均取得显著改进。
Comments CVPR 2026; Code: https://github.com/SHI-Labs/MapReduce-LoRA
机构 * Wangxuan Institute of Computer Technology(计算机技术研究所)
专题命中 图像生成评测 :text-to-image(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV
机构 * Siebel School of Computing and Data Science(计算与数据科学学院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Fractal AI Research(Fractal AI研究院)
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
机构 * Mila, University of Montreal(蒙特利尔大学Mila) ; McGill University(麦吉尔大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Toronto(多伦多大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Southwestern University of Finance and Economics(西南财经大学)
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
Comments Accepted as a main conference paper at EMNLP 2025
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV
Comments 9 pages,7 figures
Journal ref NeurIPS 2024
专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
Comments 9 pages, 8 figures, Accepted by ACMMM 2024
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
Comments Accepted by ECCV 2024
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
Comments Preprint; Project Page: https://danielchyeh.github.io/Gen4Gen/
用于视觉生成的摊销矩匹配
机构 * MMLab, CUHK(香港中文大学MMLab) ; Kling Team, Kuaishou Technology(快手科技影幻团队)
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract)
AI总结 该研究提出摊销矩匹配方法,构建AMFD损失,用于视觉生成,在ImageNet、GenEval等基准上性能优于FD基线及FLUX.2 4B模型,实现高效高维数据生成。
Comments 30 pages, 11 figures
DriveReward:面向自动驾驶的综合数据集与生成式视觉语言奖励模型
机构 * Tsinghua University(清华大学) ; Xiaomi EV(小米汽车)
专题命中 图像生成评测 :generative vision(title);分类 cs.CV
AI总结 提出DriveReward数据集和专用视觉语言奖励模型,通过反事实标注和时序视觉引导,解决自动驾驶中奖励获取的泛化问题,在强化学习和轨迹选择中取得与基于规则方法相当的性能。
CoRPA: 基于概念向量扰动和生成模型的胸部X光图像对抗生成
机构 * School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) ; NHS Lothian(NHS洛锡安)
专题命中 图像生成评测 :image generation(title);分类 cs.CV
AI总结 本文提出CoRPA,一种针对医学影像领域的临床聚焦对抗攻击框架,通过概念向量扰动生成对抗性影像报告和图像,揭示医疗AI在真实临床场景下的脆弱性。
具有物理信息的模拟框架用于真实声纳图像生成和统计验证
机构 * Department of Computational Intelligence, SRM Institute of Science
专题命中 图像生成评测 :image generation(title);分类 cs.CV
AI总结 本文提出了一种基于物理的模拟框架ACOUSIM,用于生成真实声纳图像并进行统计验证,通过比较合成与真实声纳图像的统计特性,建立了可重复的分布级基准。
Contrast-X:一个多模态对比图像合成基准及通用模态流匹配
机构 * University of Cambridge(剑桥大学) ; MD Anderson Cancer Center(MD安德森癌症中心) ; University of Dundee(邓迪大学)
专题命中 图像生成评测 :image synthesis(title);分类 cs.CV
AI总结 Contrast-X通过多器官CT和乳腺DCE-MRI数据,提出FlowMI模型解决多模态缺失问题,评估合成图像质量及跨器官泛化能力。
MACRO:通过结构化长上下文数据推进多参考图像生成
机构 * HKU MMLab(香港大学多媒体实验室) ; Meituan(美团)
专题命中 图像生成评测 :image generation(title);分类 cs.CV
AI总结 本文提出MACRO数据集和基准,解决多参考图像生成中参考数量增加导致性能下降的问题,通过结构化长上下文数据提升生成质量。
Comments Project Page: https://macro400k.github.io/
从图像生成到基础设施设计:一种多智能体管道用于街道设计生成
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Stony Brook University(石溪大学) ; University of Florida(佛罗里达大学) ; University of Maryland(马里兰大学)
专题命中 图像生成评测 :image generation(title);分类 cs.CV
AI总结 本文提出一种多智能体系统,直接在真实街道视图上编辑和重新设计自行车设施,整合车道定位、提示优化、设计生成和自动评估,生成符合情境的街道设计。
Comments 25 pages, 8 figures
利用生成对抗网络合成黑色素瘤图像及其评估
机构 * Department of Engineering Technology, University of Houston(休斯顿大学工程技术系) ; Department of Electrical and Computer Engineering, University of Houston(休斯顿大学电气与计算机工程系) ; Department of Information Science Technology, University of Houston(休斯顿大学信息科学与技术系) ; School of Computing, Clemson University(克莱姆斯大学计算学院) ; Department of Public Health, Texas Tech University(德克萨斯技术大学公共卫生系) ; Department of Dermatology and Pathology, Texas Tech University(德克萨斯技术大学皮肤科与病理学系) ; Department of Dermatology, University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心皮肤科) ; Department of Biomedical Engineering, University of Houston(休斯顿大学生物医学工程系)
专题命中 图像生成评测 :image generation(title);分类 cs.CV
AI总结 本文通过比较四种GAN架构,生成高分辨率黑色素瘤图像,发现StyleGAN2在定量性能和感知质量上表现最佳,且能有效缓解黑色素瘤数据集中的类别不平衡问题。
Comments 18 pages, 7 figures. already accepted to MDPI bioengineering
Journal ref Bioengineering 2026, 13, 245