FaceScore: Benchmarking and Enhancing Face Quality in Human Generation
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);inpainting(abstract)
Comments Under review
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);inpainting(abstract)
Comments Under review
专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);image editing(abstract);inpainting(abstract)
Comments Accepted at The First Workshop on the Evaluation of Generative Foundation Models (EvGENFM) at CVPR 2024
AI能绘制科学吗?评估文本到图像和多模态模型生成科学图形的基准
专题命中 图像生成评测 :text-to-image(title,abstract);分类 cs.CV、cs.GR
AI总结 提出SciDraw-Bench基准,通过32个结构化任务和四维评估协议(文本保真度、语义正确性、结构质量、惯例遵循),评估文本到图像模型生成科学图形的能力。
从‘是什么’到‘如何做’:用于自回归图像生成的约束推理
机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) ; Baidu Inc.(百度公司)
专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出CoR-Painter框架,通过约束推理引导自回归图像生成,解决空间结构模糊问题,提升生成图像的准确性和质量。
一个尺寸,多种适配:在大规模广告图像生成中对多样化群体点击偏好进行对齐
机构 * NLPR & MAIS, CASIA(中国科学院长春光学精密机械与物理研究所 & 中国科学院自动化所) ; School of AI, UCAS(中国科学院大学人工智能学院) ; HKUST(gz)(香港科技大学) ; PRLab, NJU(南京大学PRLab)
专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出OSMF框架,通过自适应分组和群组感知多模态模型,解决广告图像生成中用户群体点击偏好多样性的优化问题。
机构 * Institute of Image Communication and Network Engineering, Shanghai JiaoTong University(上海交通大学图像通信与网络工程研究所) ; University of Electronic and Science Technology of China(电子科技大学) ; Nanyang Technological University(南洋理工大学)
专题命中 图像生成评测 :image editing(title,abstract);分类 cs.CV、cs.MM
专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV、cs.GR
Comments Accepted to WWW 2025
开放手术中机器人辅助的模仿学习:针对缝合跟随的多策略评估
机构 * Harvard Medical School(哈佛医学院) ; Massachusetts General Hospital(麻省总医院)
专题命中 图像生成评测 :diffusion(summary_cn,abstract)
AI总结 本研究首次评估通用模仿学习在开放手术中用于外科医生-机器人协作辅助的可行性,以缝合跟随(每次缝合时助手执行的抓取-拉动-释放动作)为任务,通过比较四种策略(ACT、Diffusion Policy、SmolVLA、π₀)在28个训练模型上的表现,发现π₀在数据效率、背景鲁棒性和轨迹平滑性上最优,并在机器人缝合试验中达到92%的缝合完成率。
MIBE:面向个性化图像生成的多主体交互基准与评估器
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; University of Southern California(南加州大学) ; DeerLab LLC(DeerLab有限责任公司) ; Carnegie Mellon University(卡内基梅隆大学) ; Clemson University(克莱姆森大学) ; Google(谷歌) ; San Jose State University(圣何塞州立大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV
AI总结 提出MIBE框架,包含多主体交互基准(MIB)和评估器(MIE),通过解耦数据体制和双头排序诊断目标,解决多主体个性化图像生成中主体遗漏、外观失配和交互错误问题,在黄金集上达到0.922成对准确率。
VTEdit-Bench:多参考图像编辑模型在虚拟试穿中的综合基准
专题命中 图像生成评测 :image editing(title,abstract);分类 cs.CV
AI总结 本文提出VTEdit-Bench基准,用于评估多参考图像编辑模型在虚拟试穿中的性能,包含24220对测试图像,涵盖五个代表性任务,通过VTEdit-QA评估模型一致性、布料一致性和图像质量。
Comments Accepted by ECCV 2026
ScalingAR: 自回归图像生成的置信度缩放
专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV
AI总结 提出ScalingAR框架,通过令牌熵作为置信度信号,在轮廓级和策略级进行自适应轨迹剪枝和动态引导调度,无需早期解码或外部奖励,显著提升自回归图像生成性能。
Comments ICML 2026; Code: https://github.com/EnVision-Research/ScalingAR
面向受限数据图像生成与增强的以对象为中心的数据集资源
机构 * The University of Queensland(昆士兰大学) ; Swinburne University of Technology(斯威本科技大学)
专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV
AI总结 针对少样本场景下的对象中心图像生成,提出三个标准化数据集资源(Cityscapes-Pedestrian、TrafficSigns、COCO PottedPlant),提供256×256裁剪、边界框标注及重建脚本,支持受控比较与评估。
Comments 5 pages including references, 2 figures, 2 tables. Dataset and related files at https://github.com/Latzi/object-centric-low-data-datasets and https://doi.org/10.5281/zenodo.20573001
ServImage: 一个来自现实商业成像服务的图像生成和编辑基准
机构 * MBZUAI, United Arab Emirates(阿联酋MBZUAI)
专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV
AI总结 ServImage通过结合经济价值评估,评估图像生成模型的商业可行性,提出包含商业设计任务和交付物的基准数据集及评分系统,实现82%的支付预测准确率。
SSD: 空间推测解码加速自回归图像生成
机构 * Rutgers University(罗格斯大学)
专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV
AI总结 提出空间推测解码(SSD),利用二维空间相关性同时预测相邻水平与下方令牌,突破视觉推理中的内存瓶颈,实现高达13.3倍的自回归图像生成加速。
临床感知的合成图像生成用于胸部X光模型的概念覆盖
机构 * University of Edinburgh(爱丁堡大学) ; NHS Lothian(洛锡安国家健康服务)
专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV
AI总结 提出CARPA框架,通过解剖约束的概念扰动生成合成胸部X光图像,扩展临床概念覆盖,提升模型性能与可靠性。
Comments Accepted for presentation at the IJCAI-ECAI 2026 RobustifAI workshop
异常偏好图像生成
机构 * Nanjing University of Science(南京理工大学) ; Beijing Normal University, Beijing, China(北京师范大学) ; China Academy of Space Technology, Beijing, China(中国航天科技集团)
专题命中 图像生成评测 :image generation(title);diffusion(abstract);分类 cs.CV
AI总结 本文提出了一种新的异常生成方法,通过隐式偏好对齐机制和时间感知能力分配模块,提升生成图像的真实性和多样性,实验表明其在真实性和多样性上均优于现有方法。
Comments Accepted by ICML 2026
通过合成局部偏好实现解剖学合理的人体图像生成
机构 * Westlake University(西湖大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 图像生成评测 :image generation(title);text-to-image(abstract);分类 cs.CV
AI总结 提出 ASAP 框架,利用局部退化机制构建受控偏好对,并结合局部有界 DPO 变体,在保持整体图像质量的同时减少解剖学错误。
Gen-Searcher: 强化搜索代理用于图像生成
机构 * MMLab, CUHK(CUHK的MMLab) ; UCLA(加州大学洛杉矶分校) ; UC Berkeley(加州大学伯克利分校) ; Meituan Home(美团家庭)
专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV
AI总结 提出Gen-Searcher,首个通过多跳推理和搜索收集文本知识与参考图像的搜索增强图像生成代理,结合SFT和强化学习训练,显著提升生成质量。
Comments Project page: https://gen-searcher.vercel.app Code: https://github.com/tulerfeng/Gen-Searcher
迈向细粒度语音修补取证:一个多区域篡改定位的数据集、方法和度量标准
机构 * Posts and Telecommunications Institute of Technology
专题命中 图像生成评测 :inpainting(title,abstract);分类 cs.CV
AI总结 本文提出MIST数据集、ISA方法和SF1@tau度量标准,用于多区域语音修补检测,揭示现有深度伪造检测器在细粒度语音修补检测上的不足。
COCO-Inpaint:用于检测和定位基于修补的图像篡改的基准
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ant Group(蚂蚁集团)
专题命中 图像生成评测 :inpainting(title,abstract);分类 cs.CV
AI总结 本文提出COCO-Inpaint基准,用于检测和定位基于修补的图像篡改,通过高质样本、多样场景和大规模覆盖,揭示修补与真实区域的内在不一致。
Comments 6 pages, 8 figures
GlazyBench:陶瓷釉料属性预测与图像生成的基准测试
机构 * Queen Mary University of London(伦敦大学玛丽女王学院)
专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV
AI总结 本文提出GlazyBench,首个用于AI辅助釉料设计的基准数据集,包含23148种真实釉料配方,支持釉料属性预测与图像生成任务,通过传统机器学习和大语言模型建立基线,展示出有前景但具挑战性的实验结果。
PlanViz: 评估面向计算机使用任务的图像生成与编辑
机构 * Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Huawei Technologies Ltd(华为技术有限公司)
专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV
AI总结 PlanViz旨在评估图像生成与编辑在计算机使用任务中的表现,通过设计日常生活中常见的子任务,如路线规划、工作图示和网页与UI显示,提出任务自适应评分体系PlanScore以评估生成图像的正确性、视觉质量和效率。
Comments The main part of our paper: PlanViz Code is at: https://github.com/lijunxian111/PlanViz Supplementary material is at: https://github.com/lijunxian111/PlanViz/releases/tag/v1
关于自回归图像生成中水印的鲁棒性
机构 * Ruhr University Bochum(波鸿鲁尔大学) ; Middlebury College(米德尔伯里学院) ; New York University(纽约大学) ; Independent Researcher(独立研究员) ; Qualcomm(高通)
专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV
AI总结 研究自回归图像生成中水印技术的鲁棒性,揭示其易受移除和伪造攻击的影响,并提出三种新攻击方法,表明现有水印方案无法可靠检测合成内容。
GEditBench v2:一个对齐人类的通用图像编辑基准
机构 * Nanyang Technological University(南洋理工大学) ; StepFun ; Southeast University(东南大学)
专题命中 图像生成评测 :image editing(title,abstract);分类 cs.CV
AI总结 本文提出GEditBench v2,包含1200个真实用户查询,涵盖23项任务,引入PVC-Judge模型评估视觉一致性,实验表明其在开放源模型中表现优异,揭示当前模型局限性。
Comments 30 pages, 24 figures
基于大语言模型的图像编辑评估:一个全面的基准和中间层探针方法
机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学)
专题命中 图像生成评测 :image editing(title,abstract);分类 cs.CV
AI总结 本文提出TIEdit基准和EditProbe方法,通过5120张编辑图像和专家评分,评估文本引导图像编辑方法的感知质量、对齐性和内容保真度,同时利用大语言模型中间层探针提升评估准确性。
扩散混合:用于扩散模型的推理时间多偏好对齐
机构 * Texas A&M University(德克萨斯大学阿姆斯特朗分校) ; Qualcomm AI Research(高通人工智能研究)
专题命中 图像生成评测 :diffusion(title,abstract);分类 cs.CV
AI总结 扩散混合通过混合反向扩散过程实现推理时间多偏好对齐,提升用户驱动的图像生成性能。
Comments Accepted at ICLR 2026
LikePhys: 通过似然偏好评估视频扩散模型中的直观物理理解
机构 * University of Oxford(牛津大学) ; MBZUAI(穆斯林人工智能研究所) ; University of Chicago(芝加哥大学) ; UWE Bristol(布里斯托尔大学)
专题命中 图像生成评测 :diffusion(title,abstract);分类 cs.CV
AI总结 LikePhys通过似然偏好评估视频扩散模型的直观物理理解,展示其与人类偏好一致,优于现有基线,并揭示模型设计和推理设置对物理理解的影响。
Comments 23 pages, 9 figures, Project Page: https://yuanjianhao508.github.io/LikePhys/
Journal ref ICLR 2026
面向细粒度图像编辑评估的人类对齐MLLM评判:一个基准、框架和分析
机构 * University of Virginia(弗吉尼亚大学) ; Columbia University(哥伦比亚大学) ; Vanderbilt University(范德比大学) ; Adobe Research(Adobe研究) ; Dolby Laboratories(杜比实验室) ; Cisco Research(思科研究) ; University of Southern California(南加州大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; University of Oregon(俄勒冈大学) ; Texas A&M University(德克萨斯大学)
专题命中 图像生成评测 :image editing(title,abstract);分类 cs.CV
AI总结 本文提出细粒度MLLM评判框架,通过分解十二个可解释因素,提升图像编辑评估的精度与实用性,为研究和改进图像编辑方法提供实用基础。
GEBench: 图形用户界面生成模型的基准测试
机构 * StepFun ; South China University of Technology(南方科技大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) ; The University of Chicago(芝加哥大学) ; Nanyang Technological University(南洋理工大学)
专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV
AI总结 GEBench提出一个评估GUI生成模型动态交互和时间一致性的基准测试,通过五维指标揭示模型在多步交互中的瓶颈问题。
Comments 23 pages, 5 figures, 4 tables
重新思考组合图像检索评估:从图像编辑中获得的细粒度基准
机构 * CASIA(中国科学院自动化研究所) ; Tongyi Lab, Alibaba Group(阿里云实验室) ; UCAS(中国科学院大学) ; HKUST(GZ)(香港科技大学(广州)) ; NTU(国立新加坡大学) ; Yale(耶鲁大学)
专题命中 图像生成评测 :image editing(title,abstract);分类 cs.CV
AI总结 本文提出EDIR细粒度CIR基准,通过图像编辑技术生成多样化查询,揭示现有模型在多模态任务中的能力差距与局限性。
Comments Under review