Gradient flow formulation of diffusion equations in the Wasserstein space over a metric graph
专题命中 图像生成评测 :diffusion(title)
Comments 31 pages
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 图像生成评测 :diffusion(title)
Comments 31 pages
专题命中 图像生成评测 :image generation(title)
Comments 10 pages, 8 figures
专题命中 图像生成评测 :diffusion(title)
Comments Dissertation
CAPEval:跨理解与生成的解耦式标题评估
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 本研究提出解耦式标题评估基准CAPEval,将标题质量分为覆盖度与精确度,发现二者分别对应理解与生成任务性能,为标题生成器的选择优化提供指导。
Comments 21 pages, 8 figures. Code and dataset will be available at https://liuzhipenggg.github.io/CAPEval/
评估生成式图像模型的知识产权保护措施:技术报告
机构 * Sony AI New York(索尼人工智能纽约分部) ; Sony AI Zurich(索尼人工智能苏黎世分部) ; Sony Group Corporation London(索尼集团公司伦敦分部) ; Sony Group Corporation New York(索尼集团公司纽约分部)
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 提出基准和自动化评估流程,测试生成式图像模型的知识产权保护证据及生成含可识别知识产权图像的倾向,评估了14个文本到图像模型,发现私有模型有不同程度拒绝生成情况。
SciIR:面向科学图像推理生成的大规模训练数据集与基准
机构 * School of Computer Science and Technology, Huazhong University of Science and Technology, China(华中科技大学计算机科学与技术学院,中国) ; School of Airspace Science and Engineering, Shandong University, China(山东大学航空航天科学与工程学院,中国) ; Department of Electronic Engineering, Tsinghua University, China(清华大学电子工程系,中国)
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 为解决文本到图像模型在科学图像生成中语义对齐与逻辑推理不足的问题,构建了包含8万+高质量科学图像-文本对的SciIR-82k数据集,并提出三层次科学推理框架及可验证评估基准SciIR-Bench,微调模型Qwen-Image-SciIR在基准上得分从35%提升至43%。
Comments Accepted to ECCV 2026
Ask, Solve, Generate: 通过自一致性奖励实现自我进化的统一多模态理解与生成
专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 提出一个自我进化的训练框架,通过内部角色(提议者、求解者、生成者)和自一致性信号,无需人工标注或外部奖励模型,同时提升统一多模态模型的理解与生成能力。
重建对齐改进统一多模态模型
机构 * UC Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; Duke University(杜克大学)
专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 提出重建对齐(RECA),一种资源高效的后训练方法,利用视觉理解编码器嵌入作为密集文本提示,通过自监督重建损失对齐理解与生成,显著提升多种统一多模态模型的生成和编辑性能。
Comments 43 pages, 36 figures and 14 tables; accepted by ICLR 2026
AMVICC: 一种用于VLM和IGM跨模态故障模式分析的新型基准
机构 * Centennial High School, Frisco, Texas, USA(Centennial High School, Texas, USA) ; Lebanon Trail High School, Frisco, Texas, USA(Lebanon Trail High School, Texas, USA) ; West Windsor-Plainsboro High School, Princeton Junction, New Jersey, USA(West Windsor-Plainsboro High School, New Jersey, USA) ; Algoverse AI Research, Palo Alto, California, USA(Algoververse AI Research, California, USA)
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 提出AMVICC基准,通过图像到文本和文本到图像任务系统比较多模态大模型和图像生成模型的视觉推理失败模式,发现故障模式在模型和模态间共享,但存在特定于模型和模态的失败。
Comments 14 pages, 4 figures, 8 tables. Presented at the 39th Conference on Neural Information Processing Systems Workshop: VLM4RWD. Presented at the 43th International Conference on Machine Learning Workshops: ICML 2026 CTB, ICML 2026 FAGEN, ICML 2026 EMM-QA. Authors Aahana Basappa and Pranay Goel contributed equally. Code: https://github.com/AahanaB24/AMVICC, Data: https://doi.org/10.5281/zenodo.17646068
首届PortraitCraft挑战赛:CVPR 2026研讨会肖像构图理解与生成竞赛
机构 * CVPR 2026
专题命中 图像生成评测 :image generation(abstract);image synthesis(abstract);分类 cs.CV
AI总结 提出PortraitCraft挑战赛,包含构图理解与生成两个赛道,并发布约5万张肖像数据集,推动肖像美学与可控图像生成研究。
条件 Vendi 分数:生成式 AI 模型和 LLM 的提示感知多样性评估
机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) ; Department of Information Engineering, The Chinese University of Hong Kong(信息工程系,香港中文大学)
专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 针对文本提示引导的生成模型,提出条件 Vendi 和条件 RKE 分数,通过条件熵分离模型自身多样性,并证明收敛性及在多个任务中恢复真实多样性排序。
MaSC:一种用于评估概念驱动生成的遮蔽相似度度量
机构 * Adam Mickiewicz University(亚当·密茨凯维奇大学) ; Kiel University(基尔大学) ; ArtCollect(艺术收藏) ; KAUST(卡塔尔科技大学)
专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出MaSC,一种基于遮蔽的相似度度量方法,用于评估文本到图像扩散模型中单概念个性化生成的保真度和提示遵循性,通过使用外部提供的前景概念遮罩将评估分解为针对主体的概念保真度和基于背景的提示遵循性。
Comments 20 pages, 2 figures, 7 tables
位置:通用审美对齐限制了艺术表达
机构 * Department of CMPS, University of British Columbia, Kelowna, Canada(计算机科学与工程系,不列颠哥伦比亚大学,加拿大克洛维纳)
专题命中 图像生成评测 :image generation(abstract);image editing(abstract);分类 cs.CV
AI总结 本文探讨了将图像生成模型过度对齐通用审美偏好与用户意图冲突的问题,指出生成模型倾向于产生传统美观输出,忽视用户对低质量或负面图像的指令。
TAVIS:一种用于第一人称主动视觉和预见性注视的模仿学习基准
机构 * Department of Intelligent Systems(智能系统系)
专题命中 图像生成评测 :diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 TAVIS提出了一种评估主动视觉模仿学习的基础设施,包含两个任务集和两个仿人躯干机器人,通过实验发现主动视觉对任务类型和条件具有任务依赖性,且多任务策略在分布偏移下表现下降,模仿学习能产生与人类参考相当的预见性注视。
ViPO:大规模视觉偏好优化
机构 * University of Central Florida(中央佛罗里达大学) ; ByteDance Seed(字节跳动种子) ; UCLA(加州大学洛杉矶分校)
专题命中 图像生成评测 :diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出ViPO大规模偏好数据集和Poly-DPO方法,通过提升数据质量和算法鲁棒性,实现视觉生成模型的高效偏好优化。
Comments ICLR 2026 Paper. Project Page: https://liming-ai.github.io/ViPO ; Code: https://github.com/liming-ai/ViPO
Graphic-Design-Bench:一个全面的评估AI在图形设计任务中的基准测试
专题命中 图像生成评测 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV
AI总结 本文提出GraphicDesignBench,首个针对专业图形设计任务的全面基准测试集,评估AI模型在布局、排版、信息图、模板设计和动画等任务中的表现,揭示当前模型在空间推理、矢量代码生成和动画分解等方面存在的不足。
GENFIG1:学术工作的视觉摘要对视觉-语言模型的挑战
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 GENFIG1基准测试要求视觉-语言模型生成能清晰表达论文核心思想的图表,强调科学理解与视觉合成的结合,揭示生成高质量学术图表的难度。
PosterReward: 解锁高质量图形设计生成的准确评估
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.GR
AI总结 本文提出PosterReward,通过多阶段训练策略构建高质量海报偏好数据集,设计专用奖励模型以提升海报评估精度,并引入评估基准测试现有模型性能。
Comments Accepted by CVPR'26
当身份崩溃时:多主体个性化的一个压力测试基准
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; University of Southern California(南加州大学) ; DeerLab LLC(DeerLab有限责任公司) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出一个压力测试基准,揭示多主体生成模型在复杂场景下的身份崩溃问题,并引入新的评估指标SCR,强调未来生成架构需显式物理解耦。
Comments 10 pages, 7 figures, accepted by CVPR 2026 Workshop P13N
BizGenEval:一个系统化的商业视觉内容生成基准测试
机构 * Microsoft Corporation(微软公司) ; Shanghai Jiao Tong University(上海交通大学) ; Xi'an Jiaotong University(西安交通大学) ; Fudan University(复旦大学)
专题命中 图像生成评测 :image generation(abstract);image synthesis(abstract);分类 cs.CV
AI总结 本文提出BizGenEval基准测试,系统评估商业视觉内容生成模型在文档类型和多约束下的能力,包含20个任务和8000个检查问题,揭示现有模型与专业需求间的差距。
ShowTable:通过协作反思与精炼解锁创意表格可视化
机构 * USTC(中国科学技术大学) ; CASIA(中国科学院自动化研究所) ; NJU(南京大学) ; SJTU(上海交通大学) ; ZJU(浙江大学) ; FDU(福建师范大学) ; Tongyi Lab(通义实验室)
专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出ShowTable框架,结合大语言模型与扩散模型,通过逐步自我纠正过程实现创意表格可视化,引入TableVisBench基准测试,展示其在多模态推理、生成和纠错方面的优势。
Comments Accepted to CVPR 2026, project page: https://lntzm.github.io/showtable-page/
GIR-Bench:用于生成图像的多功能基准
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Peking University(北京大学) ; University of Science and Technology of China(中国科学技术大学) ; Xiaohongshu Inc.(小红书公司)
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出GIR-Bench,从理解-生成一致性、文本到图像生成和多步骤编辑三个角度评估统一模型,揭示其在复杂视觉任务中的表现与不足。
Comments ICLR2026
EdiVal-Agent:一个面向多轮编辑自动细粒度评估的对象中心框架
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Microsoft AI Superintelligence(微软人工智能超智实验室) ; Lambda, Inc(Lambda公司)
专题命中 图像生成评测 :diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 本文提出EdiVal框架,通过对象中心视角实现多轮编辑的细粒度评估,引入EdiVal-IF、EdiVal-CC和EdiVal-VQ三个指标,构建多轮编辑基准测试平台,用于识别现有编辑模型的失败模式。
Comments Tianyu Chen and Yasi Zhang contributed equally; Oscar Leong, Lijuan Wang, Ying Nian Wu, and Mingyuan Zhou advised equally
DesignSense: 一种用于图形布局生成的人类偏好数据集和奖励建模框架
机构 * MDSR, Adobe(MDSR,Adobe)
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 DesignSense通过人类偏好数据集和奖励建模框架提升图形布局生成的质量和效果。
Comments 14 pages, 3 figures
AIForge-Doc: 一个用于检测金融和表单文档中AI伪造篡改的基准测试
机构 * Duke University(杜克大学) ; New York University(纽约大学) ; University of North Carolina(北卡罗来纳大学) ; University of Southern California(南加州大学)
专题命中 图像生成评测 :diffusion(abstract);inpainting(abstract);分类 cs.CV
AI总结 AIForge-Doc通过生成AI伪造的金融和表单文档数据,揭示了现有检测器对AI伪造篡改的识别能力不足,强调了文档取证领域的新挑战。
Comments 17 pages, 10 figures
了解“不”:一种数据驱动的方法用于增强CLIP中的否定意识
机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电子与计算机工程系) ; Amazon(亚马逊) ; Samsung Research(三星研究院) ; School of Computer Science and Engineering, Soongsil University(顺天大学计算机科学与工程学院) ; IPAI, AIIS, ASRI, INMC, and ISRC, Seoul National University(首尔国立大学IPAI、AIIS、ASRI、INMC和ISRC)
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出NegationCLIP,通过生成包含否定的数据增强CLIP的否定意识,同时提出NegRefCOCOg基准用于评估多模态模型的否定理解能力。
Comments Accepted to ICCV 2025
Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 2825-2835
LocateEdit-Bench:基于指令的编辑本地化基准测试
机构 * Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) ; Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) ; School of EEECS, Queen's University Belfast, Northern Ireland, UK(女王大学 Belfast 电子工程与计算机科学学院) ; Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Peking University, Beijing, China(北京大学)
专题命中 图像生成评测 :image editing(abstract);inpainting(abstract);分类 cs.CV
AI总结 LocateEdit-Bench是一个针对基于指令的编辑本地化问题设计的大规模数据集,整合了四种先进编辑模型,用于评估和推动伪造本地化方法的发展。
Comments 11 pages, 7 figures
多模态奖励基准2:评估多模态奖励模型用于交错文本和图像
机构 * FAIR at Meta Superintelligence Labs(Meta超智能实验室的FAIR)
专题命中 图像生成评测 :text-to-image(abstract);image editing(abstract);分类 cs.CV
AI总结 多模态奖励基准2评估多模态奖励模型在交错文本和图像任务中的性能,通过专家标注数据和先进模型对比,揭示了不同模型在多模态理解与生成任务中的准确率差异。
Comments Code and data available at https://github.com/facebookresearch/MMRB2
GPT-5.2、Gemini 3 Pro、Qwen3-VL、Grok 4.1 Fast、Nano Banana Pro 和 Seedream 4.5 的安全报告
机构 * Fudan University(复旦大学) ; Shanghai Innovation institute(上海创新研究院) ; Deakin University(德克萨斯大学) ; UIUC(伊利诺伊大学香槟分校)
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 本报告对六个前沿模型进行综合安全性评估,揭示其在安全性和鲁棒性方面的差异,强调需要标准化评估以指导负责任的部署。
Comments 41 pages, 22 figures
美丽的图像,有毒的词语:理解并解决生成图像中的冒犯性文本
专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出了一种针对生成图像中冒犯性文本的微调策略,并发布了ToxicBench基准,用于评估和改进文本到图像模型的安全性。
Comments Accepted at AAAI 2026 (AI Alignment Track)