arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1204 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1204 篇

2406.17100 2024-09-13 cs.CV 81%

FaceScore: Benchmarking and Enhancing Face Quality in Human Generation

Zhenyi Liao, Qingsong Xie, Chen Chen, Hannan Lu, Zhijie Deng

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);inpainting(abstract)

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00707 2024-09-04 cs.CV cs.AI cs.LG 81%

ReMOVE: A Reference-free Metric for Object Erasure

Aditya Chandrasekar, Goirik Chakrabarty, Jai Bardhan, Ramya Hebbalaguppe, Prathosh AP

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);image editing(abstract);inpainting(abstract)

Comments Accepted at The First Workshop on the Evaluation of Generative Foundation Models (EvGENFM) at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28406 2026-06-30 cs.LG cs.CV cs.GR 81%

Can AI Draw Science? A Benchmark for Evaluating Scientific Figure Generation by Text-to-Image and Multimodal Models

AI能绘制科学吗?评估文本到图像和多模态模型生成科学图形的基准

Davie Chen

专题命中 图像生成评测 :text-to-image(title,abstract);分类 cs.CV、cs.GR

AI总结 提出SciDraw-Bench基准,通过32个结构化任务和四维评估协议(文本保真度、语义正确性、结构质量、惯例遵循),评估文本到图像模型生成科学图形的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02712 2026-03-04 cs.CV cs.MM eess.IV 81%

From "What" to "How": Constrained Reasoning for Autoregressive Image Generation

从‘是什么’到‘如何做’:用于自回归图像生成的约束推理

Ruxue Yan, Xubo Liu, Wenya Guo, Zhengkun Zhang, Ying Zhang, Xiaojie Yuan

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Baidu Inc.(百度公司)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出CoR-Painter框架,通过约束推理引导自回归图像生成,解决空间结构模糊问题,提升生成图像的准确性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02033 2026-02-04 cs.CV cs.AI cs.MM 81%

One Size, Many Fits: Aligning Diverse Group-Wise Click Preferences in Large-Scale Advertising Image Generation

一个尺寸,多种适配:在大规模广告图像生成中对多样化群体点击偏好进行对齐

Shuo Lu, Haohan Wang, Wei Feng, Weizhen Wang, Shen Zhang, Yaoyu Li, Ao Ma, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Bing Zhan, Yuan Xu, Huizai Yao, Yongcan Yu, Chenyang Si, Jian Liang

机构 * NLPR & MAIS, CASIA(中国科学院长春光学精密机械与物理研究所 & 中国科学院自动化所) School of AI, UCAS(中国科学院大学人工智能学院) HKUST(gz)(香港科技大学) PRLab, NJU(南京大学PRLab)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出OSMF框架,通过自适应分组和群组感知多模态模型,解决广告图像生成中用户群体点击偏好多样性的优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16193 2025-09-09 cs.CV cs.MM 81%

LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs

Zitong Xu, Huiyu Duan, Bingnan Liu, Guangji Ma, Jiarui Wang, Liu Yang, Shiqi Gao, Xiaoyu Wang, Jia Wang, Xiongkuo Min, Guangtao Zhai, Weisi Lin

机构 * Institute of Image Communication and Network Engineering, Shanghai JiaoTong University(上海交通大学图像通信与网络工程研究所) University of Electronic and Science Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学)

专题命中 图像生成评测 :image editing(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06823 2025-02-13 cs.LG cs.CV cs.GR cs.IR 81%

CTR-Driven Advertising Image Generation with Multimodal Large Language Models

Xingye Chen, Wei Feng, Zhenbang Du, Weizhen Wang, Yanyin Chen, Haohan Wang, Linkai Liu, Yaoyu Li, Jinyuan Zhao, Yu Li, Zheng Zhang, Jingjing Lv, Junjie Shen, Zhangang Lin, Jingping Shao, Yuanjie Shao, Xinge You, Changxin Gao, Nong Sang

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV、cs.GR

Comments Accepted to WWW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28736 2026-07-28 cs.RO 版本更新 80%

Imitation Learning for Robot Assistance in Open Surgery: A Multi-Policy Evaluation on Suture Following

开放手术中机器人辅助的模仿学习:针对缝合跟随的多策略评估

Xucheng Wang, Zhizhou Yang, Xiaoman Zhang, Sung Eun Kim, Romain Hardy, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院) Massachusetts General Hospital(麻省总医院)

专题命中 图像生成评测 :diffusion(summary_cn,abstract)

AI总结 本研究首次评估通用模仿学习在开放手术中用于外科医生-机器人协作辅助的可行性,以缝合跟随(每次缝合时助手执行的抓取-拉动-释放动作)为任务,通过比较四种策略(ACT、Diffusion Policy、SmolVLA、π₀)在28个训练模型上的表现,发现π₀在数据效率、背景鲁棒性和轨迹平滑性上最优,并在机器人缝合试验中达到92%的缝合完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01383 2026-07-03 cs.CV 新提交 79%

MIBE: Multi-subject Interaction Benchmark and Evaluator for Personalized Image Generation

MIBE:面向个性化图像生成的多主体交互基准与评估器

Zhihan Chen, Yuhuan Zhao, Yijie Zhu, Xinyu Yao, Mengcong Ren, Suwen Wang, Qiuyang Yin, Yuchen Sun, Qin Wang, Lu Xin

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Southern California(南加州大学) DeerLab LLC(DeerLab有限责任公司) Carnegie Mellon University(卡内基梅隆大学) Clemson University(克莱姆森大学) Google(谷歌) San Jose State University(圣何塞州立大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 提出MIBE框架,包含多主体交互基准(MIB)和评估器(MIE),通过解耦数据体制和双头排序诊断目标,解决多主体个性化图像生成中主体遗漏、外观失配和交互错误问题,在黄金集上达到0.922成对准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11734 2026-06-30 cs.CV 79%

VTEdit-Bench: A Comprehensive Benchmark for Multi-Reference Image Editing Models in Virtual Try-On

VTEdit-Bench:多参考图像编辑模型在虚拟试穿中的综合基准

Xiaoye Liang, Zhiyuan Qu, Mingye Zou, Jiaxin Liu, Lai Jiang, Mai Xu, Yiheng Zhu

专题命中 图像生成评测 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出VTEdit-Bench基准,用于评估多参考图像编辑模型在虚拟试穿中的性能,包含24220对测试图像,涵盖五个代表性任务,通过VTEdit-QA评估模型一致性、布料一致性和图像质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26376 2026-06-25 cs.CV 版本更新 79%

ScalingAR: Scaling Confidence for Autoregressive Image Generation

ScalingAR: 自回归图像生成的置信度缩放

Harold Haodong Chen, Xianfeng Wu, Wen-Jie Shu, Rongjin Guo, Disen Lan, Harry Yang, Ying-Cong Chen

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 提出ScalingAR框架,通过令牌熵作为置信度信号,在轮廓级和策略级进行自适应轨迹剪枝和动态引导调度,无需早期解码或外部奖励,显著提升自回归图像生成性能。

Comments ICML 2026; Code: https://github.com/EnVision-Research/ScalingAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21113 2026-06-23 cs.CV cs.LG 新提交 79%

Object-Centric Dataset Resources for Constrained-Data Image Generation and Augmentation

面向受限数据图像生成与增强的以对象为中心的数据集资源

Vasile Marian, Yong-Bin Kang, Alexander Buddery

机构 * The University of Queensland(昆士兰大学) Swinburne University of Technology(斯威本科技大学)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 针对少样本场景下的对象中心图像生成,提出三个标准化数据集资源(Cityscapes-Pedestrian、TrafficSigns、COCO PottedPlant),提供256×256裁剪、边界框标注及重建脚本,支持受控比较与评估。

Comments 5 pages including references, 2 figures, 2 tables. Dataset and related files at https://github.com/Latzi/object-centric-low-data-datasets and https://doi.org/10.5281/zenodo.20573001

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24023 2026-06-23 cs.CV 版本更新 79%

ServImage: An Image Generation and Editing Benchmark from Real-world Commercial Imaging Services

ServImage: 一个来自现实商业成像服务的图像生成和编辑基准

Fengxian Ji, Jingpu Yang, Zirui Song, Lang Gao, Junhong Liang, Zhenhao Chen, Jinghui Zhang, Xiuying Chen

机构 * MBZUAI, United Arab Emirates(阿联酋MBZUAI)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 ServImage通过结合经济价值评估,评估图像生成模型的商业可行性,提出包含商业设计任务和交付物的基准数据集及评分系统,实现82%的支付预测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20543 2026-06-19 cs.CV 新提交 79%

SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation

SSD: 空间推测解码加速自回归图像生成

Shilong Xiang, Zirui Zhang, Lijun Yu, Chengzhi Mao

机构 * Rutgers University(罗格斯大学)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 提出空间推测解码(SSD),利用二维空间相关性同时预测相邻水平与下方令牌,突破视觉推理中的内存瓶颈,实现高达13.3倍的自回归图像生成加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15525 2026-06-16 cs.CV cs.HC 版本更新 79%

Clinically Aware Synthetic Image Generation for Concept Coverage in Chest X-ray Models

临床感知的合成图像生成用于胸部X光模型的概念覆盖

Amy Rafferty, Rishi Ramaesh, Ajitha Rajan

机构 * University of Edinburgh(爱丁堡大学) NHS Lothian(洛锡安国家健康服务)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 提出CARPA框架,通过解剖约束的概念扰动生成合成胸部X光图像,扩展临床概念覆盖,提升模型性能与可靠性。

Comments Accepted for presentation at the IJCAI-ECAI 2026 RobustifAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02439 2026-06-09 cs.CV cs.LG 版本更新 79%

Anomaly-Preference Image Generation

异常偏好图像生成

Fuyun Wang, Yuanzhi Wang, Xu Guo, Sujia Huang, Tong Zhang, Dan Wang, Hui Yan, Xin Liu, Zhen Cui

机构 * Nanjing University of Science(南京理工大学) Beijing Normal University, Beijing, China(北京师范大学) China Academy of Space Technology, Beijing, China(中国航天科技集团)

专题命中 图像生成评测 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种新的异常生成方法,通过隐式偏好对齐机制和时间感知能力分配模块,提升生成图像的真实性和多样性,实验表明其在真实性和多样性上均优于现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25759 2026-05-26 cs.CV 79%

Towards Anatomically Plausible Human Image Generation via Synthetic Localized Preferences

通过合成局部偏好实现解剖学合理的人体图像生成

Bao Li, Yuliang Xiu, Zhen Liu

机构 * Westlake University(西湖大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 图像生成评测 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 提出 ASAP 框架,利用局部退化机制构建受控偏好对,并结合局部有界 DPO 变体,在保持整体图像质量的同时减少解剖学错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28767 2026-05-25 cs.CV 79%

Gen-Searcher: Reinforcing Agentic Search for Image Generation

Gen-Searcher: 强化搜索代理用于图像生成

Kaituo Feng, Manyuan Zhang, Shuang Chen, Yunlong Lin, Kaixuan Fan, Yilei Jiang, Hongyu Li, Dian Zheng, Chenyang Wang, Xiangyu Yue

机构 * MMLab, CUHK(CUHK的MMLab) UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校) Meituan Home(美团家庭)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 提出Gen-Searcher,首个通过多跳推理和搜索收集文本知识与参考图像的搜索增强图像生成代理,结合SFT和强化学习训练,显著提升生成质量。

Comments Project page: https://gen-searcher.vercel.app Code: https://github.com/tulerfeng/Gen-Searcher

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02223 2026-05-20 cs.SD cs.CV 79%

Toward Fine-Grained Speech Inpainting Forensics:A Dataset, Method, and Metric for Multi-Region Tampering Localization

迈向细粒度语音修补取证:一个多区域篡改定位的数据集、方法和度量标准

Tung Vu, Yen Nguyen, Hai Nguyen, Cuong Pham, Cong Tran

机构 * Posts and Telecommunications Institute of Technology

专题命中 图像生成评测 :inpainting(title,abstract);分类 cs.CV

AI总结 本文提出MIST数据集、ISA方法和SF1@tau度量标准,用于多区域语音修补检测,揭示现有深度伪造检测器在细粒度语音修补检测上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18361 2026-05-18 cs.CV cs.AI 79%

COCO-Inpaint: A Benchmark for Detecting and Localizing Inpainting-Based Image Manipulations

COCO-Inpaint:用于检测和定位基于修补的图像篡改的基准

Haozhen Yan, Yan Hong, Jiahui Zhan, Suning Lang, Yikun Ji, Huijia Zhu, Jun Lan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 图像生成评测 :inpainting(title,abstract);分类 cs.CV

AI总结 本文提出COCO-Inpaint基准,用于检测和定位基于修补的图像篡改,通过高质样本、多样场景和大规模覆盖,揭示修补与真实区域的内在不一致。

Comments 6 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06641 2026-05-08 cs.AI cs.CV 79%

GlazyBench: A Benchmark for Ceramic Glaze Property Prediction and Image Generation

GlazyBench:陶瓷釉料属性预测与图像生成的基准测试

Ziyu Zhai, Siyou Li, Juexi Shao, Juntao Yu

机构 * Queen Mary University of London(伦敦大学玛丽女王学院)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出GlazyBench,首个用于AI辅助釉料设计的基准数据集,包含23148种真实釉料配方,支持釉料属性预测与图像生成任务,通过传统机器学习和大语言模型建立基线,展示出有前景但具挑战性的实验结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06663 2026-04-21 cs.CV 79%

PlanViz: Evaluating Planning-Oriented Image Generation and Editing for Computer-Use Tasks

PlanViz: 评估面向计算机使用任务的图像生成与编辑

Junxian Li, Kai Liu, Leyang Chen, Weida Wang, Zhixin Wang, Jiaqi Xu, Fan Li, Renjing Pei, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 PlanViz旨在评估图像生成与编辑在计算机使用任务中的表现,通过设计日常生活中常见的子任务,如路线规划、工作图示和网页与UI显示,提出任务自适应评分体系PlanScore以评估生成图像的正确性、视觉质量和效率。

Comments The main part of our paper: PlanViz Code is at: https://github.com/lijunxian111/PlanViz Supplementary material is at: https://github.com/lijunxian111/PlanViz/releases/tag/v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11720 2026-04-14 cs.CV cs.AI cs.CR 79%

On the Robustness of Watermarking for Autoregressive Image Generation

关于自回归图像生成中水印的鲁棒性

Andreas Müller, Denis Lukovnikov, Shingo Kodama, Minh Pham, Anubhav Jain, Jonathan Petit, Niv Cohen, Asja Fischer

机构 * Ruhr University Bochum(波鸿鲁尔大学) Middlebury College(米德尔伯里学院) New York University(纽约大学) Independent Researcher(独立研究员) Qualcomm(高通)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 研究自回归图像生成中水印技术的鲁棒性,揭示其易受移除和伪造攻击的影响,并提出三种新攻击方法,表明现有水印方案无法可靠检测合成内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28547 2026-03-31 cs.CV 79%

GEditBench v2: A Human-Aligned Benchmark for General Image Editing

GEditBench v2:一个对齐人类的通用图像编辑基准

Zhangqi Jiang, Zheng Sun, Xianfang Zeng, Yufeng Yang, Xuanyang Zhang, Yongliang Wu, Wei Cheng, Gang Yu, Xu Yang, Bihan Wen

机构 * Nanyang Technological University(南洋理工大学) StepFun Southeast University(东南大学)

专题命中 图像生成评测 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出GEditBench v2,包含1200个真实用户查询,涵盖23项任务,引入PVC-Judge模型评估视觉一致性,实验表明其在开放源模型中表现优异,揭示当前模型局限性。

Comments 30 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19775 2026-03-26 cs.CV 79%

Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach

基于大语言模型的图像编辑评估:一个全面的基准和中间层探针方法

Shiqi Gao, Zitong Xu, Kang Fu, Huiyu Duan, Xiongkuo Min, Jia wang

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学)

专题命中 图像生成评测 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出TIEdit基准和EditProbe方法,通过5120张编辑图像和专家评分,评估文本引导图像编辑方法的感知质量、对齐性和内容保真度,同时利用大语言模型中间层探针提升评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18547 2026-03-13 cs.AI cs.CV 79%

Diffusion Blend: Inference-Time Multi-Preference Alignment for Diffusion Models

扩散混合:用于扩散模型的推理时间多偏好对齐

Min Cheng, Fatemeh Doudi, Dileep Kalathil, Mohammad Ghavamzadeh, Panganamala R. Kumar

机构 * Texas A&M University(德克萨斯大学阿姆斯特朗分校) Qualcomm AI Research(高通人工智能研究)

专题命中 图像生成评测 :diffusion(title,abstract);分类 cs.CV

AI总结 扩散混合通过混合反向扩散过程实现推理时间多偏好对齐,提升用户驱动的图像生成性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11512 2026-03-09 cs.CV cs.AI 79%

LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood Preference

LikePhys: 通过似然偏好评估视频扩散模型中的直观物理理解

Jianhao Yuan, Fabio Pizzati, Francesco Pinto, Lars Kunze, Ivan Laptev, Paul Newman, Philip Torr, Daniele De Martini

机构 * University of Oxford(牛津大学) MBZUAI(穆斯林人工智能研究所) University of Chicago(芝加哥大学) UWE Bristol(布里斯托尔大学)

专题命中 图像生成评测 :diffusion(title,abstract);分类 cs.CV

AI总结 LikePhys通过似然偏好评估视频扩散模型的直观物理理解,展示其与人类偏好一致,优于现有基线,并揭示模型设计和推理设置对物理理解的影响。

Comments 23 pages, 9 figures, Project Page: https://yuanjianhao508.github.io/LikePhys/

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13028 2026-02-16 cs.CV cs.CL 79%

Human-Aligned MLLM Judges for Fine-Grained Image Editing Evaluation: A Benchmark, Framework, and Analysis

面向细粒度图像编辑评估的人类对齐MLLM评判:一个基准、框架和分析

Runzhou Liu, Hailey Weingord, Sejal Mittal, Prakhar Dungarwal, Anusha Nandula, Bo Ni, Samyadeep Basu, Hongjie Chen, Nesreen K. Ahmed, Li Li, Jiayi Zhang, Koustava Goswami, Subhojyoti Mukherjee, Branislav Kveton, Puneet Mathur, Franck Dernoncourt, Yue Zhao, Yu Wang, Ryan A. Rossi, Zhengzhong Tu, Hongru Du

机构 * University of Virginia(弗吉尼亚大学) Columbia University(哥伦比亚大学) Vanderbilt University(范德比大学) Adobe Research(Adobe研究) Dolby Laboratories(杜比实验室) Cisco Research(思科研究) University of Southern California(南加州大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Oregon(俄勒冈大学) Texas A&M University(德克萨斯大学)

专题命中 图像生成评测 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出细粒度MLLM评判框架,通过分解十二个可解释因素,提升图像编辑评估的精度与实用性,为研究和改进图像编辑方法提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09007 2026-02-11 cs.AI cs.CV 79%

GEBench: Benchmarking Image Generation Models as GUI Environments

GEBench: 图形用户界面生成模型的基准测试

Haodong Li, Jingwei Wu, Quan Sun, Guopeng Li, Juanxi Tian, Huanyu Zhang, Yanlin Lai, Ruichuan An, Hongbo Peng, Yuhong Dai, Chenxi Li, Chunmei Qing, Jia Wang, Ziyang Meng, Zheng Ge, Xiangyu Zhang, Daxin Jiang

机构 * StepFun South China University of Technology(南方科技大学) Peking University(北京大学) Tsinghua University(清华大学) Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) The University of Chicago(芝加哥大学) Nanyang Technological University(南洋理工大学)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 GEBench提出一个评估GUI生成模型动态交互和时间一致性的基准测试,通过五维指标揭示模型在多步交互中的瓶颈问题。

Comments 23 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16125 2026-01-23 cs.CV cs.CL cs.IR 79%

Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing

重新思考组合图像检索评估:从图像编辑中获得的细粒度基准

Tingyu Song, Yanzhao Zhang, Mingxin Li, Zhuoning Guo, Dingkun Long, Pengjun Xie, Siyue Zhang, Yilun Zhao, Shu Wu

机构 * CASIA(中国科学院自动化研究所) Tongyi Lab, Alibaba Group(阿里云实验室) UCAS(中国科学院大学) HKUST(GZ)(香港科技大学(广州)) NTU(国立新加坡大学) Yale(耶鲁大学)

专题命中 图像生成评测 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出EDIR细粒度CIR基准,通过图像编辑技术生成多样化查询,揭示现有模型在多模态任务中的能力差距与局限性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏