arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1204 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1204 篇

2504.19706 2025-04-29 cs.CV 57%

Open-set Anomaly Segmentation in Complex Scenarios

Song Xia, Yi Yu, Henghui Ding, Wenhan Yang, Shifei Liu, Alex C. Kot, Xudong Jiang

机构 * Rapid-Rich Object Search Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(快速丰富目标搜索实验室,电气与电子工程学院,南洋理工大学,新加坡) Rapid-Rich Object Search Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(快速丰富目标搜索实验室,跨学科研究生项目,南洋理工大学,新加坡) Pengcheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) Institute of Big Data, Fudan University, Shanghai, China(大数据研究院,复旦大学,上海,中国)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16965 2025-04-25 cs.CV 57%

Contrastive Learning with Synthetic Positives

Dewen Zeng, Yawen Wu, Xinrong Hu, Xiaowei Xu, Yiyu Shi

机构 * University of Notre Dame(内布拉斯加大学达灵顿分校) Guangdong Provincial People’s Hospital(广东省级人民医院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments 8 pages, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15572 2025-04-22 eess.IV cs.AI cs.CV 57%

Comparative clinical evaluation of "memory-efficient" synthetic 3d generative adversarial networks (gan) head-to-head to state of art: results on computed tomography of the chest

Mahshid Shiri, Chandra Bortolotto, Alessandro Bruno, Alessio Consonni, Daniela Maria Grasso, Leonardo Brizzi, Daniele Loiacono, Lorenzo Preda

专题命中 图像生成评测 :image synthesis(abstract);分类 cs.CV

Comments Accpeted to Journal of Imaging Informatics in Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04178 2025-04-22 cs.CV 57%

SHIELD : An Evaluation Benchmark for Face Spoofing and Forgery Detection with Multimodal Large Language Models

Yichen Shi, Yuhao Gao, Yingxin Lai, Hongyang Wang, Jun Feng, Lei He, Jun Wan, Changsheng Chen, Zitong Yu, Xiaochun Cao

机构 * School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) Department of Artificial Intelligence, Xiamen University(厦门大学人工智能系) School of Information Science and Technology, Shijiazhuang Tiedao University(石家庄铁道大学信息科学与技术学院) Electrical Engineering Department, UCLA(加州大学洛杉矶分校电子工程系) New Laboratory of Pattern Recognition(NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新实验室) College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院) School of Computing and Information Technology, Great Bay University(广东东莞Great Bay大学计算与信息科技学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments Accepted by Visual Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07184 2025-04-22 cs.CV 57%

TVPR: Text-to-Video Person Retrieval and a New Benchmark

Xu Zhang, Fan Ni, Guan-Nan Dong, Aichun Zhu, Jianhui Wu, Mingcheng Ni, Hui Liu

机构 * Nanjing Tech University(南京理工大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

Comments 9 pages, 8 figures, Proceedings of the 32nd ACM International Conference on Multimedia

Journal ref The 32nd ACM International Conference on Multimedia. 2024: 10105-10113

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11347 2025-04-17 cs.CV physics.app-ph 57%

DeepWheel: Generating a 3D Synthetic Wheel Dataset for Design and Performance Evaluation

Soyoung Yoo, Namwoo Kang

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments 28 pages, 18 figures. Not yet submitted to a journal or conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09555 2025-04-17 cs.CV 57%

Mitigating Long-tail Distribution in Oracle Bone Inscriptions: Dataset, Model, and Benchmark

Jinhao Li, Zijian Chen, Runze Jiang, Tingzhu Chen, Changbo Wang, Guangtao Zhai

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11116 2025-04-15 cs.CV cs.AI 57%

PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset

Jiazhen Liu, Yuhan Fu, Ruobing Xie, Runquan Xie, Xingwu Sun, Fengzong Lian, Zhanhui Kang, Xirong Li

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

Comments Accepted by CVPR 2025, Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10701 2025-04-15 cs.CV cs.LG 57%

GMValuator: Similarity-based Data Valuation for Generative Models

Jiaxi Yang, Wenglong Deng, Benlin Liu, Yangsibo Huang, James Zou, Xiaoxiao Li

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08623 2025-04-10 cs.CV cs.AI 57%

SketchRef: a Multi-Task Evaluation Benchmark for Sketch Synthesis

Xingyue Lin, Xingjian Hu, Shuai Peng, Jianhua Zhu, Liangcai Gao

专题命中 图像生成评测 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05238 2025-04-08 cs.CV cs.DC 57%

Federated Learning for Medical Image Classification: A Comprehensive Benchmark

Zhekai Zhou, Guibo Luo, Mingzhi Chen, Zhenyu Weng, Yuesheng Zhu

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04051 2025-04-08 cs.CV cs.AI cs.LG 57%

Can You Count to Nine? A Human Evaluation Benchmark for Counting Limits in Modern Text-to-Video Models

Xuyang Guo, Zekai Huang, Jiayan Huo, Yingyu Liang, Zhenmei Shi, Zhao Song, Jiahao Zhang

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03337 2025-04-07 cs.CV 57%

QIRL: Boosting Visual Question Answering via Optimized Question-Image Relation Learning

Quanxing Xu, Ling Zhou, Xian Zhong, Feifei Zhang, Rubing Huang, Chia-Wen Lin

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20871 2025-04-04 cs.CV cs.AI cs.CL 57%

VinaBench: Benchmark for Faithful and Consistent Visual Narratives

Silin Gao, Sheryl Mathew, Li Mi, Sepideh Mamooler, Mengjie Zhao, Hiromi Wakaki, Yuki Mitsufuji, Syrielle Montariol, Antoine Bosselut

专题命中 图像生成评测 :generative vision(abstract);分类 cs.CV

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11367 2025-04-04 cs.CV 57%

OSV: One Step is Enough for High-Quality Image to Video Generation

Xiaofeng Mao, Zhengkai Jiang, Fu-Yun Wang, Jiangning Zhang, Hao Chen, Mingmin Chi, Yabiao Wang, Wenhan Luo

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22262 2025-03-31 cs.CV 57%

Mono2Stereo: A Benchmark and Empirical Study for Stereo Conversion

Songsong Yu, Yuxin Chen, Zhongang Qi, Zeke Xie, Yifan Wang, Lijun Wang, Ying Shan, Huchuan Lu

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2025 Project webpage: https://mono2stereo-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18462 2025-03-25 cs.LG cs.AI cs.CV 57%

PALATE: Peculiar Application of the Law of Total Expectation to Enhance the Evaluation of Deep Generative Models

Tadeusz Dziarmaga, Marcin Kądziołka, Artur Kasymov, Marcin Mazur

专题命中 图像生成评测 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05869 2025-03-25 cs.CV cs.AI cs.RO 57%

Believing is Seeing: Unobserved Object Detection using Generative Models

Subhransu S. Bhattacharjee, Dylan Campbell, Rahul Shome

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments IEEE/CVF Computer Vision and Pattern Recognition 2025; 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06187 2025-03-21 cs.CV 57%

Multi-subject Open-set Personalization in Video Generation

Tsai-Shien Chen, Aliaksandr Siarohin, Willi Menapace, Yuwei Fang, Kwot Sin Lee, Ivan Skorokhodov, Kfir Aberman, Jun-Yan Zhu, Ming-Hsuan Yang, Sergey Tulyakov

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments CVPR 2025. Project page: https://snap-research.github.io/open-set-video-personalization/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14974 2025-03-20 cs.CV 57%

Language-based Image Colorization: A Benchmark and Beyond

Yifan Li, Shuai Yang, Jiaying Liu

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15321 2025-03-20 cs.CV 57%

Next Patch Prediction for Autoregressive Visual Generation

Yatian Pang, Peng Jin, Shuo Yang, Bin Lin, Bin Zhu, Zhenyu Tang, Liuhan Chen, Francis E. H. Tay, Ser-Nam Lim, Harry Yang, Li Yuan

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

Comments Code: https://github.com/PKU-YuanGroup/Next-Patch-Prediction, v2: add related work "Patch-Level Training for Large Language Models", v3: Add content

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05256 2025-03-14 cs.CV cs.AI cs.LG cs.RO 57%

Extrapolated Urban View Synthesis Benchmark

Xiangyu Han, Zhen Jia, Boyi Li, Yan Wang, Boris Ivanovic, Yurong You, Lingjie Liu, Yue Wang, Marco Pavone, Chen Feng, Yiming Li

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments Project page: https://ai4ce.github.io/EUVS-Benchmark/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11584 2025-03-14 cs.RO cs.AI cs.CV 57%

DeformPAM: Data-Efficient Learning for Long-horizon Deformable Object Manipulation via Preference-based Action Alignment

Wendi Chen, Han Xue, Fangyuan Zhou, Yuan Fang, Cewu Lu

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments Accepted to ICRA 2025. Project page: https://deform-pam.robotflow.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08276 2025-03-12 cs.CV 57%

PromptLNet: Region-Adaptive Aesthetic Enhancement via Prompt Guidance in Low-Light Enhancement Net

Jun Yin, Yangfan He, Miao Zhang, Pengyu Zeng, Tianyi Wang, Shuai Lu, Xueqian Wang

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21259 2025-03-07 cs.CV cs.AI 57%

AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

Han Bao, Yue Huang, Yanbo Wang, Jiayi Ye, Xiangqi Wang, Xiuying Chen, Yue Zhao, Tianyi Zhou, Mohamed Elhoseiny, Xiangliang Zhang

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05503 2025-03-06 cs.CV cs.AI 57%

A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction

Yongfan Chen, Xiuwen Zhu, Tianyu Li

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00783 2025-03-05 cs.CV 57%

AI-Face: A Million-Scale Demographically Annotated AI-Generated Face Dataset and Fairness Benchmark

Li Lin, Santosh, Mingyang Wu, Xin Wang, Shu Hu

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments This paper has been accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14396 2025-03-04 cs.CV 57%

SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation

Yuying Ge, Sijie Zhao, Jinguo Zhu, Yixiao Ge, Kun Yi, Lin Song, Chen Li, Xiaohan Ding, Ying Shan

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

Comments We added benchmark results (without updating models) and ablation study in this version. Project released at: https://github.com/AILab-CVC/SEED-X

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19453 2025-02-28 cs.GR 57%

SVGEditBench V2: A Benchmark for Instruction-based SVG Editing

Kunato Nishina, Yusuke Matsui

专题命中 图像生成评测 :image editing(abstract);分类 cs.GR

Comments 17 pages, 14 figures. Dataset and code in https://github.com/mti-lab/SVGEditBenchv2

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18849 2025-02-25 cs.CV 57%

Dysca: A Dynamic and Scalable Benchmark for Evaluating Perception Ability of LVLMs

Jie Zhang, Zhongqi Wang, Mengqi Lei, Zheng Yuan, Bei Yan, Shiguang Shan, Xilin Chen

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments Accepted by ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏