arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1204 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1204 篇

2506.09081 2025-07-30 cs.CV cs.AI cs.CL 57%

FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation

Zheqi He, Yesheng Liu, Jing-shu Zheng, Xuejing Li, Jin-Ge Yao, Bowen Qin, Richeng Xuan, Xi Yang

机构 * BAAI FlagEval Team(BAAI 评测团队)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

Comments Accepted by ACL 2025 Demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14540 2025-07-30 cs.RO cs.AI cs.CV 57%

IRASim: A Fine-Grained World Model for Robot Manipulation

Fangqi Zhu, Hongtao Wu, Song Guo, Yuxiao Liu, Chilam Cheang, Tao Kong

机构 * Hong Kong University of Science and Technology(香港科技大学) ByteDance Seed(字节跳动种子)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments Opensource, project website: https://gen-irasim.github.io

Journal ref ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20808 2025-07-29 cs.CV 57%

FantasyID: A dataset for detecting digital manipulations of ID-documents

Pavel Korshunov, Amir Mohammadi, Vidit Vidit, Christophe Ecabert, Sébastien Marcel

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

Comments Accepted to IJCB 2025; for project page, see https://www.idiap.ch/paper/fantasyid

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21745 2025-07-29 cs.CV 57%

3DGen-Bench: Comprehensive Benchmark Suite for 3D Generative Models

Yuhan Zhang, Mengchen Zhang, Tong Wu, Tengfei Wang, Gordon Wetzstein, Dahua Lin, Ziwei Liu

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Stanford University(斯坦福大学) The Chinese University of Hong Kong(香港中文大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

Comments Page: https://zyh482.github.io/3DGen-Bench/ ; Code: https://github.com/3DTopia/3DGen-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10395 2025-07-15 cs.CV cs.AI 57%

Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation

Zhiyang Xu, Jiuhai Chen, Zhaojiang Lin, Xichen Pan, Lifu Huang, Tianyi Zhou, Madian Khabsa, Qifan Wang, Di Jin, Michihiro Yasunaga, Lili Yu, Xi Victoria Lin, Shaoliang Nie

机构 * Meta University of Maryland(马里兰大学) New York University(纽约大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

Comments Unified image understanding and generation model

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08908 2025-07-11 cs.CV 57%

SkipVAR: Accelerating Visual Autoregressive Modeling via Adaptive Frequency-Aware Skipping

Jiajun Li, Yue Ma, Xinyu Zhang, Qingyan Wei, Songhua Liu, Linfeng Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) The Hong Kong University of Science and Technology(香港科技大学) Central South University(中南大学) National University of Singapore(新加坡国立大学) Shanghai Jiaotong University(上海交通大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04930 2025-07-08 cs.CV 57%

RainShift: A Benchmark for Precipitation Downscaling Across Geographies

Paula Harder, Luca Schmidt, Francis Pelletier, Nicole Ludwig, Matthew Chantry, Christian Lessig, Alex Hernandez-Garcia, David Rolnick

机构 * Mila Quebec AI Institute(魁北克AI研究所) European Centre for Medium Range Weather Forecasts(欧洲中期天气预报中心) Cluster of Excellence Machine Learning(卓越机器学习集群) University of Tübingen(图宾根大学) McGill University(麦吉尔大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00006 2025-07-02 cs.GR cs.LG eess.IV 57%

MVGBench: Comprehensive Benchmark for Multi-view Generation Models

Xianghui Xie, Chuhang Zou, Meher Gitika Karumuri, Jan Eric Lenssen, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Independent researcher(独立研究者)

专题命中 图像生成评测 :image generation(abstract);分类 cs.GR

Comments 17 pages, 11 figures, 9 tables, project page: https://virtualhumans.mpi-inf.mpg.de/MVGBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13952 2025-06-27 cs.CV 57%

SimWorld: A Unified Benchmark for Simulator-Conditioned Scene Generation via World Model

Xinqing Li, Ruiqi Song, Qingyu Xie, Ye Wu, Nanxin Zeng, Yunfeng Ai

机构 * The School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Waytous Inc.(Waytous公司) The State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20922 2025-06-27 cs.CV 57%

M2SFormer: Multi-Spectral and Multi-Scale Attention with Edge-Aware Difficulty Guidance for Image Forgery Localization

Ju-Hyeon Nam, Dong-Hyun Moon, Sang-Chul Lee

机构 * Department of Electrical and Computer Engineering, Inha University(电子与计算机工程系,inha大学) DeepCardio

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

Comments Accepted in International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20151 2025-06-26 cs.CV cs.AI 57%

EAR: Erasing Concepts from Unified Autoregressive Models

Haipeng Fan, Shiyuan Zhang, Baohunesitu, Zihang Guo, Huaiwen Zhang

机构 * Inner Mongolia University(内蒙古大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

Comments 11 pages, 7 figures, 1 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00912 2025-06-23 cs.CV cs.CL 57%

AutoPresent: Designing Structured Visuals from Scratch

Jiaxin Ge, Zora Zhiruo Wang, Xuhui Zhou, Yi-Hao Peng, Sanjay Subramanian, Qinyue Tan, Maarten Sap, Alane Suhr, Daniel Fried, Graham Neubig, Trevor Darrell

机构 * University of California, Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15180 2025-06-19 cs.CV 57%

ReSeDis: A Dataset for Referring-based Object Search across Large-Scale Image Collections

Ziling Huang, Yidan Zhang, Shin'ichi Satoh

机构 * National Institute of Informatics(日本国立信息学研究所) The University of Tokyo(东京大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11144 2025-06-16 cs.CV 57%

AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation

Chao Liang, Jianwen Jiang, Wang Liao, Jiaqi Yang, Zerong zheng, Weihong Zeng, Han Liang

机构 * ByteDance(字节跳动)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments Homepage: https://alignhuman.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10639 2025-06-13 cs.CV 57%

GigaVideo-1: Advancing Video Generation via Automatic Feedback with 4 GPU-Hours Fine-Tuning

Xiaoyi Bao, Jindi Lv, Xiaofeng Wang, Zheng Zhu, Xinze Chen, YuKun Zhou, Jiancheng Lv, Xingang Wang, Guan Huang

机构 * GigaAI Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09988 2025-06-12 cs.CV cs.AI cs.LG 57%

EditInspector: A Benchmark for Evaluation of Text-Guided Image Edits

Ron Yosef, Moran Yanuka, Yonatan Bitton, Dani Lischinski

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06733 2025-06-12 cs.CV 57%

RecipeGen: A Step-Aligned Multimodal Benchmark for Real-World Recipe Generation

Ruoxuan Zhang, Jidong Gao, Bin Wen, Hongxia Xie, Chenming Zhang, Hong-Han Shuai, Wen-Huang Cheng

机构 * Jilin University(吉林大学) Guangdong University of Technology(广东工业大学) National Chiao Tung University(交通大学) National Taiwan University(国立台湾大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

Comments This is an extended version of arXiv:2503.05228

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14361 2025-06-11 cs.CV 57%

Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives

Xingxing Weng, Chao Pang, Gui-Song Xia

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

Comments Accepted by IEEE Geoscience and Remote Sensing Magazine

Journal ref IEEE Geoscience and Remote Sensing Magazine, Early Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07542 2025-06-10 cs.CV cs.AI 57%

APTOS-2024 challenge report: Generation of synthetic 3D OCT images from fundus photographs

Bowen Liu, Weiyi Zhang, Peranut Chotcomwongse, Xiaolan Chen, Ruoyu Chen, Pawin Pakaymaskul, Niracha Arjkongharn, Nattaporn Vongsa, Xuelian Cheng, Zongyuan Ge, Kun Huang, Xiaohui Li, Yiru Duan, Zhenbang Wang, BaoYe Xie, Qiang Chen, Huazhu Fu, Michael A. Mahr, Jiaqi Qu, Wangyiyang Chen, Shiye Wang, Yubo Tan, Yongjie Li, Mingguang He, Danli Shi, Paisan Ruamviboonsuk

专题命中 图像生成评测 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15239 2025-06-10 cs.CV cs.AI cs.IR 57%

Benchmark Granularity and Model Robustness for Image-Text Retrieval

Mariya Hendriksen, Shuo Zhang, Ridho Reinanda, Mohamed Yahya, Edgar Meij, Maarten de Rijke

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

Comments accepted at SIGIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03420 2025-06-05 eess.IV cs.CV cs.LG 57%

Hybrid Ensemble of Segmentation-Assisted Classification and GBDT for Skin Cancer Detection with Engineered Metadata and Synthetic Lesions from ISIC 2024 Non-Dermoscopic 3D-TBP Images

Muhammad Zubair Hasan, Fahmida Yasmin Rifat

机构 * University of North Texas(北卡罗来纳州立大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments Written as per the requirements of CVPR 2025. It is a 8 page paper without reference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19901 2025-06-04 cs.CV 57%

Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM

Peng Liu, Xiaoming Ren, Fengkai Liu, Qingsong Xie, Quanlong Zheng, Yanhao Zhang, Haonan Lu, Yujiu Yang

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00874 2025-06-03 cs.CV 57%

Breaking Latent Prior Bias in Detectors for Generalizable AIGC Image Detection

Yue Zhou, Xinan He, KaiQing Lin, Bin Fan, Feng Ding, Bin Li

机构 * Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen Key Laboratory of Media Security, and SZU-AFS Joint Innovation Center for AI Technology(广东智能信息处理省级重点实验室、深圳媒体安全重点实验室及SZU-AFS人工智能技术联合创新中心) Nanchang University(南昌大学) University of North Texas(北卡罗来纳州立大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16832 2025-05-29 cs.AI cs.CL cs.CV cs.LG 57%

From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization

Haonian Ji, Shi Qiu, Siyang Xin, Siwei Han, Zhaorun Chen, Dake Zhang, Hongyi Wang, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) University of Chicago(芝加哥大学) Rutgers University(罗格斯大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments 16 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19522 2025-05-27 cs.CV cs.LG 57%

Applications and Effect Evaluation of Generative Adversarial Networks in Semi-Supervised Learning

Jiyu Hu, Haijiang Zeng, Zhen Tian

机构 * Huaiyin Institute of Technology(淮阴科技学院) Walmart Inc.(沃尔玛公司) University of Glasgow(格拉斯哥大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18775 2025-05-27 cs.CV cs.AI 57%

OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks

Jiayu Wang, Yang Jiao, Yue Yu, Tianwen Qian, Shaoxiang Chen, Jingjing Chen, Yu-Gang Jiang

机构 * Shanghai Key Lab of Intell. Info. Processing, Fudan University(上海智能信息处理关键实验室,复旦大学) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17613 2025-05-26 cs.AI cs.CL cs.CV 57%

MMMG: a Comprehensive and Reliable Evaluation Suite for Multitask Multimodal Generation

Jihan Yao, Yushi Hu, Yujie Yi, Bin Han, Shangbin Feng, Guang Yang, Bingbing Wen, Ranjay Krishna, Lucy Lu Wang, Yulia Tsvetkov, Noah A. Smith, Banghua Zhu

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14682 2025-05-21 cs.CV 57%

UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation

Rui Tian, Mingfei Gao, Mingze Xu, Jiaming Hu, Jiasen Lu, Zuxuan Wu, Yinfei Yang, Afshin Dehghan

机构 * Apple(苹果公司) Fudan University(复旦大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08552 2025-05-14 cs.CV cs.AI cs.LG 57%

DFA-CON: A Contrastive Learning Approach for Detecting Copyright Infringement in DeepFake Art

Haroon Wahab, Hassan Ugail, Irfan Mehmood

专题命中 图像生成评测 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21308 2025-05-01 cs.CV 57%

AGHI-QA: A Subjective-Aligned Dataset and Metric for AI-Generated Human Images

Yunhao Li, Sijing Wu, Wei Sun, Zhichao Zhang, Yucheng Zhu, Zicheng Zhang, Huiyu Duan, Xiongkuo Min, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏