arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1204 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1204 篇

2501.09833 2025-10-09 cs.CV 57%

Erasing More Than Intended? How Concept Erasure Degrades the Generation of Non-Target Concepts

Ibtihel Amara, Ahmed Imtiaz Humayun, Ivana Kajic, Zarana Parekh, Natalie Harris, Sarah Young, Chirag Nagpal, Najoung Kim, Junfeng He, Cristina Nader Vasconcelos, Deepak Ramachandran, Golnoosh Farnadi, Katherine Heller, Mohammad Havaei, Negar Rostamzadeh

机构 * Google Research(谷歌研究) McGill University(麦吉尔大学) Rice University(里士满大学) Google Deepmind(谷歌DeepMind)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

Comments Accepted for publication at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12543 2025-10-08 cs.AI cs.CV cs.LG 57%

Human + AI for Accelerating Ad Localization Evaluation

Harshit Rajgarhia, Shivali Dalmia, Mengyang Zhao, Mukherji Abhishek, Kiran Ganesh

机构 * Centific Global Solutions Inc.(Centific全球解决方案公司)

专题命中 图像生成评测 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05053 2025-10-07 cs.CV 57%

No-reference Quality Assessment of Contrast-distorted Images using Contrast-enhanced Pseudo Reference

Mohammad-Ali Mahmoudpour, Saeed Mahmoudpour

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03840 2025-10-07 cs.CV 57%

Mirage: Unveiling Hidden Artifacts in Synthetic Images with Large Vision-Language Models

Pranav Sharma, Shivank Garg, Durga Toshniwal

机构 * Indian Institute of Technology Roorkee(印度理工学院罗奥里分校)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

Comments ACM MM'25, MALLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02787 2025-10-06 cs.CV 57%

OTR: Synthesizing Overlay Text Dataset for Text Removal

Jan Zdenek, Wataru Shimoda, Kota Yamaguchi

机构 * CyberAgent Tokyo Japan(CyberAgent东京日本)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

Comments This is the author's version of the work. It is posted here for your personal use. Not for redistribution. The definitive Version of Record was published in Proceedings of the 33rd ACM International Conference on Multimedia (MM '25), October 27-31, 2025, Dublin, Ireland, https://doi.org/10.1145/3746027.3758297

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24427 2025-09-30 cs.CV 57%

UI2V-Bench: An Understanding-based Image-to-video Generation Benchmark

Ailing Zhang, Lina Lei, Dehong Kong, Zhixin Wang, Jiaqi Xu, Fenglong Song, Chun-Le Guo, Chang Liu, Fan Li, Jie Chen

机构 * Peking University(北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Nankai University(南开大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Tsinghua University(清华大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09881 2025-09-30 cs.CV 57%

Counterfactual Visual Explanation via Causally-Guided Adversarial Steering

Yiran Qiao, Disheng Liu, Yiren Lu, Yu Yin, Mengnan Du, Jing Ma

机构 * Case Western Reserve University(凯斯西储大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15963 2025-09-30 cs.CV cs.CL 57%

OViP: Online Vision-Language Preference Learning for VLM Hallucination

Shujun Liu, Siyuan Wang, Zejun Li, Jianxiang Wang, Cheng Zeng, Zhongyu Wei

机构 * Fudan University(复旦大学) University of Southern California(南加州大学) ByteDance(字节跳动)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18897 2025-09-24 cs.CV 57%

RS3DBench: A Comprehensive Benchmark for 3D Spatial Perception in Remote Sensing

Jiayu Wang, Ruizhi Wang, Jie Song, Haofei Zhang, Mingli Song, Zunlei Feng, Li Sun

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Software College of Zhejiang University(浙江大学软件学院) Hangzhou City University(杭州市大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12750 2025-09-17 cs.CV 57%

What Makes a Good Generated Image? Investigating Human and Multimodal LLM Image Preference Alignment

Rishab Parthasarathy, Jasmine Collins, Cory Stephenson

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

Comments 7 pages, 9 figures, 3 tables; appendix 16 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12474 2025-09-17 cs.CV 57%

Image Tokenizer Needs Post-Training

Kai Qiu, Xiang Li, Hao Chen, Jason Kuen, Xiaohao Xu, Jiuxiang Gu, Yinyi Luo, Bhiksha Raj, Zhe Lin, Marios Savvides

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe Research(Adobe研究) University of Michigan(密歇根大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments 21 pages, 16 figures, 10 tables. arXiv admin note: substantial text overlap with arXiv:2503.08354

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11959 2025-09-16 cs.CV cs.RO 57%

Learning to Generate 4D LiDAR Sequences

Ao Liang, Youquan Liu, Yu Yang, Dongyue Lu, Linfeng Li, Lingdong Kong, Huaici Zhao, Wei Tsang Ooi

机构 * NUS(国立新加坡大学) UCAS(中国科学院大学) SIA, CAS(中国科学院上海自动化研究所) FDU(福建大学) ZJU(浙江大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments Abstract Paper (Non-Archival) @ ICCV 2025 Wild3D Workshop; GitHub Repo at https://lidarcrafter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10096 2025-09-15 cs.RO cs.CV 57%

HHI-Assist: A Dataset and Benchmark of Human-Human Interaction in Physical Assistance Scenario

Saeed Saadatnejad, Reyhaneh Hosseininejad, Jose Barreiros, Katherine M. Tsui, Alexandre Alahi

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments Accepted to RA-L 2025

Journal ref IEEE Robotics and Automation Letters, vol. 10, no. 9, pp. 8746-8753, Sept. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09172 2025-09-12 cs.CV 57%

Bridging the Gap Between Ideal and Real-world Evaluation: Benchmarking AI-Generated Image Detection in Challenging Scenarios

Chunxiao Li, Xiaoxiao Wang, Meiling Li, Boming Miao, Peng Sun, Yunjian Zhang, Xiangyang Ji, Yao Zhu

机构 * Beijing Normal University(北京师范大学) University of Chinese Academy of Sciences(中国科学院大学) Fudan University(复旦大学) Central University of Finance and Economics(中央财经大学) Tsinghua University(清华大学)

专题命中 图像生成评测 :image synthesis(abstract);分类 cs.CV

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08777 2025-09-11 cs.CV cs.CL 57%

Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles

Eric Slyman, Mehrab Tanjim, Kushal Kafle, Stefan Lee

机构 * Adobe(Adobe公司) Oregon State University(俄勒冈州立大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

Comments 17 pages, 8 figures, Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13155 2025-09-11 cs.CV 57%

F-Bench: Rethinking Human Preference Evaluation Metrics for Benchmarking Face Generation, Customization, and Restoration

Lu Liu, Huiyu Duan, Qiang Hu, Liu Yang, Chunlei Cai, Tianxiao Ye, Huayu Liu, Xiaoyun Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Bilibili Inc.(哔哩哔哩公司)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14494 2025-09-04 cs.CV 57%

Deeply Supervised Flow-Based Generative Models

Inkyu Shin, Chenglin Yang, Liang-Chieh Chen

机构 * ByteDance Seed(字节跳动种子)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

Comments Accepted to ICCV 2025. Project website at https://deepflow-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01411 2025-09-03 cs.CV 57%

MILO: A Lightweight Perceptual Quality Metric for Image and Latent-Space Optimization

Uğur Çoğalan, Mojtaba Bemana, Karol Myszkowski, Hans-Peter Seidel, Colin Groth

机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所(信息研究所))

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00381 2025-09-03 cs.CV cs.HC 57%

Visually Grounded Narratives: Reducing Cognitive Burden in Researcher-Participant Interaction

Runtong Wu, Jiayao Song, Fei Teng, Xianhao Ren, Yuyan Gao, Kailun Yang

机构 * School of Mathematics, Hunan University(湖南大学数学学院) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) International Business School, Henan University of Economics and Law(河南财经政法大学国际商学院) Science & Technology College, University of Lorraine(洛林大学科学技术学院)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22677 2025-08-29 cs.CV cs.AI cs.LG 57%

DSO: Aligning 3D Generators with Simulation Feedback for Physical Soundness

Ruining Li, Chuanxia Zheng, Christian Rupprecht, Andrea Vedaldi

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments Accepted at ICCV 2025 (Highlight). Project page: https://ruiningli.com/dso

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18569 2025-08-27 cs.CL cs.CV 57%

The Mind's Eye: A Multi-Faceted Reward Framework for Guiding Visual Metaphor Generation

Girish A. Koushik, Fatemeh Nazarieh, Katherine Birch, Shenbin Qian, Diptesh Kanojia

机构 * NICE Research Group(NICE研究组) Centre for Translation Studies(翻译研究中心) Institute for People-Centred AI(以人为本的人工智能研究所) School of Computer Science & Electronic Engineering, University of Surrey, UK(Surrey大学计算机科学与电子工程学院)

专题命中 图像生成评测 :image synthesis(abstract);分类 cs.CV

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13515 2025-08-21 cs.CV 57%

2D Gaussians Meet Visual Tokenizer

Yiang Shi, Xiaoyang Guo, Wei Yin, Mingkai Jia, Qian Zhang, Xiaolin Hu, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Horizon Robotics Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13632 2025-08-20 cs.CV 57%

OmniTry: Virtual Try-On Anything without Masks

Yutong Feng, Linlin Zhang, Hengyuan Cao, Yiming Chen, Xiaoduan Feng, Jian Cao, Yuxiong Wu, Bin Wang

机构 * Kunbyte AI Zhejiang University(浙江大学)

专题命中 图像生成评测 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11255 2025-08-18 cs.CV 57%

FantasyTalking2: Timestep-Layer Adaptive Preference Optimization for Audio-Driven Portrait Animation

MengChao Wang, Qiang Wang, Fan Jiang, Mu Xu

机构 * Project Leader(项目负责人)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments https://fantasy-amap.github.io/fantasy-talking2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09715 2025-08-14 cs.CV cs.LG 57%

NEURAL: Attention-Guided Pruning for Unified Multimodal Resource-Constrained Clinical Evaluation

Devvrat Joshi, Islem Rekik

机构 * BASIRA Lab, Imperial-X (I-X) and Department of Computing, Imperial College London(BASIRA实验室、Imperial-X(I-X)及帝国理工学院计算机系)

专题命中 图像生成评测 :generative vision(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07905 2025-08-12 cs.CV 57%

Generative Video Matting

Yongtao Ge, Kangyang Xie, Guangkai Xu, Mingyu Liu, Li Ke, Longtao Huang, Hui Xue, Hao Chen, Chunhua Shen

机构 * The University of Adelaide(阿德莱德大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Zhejiang University of Technology(浙江工业大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Journal ref SIGGRAPH Conference Papers 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18645 2025-08-05 cs.CV 57%

Scendi Score: Prompt-Aware Diversity Evaluation via Schur Complement of CLIP Embeddings

Azim Ospanov, Mohammad Jalali, Farzan Farnia

机构 * The Chinese University of Hong Kong, Department of Computer Science & Engineering(香港中文大学计算机科学与工程系)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00428 2025-08-04 cs.GR cs.HC 57%

Sel3DCraft: Interactive Visual Prompts for User-Friendly Text-to-3D Generation

Nan Xiang, Tianyi Liang, Haiwen Huang, Shiqi Jiang, Hao Huang, Yifei Huang, Liangyu Chen, Changbo Wang, Chenhui Li

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.GR

Comments IEEE VIS VAST 2025 ACM 2012 CCS - Human-centered computing, Visualization, Visualization design and evaluation methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21205 2025-07-30 cs.LG cs.AI cs.CV 57%

Learning from Limited and Imperfect Data

Harsh Rangwani

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

Comments PhD Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20987 2025-07-30 cs.CV cs.AI 57%

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1

Xinhan Di, Kristin Qi, Pengqian Yu

机构 * Computer Science, University of Massachusetts Boston(马萨诸塞大学波士顿分校计算机科学系) National University of Singapore(新加坡国立大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments WiCV @ ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏