arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 762 信号源:cs.CV, cs.GR, cs.MM

1. 其他图像生成 762 篇

2512.16910 2025-12-19 cs.CV cs.LG 57%

SFTok: Bridging the Performance Gap in Discrete Tokenizers

SFTok: 缩小离散分词器在性能上的差距

Qihang Rao, Borui Zhang, Wenzhao Zheng, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 SFTok通过多步骤迭代机制和自引导视觉重建策略,提升图像重建质量,实现高压缩率下的高性能表现。

Comments Under review. Code is available at https://github.com/Neur-IO/SFTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16326 2025-12-12 cs.CV cs.LG 57%

When Worse is Better: Navigating the compression-generation tradeoff in visual tokenization

当更差的是更好的:在视觉分块化中的压缩-生成权衡导航

Vivek Ramanujan, Kushal Tirumala, Armen Aghajanyan, Luke Zettlemoyer, Ali Farhadi

机构 * University of Washington(华盛顿大学) Meta FAIR

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出CRT方法,通过正则化潜在空间提升生成性能,实现更高效的图像生成模型。

Comments Spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02018 2025-12-02 cs.CV cs.RO 57%

Data-Centric Visual Development for Self-Driving Labs

以数据为中心的自动驾驶实验室视觉发展

Anbang Liu, Guanzhong Hu, Jiayi Wang, Ping Guo, Han Liu

机构 * Department of Computer Science, Northwestern University(计算机科学系,西北大学) Department of Mechanical Engineering, Northwestern University(机械工程系,西北大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出了一种融合真实与虚拟数据生成的混合管道,用于解决自动驾驶实验室中pipetting任务的训练数据稀缺问题,通过人机协作和图像生成技术提升气泡检测的鲁棒性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00539 2025-12-02 cs.CV 57%

SAIDO: Generalizable Detection of AI-Generated Images via Scene-Aware and Importance-Guided Dynamic Optimization in Continual Learning

SAIDO: 通过场景感知和重要性引导的动态优化在持续学习中实现通用的人工智能生成图像检测

Yongkang Hu, Yu Cheng, Yushuo Zhang, Yuan Xie, Zhaoxia Yin

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 SAIDO通过场景感知和重要性引导的动态优化在持续学习中实现通用的人工智能生成图像检测,提升检测稳定性和可塑性。

Comments 17 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00428 2025-12-02 cs.CV 57%

Recognizing Pneumonia in Real-World Chest X-rays with a Classifier Trained with Images Synthetically Generated by Nano Banana

用Nano Banana生成的合成图像训练分类器以在真实世界胸片中识别肺炎

Jiachuan Peng, Kyle Lam, Jianing Qiu

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 利用Nano Banana生成的合成图像训练分类器,实现在真实世界胸片中识别肺炎,取得较高AUROC和AUPR,但存在提示设计和数据对齐的挑战。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22281 2025-12-01 cs.CV 57%

The Collapse of Patches

补丁的崩溃

Wei Guo, Shunqi Mao, Zhuonan Liang, Heng Wang, Weidong Cai

机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 通过补丁崩溃视角提升图像建模效率,利用补丁依赖关系优化图像生成与分类

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19343 2025-11-25 cs.CV 57%

Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning

Syn-GRPO:面向多模态大语言模型感知推理的自进化数据合成

Qihan Huang, Haofei Zhang, Rong Wei, Yi Wang, Rui Tang, Mingli Song, Jie Song

机构 * Zhejiang University(浙江大学) Manycore Tech Inc.(Manycore科技公司)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 Syn-GRPO通过自进化数据合成提升多模态大语言模型的感知推理能力,采用数据服务器与GRPO工作流协同生成高质量多样化训练数据,实验验证其在视觉感知任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12740 2025-11-18 cs.CV 57%

Deep Imbalanced Multi-Target Regression: 3D Point Cloud Voxel Content Estimation in Simulated Forests

Amirhossein Hassanzadeh, Bartosz Krawczyk, Michael Saunders, Rob Wible, Keith Krause, Dimah Dera, Jan van Aardt

机构 * United State Space Force(美国太空军) Battelle(巴特尔)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12594 2025-11-18 cs.CV 57%

Seg-VAR: Image Segmentation with Visual Autoregressive Modeling

Rongkun Zheng, Lu Qi, Xi Chen, Yi Wang, Kun Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Insta360 Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) SenseTime Research(商汤科技研究院)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

Comments NeurIPS 2025, 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08567 2025-11-17 cs.CV cs.LG 57%

Adaptive Parametric Activation: Unifying and Generalising Activation Functions Across Tasks

Konstantinos Panagiotis Alexandridis, Jiankang Deng, Anh Nguyen, Shan Luo

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Department of Computing, Imperial College London(帝国理工学院计算机系) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Department of Engineering, King’s College London(伦敦国王学院工程系)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

Comments Version 2: 19 pages, 7 figures, 13 Tables. Extension of the ECCV2024 oral paper arXiv:2407.08567v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14245 2025-11-10 cs.CV cs.CL 57%

Towards Explainable Fake Image Detection with Multi-Modal Large Language Models

Yikun Ji, Yan Hong, Jiahui Zhan, Haoxing Chen, jun lan, Huijia Zhu, Weiqiang Wang, Liqing Zhang, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

Comments Accepted to ACM MM 2025; 14 pages including Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21815 2025-10-28 eess.IV cs.AI cs.CV 57%

HDR Image Reconstruction using an Unsupervised Fusion Model

Kumbha Nagaswetha

机构 * Department of Electrical Communication Engineering, Indian Institute of Science(电子通信工程系,印度科学研究院)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20349 2025-10-24 cs.LG cs.CV 57%

Synthetic Data for Robust Runway Detection

Estelle Chigot, Dennis G. Wilson, Meriem Ghrib, Fabrice Jimenez, Thomas Oberlin

机构 * Fédération ENAC ISAE-SUPAERO ONERA(法国ENAC联合会ISAE-SUPAERO ONERA) Université de Toulouse(图卢兹大学) Airbus(空客)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

Journal ref Computer Analysis of Images and Patterns. CAIP 2025. Lecture Notes in Computer Science, vol 15621. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17869 2025-10-22 cs.CV 57%

GAN-based Content-Conditioned Generation of Handwritten Musical Symbols

Gerard Asbert, Pau Torras, Lei Kang, Alicia Fornés, Josep Lladós

机构 * Computer Vision Center(计算机视觉中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

Comments 15 pages, 5 figures, Accepted at ICDAR workshop GREC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17657 2025-10-21 cs.CV 57%

Attention (as Discrete-Time Markov) Chains

Yotam Erel, Olaf Dünkel, Rishabh Dabral, Vladislav Golyanik, Christian Theobalt, Amit H. Bermano

机构 * Tel Aviv University(特拉维夫大学) MPI for Informatics, SIC(信息学研究所)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

Comments NeurIPS 2025. Project page: https://yoterel.github.io/attention_chains/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05633 2025-10-08 cs.CV cs.AI cs.CR 57%

Beyond Spectral Peaks: Interpreting the Cues Behind Synthetic Image Detection

Sara Mandelli, Diego Vila-Portela, David Vázquez-Padín, Paolo Bestagini, Fernando Pérez-González

机构 * atlanTTic Research Center, University of Vigo(atlanTTic研究中心,维戈大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09630 2025-10-07 cs.CV cs.AI 57%

Brain Stroke Detection and Classification Using CT Imaging with Transformer Models and Explainable AI

Shomukh Qari, Maha A. Thafar

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

Comments 5 figures

Journal ref https://www.mdpi.com/2075-4418/15/19/2486

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03684 2025-10-07 q-bio.NC cs.CV 57%

Model-Guided Microstimulation Steers Primate Visual Behavior

Johannes Mehrer, Ben Lonnqvist, Anna Mitola, Abdulkadir Gokce, Paolo Papale, Martin Schrimpf

机构 * EPFL(瑞士联邦理工学院) Netherlands Institute for Neuroscience(荷兰神经科学研究所) University of Parma(帕尔马大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01758 2025-10-03 cs.LG cs.AI cs.CV 57%

Unsupervised Dynamic Feature Selection for Robust Latent Spaces in Vision Tasks

Bruno Corcuera, Carlos Eiras-Franco, Brais Cancela

机构 * Universidade da Coruña(科鲁纳大学) CITIC Research Center(CITIC研究中心)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00996 2025-10-03 cs.CV 57%

SoftCFG: Uncertainty-guided Stable Guidance for Visual Autoregressive Model

Dongli Xu, Aleksei Tiulpin, Matthew B. Blaschko

机构 * Processing Speech and Images, ESAT KU Leuven(KU莱顿大学ESAT研究所) HST Research Unit, Faculty of Medicine University of Oulu(奥卢大学医学学院HST研究单位)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15167 2025-09-18 cs.CV 57%

Enhancing Intent Understanding for Ambiguous prompt: A Human-Machine Co-Adaption Strategy

Yangfan He, Jianhui Wang, Yijin Wang, Yan Zhong, Xinyuan Song, Junjiang Lin, Xinhang Yuan, Jingqun Tang, Yi Xin, Hao Zhang, Yuchen Li, Zijian Zhang, Hongyang He, Tianxiang Xu, Miao Zhang, Kuan Lu, Menghao Huo, Keqin Li, Jiaqi Chen, Tianyu Shi, Jianyuan Ni

机构 * UMN(明尼苏达大学) UESTC(电子科技大学) XDU(西安电子科技大学) NTU(国立台湾大学) Emory(埃默里大学) Amazon(亚马逊) WUSTL(华盛顿大学) ByteDance(字节跳动) NJU(南京大学) UCAS(中国科学技术大学) Baidu(百度) Upenn(宾夕法尼亚大学) UofWarwick(沃里克大学) THU(清华大学) Google(谷歌) SCU(四川大学) AMA(美国人工智能协会) UofT(多伦多大学) PKU(北京大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19794 2025-09-18 cs.CV cs.LG cs.SE 57%

DiffGAN: A Test Generation Approach for Differential Testing of Deep Neural Networks for Image Analysis

Zohreh Aghababaeyan, Manel Abdellatif, Lionel Briand, Ramesh S

机构 * School of EECS, University of Ottawa(滑铁卢大学电子工程与计算机科学学院) Software and Information Technology Engineering Department, École de Technologie Supérieure(École de Technologie Supérieure软件与信息技术工程系) School of Electrical Engineering and Computer Science (EECS), University of Ottawa(滑铁卢大学电子工程与计算机科学学院) Lero SFI Research Center and University of Limerick(Lero SFI研究中心和利默里克大学) Department of Research and Development, General Motors(通用汽车公司研发部)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

Comments Accepted into IEEE Transactions on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03542 2025-09-05 quant-ph cs.GR 57%

The Chaotic Art: Quantum Representation and Manipulation of Color

Guosheng Hu

专题命中 其他图像生成 :image generation(abstract);分类 cs.GR

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15594 2025-08-22 eess.IV cs.AI cs.CV 57%

Are Virtual DES Images a Valid Alternative to the Real Ones?

Ana C. Perre, Luís A. Alexandre, Luís C. Freire

机构 * Faculdade Ciências da Saúde, Universidade da Beira Interior and Unidade Local de Saúde do Oeste(健康科学学院,贝拉内里大学及西部本地卫生单位) NOVA LINCS, Universidade da Beira Interior(NOVA LINCS,贝拉内里大学) Escola Superior de Tecnologia da Saúde de Lisboa, Instituto Politécnico de Lisboa(里斯本健康技术学院,里斯本技术学院)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10065 2025-08-15 cs.CR cs.CV 57%

Invisible Watermarks, Visible Gains: Steering Machine Unlearning with Bi-Level Watermarking Design

Yuhao Sun, Yihua Zhang, Gaowen Liu, Hongtao Xie, Sijia Liu

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence(人工智能研究院) Hefei Comprehensive National Science Center(合肥综合国家科学中心) Michigan State University(密歇根州立大学) Cisco Research(思科研究)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09522 2025-08-14 cs.CV cs.AI cs.LG 57%

Generation of Indian Sign Language Letters, Numbers, and Words

Ajeet Kumar Yadav, Nishant Kumar, Rathna G N

机构 * Electrical Communication Engineering Indian Institute of Science, Banglore Bengaluru, India(电子通信工程 印度科学研究院,班加罗尔 印度班加罗尔) Automation Indian Institute of Science, Banglore Bengaluru, India(自动化 印度科学研究院,班加罗尔 印度班加罗尔) Electrical Engineering Indian Institute of Science, Banglore Bengaluru, India(电气工程 印度科学研究院,班加罗尔 印度班加罗尔)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

Comments 6 pages, 5 figures, 2024 International Conference on Intelligent Algorithms for Computational Intelligence Systems (IACIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07031 2025-08-12 eess.IV cs.AI cs.CV 57%

Trustworthy Medical Imaging with Large Language Models: A Study of Hallucinations Across Modalities

Anindya Bijoy Das, Shahnewaz Karim Sakib, Shibbir Ahmed

机构 * The University of Akron(阿克隆大学) University of Tennessee at Chattanooga(田纳西大学查塔努加分校) Texas State University(德克萨斯州立大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04181 2025-08-07 cs.CV 57%

Deeper Inside Deep ViT

Sungrae Hong

机构 * Graduate School of Data Science(数据科学研究生院) KAIST(韩国科学技术院)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17332 2025-07-31 cs.CV 57%

PARTE: Part-Guided Texturing for 3D Human Reconstruction from a Single Image

Hyeongjin Nam, Donghwan Kim, Gyeongsik Moon, Kyoung Mu Lee

机构 * Dept. of ECE&ASRI, Seoul National University(电子工程与先进科学研究所,首尔国立大学) Dept. of CSE, Korea University(计算机科学与工程系,韩国大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

Comments Published at ICCV 2025, 22 pages including the supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18640 2025-07-28 cs.HC cs.AI cs.CV 57%

How good are humans at detecting AI-generated images? Learnings from an experiment

Thomas Roca, Anthony Cintron Roman, Jehú Torres Vega, Marcelo Duarte, Pengce Wang, Kevin White, Amit Misra, Juan Lavista Ferres

机构 * Microsoft AI for Good Lab(微软AI for Good实验室)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏