arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86539 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2501.08505 2025-08-26 cs.CV eess.IV 77%

Yuan: Yielding Unblemished Aesthetics Through A Unified Network for Visual Imperfections Removal in Generated Images

Zhenyu Yu, Chee Seng Chan

专题命中 文生图 :text-to-image(abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

Journal ref AAAI 2025, Vol. 39, No. 9, pp. 9716-9724

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03320 2025-08-06 cs.CV 77%

Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation

Peiyu Wang, Yi Peng, Yimeng Gan, Liang Hu, Tianyidan Xie, Xiaokun Wang, Yichen Wei, Chuanxin Tang, Bo Zhu, Changshi Li, Hongyang Wei, Eric Li, Xuchen Song, Yang Liu, Yahui Zhou

机构 * Multimodality Team, Skywork AI(Skywork AI 多模态团队)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02324 2025-08-05 cs.CV 77%

Qwen-Image Technical Report

Chenfei Wu, Jiahao Li, Jingren Zhou, Junyang Lin, Kaiyuan Gao, Kun Yan, Sheng-ming Yin, Shuai Bai, Xiao Xu, Yilei Chen, Yuxiang Chen, Zecheng Tang, Zekai Zhang, Zhengyi Wang, An Yang, Bowen Yu, Chen Cheng, Dayiheng Liu, Deqing Li, Hang Zhang, Hao Meng, Hu Wei, Jingyuan Ni, Kai Chen, Kuan Cao, Liang Peng, Lin Qu, Minggang Wu, Peng Wang, Shuting Yu, Tingkun Wen, Wensen Feng, Xiaoxiao Xu, Yi Wang, Yichang Zhang, Yongqiang Zhu, Yujia Wu, Yuxuan Cai, Zenan Liu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

Comments https://github.com/QwenLM/Qwen-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12283 2025-07-17 cs.CV 77%

FADE: Adversarial Concept Erasure in Flow Models

Zixuan Fu, Yan Ren, Finn Carter, Chenyue Wang, Ze Niu, Dacheng Yu, Emily Davis, Bo Zhang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21356 2025-07-16 cs.CV cs.AI 77%

Nexus-Gen: Unified Image Understanding, Generation, and Editing via Prefilled Autoregression in Shared Embedding Space

Hong Zhang, Zhongjie Duan, Xingjun Wang, Yuze Zhao, Weiyi Lu, Zhipeng Di, Yixuan Xu, Yingda Chen, Yu Zhang

专题命中 文生图 :diffusion(abstract);image editing(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09595 2025-07-15 cs.CV 77%

Demystifying Flux Architecture

Or Greenberg

机构 * Hebrew University of Jerusalem(耶路撒冷希伯来大学) General Motors R&D(通用汽车研发)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00751 2025-06-24 cs.CV 77%

InstructAttribute: Fine-grained Object Attributes editing with Instruction

Xingxi Yin, Jingfeng Zhang, Yue Deng, Zhi Li, Yicheng Li, Yin Zhang

机构 * Zhejiang University(浙江大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08991 2025-06-11 cs.CV cs.CR 77%

Do Concept Replacement Techniques Really Erase Unacceptable Concepts?

Anudeep Das, Gurjot Singh, Prach Chantasantitam, N. Asokan

机构 * University of Waterloo(滑铁卢大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23161 2025-06-05 cs.CV cs.AI cs.LG 77%

Implicit Inversion turns CLIP into a Decoder

Antonio D'Orazio, Maria Rosaria Briglia, Donato Crisostomi, Dario Loi, Emanuele Rodolà, Iacopo Masi

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16039 2025-05-30 cs.CV 77%

SafeCFG: Controlling Harmful Features with Dynamic Safe Guidance for Safe Generation

Jiadong Pan, Liang Li, Hongcheng Gao, Zheng-Jun Zha, Qingming Huang, Jiebo Luo

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) University of Rochester(罗切斯特大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11131 2025-05-27 cs.CV cs.AI 77%

One Image is Worth a Thousand Words: A Usability Preservable Text-Image Collaborative Erasing Framework

Feiran Li, Qianqian Xu, Shilong Bao, Zhiyong Yang, Xiaochun Cao, Qingming Huang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments This paper has been accepeted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10297 2025-05-13 cs.CV cs.AI 77%

On Synthetic Texture Datasets: Challenges, Creation, and Curation

Blaine Hoak, Patrick McDaniel

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03667 2025-05-07 cs.CV 77%

Distribution-Conditional Generation: From Class Distribution to Creative Generation

Fu Feng, Yucheng Xie, Xu Yang, Jing Wang, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(计算机科学与工程学院,东南大学,南京,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其跨学科应用重点实验室(东南大学),教育部,中国)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14260 2025-04-22 cs.CV cs.CL 77%

Cross-attention for State-based model RWKV-7

Liu Xiao, Li Zhiyuan, Lin Yueyu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11104 2025-04-16 cs.CL cs.CV cs.CY 77%

Using LLMs as prompt modifier to avoid biases in AI image generators

René Peinl

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05838 2025-04-09 cs.CV cs.AI cs.CR 77%

Mind the Trojan Horse: Image Prompt Adapter Enabling Scalable and Deceptive Jailbreaking

Junxi Chen, Junhao Dong, Xiaohua Xie

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR2025 as Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19867 2025-04-02 cs.CV cs.AI cs.LG 77%

Data-Free Group-Wise Fully Quantized Winograd Convolution via Learnable Scales

Shuokai Pan, Gerti Tuzi, Sudarshan Sreeram, Dibakar Gope

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06143 2025-04-01 cs.CV cs.AI 77%

Precise, Fast, and Low-cost Concept Erasure in Value Space: Orthogonal Complement Matters

Yuan Wang, Ouxiang Li, Tingting Mu, Yanbin Hao, Kuien Liu, Xiang Wang, Xiangnan He

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19262 2025-03-26 cs.CV 77%

Learning Hazing to Dehazing: Towards Realistic Haze Generation for Real-World Image Dehazing

Ruiyi Wang, Yushuo Zheng, Zicheng Zhang, Chunyi Li, Shuaicheng Liu, Guangtao Zhai, Xiaohong Liu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17728 2025-03-25 cs.CV cs.AI 77%

DynASyn: Multi-Subject Personalization Enabling Dynamic Action Synthesis

Yongjin Choi, Chanhun Park, Seung Jun Baek

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17076 2025-03-24 cs.CV 77%

Halton Scheduler For Masked Generative Image Transformer

Victor Besnier, Mickael Chen, David Hurych, Eduardo Valle, Matthieu Cord

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16322 2025-03-21 cs.CV 77%

Ultra-Resolution Adaptation with Ease

Ruonan Yu, Songhua Liu, Zhenxiong Tan, Xinchao Wang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Technical Report. Codes are available \href{https://github.com/Huage001/URAE}{here}

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10639 2025-03-14 cs.CV 77%

GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing

Rongyao Fang, Chengqi Duan, Kun Wang, Linjiang Huang, Hao Li, Shilin Yan, Hao Tian, Xingyu Zeng, Rui Zhao, Jifeng Dai, Xihui Liu, Hongsheng Li

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Dataset and models are released in https://github.com/rongyaofang/GoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04229 2025-03-07 cs.CV cs.LG 77%

Synthetic Data is an Elegant GIFT for Continual Vision-Language Models

Bin Wu, Wuxuan Shi, Jinqiao Wang, Mang Ye

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments This work is accepted by CVPR 2025. Modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03664 2025-03-06 cs.CV cs.AI 77%

A Generative Approach to High Fidelity 3D Reconstruction from Text Data

Venkat Kumar R, Deepak Saravanan

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06751 2025-03-04 cs.CL cs.CV 77%

Padding Tone: A Mechanistic Analysis of Padding Tokens in T2I Models

Michael Toker, Ido Galil, Hadas Orgad, Rinon Gal, Yoad Tewel, Gal Chechik, Yonatan Belinkov

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Published in: NAACL 2025. Project webpage: https://padding-tone.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19828 2025-02-28 cs.CV 77%

Analyzing CLIP's Performance Limitations in Multi-Object Scenarios: A Controlled High-Resolution Study

Reza Abbasi, Ali Nazari, Aminreza Sefid, Mohammadali Banayeeanzade, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at ECCV 2024 Workshop EVAL-FoMo

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07753 2025-02-12 cs.CV 77%

Direct Ascent Synthesis: Revealing Hidden Generative Capabilities in Discriminative Models

Stanislav Fort, Jonathan Whitaker

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments 12 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06167 2025-02-11 cs.LG cs.AI cs.CL cs.CV 77%

Universal Approximation of Visual Autoregressive Transformers

Yifang Chen, Xiaoyu Li, Yingyu Liang, Zhenmei Shi, Zhao Song

专题命中 文生图 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14551 2025-02-11 cs.CV 77%

Advancing Fine-Grained Classification by Structure and Subject Preserving Augmentation

Eyal Michaeli, Ohad Fried

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏