arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86539 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2312.02253 2025-01-22 cs.CV cs.AI cs.LG 77%

Diversify, Don't Fine-Tune: Scaling Up Visual Recognition Training with Synthetic Images

Zhuoran Yu, Chenchen Zhu, Sean Culatana, Raghuraman Krishnamoorthi, Fanyi Xiao, Yong Jae Lee

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06774 2024-12-10 cs.CV cs.AI cs.LG 77%

Visual Lexicon: Rich Image Features in Language Space

XuDong Wang, Xingyi Zhou, Alireza Fathi, Trevor Darrell, Cordelia Schmid

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Tech report. 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00782 2024-12-03 cs.CV 77%

Memories of Forgotten Concepts

Matan Rusanovsky, Shimon Malnick, Amir Jevnisek, Ohad Fried, Shai Avidan

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments The first three authors contributed equally to this work. Project page: https://matanr.github.io/Memories_of_Forgotten_Concepts/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16022 2024-11-01 cs.CV 77%

PuLID: Pure and Lightning ID Customization via Contrastive Alignment

Zinan Guo, Yanze Wu, Zhuowei Chen, Lang Chen, Peng Zhang, Qian He

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments NeurIPS 2024. Codes and models are available at https://github.com/ToTheBeginning/PuLID

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11305 2024-10-15 cs.CV cs.AI 77%

UniFashion: A Unified Vision-Language Model for Multimodal Fashion Retrieval and Generation

Xiangyu Zhao, Yuehan Zhang, Wenlong Zhang, Xiao-Ming Wu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by EMNLP 2024, main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11262 2024-10-04 cs.CV 77%

Generative Visual Instruction Tuning

Jefferson Hernandez, Ruben Villegas, Vicente Ordonez

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

Comments Add more results using task tokens, expand the introduction and related work FIX: error in LLM-as-judge evaluation that was over-inflating the results

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18401 2024-09-30 cs.CV cs.AI 77%

GenesisTex2: Stable, Consistent and High-Quality Text-to-Texture Generation

Jiawei Lu, Yingpeng Zhang, Zengjun Zhao, He Wang, Kun Zhou, Tianjia Shao

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03745 2024-09-06 cs.CV 77%

ArtiFade: Learning to Generate High-quality Subject from Blemished Images

Shuya Yang, Shaozhe Hao, Yukang Cao, Kwan-Yee K. Wong

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12418 2024-08-23 cs.CV cs.AI 77%

CODE: Confident Ordinary Differential Editing

Bastien van Delft, Tommaso Martorella, Alexandre Alahi

专题命中 文生图 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17419 2024-08-22 cs.CV 77%

AntifakePrompt: Prompt-Tuned Vision-Language Models are Fake Image Detectors

You-Ming Chang, Chen Yeh, Wei-Chen Chiu, Ning Yu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06196 2024-07-10 cs.CV cs.AI 77%

Poetry2Image: An Iterative Correction Framework for Images Generated from Chinese Classical Poetry

Jing Jiang, Yiran Ling, Binzhu Li, Pengxiang Li, Junming Piao, Yu Zhang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08478 2024-06-19 cs.CV cs.CL 77%

What If We Recaption Billions of Web Images with LLaMA-3?

Xianhang Li, Haoqin Tu, Mude Hui, Zeyu Wang, Bingchen Zhao, Junfei Xiao, Sucheng Ren, Jieru Mei, Qing Liu, Huangjie Zheng, Yuyin Zhou, Cihang Xie

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments First five authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07506 2024-06-12 cs.CV cs.AI cs.LG 77%

Understanding Visual Concepts Across Models

Brandon Trabucco, Max Gurinas, Kyle Doherty, Ruslan Salakhutdinov

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Official code at: https://github.com/visual-words/visual-words

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10103 2024-06-10 cs.CV cs.AI cs.CL 77%

ASPIRE: Language-Guided Data Augmentation for Improving Robustness Against Spurious Correlations

Sreyan Ghosh, Chandra Kiran Reddy Evuru, Sonal Kumar, Utkarsh Tyagi, Sakshi Singh, Sanjoy Chowdhury, Dinesh Manocha

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

Comments ACL 2024 Findings. Code: https://github.com/Sreyan88/ASPIRE

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02881 2024-06-07 cs.CV 77%

Inv-Adapter: ID Customization Generation via Image Inversion and Lightweight Adapter

Peng Xing, Ning Wang, Jianbo Ouyang, Zechao Li

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01071 2024-06-04 cs.CV cs.LG 77%

Visual Car Brand Classification by Implementing a Synthetic Image Dataset Creation Pipeline

Jan Lippemeier, Stefanie Hittmeyer, Oliver Niehörster, Markus Lange-Hegermann

专题命中 文生图 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18304 2024-05-29 cs.CV 77%

Multi-modal Generation via Cross-Modal In-Context Learning

Amandeep Kumar, Muzammal Naseer, Sanath Narayan, Rao Muhammad Anwer, Salman Khan, Hisham Cholakkal

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10864 2024-05-20 cs.CV cs.LG 77%

Improving face generation quality and prompt following with synthetic captions

Michail Tarasiou, Stylianos Moschoglou, Jiankang Deng, Stefanos Zafeiriou

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12631 2024-04-24 cs.CV 77%

GPT4Motion: Scripting Physical Motions in Text-to-Video Generation via Blender-Oriented GPT Planning

Jiaxi Lv, Yi Huang, Mingfu Yan, Jiancheng Huang, Jianzhuang Liu, Yifan Liu, Yafei Wen, Xiaoxin Chen, Shifeng Chen

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18231 2024-03-11 eess.IV cs.CV cs.LG stat.ML 77%

High-Fidelity Image Compression with Score-based Generative Models

Emiel Hoogeboom, Eirikur Agustsson, Fabian Mentzer, Luca Versari, George Toderici, Lucas Theis

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08750 2024-02-15 cs.CV eess.IV 77%

Towards the Detection of AI-Synthesized Human Face Images

Yuhang Lu, Touradj Ebrahimi

专题命中 文生图 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18829 2024-01-01 cs.CV 77%

MicroCinema: A Divide-and-Conquer Approach for Text-to-Video Generation

Yanhui Wang, Jianmin Bao, Wenming Weng, Ruoyu Feng, Dacheng Yin, Tao Yang, Jingxu Zhang, Qi Dai Zhiyuan Zhao, Chunyu Wang, Kai Qiu, Yuhui Yuan, Chuanxin Tang, Xiaoyan Sun, Chong Luo, Baining Guo

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project page: https://wangyanhui666.github.io/MicroCinema.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15770 2023-12-27 cs.CV cs.AI 77%

A Recipe for Scaling up Text-to-Video Generation with Text-free Videos

Xiang Wang, Shiwei Zhang, Hangjie Yuan, Zhiwu Qing, Biao Gong, Yingya Zhang, Yujun Shen, Changxin Gao, Nong Sang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project page: https://tf-t2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08889 2023-12-27 cs.CV 77%

SEEAvatar: Photorealistic Text-to-3D Avatar Generation with Constrained Geometry and Appearance

Yuanyou Xu, Zongxin Yang, Yi Yang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18007 2023-11-21 cs.CV 77%

Conditional Score Guidance for Text-Driven Image-to-Image Translation

Hyunsoo Lee, Minsoo Kang, Bohyung Han

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at NeurIPS2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10769 2023-10-18 cs.CV 77%

LAMP: Learn A Motion Pattern for Few-Shot-Based Video Generation

Ruiqi Wu, Liangyu Chen, Tong Yang, Chunle Guo, Chongyi Li, Xiangyu Zhang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project Page: https://rq-wu.github.io/projects/LAMP

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10543 2023-10-17 cs.CL cs.CV 77%

ViPE: Visualise Pretty-much Everything

Hassan Shahmohammadi, Adhiraj Ghosh, Hendrik P. A. Lensch

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments To be presented in EMNLP2023 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07419 2023-10-12 cs.CV cs.AI 77%

Multi-Concept T2I-Zero: Tweaking Only The Text Embeddings and Nothing Else

Hazarapet Tunanyan, Dejia Xu, Shant Navasardyan, Zhangyang Wang, Humphrey Shi

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05956 2023-09-13 cs.CV 77%

Beyond Generation: Harnessing Text to Image Models for Object Detection and Segmentation

Yunhao Ge, Jiashu Xu, Brian Nlong Zhao, Neel Joshi, Laurent Itti, Vibhav Vineet

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Code in https://github.com/gyhandy/Text2Image-for-Detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02591 2023-09-07 cs.LG cs.CL cs.CV 77%

Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning

Lili Yu, Bowen Shi, Ramakanth Pasunuru, Benjamin Muller, Olga Golovneva, Tianlu Wang, Arun Babu, Binh Tang, Brian Karrer, Shelly Sheynin, Candace Ross, Adam Polyak, Russell Howes, Vasu Sharma, Puxin Xu, Hovhannes Tamoyan, Oron Ashual, Uriel Singer, Shang-Wen Li, Susan Zhang, Richard James, Gargi Ghosh, Yaniv Taigman, Maryam Fazel-Zarandi, Asli Celikyilmaz, Luke Zettlemoyer, Armen Aghajanyan

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏