arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86539 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2306.15706 2023-08-22 cs.CV 77%

Approximated Prompt Tuning for Vision-Language Pre-trained Models

Qiong Wu, Shubin Huang, Yiyi Zhou, Pingyang Dai, Annan Shu, Guannan Jiang, Rongrong Ji

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.12249 2023-08-22 cs.CV cs.LG 77%

Do DALL-E and Flamingo Understand Each Other?

Hang Li, Jindong Gu, Rajat Koner, Sahand Sharifzadeh, Volker Tresp

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06571 2023-08-15 cs.CV cs.AI 77%

ModelScope Text-to-Video Technical Report

Jiuniu Wang, Hangjie Yuan, Dayou Chen, Yingya Zhang, Xiang Wang, Shiwei Zhang

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Technical report. Project page: \url{https://modelscope.cn/models/damo/text-to-video-synthesis/summary}

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08041 2023-08-15 cs.CV 77%

Planting a SEED of Vision in Large Language Model

Yuying Ge, Yixiao Ge, Ziyun Zeng, Xintao Wang, Ying Shan

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Technical Report; Project released at: https://github.com/AILab-CVC/SEED

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12980 2023-07-25 cs.CV 77%

A Systematic Survey of Prompt Engineering on Vision-Language Foundation Models

Jindong Gu, Zhen Han, Shuo Chen, Ahmad Beirami, Bailan He, Gengyuan Zhang, Ruotong Liao, Yao Qin, Volker Tresp, Philip Torr

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16811 2023-05-29 cs.CV cs.CL 77%

Improved Visual Story Generation with Adaptive Context Modeling

Zhangyin Feng, Yuchen Ren, Xinmiao Yu, Xiaocheng Feng, Duyu Tang, Shuming Shi, Bing Qin

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.11550 2023-02-23 cs.RO cs.AI cs.CL cs.CV cs.LG 77%

Scaling Robot Learning with Semantically Imagined Experience

Tianhe Yu, Ted Xiao, Austin Stone, Jonathan Tompson, Anthony Brohan, Su Wang, Jaspiar Singh, Clayton Tan, Dee M, Jodilyn Peralta, Brian Ichter, Karol Hausman, Fei Xia

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00990 2022-10-04 cs.CV cs.AI 77%

Visual Prompt Tuning for Generative Transfer Learning

Kihyuk Sohn, Yuan Hao, José Lezama, Luisa Polania, Huiwen Chang, Han Zhang, Irfan Essa, Lu Jiang

专题命中 文生图 :image generation(abstract);generative vision(abstract);image synthesis(abstract);分类 cs.CV

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.15283 2022-01-03 cs.CV cs.CL 77%

ERNIE-ViLG: Unified Generative Pre-training for Bidirectional Vision-Language Generation

Han Zhang, Weichong Yin, Yewei Fang, Lanxin Li, Boqiang Duan, Zhihua Wu, Yu Sun, Hao Tian, Hua Wu, Haifeng Wang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.10379 2021-04-06 cs.CV 77%

Generative Hierarchical Features from Synthesizing Images

Yinghao Xu, Yujun Shen, Jiapeng Zhu, Ceyuan Yang, Bolei Zhou

专题命中 文生图 :image generation(abstract);image editing(abstract);image synthesis(abstract);分类 cs.CV

Comments CVPR 2021 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.13580 2020-11-11 cs.CV cs.LG 77%

Network-to-Network Translation with Conditional Invertible Neural Networks

Robin Rombach, Patrick Esser, Björn Ommer

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments NeurIPS 2020 (oral). Code at https://github.com/CompVis/net2net

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.00472 2020-06-02 cs.CV 77%

Exemplar-based Generative Facial Editing

Jingtao Guo, Yi Liu, Zhenzhen Qian, Zuowei Zhou

专题命中 文生图 :image editing(abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.08752 2020-03-20 cs.CV 77%

Hierarchical Modes Exploring in Generative Adversarial Networks

Mengxiao Hu, Jinlong Li, Maolin Hu, Tao Hu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.03664 2017-03-13 cs.CV cs.NE 77%

Parallel Multiscale Autoregressive Density Estimation

Scott Reed, Aäron van den Oord, Nal Kalchbrenner, Sergio Gómez Colmenarejo, Ziyu Wang, Dan Belov, Nando de Freitas

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19233 2025-08-05 cs.CV cs.AI cs.MM eess.IV 76%

RAISE: Realness Assessment for Image Synthesis and Evaluation

Aniruddha Mukherjee, Spriha Dubey, Somdyuti Paul

机构 * Department of Computer Science and Engineering, Kalinga Institute of Industrial Technology(计算机科学与工程系,卡林加工业技术学院) Department of Metallurgical and Materials Engineering, Indian Institute of Technology Kharagpur(冶金与材料工程系,印度理工学院卡里格普分校) Department of Artificial Intelligence, Indian Institute of Technology Kharagpur(人工智能系,印度理工学院卡里格普分校)

专题命中 文生图 :image synthesis(title);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.15820 2022-07-22 cs.CV cs.GR 76%

Photorealism in Driving Simulations: Blending Generative Adversarial Image Synthesis with Rendering

Ekim Yurtsever, Dongfang Yang, Ibrahim Mert Koc, Keith A. Redmill

专题命中 文生图 :image synthesis(title);分类 cs.CV、cs.GR

Comments 10 pages, 5 figures, IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.04987 2020-05-20 cs.CV cs.GR 76%

Artistic Glyph Image Synthesis via One-Stage Few-Shot Learning

Yue Gao, Yuan Guo, Zhouhui Lian, Yingmin Tang, Jianguo Xiao

专题命中 文生图 :image synthesis(title);分类 cs.CV、cs.GR

Comments Accepted by SIGGRAPH Asia 2019, code and datasets: https://hologerry.github.io/AGIS-Net/

Journal ref ACM Trans. Graph. 38, 6, Article 185 (November 2019), 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.00407 2019-10-18 eess.IV cs.CV cs.GR 76%

InSituNet: Deep Image Synthesis for Parameter Space Exploration of Ensemble Simulations

Wenbin He, Junpeng Wang, Hanqi Guo, Ko-Chih Wang, Han-Wei Shen, Mukund Raj, Youssef S. G. Nashed, Tom Peterka

专题命中 文生图 :image synthesis(title);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.13149 2019-05-31 cs.CV cs.GR cs.LG stat.ML 76%

The Art of Food: Meal Image Synthesis from Ingredients

Fangda Han, Ricardo Guerrero, Vladimir Pavlovic

专题命中 文生图 :image synthesis(title);分类 cs.CV、cs.GR

Comments 12 pages, 6 figures, 2 tables, under review as a conference paper at BMVC 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.06358 2018-10-30 cs.LG cs.CV cs.GR stat.ML 76%

IntroVAE: Introspective Variational Autoencoders for Photographic Image Synthesis

Huaibo Huang, Zhihang Li, Ran He, Zhenan Sun, Tieniu Tan

专题命中 文生图 :image synthesis(title);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.09405 2017-08-01 cs.CV cs.AI cs.GR cs.LG 76%

Photographic Image Synthesis with Cascaded Refinement Networks

Qifeng Chen, Vladlen Koltun

专题命中 文生图 :image synthesis(title);分类 cs.CV、cs.GR

Comments Published at the International Conference on Computer Vision (ICCV 2017)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21036 2026-04-24 cs.AI 75%

Who Defines Fairness? Target-Based Prompting for Demographic Representation in Generative Models

谁定义了公平性?面向生成模型的基于目标的提示方法用于人口特征表示

Marzia Binta Nizam, James Davis

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 文生图 :diffusion(abstract,abstract_cn);text-to-image(abstract)

AI总结 本文提出一种轻量级框架,在推理阶段通过提示级干预减轻生成模型中的代表性偏见,允许用户选择多种公平性定义,通过审计目标符合度和肤色分布来评估公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11720 2026-01-13 cs.LG cs.AI 75%

RPO: Fine-Tuning Visual Generative Models via Rich Vision-Language Preferences

RPO:通过丰富的视觉-语言偏好进行视觉生成模型微调

Hanyang Zhao, Haoxian Chen, Yucheng Guo, Genta Indra Winata, Tingting Ou, Ziyu Huang, David D. Yao, Wenpin Tang

机构 * Columbia University(哥伦比亚大学) Amazon(亚马逊) Princeton University(普林斯顿大学) Capital One

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 RPO通过利用视觉语言模型的丰富反馈信号,改进偏好对的编纂,从而提升视觉生成模型的微调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09488 2025-09-12 cs.CR cs.AI 75%

Prompt Pirates Need a Map: Stealing Seeds helps Stealing Prompts

Felix Mächtle, Ashwath Shetty, Jonas Sander, Nils Loose, Sören Pirk, Thomas Eisenbarth

机构 * Visual Computing and Artificial Intelligence, Kiel University, Germany(视觉计算与人工智能,基尔大学,德国) Artificial Intelligence, Kiel University, Germany(人工智能,基尔大学,德国)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15227 2025-09-03 cs.HC cs.AI 75%

GenTune: Toward Traceable Prompts to Improve Controllability of Image Refinement in Environment Design

Wen-Fan Wang, Ting-Ying Lee, Chien-Ting Lu, Che-Wei Hsu, Nil Ponsa Campanyà, Yu Chen, Mike Y. Chen, Bing-Yu Chen

机构 * National Taiwan University(国立台湾大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);inpainting(abstract)

Comments Accepted ACM Symposium on User Interface Software and Technology (UIST '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10039 2025-08-15 cs.CR cs.AI 75%

Multi-task Adversarial Attacks against Black-box Model with Few-shot Queries

Wenqiang Wang, Yan Xiao, Hao Lin, Yangshijie Zhang, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Peng Cheng Laboratory(鹏城实验室) Lanzhou University(兰州大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07849 2025-05-23 cs.LG cs.AI stat.ML 75%

Classifier-Free Guidance: From High-Dimensional Analysis to Generalized Guidance Forms

Krunoslav Lehman Pavasovic, Jakob Verbeek, Giulio Biroli, Marc Mezard

机构 * FAIR at Meta(Meta 的 FAIR 部门) Bocconi University, Milan(米兰博科尼大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23948 2025-04-01 cs.AI 75%

AI2Agent: An End-to-End Framework for Deploying AI Projects as Autonomous Agents

Jiaxiang Chen, Jingwei Shi, Lei Gan, Jiale Zhang, Qingyu Zhang, Dongqian Zhang, Xin Pang, Zhucong Li, Yinghui Xu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00521 2025-03-25 cs.AI 75%

A new approach for encoding code and assisting code understanding

Mengdan Fan, Wei Zhang, Haiyan Zhao, Zhi Jin

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

Comments 10 page, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14421 2024-12-20 q-bio.NC stat.ML 75%

Comparing noisy neural population dynamics using optimal transport distances

Amin Nejatbakhsh, Victor Geadah, Alex H. Williams, David Lipshutz

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏