arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86504 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2206.07699 2023-02-20 cs.CV cs.CL cs.LG 85%

Write and Paint: Generative Vision-Language Models are Unified Modal Learners

Shizhe Diao, Wangchunshu Zhou, Xinsong Zhang, Jiawei Wang

专题命中 文生图 :generative vision(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.03702 2023-02-02 cs.CV 85%

BIGRoC: Boosting Image Generation via a Robust Classifier

Roy Ganz, Michael Elad

专题命中 文生图 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

Journal ref Transactions on machine learning research, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.14491 2022-11-23 cs.CV cs.AI cs.LG 85%

Re-Imagen: Retrieval-Augmented Text-to-Image Generator

Wenhu Chen, Hexiang Hu, Chitwan Saharia, William W. Cohen

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11742 2022-11-22 cs.CV 85%

SceneComposer: Any-Level Semantic Image Synthesis

Yu Zeng, Zhe Lin, Jianming Zhang, Qing Liu, John Collomosse, Jason Kuen, Vishal M. Patel

专题命中 文生图 :image synthesis(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.15230 2022-10-28 cs.CL cs.AI cs.LG cs.MM 85%

How well can Text-to-Image Generative Models understand Ethical Natural Language Interventions?

Hritik Bansal, Da Yin, Masoud Monajatipoor, Kai-Wei Chang

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.MM

Comments 13 pages, 8 figures, 6 tables. Accepted as Oral Presentation at EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.11824 2022-10-25 cs.CV 85%

Semi-Parametric Neural Image Synthesis

Andreas Blattmann, Robin Rombach, Kaan Oktay, Jonas Müller, Björn Ommer

专题命中 文生图 :image synthesis(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.06192 2022-09-14 cs.CV cs.AI cs.CL 85%

StoryDALL-E: Adapting Pretrained Text-to-Image Transformers for Story Continuation

Adyasha Maharana, Darryl Hannan, Mohit Bansal

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments ECCV 2022 (33 pages; code, data, demo, model card available at https://github.com/adymaharana/storydalle)

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.12929 2022-03-01 cs.CV cs.LG 85%

OptGAN: Optimizing and Interpreting the Latent Space of the Conditional Text-to-Image GANs

Zhenxing Zhang, Lambert Schomaker

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.03243 2021-03-05 cs.CV 85%

Anycost GANs for Interactive Image Synthesis and Editing

Ji Lin, Richard Zhang, Frieder Ganz, Song Han, Jun-Yan Zhu

专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);image editing(abstract);分类 cs.CV

Comments Accepted to CVPR 2021. The code and demo are available: https://github.com/mit-han-lab/anycost-gan

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.13736 2020-12-29 cs.CV eess.IV 85%

Image Synthesis with Adversarial Networks: a Comprehensive Survey and Case Studies

Pourya Shamsolmoali, Masoumeh Zareapoor, Eric Granger, Huiyu Zhou, Ruili Wang, M. Emre Celebi, Jie Yang

专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.05551 2018-01-18 cs.CV 85%

Semi-supervised FusedGAN for Conditional Image Generation

Navaneeth Bodla, Gang Hua, Rama Chellappa

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.06676 2017-06-06 cs.CV cs.CL 85%

I2T2I: Learning Text to Image Synthesis with Textual Data Augmentation

Hao Dong, Jingqing Zhang, Douglas McIlwraith, Yike Guo

专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments International Conference on Image Processing (ICIP) 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10005 2025-06-13 cs.CV cs.AI cs.CL cs.GR cs.MM 85%

Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models

Sridhar S, Nithin A, Shakeel Rifath, Vasantha Raj

机构 * Computer Science Engineering(计算机科学与工程) Hindustan Institute of Technology and Science(印度恒河理工学院与科学研究院)

专题命中 文生图 :text-to-image(title,comments);diffusion(abstract);image synthesis(abstract);分类 cs.CV、cs.GR、cs.MM

Comments 10 pages, seven figures about Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08652 2026-08-07 cs.AI 版本更新 85%

CoCo: Code as CoT for Text-to-Image Preview and Rare Concept Generation

CoCo:用于文本到图像预览和稀有概念生成的代码作为CoT

Haodong Li, Chunmei Qing, Huanyu Zhang, Dongzhi Jiang, Yihang Zou, Hongbo Peng, Dingming Li, Yuhong Dai, ZePeng Lin, Juanxi Tian, Yi Zhou, Siqi Dai, Jingwei Wu, Pheng-Ann Heng

机构 * South China University of Technology(南方科技大学) StepFun Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);image editing(abstract)

AI总结 CoCo通过代码驱动的推理框架,提升文本到图像生成的精度和可控性,实现结构化图像生成和稀有概念生成。

Comments 21 pages, 7 figures, and 3 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17779 2026-07-21 cs.AI 新提交 85%

Dynamic Defense Profiling Enables Cognitive Jailbreak of Text-to-Image Models

动态防御剖析实现文本到图像模型的认知越狱

Dongdong Yang, Deyue Zhang, Zhao Liu, Zonghao Ying, Wenzhuo Xu, Jiankai Jin, Xiangzheng Zhang, Quanchen Zou

机构 * Alibaba Tongyi Lab(阿里巴巴通义实验室)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract,abstract_cn)

AI总结 研究文本到图像模型易受对抗性滥用问题,提出MIND认知越狱框架,将对抗提示生成重构为信念状态推理,集成多模态判断器等组件,经实验验证其在多个防御设置下显著优于现有方法,有效实现越狱生成。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08724 2026-06-09 cs.LG 版本更新 85%

Exposing Hidden Biases in Text-to-Image Models via Automated Prompt Search

通过自动化提示搜索暴露文本到图像模型中的隐藏偏见

Manos Plitsis, Giorgos Bouritsas, Vassilis Katsouros, Yannis Panagakis

机构 * University of Edinburgh(爱丁堡大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract,abstract_cn)

AI总结 本文提出Bias-Guided Prompt Search框架,通过自动生成提示最大化图像偏见,揭示文本到图像模型中的隐藏偏见,提升公平性评估。

Comments ICML 2026. Code is here: https://github.com/manosplitsis/BGPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01137 2026-04-20 cs.CL 85%

Follow the Flow: On Information Flow Across Textual Tokens in Text-to-Image Models

跟随流动:文本到图像模型中文本令牌间信息流动的研究

Guy Kaplan, Michael Toker, Yuval Reif, Yonatan Belinkov, Roy Schwartz

机构 * Hebrew University of Jerusalem(海法大学) Technion – Israel Institute of Technology(技术学院 – 以色列理工学院) Kempner Institute, Harvard University(哈佛大学凯普纳研究所)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract)

AI总结 本文研究文本到图像模型中令牌表示间的信息分布,发现信息常集中于少数几个令牌,且令牌间存在孤立与交互影响,改进编码可提升生成质量。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07422 2026-04-10 cs.LG 85%

Multimodal Large Language Models for Multi-Subject In-Context Image Generation

多模态大语言模型用于多主体上下文图像生成

Yucheng Zhou, Dubing Chen, Huan Zheng, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学,科技学院,计算机与信息科学系,智慧城市物联网国家重点实验室)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 本文提出MUSIC模型,通过视觉链式思维机制和空间布局规划方法,解决多主体上下文图像生成中的主体缺失和语义漂移问题,并在多主体场景中取得显著优势。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17928 2024-10-29 cs.CL cs.AI 85%

Pioneering Reliable Assessment in Text-to-Image Knowledge Editing: Leveraging a Fine-Grained Dataset and an Innovative Criterion

Hengrui Gu, Kaixiong Zhou, Yili Wang, Ruobing Wang, Xin Wang

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract)

Comments Accepted to EMNLP24 Findings. Our code is available at https://github.com/Hengrui-Gu/T2IKnowledgeEditing

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17236 2024-05-28 cs.HC 85%

From Text to Blueprint: Leveraging Text-to-Image Tools for Floor Plan Creation

Xiaoyu Li, Jonathan Benjamin, Xin Zhang

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);image synthesis(abstract)

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03046 2026-07-07 cs.CV 新提交 84%

Text-to-Image Generation for Projector-Camera System Registration

用于投影仪-相机系统配准的文本到图像生成

Xinyu Chen, Yuqi Li, Jiabao Li, Pinyan Tang, Chong Wang, Aditi Majumder

机构 * Ningbo University(宁波大学) University of California, Irvine(加利福尼亚大学欧文分校)

专题命中 文生图 :image generation(title);text-to-image(title);分类 cs.CV

AI总结 针对投影仪-相机系统配准中现有方法的局限,提出基于深度神经网络的方法,从文本提示生成自然图像,增强配准精度,经实验验证该方法实用有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05829 2026-06-05 cs.CV 84%

Gender Artifacts from Art History to Text-to-Image Generation

从艺术史到文本到图像生成中的性别伪影

Piera Riccio, Miriam Doh, Benedikt Höltgen, Noa Garcia, Nanne van Noord

机构 * University of Amsterdam(阿姆斯特丹大学) Université Libre de Bruxelles(布鲁塞尔自由大学) Hasso Plattner Institut University of Potsdam(波茨坦大学霍索普纳研究所) The University of Osaka(大阪大学)

专题命中 文生图 :image generation(title);text-to-image(title);分类 cs.CV

AI总结 通过提出性别伪影度量(PixelSGA和MaskSGA),研究了艺术风格中性别表征与视觉特征的关系,并发现文本到图像生成模型会放大历史来源中的性别伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08114 2025-10-14 cs.CV 84%

RATLIP: Generative Adversarial CLIP Text-to-Image Synthesis Based on Recurrent Affine Transformations

Chengde Lin, Xijun Lu, Guangxi Chen

机构 * School of Artificial Intelligence, Guangxi Colleges and Universities Key Laboratory of AI Algorithm Engineering(人工智能学院、广西 Colleges and Universities AI 算法工程重点实验室)

专题命中 文生图 :text-to-image(title);image synthesis(title);分类 cs.CV

Comments Accepted by 2024 IEEE International Conference on Systems, Man, and Cybernetics(SMC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11089 2025-06-04 cs.CV cs.AI cs.CY 84%

The Male CEO and the Female Assistant: Evaluation and Mitigation of Gender Biases in Text-To-Image Generation of Dual Subjects

Yixin Wan, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 文生图 :image generation(title);text-to-image(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05472 2025-05-13 cs.CV 84%

Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation

Chao Liao, Liyang Liu, Xun Wang, Zhengxiong Luo, Xinyu Zhang, Wenliang Zhao, Jie Wu, Liang Li, Zhi Tian, Weilin Huang

机构 * ByteDance Seed(字节跳动种子)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

Comments Mogao Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01107 2024-02-27 cs.CV cs.AI cs.LG stat.ML 84%

Ground-A-Video: Zero-shot Grounded Video Editing using Text-to-image Diffusion Models

Hyeonho Jeong, Jong Chul Ye

专题命中 文生图 :text-to-image(title);diffusion(title);分类 cs.CV

Comments Accepted to ICLR 2024, Project Page: http://ground-a-video.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.12663 2022-01-17 cs.CV 84%

CAGAN: Text-To-Image Generation with Combined Attention GANs

Henning Schulze, Dogucan Yaman, Alexander Waibel

专题命中 文生图 :image generation(title);text-to-image(title);分类 cs.CV

Journal ref LNCS 13024 (2021) 392-404

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.08143 2021-10-18 cs.CV 84%

Multi-Tailed, Multi-Headed, Spatial Dynamic Memory refined Text-to-Image Synthesis

Amrit Diggavi Seshadri, Balaraman Ravindran

专题命中 文生图 :text-to-image(title);image synthesis(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.13516 2021-07-29 cs.CV 84%

CRD-CGAN: Category-Consistent and Relativistic Constraints for Diverse Text-to-Image Generation

Tao Hu, Chengjiang Long, Chunxia Xiao

专题命中 文生图 :image generation(title);text-to-image(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.09178 2018-04-10 cs.CV 84%

Photographic Text-to-Image Synthesis with a Hierarchically-nested Adversarial Network

Zizhao Zhang, Yuanpu Xie, Lin Yang

专题命中 文生图 :text-to-image(title);image synthesis(title);分类 cs.CV

Comments CVPR2018 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏