arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3480 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2309.02402 2023-09-06 cs.HC 82%

Breaking Barriers to Creative Expression: Co-Designing and Implementing an Accessible Text-to-Image Interface

Atieh Taheri, Mohammad Izadi, Gururaj Shriram, Negar Rostamzadeh, Shaun Kane

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract)

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12601 2023-09-06 cs.HC cs.AI 82%

"An Adapt-or-Die Type of Situation": Perception, Adoption, and Use of Text-To-Image-Generation AI by Game Industry Professionals

Veera Vimpari, Annakaisa Kultima, Perttu Hämäläinen, Christian Guckelsberger

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract)

Comments 34 pages (incl. appendix), 3 figures, 4 tables. Coding template (31 pages, 10 tables), study invitations (email, social media) and pre-study survey provided as supplementary (ancillary) material. Accepted at ACM CHI Play 2023

Journal ref Proc. ACM Hum.-Comput. Interact., Vol. 7, No. CHI PLAY, 2023, Article 379

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07589 2023-07-24 cs.HC 82%

GenAssist: Making Image Generation Accessible

Mina Huh, Yi-Hao Peng, Amy Pavel

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract)

Comments For accessibility tagged pdf, please refer to the ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08985 2023-07-19 cs.HC cs.AI 82%

PromptCrafter: Crafting Text-to-Image Prompt through Mixed-Initiative Dialogue with LLM

Seungho Baek, Hyerin Im, Jiseung Ryu, Juhyeong Park, Takyeon Lee

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract)

Comments 5 pages, AI & HCI Workshop at the 40 International Conference on Machine Learning (ICML) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07837 2023-07-18 cs.RO 82%

Can Pre-Trained Text-to-Image Models Generate Visual Goals for Reinforcement Learning?

Jialu Gao, Kaizhe Hu, Guowei Xu, Huazhe Xu

专题命中 文生图 :text-to-image(title,abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05041 2023-06-09 cs.LG cs.AI cs.DC 82%

Energy-Efficient Downlink Semantic Generative Communication with Text-to-Image Generators

Hyein Lee, Jihong Park, Sooyoung Kim, Jinho Choi

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract)

Comments 6 pages, 7 figures. arXiv admin note: text overlap with arXiv:2302.02498

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.00561 2023-02-02 cs.AI 82%

Trash to Treasure: Using text-to-image models to inform the design of physical artefacts

Amy Smith, Hope Schroeder, Ziv Epstein, Michael Cook, Simon Colton, Andrew Lippman

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract)

Comments 6 pages, 7 figures, In proceedings of the 37th AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10578 2022-10-20 cs.CL 82%

Language Does More Than Describe: On The Lack Of Figurative Speech in Text-To-Image Models

Ricardo Kleinlein, Cristina Luna-Jiménez, Fernando Fernández-Martínez

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract)

Comments NeurIPS 2022 Machine Learning for Creativity and Design Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.09007 2022-08-18 cs.HC 82%

Opal: Multimodal Image Generation for News Illustration

Vivian Liu, Han Qiao, Lydia Chilton

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21090 2026-05-21 cs.CV 81%

TextSculptor: Training and Benchmarking Scene Text Editing

TextSculptor: 训练和评估场景文本编辑

Yiheng Lin, Siyu Jiao, Xiaohan Lan, Wei Zhou, Qi She, Fei Yu, Heyun Chen, Zhengwei Wang, Jinghuan Chen, Moran Li, Yingchen Yu, Zijian Feng, Yao Zhao, Yunchao Wei, Yujie Zhong

机构 * Beijing Jiaotong University(北京交通大学) Bytedance(字节跳动)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image editing(abstract);image synthesis(abstract)

AI总结 本文提出TextSculptor框架,通过构建大规模数据集和基准测试,解决场景文本编辑中高质量训练数据稀缺和缺乏标准化评估的问题,提升开源模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11980 2026-02-13 cs.CV 81%

Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation

空间链式思考:连接理解与生成模型以实现空间推理生成

Wei Chen, Yancheng Long, Mingqiao Liu, Haojie Ding, Yankai Yang, Hongyang Wei, Yi-Fan Zhang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 文生图 :image generation(abstract);diffusion(abstract);image editing(abstract);image synthesis(abstract)

AI总结 本文提出SCoT框架,通过结合MLLMs的推理能力与扩散模型的生成能力,提升空间推理生成任务的性能。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07702 2025-12-12 cs.CV cs.AI 81%

Guiding What Not to Generate: Automated Negative Prompting for Text-Image Alignment

引导不应生成的内容:用于文本-图像对齐的自动化负提示

Sangha Park, Eunji Kim, Yeongtak Oh, Jooyoung Choi, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Amazon(亚马逊) IPAI, AIIS, ASRI, INMC, and ISRC, Seoul National University(IPAI、AIIS、ASRI、INMC 和 ISRC,首尔国立大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 本文提出NPC方法,通过自动化负提示生成提升文本-图像对齐效果,在GenEval++和Imagine-Bench上取得优异成绩。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16917 2025-11-24 cs.CV 81%

UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation

UniModel: 一种仅依赖视觉的统一多模态理解和生成框架

Chi Zhang, Jiepeng Wang, Youming Wang, Yuanzhi Liang, Xiaoyan Yang, Zuoxin Li, Haibin Huang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究所)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 UniModel通过统一模型、任务和表示,在单一视觉空间中实现多模态理解和生成的统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15299 2025-11-20 cs.CV 81%

Taming Generative Synthetic Data for X-ray Prohibited Item Detection

Jialong Sun, Hongguang Zhu, Weizhe Liu, Yunda Sun, Renshuai Tao, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(信息科学学院,北京交通大学) Faculty of Data Science, City University of Macau(数据科学学院,澳门城市大学) Nuctech Company Limited(NuTech公司)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12528 2025-09-09 cs.CV 81%

Show-o: One Single Transformer to Unify Multimodal Understanding and Generation

Jinheng Xie, Weijia Mao, Zechen Bai, David Junhao Zhang, Weihao Wang, Kevin Qinghong Lin, Yuchao Gu, Zhijie Chen, Zhenheng Yang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) ByteDance(字节跳动)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);inpainting(abstract)

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14931 2025-08-22 eess.IV cs.GR 81%

Pixels Under Pressure: Exploring Fine-Tuning Paradigms for Foundation Models in High-Resolution Medical Imaging

Zahra TehraniNasab, Amar Kumar, Tal Arbel

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02471 2025-06-16 cs.CV 81%

Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction

Inclusion AI, Biao Gong, Cheng Zou, Dandan Zheng, Hu Yu, Jingdong Chen, Jianxin Sun, Junbo Zhao, Jun Zhou, Kaixiang Ji, Lixiang Ru, Libin Wang, Qingpei Guo, Rui Liu, Weilong Chai, Xinyu Xiao, Ziyuan Huang

机构 * Inclusion AI Ant Group(Inclusion AI蚂蚁集团)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

Comments https://github.com/inclusionAI/Ming/tree/Ming-Lite-Omni-Preview/Ming-unify

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03652 2025-06-05 cs.CV 81%

EmoArt: A Multidimensional Dataset for Emotion-Aware Artistic Generation

Cheng Zhang, Hongxia xie, Bin Wen, Songhan Zuo, Ruoxuan Zhang, Wen-huang Cheng

机构 * Jilin University(吉林大学) National Taiwan University(国立台湾大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02949 2025-04-07 cs.CV cs.AI 81%

VARGPT-v1.1: Improve Visual Autoregressive Large Unified Model via Iterative Instruction Tuning and Reinforcement Learning

Xianwei Zhuang, Yuxin Xie, Yufan Deng, Dongchao Yang, Liming Liang, Jinghan Ru, Yuguo Yin, Yuexian Zou

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract);image synthesis(abstract)

Comments Code is available at: https://github.com/VARGPT-family/VARGPT-v1.1. arXiv admin note: text overlap with arXiv:2501.12327

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18137 2025-03-25 cs.CV 81%

TCFG: Tangential Damping Classifier-free Guidance

Mingi Kwon, Shin seong Kim, Jaeseok Jeong. Yi Ting Hsiao, Youngjung Uh

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

Comments CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06089 2025-03-12 cs.CV 81%

GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis

Ashish Goswami, Satyam Kumar Modi, Santhosh Rishi Deshineni, Harman Singh, Prathosh A. P, Parag Singla

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18033 2025-01-31 cs.CV 81%

Generative AI for Vision: A Comprehensive Study of Frameworks and Applications

Fouad Bousetouane

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

Comments 53 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09826 2025-01-20 cs.CV 81%

PIXELS: Progressive Image Xemplar-based Editing with Latent Surgery

Shristi Das Biswas, Matthew Shreve, Xuelu Li, Prateek Singhal, Kaushik Roy

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02487 2025-01-16 cs.CV 81%

ACE++: Instruction-Based Image Creation and Editing via Context-Aware Content Filling

Chaojie Mao, Jingfeng Zhang, Yulin Pan, Zeyinzi Jiang, Zhen Han, Yu Liu, Jingren Zhou

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);inpainting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02230 2024-10-04 cs.CV 81%

I4VGen: Image as Free Stepping Stone for Text-to-Video Generation

Xiefan Guo, Jinlin Liu, Miaomiao Cui, Liefeng Bo, Di Huang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

Comments Project page: https://xiefan-guo.github.io/i4vgen

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10910 2024-07-17 cs.CV cs.LG 81%

DataDream: Few-shot Guided Dataset Generation

Jae Myung Kim, Jessica Bader, Stephan Alaniz, Cordelia Schmid, Zeynep Akata

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04337 2024-06-11 cs.CV cs.AI 81%

Coherent Zero-Shot Visual Instruction Generation

Quynh Phung, Songwei Ge, Jia-Bin Huang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

Comments https://instruct-vis-zero.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16823 2024-05-28 cs.CV cs.AI 81%

Unified Editing of Panorama, 3D Scenes, and Videos Through Disentangled Self-Attention Injection

Gihyun Kwon, Jangho Park, Jong Chul Ye

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

Comments Project Page: https://unifyediting.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00627 2024-05-20 cs.CV cs.AI 81%

CapHuman: Capture Your Moments in Parallel Universes

Chao Liang, Fan Ma, Linchao Zhu, Yingying Deng, Yi Yang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

Comments Accepted by CVPR 2024. Project page: https://caphuman.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18978 2024-03-29 cs.CV cs.AI cs.LG 81%

TextCraftor: Your Text Encoder Can be Image Quality Controller

Yanyu Li, Xian Liu, Anil Kag, Ju Hu, Yerlan Idelbayev, Dhritiman Sagar, Yanzhi Wang, Sergey Tulyakov, Jian Ren

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏