arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86350 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3474 篇

2010.14953 2020-10-29 cs.CV 86%

Leveraging Visual Question Answering to Improve Text-to-Image Synthesis

Stanislav Frolov, Shailza Jolly, Jörn Hees, Andreas Dengel

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title);分类 cs.CV

Comments Accepted to the LANTERN workshop at COLING 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.06658 2020-01-22 cs.CV 86%

Text-to-Image Generation with Attention Based Recurrent Neural Networks

Tehseen Zia, Shahan Arif, Shakeeb Murtaza, Mirza Ahsan Ullah

专题命中 文生图 :image generation(title,abstract);text-to-image(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.10274 2018-09-28 cs.LG cs.CL cs.CV stat.ML 86%

Semantically Invariant Text-to-Image Generation

Shagan Sah, Dheeraj Peri, Ameya Shringi, Chi Zhang, Miguel Dominguez, Andreas Savakis, Ray Ptucha

专题命中 文生图 :image generation(title,abstract);text-to-image(title);分类 cs.CV

Comments 5 papers, 5 figures, Published in 2018 25th IEEE International Conference on Image Processing (ICIP)

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.10238 2018-09-28 cs.CV cs.AI cs.LG stat.ML 86%

C4Synth: Cross-Caption Cycle-Consistent Text-to-Image Synthesis

K J Joseph, Arghya Pal, Sailaja Rajanala, Vineeth N Balasubramanian

专题命中 文生图 :text-to-image(title);image synthesis(title);image editing(abstract);分类 cs.CV

Comments To appear in the proceedings of IEEE Winter Conference on Applications of Computer Vision, WACV-2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05658 2025-08-12 cs.CR cs.CV cs.MM 86%

Universally Unfiltered and Unseen:Input-Agnostic Multimodal Jailbreaks against Text-to-Image Model Safeguards

Song Yan, Hui Wei, Jinlong Fei, Guoliang Yang, Zhengyu Zhao, Zheng Wang

机构 * Information Engineering University Zhengzhou China School of Computer Science, \ University Wuhan China Xi’an Jiaotong University Xi’an China Wuhan University Wuhan China Information Engineering University School of Computer Science, \ University Xi’an Jiaotong University Wuhan University

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV、cs.MM

Comments This paper has been accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11324 2025-03-17 cs.MM cs.CV eess.IV 86%

Safe-VAR: Safe Visual Autoregressive Model for Text-to-Image Generative Watermarking

Ziyi Wang, Songbai Tan, Gang Xu, Xuerui Qiu, Hongbin Xu, Xin Meng, Ming Li, Fei Richard Yu

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.04749 2023-12-07 cs.CV cs.AI cs.LG cs.MM stat.ML 86%

Divide, Evaluate, and Refine: Evaluating and Improving Text-to-Image Alignment with Iterative VQA Feedback

Jaskirat Singh, Liang Zheng

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV、cs.MM

Journal ref Published at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10056 2023-11-03 cs.CV cs.MM 86%

GlueGen: Plug and Play Multi-modal Encoders for X-to-image Generation

Can Qin, Ning Yu, Chen Xing, Shu Zhang, Zeyuan Chen, Stefano Ermon, Yun Fu, Caiming Xiong, Ran Xu

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.MM

Comments ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11504 2023-06-21 cs.GR cs.CV cs.SD eess.AS 86%

Align, Adapt and Inject: Sound-guided Unified Image Generation

Yue Yang, Kaipeng Zhang, Yuying Ge, Wenqi Shao, Zeyue Xue, Yu Qiao, Ping Luo

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06276 2025-06-10 cs.CV cs.AI cs.LG 86%

STARFlow: Scaling Latent Normalizing Flows for High-resolution Image Synthesis

Jiatao Gu, Tianrong Chen, David Berthelot, Huangjie Zheng, Yuyang Wang, Ruixiang Zhang, Laurent Dinh, Miguel Angel Bautista, Josh Susskind, Shuangfei Zhai

专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

Comments TLDR: We show for the first time that normalizing flows can be scaled for high-resolution and text-conditioned image synthesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01388 2025-06-02 cs.CV 86%

AutoStudio: Crafting Consistent Subjects in Multi-turn Interactive Image Generation

Junhao Cheng, Xi Lu, Hanhui Li, Khun Loun Zai, Baiqiao Yin, Yuhao Cheng, Yiqiang Yan, Xiaodan Liang

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Multi-turn interactive image generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09592 2022-12-23 cs.CV 86%

DALL-E for Detection: Language-driven Compositional Image Synthesis for Object Detection

Yunhao Ge, Jiashu Xu, Brian Nlong Zhao, Neel Joshi, Laurent Itti, Vibhav Vineet

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract,comments);image generation(abstract);分类 cs.CV

Comments v3(same as v2) version, update structure (add foreground generation, stable diffusion), add more experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11002 2026-08-12 cs.CL cs.AI 新提交 86%

On the Limitations of Cross-Lingual Consistency in Multilingual Text-to-image Generation

多语言文本到图像生成中跨语言一致性的局限性研究

Sicheng Zhang, Zhonghao Yan, Binzhu Xie, Shi Qiu, Muzammal Naseer, Naveed Akhtar, Mubarak Shah

机构 * Khalifa University(哈利法大学) Queen Mary University of London(伦敦玛丽女王大学) The Chinese University of Hong Kong(香港中文大学) The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学) University of Central Florida(中佛罗里达大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

AI总结 本文针对多语言文本到图像生成的跨语言一致性局限,构建含10种语言、3.3万条提示词的LingT2I基准,经分析揭示语言相关生成规律,为开发更鲁棒的多语言T2I模型奠定基础。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18627 2026-03-20 cs.AI 86%

Agentic Flow Steering and Parallel Rollout Search for Spatially Grounded Text-to-Image Generation

代理流引导与并行展开搜索用于空间感知的文本到图像生成

Ping Chen, Daoxuan Zhang, Xiangming Wang, Yungeng Liu, Haijin Zeng, Yongyong Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

AI总结 本文提出AFS-Search框架,通过闭合环路机制和空间感知引导提升文本到图像生成的精度与效率,实现性能和速度的双重优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16830 2026-03-19 cs.CL 86%

PEPPER: Perception-Guided Perturbation for Robust Backdoor Defense in Text-to-Image Diffusion Models

PEPPER:基于感知的扰动用于文本到图像扩散模型的鲁棒后门防御

Oscar Chew, Po-Yi Lu, Jayden Lin, Kuan-Hao Huang, Hsuan-Tien Lin

机构 * Texas A&M University(德克萨斯A&M大学) National Taiwan University(台湾国立大学) University of Michigan(密歇根大学)

专题命中 文生图 :diffusion(title,abstract);text-to-image(title)

AI总结 PEPPER通过重写提示生成语义上不同但视觉上相似的描述,干扰输入提示中的触发器,提高文本到图像扩散模型的鲁棒性,尤其有效对抗基于文本编码器的攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09166 2026-01-27 cs.HC cs.AI 86%

An Exploration of Default Images in Text-to-Image Generation

文本到图像生成中默认图像的探索

Hannu Simonen, Atte Kiviniemi, Hannah Johnston, Helena Barranha, Jonas Oppenlaender

机构 * University of Oulu Oulu Finland Carleton University Ottawa Canada IST, University of Lisbon \& IHA-NOVA FCSH / IN2PAST Lisbon Portugal University of Oulu Carleton University IST, University of Lisbon \& IHA-NOVA FCSH / IN2PAST

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

AI总结 本文首次探讨了文本到图像生成中默认图像的特性,通过实验分析揭示了默认图像的一致性及其对用户满意度的影响。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16803 2026-01-26 cs.CL cs.AI 86%

SoS: Analysis of Surface over Semantics in Multilingual Text-To-Image Generation

SoS:多语言文本到图像生成中的表面与语义分析

Carolin Holtermann, Florian Schneider, Anne Lauscher

机构 * Trustworthy AI Lab, University of Hamburg(汉堡大学可信人工智能实验室) Language Technology Group, University of Hamburg(汉堡大学语言技术小组)

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

AI总结 本文分析了多语言文本到图像生成中表面与语义的偏差问题,揭示了T2I模型在不同语言下生成刻板印象图像的倾向,并提出新的度量方法来量化这种现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12041 2025-10-16 cs.CL 86%

Improving Text-to-Image Generation with Input-Side Inference-Time Scaling

Ruibo Chen, Jiacheng Pan, Heng Huang, Zhenheng Yang

机构 * TikTok University of Maryland, College Park(马里兰大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00523 2025-06-26 cs.CR cs.AI cs.LG 86%

Fuzz-Testing Meets LLM-Based Agents: An Automated and Efficient Framework for Jailbreaking Text-To-Image Generation Models

Yingkai Dong, Xiangtao Meng, Ning Yu, Zheng Li, Shanqing Guo

机构 * School of Cyber Science and Technology, Shandong University(山东大学网络科学与技术学院) Netflix Eyeline Studios State Key Laboratory of Cryptography and Digital Economy Security, Shandong University(山东大学密码与数字经济安全国家重点实验室) Shandong Key Laboratory of Artificial Intelligence Security, Shandong University(山东省人工智能安全重点实验室)

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18428 2025-06-24 cs.AI cs.LG 86%

How Robust is Model Editing after Fine-Tuning? An Empirical Study on Text-to-Image Diffusion Models

Feng He, Zhenyang Liu, Marco Valentino, Zhixue Zhao

机构 * University of Sheffield, UK(谢菲尔德大学)

专题命中 文生图 :diffusion(title,abstract);text-to-image(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14125 2025-04-22 cs.HC cs.AI cs.CY 86%

Exploring Language Patterns of Prompts in Text-to-Image Generation and Their Impact on Visual Diversity

Maria-Teresa De Rosa Palmini, Eva Cetinic

机构 * University of Zurich(苏黎世大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23734 2025-04-01 eess.SP 86%

Semantic Packet Aggregation and Repeated Transmission for Text-to-Image Generation

Seunghun Lee, Jihong Park, Jinho Choi, Hyuncheol Park

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07086 2025-01-14 cs.CL 86%

Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models

Yongyu Mu, Hengyu Li, Junxin Wang, Xiaoxuan Zhou, Chenglong Wang, Yingfeng Luo, Qiaozhi He, Tong Xiao, Guocheng Chen, Jingbo Zhu

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

Comments Accepted to ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17155 2024-09-27 cs.CY 86%

Exploring the Boundaries of Content Moderation in Text-to-Image Generation

Piera Riccio, Georgina Curto, Nuria Oliver

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

Comments To be published at the CEGIS (critical evaluation of generative models and their impact on society) workshop at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15381 2024-09-25 cs.CL cs.AI cs.CR cs.LG 86%

Adversarial Attacks on Parts of Speech: An Empirical Study in Text-to-Image Generation

G M Shahariar, Jia Chen, Jiachen Li, Yue Dong

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

Comments Findings of the EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14440 2024-07-18 cs.LG cs.CR 86%

Asymmetric Bias in Text-to-Image Generation with Adversarial Attacks

Haz Sameen Shahgir, Xianghao Kong, Greg Ver Steeg, Yue Dong

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

Comments camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11317 2023-10-31 cs.CL 86%

Collaborative Generative AI: Integrating GPT-k for Efficient Editing in Text-to-Image Generation

Wanrong Zhu, Xinyi Wang, Yujie Lu, Tsu-Jui Fu, Xin Eric Wang, Miguel Eckstein, William Yang Wang

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.04056 2019-10-10 cs.LG cs.CL stat.ML 86%

Text-to-Image Synthesis Based on Machine Generated Captions

Marco Menardi, Alex Falcon, Saida S. Mohamed, Lorenzo Seidenari, Giuseppe Serra, Alberto Del Bimbo, Carlo Tasso

专题命中 文生图 :image synthesis(title,abstract);text-to-image(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14807 2026-07-17 cs.CV 新提交 85%

TAMF-VTON: Texture-Aware Mask-Free Virtual Try-On via High-Fidelity Image Synthesis

TAMF-VTON:通过高保真图像合成实现纹理感知无掩码虚拟试穿

Jie Wang, Qian He, Gaofeng He, Xiaogang Jin, Huamin Wang

机构 * State Key Lab of CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Style3D Research China(中国凌迪科技风格实验室)

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 TAMF-VTON旨在解决虚拟试穿方法局限,通过统一生成管道,含轻量级专家混合适应方案、频域监督机制和强大数据管理管道,实现无掩码、多服装组合、纹理保留及高效推理,优于现有方法,为数字时尚提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07117 2026-07-09 cs.CV cs.AI 新提交 85%

Tree-of-Thoughts Reasoning for Text-to-Image In-Context Learning

用于文本到图像上下文学习的思维树推理

Stepanida Alekseeva, Jenifer Kalafatovich, Seong-Whan Lee

机构 * Korea University(韩国大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 研究文本到图像上下文学习中模型的推理问题,提出思维树推理框架,通过多阶段推理和选择层减轻提示模糊性与组合错误,实验表明该结构化多分支推理能提升图像生成效果,无需额外训练或微调。

Comments 6 pages, 3 figures, 4 tables. Accepted at IEEE SMC 2026. Code available at https://github.com/Pandastep/ToT-T2I-ICL

详情

展开后加载摘要…

URL PDF HTML 收藏