arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86539 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2410.20180 2024-11-07 cs.LG cs.GT 75%

Copyright-Aware Incentive Scheme for Generative Art Models Using Hierarchical Reinforcement Learning

Zhuan Shi, Yifei Song, Xiaoli Tang, Lingjuan Lyu, Boi Faltings

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19546 2024-07-08 cs.HC 75%

Understanding Modality Preferences in Search Clarification

Leila Tavakoli, Giovanni Castiglia, Federica Calo, Yashar Deldjoo, Hamed Zamani, Johanne R. Trippas

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04629 2024-06-10 cs.CV cs.GR cs.MM 75%

STAR: Skeleton-aware Text-based 4D Avatar Generation with In-Network Motion Retargeting

Zenghao Chai, Chen Tang, Yongkang Wong, Mohan Kankanhalli

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12103 2024-06-05 cs.AI cs.NE 75%

Quality Diversity through Human Feedback: Towards Open-Ended Diversity-Driven Optimization

Li Ding, Jenny Zhang, Jeff Clune, Lee Spector, Joel Lehman

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16305 2024-02-27 cs.LG cs.AI 75%

Referee Can Play: An Alternative Approach to Conditional Generation via Model Inversion

Xuantong Liu, Tianyang Hu, Wenjia Wang, Kenji Kawaguchi, Yuan Yao

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14840 2024-01-01 cs.AI 75%

Identifying and Mitigating the Security Risks of Generative AI

Clark Barrett, Brad Boyd, Elie Burzstein, Nicholas Carlini, Brad Chen, Jihye Choi, Amrita Roy Chowdhury, Mihai Christodorescu, Anupam Datta, Soheil Feizi, Kathleen Fisher, Tatsunori Hashimoto, Dan Hendrycks, Somesh Jha, Daniel Kang, Florian Kerschbaum, Eric Mitchell, John Mitchell, Zulfikar Ramzan, Khawaja Shams, Dawn Song, Ankur Taly, Diyi Yang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

Journal ref Foundations and Trends in Privacy and Security 6 (2023) 1-52

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17370 2023-10-27 cs.AI cs.HC cs.IR 75%

Exploring the Potential of Generative AI for the World Wide Web

Nouar AlDahoul, Joseph Hong, Matteo Varvello, Yasir Zaki

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07653 2023-10-16 cs.AI 75%

Mini-DALLE3: Interactive Text to Image by Prompting Large Language Models

Zeqiang Lai, Xizhou Zhu, Jifeng Dai, Yu Qiao, Wenhai Wang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

Comments Technical report. Project page at https://minidalle3.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.01795 2023-05-04 cs.CL 75%

Multimodal Procedural Planning via Dual Text-Image Prompting

Yujie Lu, Pan Lu, Zhiyu Chen, Wanrong Zhu, Xin Eric Wang, William Yang Wang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.15271 2022-11-30 cs.AI 75%

The Myth of Culturally Agnostic AI Models

Eva Cetinic

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

Comments Accepted for "Cultures in AI/AI in Culture" NeurIPS 2022 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.03812 2022-11-22 cs.LG math.OC 75%

Neural Monge Map estimation and its applications

Jiaojiao Fan, Shu Liu, Shaojun Ma, Haomin Zhou, Yongxin Chen

专题命中 文生图 :image generation(abstract);text-to-image(abstract);inpainting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12565 2022-10-25 cs.CL cs.LG 75%

A Visual Tour Of Current Challenges In Multimodal Language Models

Shashank Sonkar, Naiming Liu, Richard G. Baraniuk

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11343 2026-08-13 cs.AI cs.CV cs.IR cs.LG 新提交 74%

Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval

前沿大语言模型能否媲美原生多模态嵌入?在难负例文本到图像检索上的对比

Archan Dutta, Vyanktesh Kanungo

机构 * Westcliff University(韦克利夫大学)

专题命中 文生图 :text-to-image(title);分类 cs.CV

AI总结 本研究在Flickr30k数据集上对比Gemini Embedding 2等原生多模态嵌入与GPT-4.1、Claude Sonnet 4.6等前沿LLM的难负例文本到图像检索性能,发现二者表现相当,且多模态嵌入更适配低延迟应用

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22649 2026-05-22 cs.CV cs.LG 74%

From Baseline to Follow-Up: Counterfactual Spine DXA Image Synthesis in UK Biobank Using a Causal Hierarchical Variational Autoencoder

从基线到随访:利用因果层次变分自编码器在UK Biobank中生成脊柱DXA图像

Yilin Zhang, Nicholas C. Harvey, Nicholas R. Fuggle, Rahman Attar

机构 * School of Electronics and Computer Science(电子与计算机科学学院) University of Southampton(萨塞克斯大学) MRC Lifecourse Epidemiology Centre(英国医学研究理事会生命周期流行病学中心) University of Southampton, Southampton General Hospital(萨塞克斯大学索马塞特医院) Computer Science University of Southampton(计算机科学萨塞克斯大学)

专题命中 文生图 :image synthesis(title);分类 cs.CV

AI总结 本文提出了一种基于元数据的因果层次变分自编码器,用于在UK Biobank中生成一致的脊柱DXA图像,通过基线到随访的设置评估因果一致性,展示了年龄干预下关键椎体形态学变量的高一致性,支持了在解剖上合理的DXA图像合成。

Comments 7 pages, 4 figures, 3 tables. Accepted at the 48th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21573 2026-05-22 cs.CV 74%

Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models

Lens:重新思考基础文本到图像模型的训练效率

Dong Chen, Fangyun Wei, Ziyu Wan, Dongdong Chen, Jiawei Zhang, Jinjing Zhao, Sirui Zhang, Yang Yue, Zhiyang Liang, Baining Guo, Chong Luo, Jianmin Bao, Ji Li, Lei Shi, Qinhong Yang, Xiuyu Wu, Xuelu Feng, Yan Lu, Yanchen Dong, Yitong Wang, Yunuo Chen

机构 * Microsoft Lens Team(微软Lens团队)

专题命中 文生图 :text-to-image(title);分类 cs.CV

AI总结 本文提出Lens,一个具有38亿参数的文本到图像模型,在多种基准测试中表现与超过60亿参数的最新模型相当甚至更优,同时训练计算需求显著降低。通过最大化训练批次的数据信息密度和改进收敛速度的架构选择,实现了高效的训练和优化。

Comments Project Page: https://github.com/microsoft/Lens

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07561 2026-05-20 cs.CV 74%

PureCC: Pure Learning for Text-to-Image Concept Customization

PureCC: 文本到图像概念定制的纯学习

Zhichao Liao, Xiaole Xian, Qingyu Li, Wenyu Qin, Meng Wang, Weicheng Xie, Siyang Song, Pingfa Feng, Long Zeng, Liang Pan

机构 * Tsinghua University(清华大学) School of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(深圳大学智能信息处理广东省重点实验室) Kling Team, Kuaishou Technology(快手科技Kling团队) University of Exeter(埃克塞特大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 文生图 :text-to-image(title);分类 cs.CV

AI总结 本文提出PureCC,一种用于文本到图像概念定制的纯学习方法,通过分离学习目标来平衡概念定制的保真度与模型保留。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00070 2026-05-04 eess.IV cs.AI cs.CV 74%

Brain MR Image Synthesis with 3D Multi-Contrast Self-Attention GAN

利用3D多对比自注意GAN进行脑部MRI图像合成

Zaid A. Abod, Furqan Aziz

机构 * School of Computing and Mathematical Sciences, University of Leicester(利兹大学计算与数学科学学院)

专题命中 文生图 :image synthesis(title);分类 cs.CV

AI总结 本文提出3D-MC-SAGAN框架,通过单张T2w图像生成高保真多对比MRI图像,保留肿瘤特征,结合多种损失函数提升全局真实感和肿瘤结构保真度。

Comments Note: This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07936 2026-03-10 cs.CV 74%

Text to Automata Diagrams: Comparing TikZ Code Generation with Direct Image Synthesis

文本到自动机图:比较TikZ代码生成与直接图像合成

Ethan Young, Zichun Wang, Aiden Taylor, Chance Jewell, Julian Myers, Satya Sri Rajiteswari Nimmagadda, Anthony White, Aniruddha Maiti, Ananya Jana

机构 * Marshall University(马歇尔大学) West Virginia State University(西弗吉尼亚州立大学)

专题命中 文生图 :image synthesis(title);分类 cs.CV

AI总结 本研究比较了通过视觉-语言模型生成TikZ代码与直接图像合成在生成自动机图描述中的效果,发现人工修正能显著提高生成准确性。

Comments Accepted to ASEE North Central Section 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19243 2026-02-06 cs.CV 74%

VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis

VisionDirector: 生成图像合成中的视觉-语言引导闭环细化

Meng Chu, Senqiao Yang, Haoxuan Che, Suiyun Zhang, Xichen Zhang, Shaozuo Yu, Haokun Gui, Zhefan Rao, Dandan Tu, Rui Liu, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港理工大学) The Chinese University of Hong Kong(香港中文大学) Huawei Research(华为研究)

专题命中 文生图 :image synthesis(title);分类 cs.CV

AI总结 VisionDirector通过视觉-语言引导闭环细化方法,提升生成图像合成中多目标任务的完成度和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02171 2026-02-03 cs.CV 74%

Lung Nodule Image Synthesis Driven by Two-Stage Generative Adversarial Networks

由双阶段生成对抗网络驱动的肺结节图像合成

Lu Cao, Xiquan He, Junying Zeng, Chaoyun Mai, Min Luo

专题命中 文生图 :image synthesis(title);分类 cs.CV

AI总结 本文提出双阶段生成对抗网络TSGAN,通过解耦肺结节形态结构与纹理特征,提升合成数据多样性及检测模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06368 2026-01-13 cs.CR cs.CV 74%

From Easy to Hard++: Promoting Differentially Private Image Synthesis Through Spatial-Frequency Curriculum

从易到难++:通过空间-频率课程促进差分隐私图像合成

Chen Gong, Kecen Li, Zinan Lin, Tianhao Wang

机构 * University of Virginia(弗吉尼亚大学) Microsoft Research(微软研究院)

专题命中 文生图 :image synthesis(title);分类 cs.CV

AI总结 FETA-Pro通过引入频率特征作为训练捷径,提升差分隐私图像合成的保真度和实用性。

Comments Accepted at Usenix Security 2026; code available at https://github.com/2019ChenGong/Feta-Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17860 2025-12-23 cs.CV cs.AI cs.LG 74%

Towards Facilitated Fairness Assessment of AI-based Skin Lesion Classifiers Through GenAI-based Image Synthesis

通过生成式人工智能图像合成促进AI皮肤病变分类器的公平性评估

Ko Watanabe, Stanislav Frolov, Aya Hassan, David Dembinsky, Adriano Lucieri, Andreas Dengel

机构 * DFKI GmbH(德累斯顿理工大学人工智能研究所)

专题命中 文生图 :image synthesis(title);分类 cs.CV

AI总结 本文通过生成式人工智能图像合成方法,评估AI皮肤病变分类器的公平性,验证合成图像在公平性测试中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09116 2025-12-22 cs.CV 74%

Zero-shot Hierarchical Plant Segmentation via Foundation Segmentation Models and Text-to-image Attention

零shot分层植物分割:通过基础分割模型和文本到图像注意力

Junhao Xing, Ryohei Miyakawa, Yang Yang, Xinpeng Liu, Risa Shinoda, Hiroaki Santo, Yosuke Toda, Fumio Okura

机构 * The University of Osaka(大阪大学) Phytometrics Nagoya University(名古屋大学)

专题命中 文生图 :text-to-image(title);分类 cs.CV

AI总结 ZeroPlantSeg通过基础分割模型和文本到图像注意力实现零shot分层植物分割,有效提取植物个体,优于现有方法。

Comments WACV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17255 2025-11-24 cs.CV cs.IR 74%

A Little More Like This: Text-to-Image Retrieval with Vision-Language Models Using Relevance Feedback

略多一些像这个:利用视觉语言模型进行文本到图像检索的相关反馈

Bulat Khaertdinov, Mirela Popa, Nava Tintarev

机构 * Maastricht University(马斯特里赫特大学)

专题命中 文生图 :text-to-image(title);分类 cs.CV

AI总结 本文提出基于相关反馈机制提升视觉语言模型文本到图像检索性能的方法,通过四种反馈策略在Flickr30k和COCO数据集上验证,提升了检索效果并增强了多轮检索的鲁棒性。

Comments Accepted to WACV'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04116 2025-11-13 cs.MM 74%

RFNNS: Robust Fixed Neural Network Steganography with Universal Text-to-Image Models

Yu Cheng, Jiuan Zhou, Jiawei Chen, Zhaoxia Yin, Xinpeng Zhang

专题命中 文生图 :text-to-image(title);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06701 2025-10-14 cs.CV cs.AI cs.LG 74%

Camouflaged Image Synthesis Is All You Need to Boost Camouflaged Detection

Haichao Zhang, Can Qin, Yu Yin, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(电气与计算机工程系,东北大学) Department of Electrical Engineering and Computer Science, Case Western Reserve University(电气工程与计算机科学系,凯斯西储大学)

专题命中 文生图 :image synthesis(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05990 2025-08-18 eess.IV cs.CV 74%

HealthiVert-GAN: A Novel Framework of Pseudo-Healthy Vertebral Image Synthesis for Interpretable Compression Fracture Grading

Qi Zhang, Cheng Chuang, Shunan Zhang, Ziqi Zhao, Kun Wang, Jun Xu, Jianqi Sun

机构 * School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院) National Engineering Research Center of Advanced Magnetic Resonance Technologies for Diagnosis and Therapy (NERC-AMRT)(先进磁共振诊断与治疗技术国家工程研究中心) Med-X Research Institute, Shanghai Jiao Tong University(医-X研究院) Kashi Prefecture Second People’s Hospital(喀什县第二人民医院) Renji Hospital, Shanghai, China(仁济医院) Shanghai Sixth People’s Hospital, Shanghai, China(上海第六人民医院)

专题命中 文生图 :image synthesis(title);分类 cs.CV

Journal ref IEEE Journal of Biomedical and Health Informatics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07897 2025-08-12 cs.CV cs.AI 74%

NeeCo: Image Synthesis of Novel Instrument States Based on Dynamic and Deformable 3D Gaussian Reconstruction

Tianle Zeng, Junlei Hu, Gerardo Loza Galindo, Sharib Ali, Duygu Sarikaya, Pietro Valdastri, Dominic Jones

机构 * STORM Lab UK, School of Electronic and Electrical Engineering, University of Leeds(STORM实验室(英国)、电子与电气工程学院、利兹大学)

专题命中 文生图 :image synthesis(title);分类 cs.CV

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01756 2025-07-23 cs.CV 74%

Rethinking Discrete Tokens: Treating Them as Conditions for Continuous Autoregressive Image Synthesis

Peng Zheng, Junke Wang, Yi Chang, Yizhou Yu, Rui Ma, Zuxuan Wu

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Shanghai Innovation Institute(上海创新研究院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)

专题命中 文生图 :image synthesis(title);分类 cs.CV

Comments iccv 2025, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14171 2025-07-15 eess.IV cs.CV 74%

Guided Neural Schrödinger bridge for Brain MR image synthesis with Limited Data

Hanyeol Yang, Sunggyu Kim, Mi Kyung Kim, Yongseon Yoo, Yu-Mi Kim, Min-Ho Shin, Insung Chung, Sang Baek Koh, Hyeon Chang Kim, Jong-Min Lee

机构 * Hanyang University(翰阳大学) Hanyang University College of Medicine(翰阳大学医学院) Chonnam National University Medical School(全南国立大学医学院) Keimyung University School of Medicine(庆尚大学医学院) Yonsei Wonju College of Medicine(延世Wonju医学院) Yonsei University College of Medicine(延世大学医学院)

专题命中 文生图 :image synthesis(title);分类 cs.CV

Comments Single column, 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏