arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86539 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2505.17534 2025-11-21 cs.CV cs.CL cs.MM 73%

Co-Reinforcement Learning for Unified Multimodal Understanding and Generation

协同强化学习用于统一多模态理解和生成

Jingjing Jiang, Chongjie Si, Jun Luo, Hanwang Zhang, Chao Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 本文提出CoRL框架,通过协同强化学习提升多模态大语言模型在生成与理解任务上的性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06284 2025-11-11 cs.CV cs.CL cs.MM 73%

Enhancing Multimodal Misinformation Detection by Replaying the Whole Story from Image Modality Perspective

Bing Wang, Ximing Li, Yanjun Wang, Changchun Li, Lin Yuanbo Wu, Buyu Wang, Shengsheng Wang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

Comments Accepted by AAAI 2026. 13 pages, 6 figures. Code: https://github.com/wangbing1416/RETSIMD

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03815 2025-10-13 cs.CV cs.MM eess.IV 73%

T2IW: Joint Text to Image & Watermark Generation

An-An Liu, Guokai Zhang, Yuting Su, Ning Xu, Yongdong Zhang, Lanjun Wang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

Journal ref Machine Intelligence Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03004 2025-09-16 cs.GR cs.CV 73%

PartComposer: Learning and Composing Part-Level Concepts from Single-Image Examples

Junyu Liu, R. Kenny Jones, Daniel Ritchie

机构 * Brown University(布朗大学) Stanford University(斯坦福大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10462 2025-09-03 cs.CV cs.AI cs.GR cs.LG 73%

BloomScene: Lightweight Structured 3D Gaussian Splatting for Crossmodal Scene Generation

Xiaolu Hou, Mingcheng Li, Dingkang Yang, Jiawei Chen, Ziyun Qian, Xiao Zhao, Yue Jiang, Jinjie Wei, Qingyao Xu, Lihua Zhang

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments Accepted by AAAI 2025. Code: https://github.com/SparklingH/BloomScene

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03001 2025-08-26 cs.CV cs.MM 73%

One Framework to Rule Them All: Unifying Multimodal Tasks with LLM Neural-Tuning

Hao Sun, Yu Song, Jiaqing Liu, Jihong Hu, Yen-Wei Chen, Lanfen Lin

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03415 2025-08-06 cs.CV cs.AI cs.GR 73%

Learning Latent Representations for Image Translation using Frequency Distributed CycleGAN

Shivangi Nigam, Adarsh Prasad Behera, Shekhar Verma, P. Nagabhushan

机构 * Department of Information Technology, Indian Institute of Information Technology, Allahabad, U.P.(信息科技系,印度信息技术研究所,阿勒普尔,乌塔兰邦) KTH Royal Institute of Technology(皇家理工学院) Department of Computer Science and Engineering, Vignan University, Guntur, Andhra Pradesh(计算机科学与工程系,维加恩大学,古特尔,安得拉邦)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

Comments This paper is currently under review for publication in an IEEE Transactions. If accepted, the copyright will be transferred to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07784 2025-06-26 cs.CV cs.GR 73%

MatSwap: Light-aware material transfers in images

Ivan Lopes, Valentin Deschaintre, Yannick Hold-Geoffroy, Raoul de Charette

机构 * Inria(法国国家信息与自动化技术研究所) Adobe Research(Adobe研究院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments Accepted to EGSR, journal track to appear in Computer Graphics Forum

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09291 2025-04-15 cs.CV cs.MM 73%

Towards Explainable Partial-AIGC Image Quality Assessment

Jiaying Qian, Ziheng Jia, Zicheng Zhang, Zeyu Zhang, Guangtao Zhai, Xiongkuo Min

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12221 2025-02-06 cs.CV cs.LG cs.MM cs.SD eess.AS 73%

Images that Sound: Composing Images and Sounds on a Single Canvas

Ziyang Chen, Daniel Geng, Andrew Owens

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.MM

Comments Accepted to NeurIPS 2024. Project site: https://ificl.github.io/images-that-sound/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08620 2024-10-14 cs.CR cs.CV cs.MM 73%

Natural Language Induced Adversarial Images

Xiaopei Zhu, Peiyang Xu, Guanning Zeng, Yingpeng Dong, Xiaolin Hu

专题命中 文生图 :text-to-image(abstract);image editing(abstract);分类 cs.CV、cs.MM

Comments Carmera-ready version. To appear in ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15187 2024-07-23 cs.CV cs.GR 73%

HoloDreamer: Holistic 3D Panoramic World Generation from Text Descriptions

Haiyang Zhou, Xinhua Cheng, Wangbo Yu, Yonghong Tian, Li Yuan

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments Homepage: https://zhouhyocean.github.io/holodreamer

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00093 2024-06-12 cs.CV cs.GR cs.LG 73%

GraphDreamer: Compositional 3D Scene Synthesis from Scene Graphs

Gege Gao, Weiyang Liu, Anpei Chen, Andreas Geiger, Bernhard Schölkopf

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments CVPR 2024 (18 pages, 11 figures, https://graphdreamer.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00500 2024-05-22 cs.CV cs.AI cs.MM 73%

Parents and Children: Distinguishing Multimodal DeepFakes from Natural Images

Roberto Amoroso, Davide Morelli, Marcella Cornia, Lorenzo Baraldi, Alberto Del Bimbo, Rita Cucchiara

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.MM

Comments ACM Transactions on Multimedia Computing, Communications and Applications (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05950 2024-05-15 cs.CL cs.CV cs.LG cs.MM 73%

Language Models as Black-Box Optimizers for Vision-Language Models

Shihong Liu, Zhiqiu Lin, Samuel Yu, Ryan Lee, Tiffany Ling, Deepak Pathak, Deva Ramanan

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

Comments Published at CVPR 2024. Project site: https://llm-can-optimize-vlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16311 2023-12-14 cs.CV cs.GR cs.LG 73%

Break-A-Scene: Extracting Multiple Concepts from a Single Image

Omri Avrahami, Kfir Aberman, Ohad Fried, Daniel Cohen-Or, Dani Lischinski

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments SIGGRAPH Asia 2023. Project page: at: https://omriavrahami.com/break-a-scene/ Video: https://www.youtube.com/watch?v=-9EA-BhizgM

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17924 2023-12-01 cs.GR cs.HC cs.LG cs.MM 73%

Unrolling Virtual Worlds for Immersive Experiences

Alexey Tikhonov, Anton Repushko

专题命中 文生图 :text-to-image(abstract);inpainting(abstract);分类 cs.GR、cs.MM

Comments Accepted for NeurIPS 2023 Workshop on Machine Learning for Creativity and Design

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08523 2023-10-19 cs.CV cs.GR 73%

Breathing New Life into 3D Assets with Generative Repainting

Tianfu Wang, Menelaos Kanakis, Konrad Schindler, Luc Van Gool, Anton Obukhov

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08545 2023-08-22 cs.CV cs.AI cs.GR 73%

TeCH: Text-guided Reconstruction of Lifelike Clothed Humans

Yangyi Huang, Hongwei Yi, Yuliang Xiu, Tingting Liao, Jiaxiang Tang, Deng Cai, Justus Thies

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments Project: https://huangyangyi.github.io/TeCH, Code: https://github.com/huangyangyi/TeCH

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03463 2023-08-11 cs.CV cs.MM 73%

DiffSynth: Latent In-Iteration Deflickering for Realistic Video Synthesis

Zhongjie Duan, Lizhou You, Chengyu Wang, Cen Chen, Ziheng Wu, Weining Qian, Jun Huang

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV、cs.MM

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06441 2023-06-13 cs.CV cs.GR 73%

Image Vectorization: a Review

Maria Dziuba, Ivan Jarsky, Valeria Efimova, Andrey Filchenkov

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14400 2023-06-08 cs.CV cs.GR 73%

IconShop: Text-Guided Vector Icon Synthesis with Autoregressive Transformers

Ronghuan Wu, Wanchao Su, Kede Ma, Jing Liao

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.GR

Comments Project Page: https://icon-shop.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14598 2023-05-25 cs.CV cs.MM 73%

Vision + Language Applications: A Survey

Yutong Zhou, Nobutaka Shimada

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

Comments Accepted by GCV @CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04497 2023-05-09 cs.CV cs.MM 73%

IIITD-20K: Dense captioning for Text-Image ReID

A V Subramanyam, Niranjan Sundararajan, Vibhu Dubey, Brejesh Lall

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04001 2023-03-10 cs.CV cs.CL cs.GR cs.LG 73%

ELODIN: Naming Concepts in Embedding Spaces

Rodrigo Mello, Filipe Calegario, Geber Ramalho

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

Comments Added quantitative data, fixed formatting issues

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.03430 2023-02-21 cs.LG cs.AI cs.CL cs.CV cs.MM 73%

Foundations and Trends in Multimodal Machine Learning: Principles, Challenges, and Open Questions

Paul Pu Liang, Amir Zadeh, Louis-Philippe Morency

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14794 2022-12-12 cs.CV cs.AI cs.LG cs.MM stat.ML 73%

Traditional Classification Neural Networks are Good Generators: They are Competitive with DDPMs and GANs

Guangrun Wang, Philip H. S. Torr

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

Comments This paper has 29 pages with 22 figures, including rich supplementary information. Project page is at \url{https://classifier-as-generator.github.io/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.08472 2022-04-20 cs.CV cs.GR cs.LG 73%

Simultaneous Multiple-Prompt Guided Generation Using Differentiable Optimal Transport

Yingtao Tian, Marco Cuturi, David Ha

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

Comments Accepted at ICCC 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.09753 2021-10-20 cs.CV cs.CL cs.MM 73%

Unifying Multimodal Transformer for Bi-directional Image and Text Generation

Yupan Huang, Hongwei Xue, Bei Liu, Yutong Lu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

Comments ACM MM 2021 (Industrial Track). Code: https://github.com/researchmm/generate-it

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.09486 2021-06-18 cs.CV cs.GR 73%

Deep HDR Hallucination for Inverse Tone Mapping

Demetris Marnerides, Thomas Bashford-Rogers, Kurt Debattista

专题命中 文生图 :inpainting(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

Journal ref Sensors 2021, 21, 4032

详情

展开后加载摘要…

URL PDF HTML 收藏