arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86539 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2403.12962 2024-03-20 cs.CV 70%

FRESCO: Spatial-Temporal Correspondence for Zero-Shot Video Translation

Shuai Yang, Yifan Zhou, Ziwei Liu, Chen Change Loy

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments CVPR 24, Code: https://github.com/williamyang1991/FRESCO, Project: https://www.mmlab-ntu.com/project/fresco/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05523 2024-03-12 cs.CV 70%

Beyond Finite Data: Towards Data-free Out-of-distribution Generalization via Extrapolation

Yijiang Li, Sucheng Ren, Weipeng Deng, Yuzhi Xu, Ying Gao, Edith Ngai, Haohan Wang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Preprint. Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08882 2024-03-12 cs.CV 70%

Neural Video Fields Editing

Shuzhou Yang, Chong Mou, Jiwen Yu, Yuhan Wang, Xiandong Meng, Jian Zhang

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04575 2024-03-07 cs.CV cs.AI 70%

Let's Go Shopping (LGS) -- Web-Scale Image-Text Dataset for Visual Concept Understanding

Yatong Bai, Utsav Garg, Apaar Shanker, Haoming Zhang, Samyak Parajuli, Erhan Bas, Isidora Filipovic, Amelia N. Chu, Eugenia D Fomitcheva, Elliot Branson, Aerin Kim, Somayeh Sojoudi, Kyunghyun Cho

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05922 2024-03-04 cs.CV 70%

FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editing

Yuren Cong, Mengmeng Xu, Christian Simon, Shoufa Chen, Jiawei Ren, Yanping Xie, Juan-Manuel Perez-Rua, Bodo Rosenhahn, Tao Xiang, Sen He

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by ICLR2024. Project page: https://flatten-video-editing.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09872 2024-02-16 cs.CV 70%

Social Reward: Evaluating and Enhancing Generative AI through Million-User Feedback from an Online Creative Community

Arman Isajanyan, Artur Shatveryan, David Kocharyan, Zhangyang Wang, Humphrey Shi

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments 16 pages with 10 figures, accepted at ICLR 2024 as a spotlight, codes can be accessed at https://github.com/Picsart-AI-Research/Social-Reward

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03705 2024-02-07 cs.CV cs.CR 70%

FoolSDEdit: Deceptively Steering Your Edits Towards Targeted Attribute-aware Distribution

Qi Zhou, Dongxia Wang, Tianlin Li, Zhihong Xu, Yang Liu, Kui Ren, Wenhai Wang, Qing Guo

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14330 2024-02-07 cs.CV cs.AI cs.CL 70%

DirecT2V: Large Language Models are Frame-Level Directors for Zero-Shot Text-to-Video Generation

Susung Hong, Junyoung Seo, Heeseong Shin, Sunghwan Hong, Seungryong Kim

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments The code and demo will be available at https://github.com/KU-CVLAB/DirecT2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03610 2024-02-05 cs.CV cs.AI cs.CL 70%

The Role of Data Curation in Image Captioning

Wenyan Li, Jonas F. Lotz, Chen Qiu, Desmond Elliott

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07973 2024-02-02 eess.IV cs.CV 70%

M3Dsynth: A dataset of medical 3D images with AI-generated local manipulations

Giada Zingarini, Davide Cozzolino, Riccardo Corvi, Giovanni Poggi, Luisa Verdoliva

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15975 2024-01-30 cs.CV 70%

StableIdentity: Inserting Anybody into Anywhere at First Sight

Qinghe Wang, Xu Jia, Xiaomin Li, Taiqing Li, Liqian Ma, Yunzhi Zhuge, Huchuan Lu

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08044 2024-01-22 cs.CV 70%

Benchmarking Robustness of Multimodal Image-Text Models under Distribution Shift

Jielin Qiu, Yi Zhu, Xingjian Shi, Florian Wenzel, Zhiqiang Tang, Ding Zhao, Bo Li, Mu Li

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted by Journal of Data-centric Machine Learning Research (DMLR) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09763 2024-01-19 cs.CV cs.AI 70%

CLIP Model for Images to Textual Prompts Based on Top-k Neighbors

Xin Zhang, Xin Zhang, YeMing Cai, Tianzhi Jia

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments CLIP model, KNN, image-to-prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08567 2024-01-17 cs.LG cs.AI cs.CL cs.CV 70%

Connect, Collapse, Corrupt: Learning Cross-Modal Tasks with Uni-Modal Data

Yuhui Zhang, Elaine Sui, Serena Yeung-Levy

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Published at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07727 2024-01-17 cs.CV 70%

HexaGen3D: StableDiffusion is just one step away from Fast and Diverse Text-to-3D Generation

Antoine Mercier, Ramin Nakhli, Mahesh Reddy, Rajeev Yasarla, Hong Cai, Fatih Porikli, Guillaume Berger

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 9 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.08455 2024-01-11 cs.CV 70%

Spatial Steerability of GANs via Self-Supervision from Discriminator

Jianyuan Wang, Lalit Bhagat, Ceyuan Yang, Yinghao Xu, Yujun Shen, Hongdong Li, Bolei Zhou

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments This manuscript is a journal extension of our previous conference work (arXiv:2112.00718), submitted to TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02473 2024-01-08 cs.CV 70%

VASE: Object-Centric Appearance and Shape Manipulation of Real Videos

Elia Peruzzo, Vidit Goel, Dejia Xu, Xingqian Xu, Yifan Jiang, Zhangyang Wang, Humphrey Shi, Nicu Sebe

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project Page https://helia95.github.io/vase-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12856 2023-12-21 cs.CV cs.AI cs.LG 70%

SkyScript: A Large and Semantically Diverse Vision-Language Dataset for Remote Sensing

Zhecheng Wang, Rajanie Prabha, Tianyuan Huang, Jiajun Wu, Ram Rajagopal

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10163 2023-12-19 cs.CV cs.LG 70%

Towards the Unification of Generative and Discriminative Visual Foundation Model: A Survey

Xu Liu, Tong Zhou, Yuanxin Wang, Yuping Wang, Qinjingwen Cao, Weizhi Du, Yonghuan Yang, Junjun He, Yu Qiao, Yiqing Shen

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09251 2023-12-15 cs.CV 70%

VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation

Jinguo Zhu, Xiaohan Ding, Yixiao Ge, Yuying Ge, Sijie Zhao, Hengshuang Zhao, Xiaohua Wang, Ying Shan

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08885 2023-12-15 cs.CV 70%

SceneWiz3D: Towards Text-guided 3D Scene Composition

Qihang Zhang, Chaoyang Wang, Aliaksandr Siarohin, Peiye Zhuang, Yinghao Xu, Ceyuan Yang, Dahua Lin, Bolei Zhou, Sergey Tulyakov, Hsin-Ying Lee

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project page: https://zqh0253.github.io/SceneWiz3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08094 2023-12-14 cs.CV 70%

3DGEN: A GAN-based approach for generating novel 3D models from image data

Antoine Schnepf, Flavian Vasile, Ugo Tanielian

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments Submitted to NeurIPS 2022 Machine Learning for Creativity and Design Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04780 2023-12-11 cs.CV cs.AI 70%

Fine-Tuning InstructPix2Pix for Advanced Image Colorization

Zifeng An, Zijing Xu, Eric Fan, Qi Cao

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02963 2023-12-06 cs.CV 70%

MVHumanNet: A Large-scale Dataset of Multi-view Daily Dressing Human Captures

Zhangyang Xiong, Chenghong Li, Kenkun Liu, Hongjie Liao, Jianqiao Hu, Junyi Zhu, Shuliang Ning, Lingteng Qiu, Chongjie Wang, Shijie Wang, Shuguang Cui, Xiaoguang Han

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Project page: https://x-zhangyang.github.io/MVHumanNet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17971 2023-12-05 cs.CV 70%

GeoDream: Disentangling 2D and Geometric Priors for High-Fidelity and Consistent 3D Generation

Baorui Ma, Haoge Deng, Junsheng Zhou, Yu-Shen Liu, Tiejun Huang, Xinlong Wang

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Code and Demo: https://github.com/baaivision/GeoDream

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00375 2023-12-04 cs.CV 70%

Text-Guided 3D Face Synthesis -- From Generation to Editing

Yunjie Wu, Yapeng Meng, Zhipeng Hu, Lincheng Li, Haoqian Wu, Kun Zhou, Weiwei Xu, Xin Yu

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18654 2023-12-01 cs.CV cs.AI 70%

Detailed Human-Centric Text Description-Driven Large Scene Synthesis

Gwanghyun Kim, Dong Un Kang, Hoigi Seo, Hayeon Kim, Se Young Chun

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18064 2023-12-01 cs.CV 70%

GELDA: A generative language annotation framework to reveal visual biases in datasets

Krish Kabra, Kathleen M. Lewis, Guha Balakrishnan

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 21 pages, 15 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01681 2023-12-01 cs.CV 70%

Dense Pixel-to-Pixel Harmonization via Continuous Image Representation

Jianqi Chen, Yilan Zhang, Zhengxia Zou, Keyan Chen, Zhenwei Shi

专题命中 文生图 :image editing(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15556 2023-11-30 cs.CV eess.IV 70%

PKU-I2IQA: An Image-to-Image Quality Assessment Database for AI Generated Images

Jiquan Yuan, Xinyan Cao, Changjin Li, Fanyi Yang, Jinlong Lin, Xixin Cao

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏