arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4215 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4215 篇

2406.13897 2024-06-21 cs.CV 57%

CLAY: A Controllable Large-scale Generative Model for Creating High-quality 3D Assets

Longwen Zhang, Ziyu Wang, Qixuan Zhang, Qiwei Qiu, Anqi Pang, Haoran Jiang, Wei Yang, Lan Xu, Jingyi Yu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://sites.google.com/view/clay-3dlm Video: https://youtu.be/YcKFp4U2Voo

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15253 2024-06-21 cs.CV cs.NA math.NA physics.data-an 57%

Seeing the World through an Antenna's Eye: Reception Quality Visualization Using Incomplete Technical Signal Information

Leif Bergerhoff

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments 5 pages, to be published in the conference proceedings of the European Signal Processing Conference (EUSIPCO) 2024, camera-ready version adding information on the space and time complexity, as well as the dataset size

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08801 2024-06-18 cs.CV 57%

Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation

Mingwang Xu, Hui Li, Qingkun Su, Hanlin Shang, Liwei Zhang, Ce Liu, Jingdong Wang, Yao Yao, Siyu Zhu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17095 2024-06-18 cs.CV cs.AI 57%

Emergent Open-Vocabulary Semantic Segmentation from Off-the-shelf Vision-Language Models

Jiayun Luo, Siddhesh Khandelwal, Leonid Sigal, Boyang Li

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

Comments Accepted to CVPR 2024; Earlier version of this paper contained an unintentional error stemming from a bug in the code. This version corrects this error, which had to do with filtering of class names. In consultation with CVPR Program Chairs it was suggested errata be submitted as the updated (fixed) code reinforced original findings (albeit with slightly different final numbers)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08249 2024-06-13 cs.CV cs.LG 57%

Dataset Enhancement with Instance-Level Augmentations

Orest Kupyn, Christian Rupprecht

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13254 2024-06-13 cs.CV cs.AI cs.CL cs.LG 57%

CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual Examples

Jianrui Zhang, Mu Cai, Tengyang Xie, Yong Jae Lee

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 15 pages, 6 figures, 12 tables, Project Page: https://countercurate.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07207 2024-06-12 cs.CV 57%

GALA3D: Towards Text-to-3D Complex Scene Generation via Layout-guided Generative Gaussian Splatting

Xiaoyu Zhou, Xingjian Ran, Yajiao Xiong, Jinlin He, Zhiwei Lin, Yongtao Wang, Deqing Sun, Ming-Hsuan Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04983 2024-06-10 cs.CV 57%

CityCraft: A Real Crafter for 3D City Generation

Jie Deng, Wenhao Chai, Junsheng Huang, Zhonghan Zhao, Qixuan Huang, Mingyan Gao, Jianshu Guo, Shengyu Hao, Wenhao Hu, Jenq-Neng Hwang, Xi Li, Gaoang Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01900 2024-06-10 cs.CV 57%

Follow-Your-Emoji: Fine-Controllable and Expressive Freestyle Portrait Animation

Yue Ma, Hongyu Liu, Hongfa Wang, Heng Pan, Yingqing He, Junkun Yuan, Ailing Zeng, Chengfei Cai, Heung-Yeung Shum, Wei Liu, Qifeng Chen

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project Page: https://follow-your-emoji.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04340 2024-06-07 cs.CV 57%

GLACE: Global Local Accelerated Coordinate Encoding

Fangjinhua Wang, Xudong Jiang, Silvano Galliani, Christoph Vogel, Marc Pollefeys

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Large-scale visual localization with a single optimizable MLP. CVPR 2024. Code: https://github.com/cvg/glace. Project page: https://xjiangan.github.io/glace

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03866 2024-06-07 cs.CV 57%

LLplace: The 3D Indoor Scene Layout Generation and Editing via Large Language Model

Yixuan Yang, Junru Lu, Zixiang Zhao, Zhen Luo, James J. Q. Yu, Victor Sanchez, Feng Zheng

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01349 2024-06-07 cs.CV 57%

Unleashing Generalization of End-to-End Autonomous Driving with Controllable Long Video Generation

Enhui Ma, Lijun Zhou, Tao Tang, Zhan Zhang, Dong Han, Junpeng Jiang, Kun Zhan, Peng Jia, Xianpeng Lang, Haiyang Sun, Di Lin, Kaicheng Yu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project Page: https://westlake-autolab.github.io/delphi.github.io/, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18610 2024-06-07 cs.CV 57%

DiffCAD: Weakly-Supervised Probabilistic CAD Model Retrieval and Alignment from an RGB Image

Daoyi Gao, Dávid Rozenberszki, Stefan Leutenegger, Angela Dai

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments SIGGRAPH 2024, Project page: https://daoyig.github.io/DiffCAD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02509 2024-06-05 cs.CV 57%

CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation

Dejia Xu, Weili Nie, Chao Liu, Sifei Liu, Jan Kautz, Zhangyang Wang, Arash Vahdat

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://ir1d.github.io/CamCo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14781 2024-06-04 cs.CV 57%

Champ: Controllable and Consistent Human Image Animation with 3D Parametric Guidance

Shenhao Zhu, Junming Leo Chen, Zuozhuo Dai, Qingkun Su, Yinghui Xu, Xun Cao, Yao Yao, Hao Zhu, Siyu Zhu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19854 2024-05-31 cs.CV 57%

RTGen: Generating Region-Text Pairs for Open-Vocabulary Object Detection

Fangyi Chen, Han Zhang, Zhantao Yang, Hao Chen, Kai Hu, Marios Savvides

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18801 2024-05-30 cs.CV 57%

SketchTriplet: Self-Supervised Scenarized Sketch-Text-Image Triplet Generation

Zhenbei Wu, Qiang Wang, Jie Yang

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15758 2024-05-27 cs.CV cs.AI 57%

InstructAvatar: Text-Guided Emotion and Motion Control for Avatar Generation

Yuchi Wang, Junliang Guo, Jianhong Bai, Runyi Yu, Tianyu He, Xu Tan, Xu Sun, Jiang Bian

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://wangyuchi369.github.io/InstructAvatar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13865 2024-05-24 cs.CV 57%

ReVideo: Remake a Video with Motion and Content Control

Chong Mou, Mingdeng Cao, Xintao Wang, Zhaoyang Zhang, Ying Shan, Jian Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07306 2024-05-24 cs.CV 57%

Point Resampling and Ray Transformation Aid to Editable NeRF Models

Zhenyang Li, Zilong Chen, Feifan Qu, Mingqing Wang, Yizhou Zhao, Kai Zhang, Yifan Peng

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12796 2024-05-22 cs.CV 57%

DisenStudio: Customized Multi-subject Text-to-Video Generation with Disentangled Spatial Control

Hong Chen, Xin Wang, Yipeng Zhang, Yuwei Zhou, Zeyang Zhang, Siao Tang, Wenwu Zhu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04965 2024-05-22 cs.CV 57%

Seeing a Rose in Five Thousand Ways

Yunzhi Zhang, Shangzhe Wu, Noah Snavely, Jiajun Wu

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments CVPR 2023. Project page: https://cs.stanford.edu/~yzzhang/projects/rose/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01655 2024-05-21 cs.CV 57%

FashionEngine: Interactive 3D Human Generation and Editing via Multimodal Controls

Tao Hu, Fangzhou Hong, Zhaoxi Chen, Ziwei Liu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project Page: https://taohuumd.github.io/projects/FashionEngine

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10508 2024-05-20 cs.CV 57%

ART3D: 3D Gaussian Splatting for Text-Guided Artistic Scenes Generation

Pengzhi Li, Chengshuai Tang, Qinxuan Huang, Zhiheng Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted at CVPR 2024 Workshop on AI3DG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17105 2024-05-14 cs.CV 57%

Synthesizing Iris Images using Generative Adversarial Networks: Survey and Comparative Analysis

Shivangi Yadav, Arun Ross

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06547 2024-05-13 cs.CV 57%

OneTo3D: One Image to Re-editable Dynamic 3D Model and Video Generation

Jinwei Lin

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 24 pages, 13 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05768 2024-05-10 cs.CV 57%

FastScene: Text-Driven Fast 3D Indoor Scene Generation via Panoramic Gaussian Splatting

Yikun Ma, Dandan Zhan, Zhi Jin

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Accepted by IJCAI-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07270 2024-05-07 cs.CV cs.CL cs.LG 57%

Open-ended VQA benchmarking of Vision-Language models by exploiting Classification datasets and their semantic hierarchy

Simon Ging, María A. Bravo, Thomas Brox

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

Comments Accepted as Spotlight Paper for ICLR 2024. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02601 2024-05-06 cs.CV cs.AI 57%

MagicDrive: Street View Generation with Diverse 3D Geometry Control

Ruiyuan Gao, Kai Chen, Enze Xie, Lanqing Hong, Zhenguo Li, Dit-Yan Yeung, Qiang Xu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project Page: https://flymin.github.io/magicdrive; Figure 7 updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15789 2024-05-02 cs.CV 57%

MotionMaster: Training-free Camera Motion Transfer For Video Generation

Teng Hu, Jiangning Zhang, Ran Yi, Yating Wang, Hongrui Huang, Jieyu Weng, Yabiao Wang, Lizhuang Ma

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏