arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4215 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4215 篇

2312.09570 2024-03-21 cs.CV 57%

CAGE: Controllable Articulation GEneration

Jiayi Liu, Hou In Ivan Tam, Ali Mahdavi-Amiri, Manolis Savva

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments CVPR 2024. Project page: https://3dlg-hcvc.github.io/cage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12037 2024-03-20 cs.CV 57%

MineDreamer: Learning to Follow Instructions via Chain-of-Imagination for Simulated-World Control

Enshen Zhou, Yiran Qin, Zhenfei Yin, Yuzhou Huang, Ruimao Zhang, Lu Sheng, Yu Qiao, Jing Shao

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://sites.google.com/view/minedreamer/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18152 2024-03-19 eess.IV cs.AI cs.CV 57%

Boosting Neural Representations for Videos with a Conditional Decoder

Xinjie Zhang, Ren Yang, Dailan He, Xingtong Ge, Tongda Xu, Yan Wang, Hongwei Qin, Jun Zhang

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Accept by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11784 2024-03-19 cs.CV 57%

Progressive3D: Progressively Local Editing for Text-to-3D Content Creation with Complex Semantic Prompts

Xinhua Cheng, Tianyu Yang, Jianan Wang, Yu Li, Lei Zhang, Jian Zhang, Li Yuan

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accept by ICLR2024. Project Page: https://cxh0519.github.io/projects/Progressive3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10166 2024-03-18 cs.CV 57%

SemanticHuman-HD: High-Resolution Semantic Disentangled 3D Human Generation

Peng Zheng, Tao Liu, Zili Yi, Rui Ma

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

Comments 26 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07033 2024-03-18 cs.CV 57%

SelfPromer: Self-Prompt Dehazing Transformers with Depth-Consistency

Cong Wang, Jinshan Pan, Wanyu Lin, Jiangxin Dong, Xiao-Ming Wu

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Accepted by AAAI24. Source codes will be made available at: https://github.com/supersupercong/SelfPromer

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09407 2024-03-15 cs.SD cs.AI cs.LG cs.MM eess.AS 57%

LM2D: Lyrics- and Music-Driven Dance Synthesis

Wenjie Yin, Xuejiao Zhao, Yi Yu, Hang Yin, Danica Kragic, Mårten Björkman

专题命中 可控生成 :diffusion(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09093 2024-03-15 cs.CV 57%

Desigen: A Pipeline for Controllable Design Template Generation

Haohan Weng, Danqing Huang, Yu Qiao, Zheng Hu, Chin-Yew Lin, Tong Zhang, C. L. Philip Chen

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments This paper has been accepted for publication in CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07518 2024-03-13 cs.CV 57%

Open-Vocabulary Scene Text Recognition via Pseudo-Image Labeling and Margin Loss

Xuhua Ren, Hengcan Shi, Jin Li

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18287 2024-02-29 cs.CV 57%

Windowed-FourierMixer: Enhancing Clutter-Free Room Modeling with Fourier Transform

Bruno Henriques, Benjamin Allaert, Jean-Philippe Vandeborre

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18092 2024-02-29 cs.CV 57%

Context-aware Talking Face Video Generation

Meidai Xuanyuan, Yuwang Wang, Honglei Guo, Qionghai Dai

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17292 2024-02-28 cs.CV 57%

DivAvatar: Diverse 3D Avatar Generation with a Single Prompt

Weijing Tao, Biwen Lei, Kunhao Liu, Shijian Lu, Miaomiao Cui, Xuansong Xie, Chunyan Miao

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16936 2024-02-28 cs.CV cs.LG 57%

Disentangled 3D Scene Generation with Layout Learning

Dave Epstein, Ben Poole, Ben Mildenhall, Alexei A. Efros, Aleksander Holynski

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11141 2024-02-20 cs.CV 57%

Semantically-aware Neural Radiance Fields for Visual Scene Understanding: A Comprehensive Review

Thang-Anh-Quan Nguyen, Amine Bourki, Mátyás Macudzinski, Anthony Brunel, Mohammed Bennamoun

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05728 2024-02-09 cs.CV 57%

CTGAN: Semantic-guided Conditional Texture Generator for 3D Shapes

Yi-Ting Pan, Chai-Rong Lee, Shu-Ho Fan, Jheng-Wei Su, Jia-Bin Huang, Yung-Yu Chuang, Hung-Kuo Chu

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01566 2024-02-05 cs.CV cs.AI 57%

Boximator: Generating Rich and Controllable Motions for Video Synthesis

Jiawei Wang, Yuchen Zhang, Jiaxin Zou, Yan Zeng, Guoqiang Wei, Liping Yuan, Hang Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15977 2024-02-01 cs.CV 57%

Motion-I2V: Consistent and Controllable Image-to-Video Generation with Explicit Motion Modeling

Xiaoyu Shi, Zhaoyang Huang, Fu-Yun Wang, Weikang Bian, Dasong Li, Yi Zhang, Manyuan Zhang, Ka Chun Cheung, Simon See, Hongwei Qin, Jifeng Dai, Hongsheng Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://xiaoyushi97.github.io/Motion-I2V/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14257 2024-01-30 cs.CV cs.AI 57%

Sketch2NeRF: Multi-view Sketch-guided Text-to-3D Generation

Minglin Chen, Weihao Yuan, Yukun Wang, Zhe Sheng, Yisheng He, Zilong Dong, Liefeng Bo, Yulan Guo

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11239 2024-01-23 cs.CV 57%

Product-Level Try-on: Characteristics-preserving Try-on with Realistic Clothes Shading and Wrinkles

Yanlong Zang, Han Yang, Jiaxu Miao, Yi Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11122 2024-01-23 cs.CV 57%

Spatial Structure Constraints for Weakly Supervised Semantic Segmentation

Tao Chen, Yazhou Yao, Xingguo Huang, Zechao Li, Liqiang Nie, Jinhui Tang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments accepted by IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07770 2024-01-17 cs.CV 57%

Seeing the Unseen: Visual Common Sense for Semantic Placement

Ram Ramrakhya, Aniruddha Kembhavi, Dhruv Batra, Zsolt Kira, Kuo-Hao Zeng, Luca Weihs

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07487 2024-01-17 cs.RO cs.CV 57%

Robo-ABC: Affordance Generalization Beyond Categories via Semantic Correspondence for Robot Manipulation

Yuanchen Ju, Kaizhe Hu, Guowei Zhang, Gu Zhang, Mingrun Jiang, Huazhe Xu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02142 2024-01-09 cs.CV 57%

GUESS:GradUally Enriching SyntheSis for Text-Driven Human Motion Generation

Xuehao Gao, Yang Yang, Zhenyu Xie, Shaoyi Du, Zhongqian Sun, Yang Wu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Visualization and Computer Graphics (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01862 2024-01-04 cs.CV cs.CL cs.LG 57%

A Vision Check-up for Language Models

Pratyusha Sharma, Tamar Rott Shaham, Manel Baradad, Stephanie Fu, Adrian Rodriguez-Munoz, Shivam Duggal, Phillip Isola, Antonio Torralba

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01827 2024-01-04 cs.CV 57%

Moonshot: Towards Controllable Video Generation and Editing with Multimodal Conditions

David Junhao Zhang, Dongxu Li, Hung Le, Mike Zheng Shou, Caiming Xiong, Doyen Sahoo

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments project page: https://showlab.github.io/Moonshot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17172 2023-12-29 cs.CV cs.AI cs.CL 57%

Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Action

Jiasen Lu, Christopher Clark, Sangho Lee, Zichen Zhang, Savya Khosla, Ryan Marten, Derek Hoiem, Aniruddha Kembhavi

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 38 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15480 2023-12-27 cs.CV 57%

A Two-stage Personalized Virtual Try-on Framework with Shape Control and Texture Guidance

Shufang Zhang, Minxue Ni, Lei Wang, Wenxin Ding, Shuai Chen, Yuhong Liu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01406 2023-12-27 cs.CV 57%

Learning Residual Elastic Warps for Image Stitching under Dirichlet Boundary Condition

Minsu Kim, Yongjun Lee, Woo Kyoung Han, Kyong Hwan Jin

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14724 2023-12-25 cs.CV stat.ML 57%

Images in Discrete Choice Modeling: Addressing Data Isomorphism in Multi-Modality Inputs

Brian Sifringer, Alexandre Alahi

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments 17 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14233 2023-12-25 cs.CV 57%

VCoder: Versatile Vision Encoders for Multimodal Large Language Models

Jitesh Jain, Jianwei Yang, Humphrey Shi

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Project Page: https://praeclarumjj3.github.io/vcoder/

详情

展开后加载摘要…

URL PDF HTML 收藏