arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2411.09151 2024-11-15 cs.CV 57%

Mono2Stereo: Monocular Knowledge Transfer for Enhanced Stereo Matching

Yuran Wang, Yingping Liang, Hesong Li, Ying Fu

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08328 2024-11-14 cs.CV 57%

Motion Control for Enhanced Complex Action Video Generation

Qiang Zhou, Shaofeng Zhang, Nianzu Yang, Ye Qian, Hao Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://mvideo-v1.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04598 2024-11-08 cs.CV 57%

Social EgoMesh Estimation

Luca Scofano, Alessio Sampieri, Edoardo De Matteis, Indro Spinelli, Fabio Galasso

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03561 2024-11-07 cs.CV 57%

Estimating Ego-Body Pose from Doubly Sparse Egocentric Video Data

Seunggeun Chi, Pin-Hao Huang, Enna Sachdeva, Hengbo Ma, Karthik Ramani, Kwonjoon Lee

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02229 2024-11-07 cs.CV 57%

FewViewGS: Gaussian Splatting with Few View Matching and Multi-stage Training

Ruihong Yin, Vladimir Yugay, Yue Li, Sezer Karaoglu, Theo Gevers

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by NeurIPS2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01919 2024-11-05 cs.RO cs.CV 57%

Real-Time Polygonal Semantic Mapping for Humanoid Robot Stair Climbing

Teng Bin, Jianming Yao, Tin Lun Lam, Tianwei Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by The 2024 IEEE-RAS International Conference on Humanoid Robots. The code: https://github.com/BTFrontier/polygon_mapping

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01573 2024-11-05 cs.CV cs.LG eess.IV 57%

Conditional Controllable Image Fusion

Bing Cao, Xingxin Xu, Pengfei Zhu, Qilong Wang, Qinghua Hu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10062 2024-11-05 cs.GR 57%

360° Stereo Image Composition with Depth Adaption

Kun Huang, Fanglue Zhang, Junhong Zhao, Yiheng Li, Neil Dodgson

专题命中 可控生成 :image generation(abstract);分类 cs.GR

Comments A 14 pages paper, this have been puslished at IEEE TRANSACTIONS ON VISUALIZATION AND COMPUTER GRAPHICS (TVCG) https://ieeexplore.ieee.org/abstract/document/10298822

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12192 2024-11-01 cs.RO cs.AI cs.CV cs.LG 57%

DynaMo: In-Domain Dynamics Pretraining for Visuo-Motor Control

Zichen Jeff Cui, Hengkai Pan, Aadhithya Iyer, Siddhant Haldar, Lerrel Pinto

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22317 2024-10-30 cs.CV 57%

Multi-Class Textual-Inversion Secretly Yields a Semantic-Agnostic Classifier

Kai Wang, Fei Yang, Bogdan Raducanu, Joost van de Weijer

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

Comments Accepted in WACV 2025. Code link: https://github.com/wangkai930418/mc_ti

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19079 2024-10-30 cs.CV cs.LG 57%

BIFRÖST: 3D-Aware Image compositing with Language Instructions

Lingxiao Li, Kaixiong Gong, Weihong Li, Xili Dai, Tao Chen, Xiaojun Yuan, Xiangyu Yue

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments NeurIPS 2024, Code Available: https://github.com/lingxiao-li/Bifrost

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06904 2024-10-30 cs.CV 57%

Human Pose Descriptions and Subject-Focused Attention for Improved Zero-Shot Transfer in Human-Centric Classification Tasks

Muhammad Saif Ullah Khan, Muhammad Ferjad Naeem, Federico Tombari, Luc Van Gool, Didier Stricker, Muhammad Zeshan Afzal

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05799 2024-10-29 cs.CV 57%

SeeClear: Semantic Distillation Enhances Pixel Condensation for Video Super-Resolution

Qi Tang, Yao Zhao, Meiqin Liu, Chao Yao

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.02997 2024-10-28 cs.CV 57%

MOGAN: Morphologic-structure-aware Generative Learning from a Single Image

Jinshu Chen, Qihui Xu, Qi Kang, MengChu Zhou

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12647 2024-10-28 cs.CV cs.RO 57%

DiffusionNOCS: Managing Symmetry and Uncertainty in Sim2Real Multi-Modal Category-level Pose Estimation

Takuya Ikeda, Sergey Zakharov, Tianyi Ko, Muhammad Zubair Irshad, Robert Lee, Katherine Liu, Rares Ambrus, Koichi Nishiwaki

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 8 pages. 9 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.14107 2024-10-25 cs.CV cs.CR 57%

Hijack-GAN: Unintended-Use of Pretrained, Black-Box GANs

Hui-Po Wang, Ning Yu, Mario Fritz

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Accepted by CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18079 2024-10-24 cs.CV 57%

FreeVS: Generative View Synthesis on Free Driving Trajectory

Qitai Wang, Lue Fan, Yuqi Wang, Yuntao Chen, Zhaoxiang Zhang

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

Comments Project Page: https://freevs24.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11965 2024-10-23 cs.CV 57%

UrbanWorld: An Urban World Model for 3D City Generation

Yu Shang, Yuming Lin, Yu Zheng, Hangyu Fan, Jingtao Ding, Jie Feng, Jiansheng Chen, Li Tian, Yong Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.04785 2024-10-22 cs.CV cs.LG eess.IV 57%

Generating Physically-Consistent Satellite Imagery for Climate Visualizations

Björn Lütjens, Brandon Leshchinskiy, Océane Boulais, Farrukh Chishtie, Natalia Díaz-Rodríguez, Margaux Masson-Forsythe, Ana Mata-Payerro, Christian Requena-Mesa, Aruna Sankaranarayanan, Aaron Piña, Yarin Gal, Chedy Raïssi, Alexander Lavin, Dava Newman

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2010.08103

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09414 2024-10-22 cs.CV 57%

Depth Anything V2

Lihe Yang, Bingyi Kang, Zilong Huang, Zhen Zhao, Xiaogang Xu, Jiashi Feng, Hengshuang Zhao

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024. Project page: https://depth-anything-v2.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14540 2024-10-21 cs.CV 57%

Multi-modal Pose Diffuser: A Multimodal Generative Conditional Pose Prior

Calvin-Khang Ta, Arindam Dutta, Rohit Kundu, Rohit Lal, Hannah Dela Cruz, Dripta S. Raychaudhuri, Amit Roy-Chowdhury

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13830 2024-10-18 cs.CV 57%

DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion Control

Yujie Wei, Shiwei Zhang, Hangjie Yuan, Xiang Wang, Haonan Qiu, Rui Zhao, Yutong Feng, Feng Liu, Zhizhong Huang, Jiaxin Ye, Yingya Zhang, Hongming Shan

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://dreamvideo2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13030 2024-10-18 cs.CV cs.CL cs.LG 57%

Sensitivity of Generative VLMs to Semantically and Lexically Altered Prompts

Sri Harsha Dumpala, Aman Jaiswal, Chandramouli Sastry, Evangelos Milios, Sageev Oore, Hassan Sajjad

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12501 2024-10-17 cs.CV cs.AI 57%

DH-VTON: Deep Text-Driven Virtual Try-On via Hybrid Attention Learning

Jiabao Wei, Zhiyuan Ma

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 5 pages, 6 figures, ICASSP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11963 2024-10-17 cs.CV cs.AI 57%

CtrlSynth: Controllable Image Text Synthesis for Data-Efficient Multimodal Learning

Qingqing Cao, Mahyar Najibi, Sachin Mehta

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11878 2024-10-17 cs.CV cs.AI cs.LG 57%

Neural Metamorphosis

Xingyi Yang, Xinchao Wang

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments in ECCV2024, https://adamdad.github.io/neumeta/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10817 2024-10-15 cs.CV cs.LG 57%

When Does Perceptual Alignment Benefit Vision Representations?

Shobhita Sundaram, Stephanie Fu, Lukas Muttenthaler, Netanel Y. Tamir, Lucy Chai, Simon Kornblith, Trevor Darrell, Phillip Isola

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments S.S. and S.F. contributed equally. Website: percep-align.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10751 2024-10-15 cs.CV 57%

DragEntity: Trajectory Guided Video Generation using Entity and Positional Relationships

Zhang Wan, Sheng Tang, Jiawei Wei, Ruize Zhang, Juan Cao

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ACM MM2024 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10745 2024-10-15 cs.CV cs.AI 57%

FlexGen: Flexible Multi-View Generation from Text and Image Inputs

Xinli Xu, Wenhang Ge, Jiantao Lin, Jiawei Feng, Lie Xu, HanFeng Zhao, Shunsi Zhang, Ying-Cong Chen

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.15812 2024-10-15 cs.CV 57%

LatentKeypointGAN: Controlling Images via Latent Keypoints

Xingzhe He, Bastian Wandt, Helge Rhodin

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Journal ref Conference on Robots and Vision 2023

详情

展开后加载摘要…

URL PDF HTML 收藏