arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2411.15595 2024-12-17 cs.CV cs.AI 57%

An adversarial feature learning based semantic communication method for Human 3D Reconstruction

Shaojiang Liu, Jiajun Zou, Zhendan Liu, Meixia Dong, Zhiping Wan

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments It was published to arXiv without consulting the corresponding author, so the corresponding author requested a withdrawal first

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10219 2024-12-16 cs.CV 57%

Learning Complex Non-Rigid Image Edits from Multimodal Conditioning

Nikolai Warner, Jack Kolb, Meera Hahn, Vighnesh Birodkar, Jonathan Huang, Irfan Essa

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09623 2024-12-13 cs.CV 57%

OmniDrag: Enabling Motion Control for Omnidirectional Image-to-Video Generation

Weiqi Li, Shijie Zhao, Chong Mou, Xuhan Sheng, Zhenyu Zhang, Qian Wang, Junlin Li, Li Zhang, Jian Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09160 2024-12-13 cs.CV 57%

Pinpoint Counterfactuals: Reducing social bias in foundation models via localized counterfactual generation

Kirill Sirotkin, Marcos Escudero-Viñolo, Pablo Carballeira, Mayug Maniparambil, Catarina Barata, Noel E. O'Connor

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01916 2024-12-13 cs.CV 57%

FastLGS: Speeding up Language Embedded Gaussians with Feature Grid Mapping

Yuzhou Ji, He Zhu, Junshu Tang, Wuyi Liu, Zhizhong Zhang, Xin Tan, Yuan Xie

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments This paper is accepted to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16767 2024-12-11 cs.LG cs.CL cs.CV 57%

REBEL: Reinforcement Learning via Regressing Relative Rewards

Zhaolin Gao, Jonathan D. Chang, Wenhao Zhan, Owen Oertell, Gokul Swamy, Kianté Brantley, Thorsten Joachims, J. Andrew Bagnell, Jason D. Lee, Wen Sun

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments New experimental results on general chat

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06673 2024-12-10 cs.CV 57%

ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance

Chunwei Wang, Guansong Lu, Junwei Yang, Runhui Huang, Jianhua Han, Lu Hou, Wei Zhang, Hang Xu

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03520 2024-12-10 cs.CV 57%

Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention

Hannan Lu, Xiaohe Wu, Shudong Wang, Xiameng Qin, Xinyu Zhang, Junyu Han, Wangmeng Zuo, Ji Tao

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09386 2024-12-10 cs.CV 57%

SimGen: Simulator-conditioned Driving Scene Generation

Yunsong Zhou, Michael Simon, Zhenghao Peng, Sicheng Mo, Hongzi Zhu, Minyi Guo, Bolei Zhou

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2403.09630 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05630 2024-12-10 cs.CV 57%

Ctrl-V: Higher Fidelity Video Generation with Bounding-Box Controlled Object Motion

Ge Ya Luo, Zhi Hao Luo, Anthony Gosselin, Alexia Jolicoeur-Martineau, Christopher Pal

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03517 2024-12-09 cs.CV 57%

NVComposer: Boosting Generative Novel View Synthesis with Multiple Sparse and Unposed Images

Lingen Li, Zhaoyang Zhang, Yaowei Li, Jiale Xu, Wenbo Hu, Xiaoyu Li, Weihao Cheng, Jinwei Gu, Tianfan Xue, Ying Shan

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project Page: https://lg-li.github.io/project/nvcomposer

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03079 2024-12-06 cs.CV 57%

Align3R: Aligned Monocular Depth Estimation for Dynamic Videos

Jiahao Lu, Tianyu Huang, Peng Li, Zhiyang Dou, Cheng Lin, Zhiming Cui, Zhen Dong, Sai-Kit Yeung, Wenping Wang, Yuan Liu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project Page: https://igl-hkust.github.io/Align3R.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07500 2024-12-06 cs.CV 57%

SPIN: Spacecraft Imagery for Navigation

Javier Montalvo, Juan Ignacio Bravo Pérez-Villar, Álvaro García-Martín, Pablo Carballeira, Jesús Bescós

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00754 2024-12-03 cs.CV cs.AI 57%

CtrlNeRF: The Generative Neural Radiation Fields for the Controllable Synthesis of High-fidelity 3D-Aware Images

Jian Liu, Zhen Yu

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22059 2024-12-03 cs.RO cs.CV 57%

PACA: Perspective-Aware Cross-Attention Representation for Zero-Shot Scene Rearrangement

Shutong Jin, Ruiyu Wang, Kuangyi Chen, Florian T. Pokorny

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by WACV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00397 2024-12-03 cs.CV 57%

DreamDance: Animating Human Images by Enriching 3D Geometry Cues from 2D Poses

Yatian Pang, Bin Zhu, Bin Lin, Mingzhe Zheng, Francis E. H. Tay, Ser-Nam Lim, Harry Yang, Li Yuan

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19324 2024-12-02 cs.CV 57%

Trajectory Attention for Fine-grained Video Motion Control

Zeqi Xiao, Wenqi Ouyang, Yifan Zhou, Shuai Yang, Lei Yang, Jianlou Si, Xingang Pan

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project Page: xizaoqu.github.io/trajattn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18000 2024-12-02 cs.CV 57%

Exploring Visual Vulnerabilities via Multi-Loss Adversarial Search for Jailbreaking Vision-Language Models

Shuyang Hao, Bryan Hooi, Jun Liu, Kai-Wei Chang, Zi Huang, Yujun Cai

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00233 2024-12-02 cs.SD cs.AI cs.MM eess.AS eess.SP 57%

SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound

Haohe Liu, Xuenan Xu, Yi Yuan, Mengyue Wu, Wenwu Wang, Mark D. Plumbley

专题命中 可控生成 :diffusion(abstract);分类 cs.MM

Comments Accepted by Journal of Selected Topics in Signal Processing (JSTSP). Demo and code: https://haoheliu.github.io/SemantiCodec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18660 2024-12-02 cs.CV 57%

OOD-HOI: Text-Driven 3D Whole-Body Human-Object Interactions Generation Beyond Training Domains

Yixuan Zhang, Hui Yang, Chuanchen Luo, Junran Peng, Yuxi Wang, Zhaoxiang Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17949 2024-11-28 cs.CV 57%

ROICtrl: Boosting Instance Control for Visual Generation

Yuchao Gu, Yipin Zhou, Yunfan Ye, Yixin Nie, Licheng Yu, Pingchuan Ma, Kevin Qinghong Lin, Mike Zheng Shou

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page at https://roictrl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17696 2024-11-27 cs.CV 57%

ScribbleLight: Single Image Indoor Relighting with Scribbles

Jun Myeong Choi, Annie Wang, Pieter Peers, Anand Bhattad, Roni Sengupta

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17532 2024-11-27 cs.CV 57%

FTMoMamba: Motion Generation with Frequency and Text State Space Models

Chengjian Li, Xiangbo Shu, Qiongjie Cui, Yazhou Yao, Jinhui Tang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16327 2024-11-26 cs.CV 57%

CapHDR2IR: Caption-Driven Transfer from Visible Light to Infrared Domain

Jingchao Peng, Thomas Bashford-Rogers, Zhuang Shao, Haitao Zhao, Aru Ranjan Singh, Abhishek Goswami, Kurt Debattista

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15860 2024-11-26 cs.CV 57%

Generalizable Single-view Object Pose Estimation by Two-side Generating and Matching

Yujing Sun, Caiyi Sun, Yuan Liu, Yuexin Ma, Siu Ming Yiu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by WACV 2025, not published yet

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14816 2024-11-25 cs.CV cs.RO eess.IV 57%

Unsupervised Multi-view UAV Image Geo-localization via Iterative Rendering

Haoyuan Li, Chang Xu, Wen Yang, Li Mi, Huai Yu, Haijian Zhang

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13836 2024-11-22 cs.CV 57%

CLIPer: Hierarchically Improving Spatial Representation of CLIP for Open-Vocabulary Semantic Segmentation

Lin Sun, Jiale Cao, Jin Xie, Xiaoheng Jiang, Yanwei Pang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Homepange and code: https://linsun449.github.io/cliper

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18392 2024-11-19 cs.CV 57%

A Reference-Based 3D Semantic-Aware Framework for Accurate Local Facial Attribute Editing

Yu-Kai Huang, Yutong Zheng, Yen-Shuo Su, Anudeepsekhar Bolimera, Han Zhang, Fangyi Chen, Marios Savvides

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12886 2024-11-19 cs.CV cs.LG 57%

MCM: Multi-condition Motion Synthesis Framework

Zeyu Ling, Bo Han, Yongkang Wongkan, Han Lin, Mohan Kankanhalli, Weidong Geng

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Journal ref International Joint Conference on Artificial Intelligence 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10187 2024-11-18 cs.CV 57%

Try-On-Adapter: A Simple and Flexible Try-On Paradigm

Hanzhong Guo, Jianfeng Zhang, Cheng Zou, Jun Li, Meng Wang, Ruxue Wen, Pingzhong Tang, Jingdong Chen, Ming Yang

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Image virtual try-on, 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏