arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4210 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4210 篇

2411.16683 2025-03-25 cs.CV 70%

Generative Omnimatte: Learning to Decompose Video into Layers

Yao-Chih Lee, Erika Lu, Sarah Rumbley, Michal Geyer, Jia-Bin Huang, Tali Dekel, Forrester Cole

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

Comments CVPR 2025. Project page: https://gen-omnimatte.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13558 2025-03-25 cs.CV 70%

LASER: Tuning-Free LLM-Driven Attention Control for Efficient Text-conditioned Image-to-Animation

Haoyu Zheng, Wenqiao Zhang, Yaoke Wang, Juncheng Li, Zheqi Lv, Xin Min, Mengze Li, Dongping Zhang, Siliang Tang, Yueting Zhuang

专题命中 可控生成 :text-to-image(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24160 2025-03-18 cs.CV cs.CL 70%

Redefining <Creative> in Dictionary: Towards an Enhanced Semantic Understanding of Creative Generation

Fu Feng, Yucheng Xie, Xu Yang, Jing Wang, Xin Geng

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09221 2025-03-13 cs.CV 70%

Active Learning Inspired ControlNet Guidance for Augmenting Semantic Segmentation Datasets

Hannah Kniesel, Pedro Hermosilla, Timo Ropinski

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06142 2025-03-11 cs.CV 70%

VLForgery Face Triad: Detection, Localization and Attribution via Multimodal Large Language Models

Xinan He, Yue Zhou, Bing Fan, Bin Li, Guopu Zhu, Feng Ding

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03355 2025-03-04 cs.CV cs.AI 70%

LANTERN: Accelerating Visual Autoregressive Models with Relaxed Speculative Decoding

Doohyuk Jang, Sihwan Park, June Yong Yang, Yeonsung Jung, Jihun Yun, Souvik Kundu, Sung-Yub Kim, Eunho Yang

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments 30 pages, 13 figures, Accepted to ICLR 2025 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13252 2025-02-24 cs.CV 70%

LayerPano3D: Layered 3D Panorama for Hyper-Immersive Scene Generation

Shuai Yang, Jing Tan, Mengchen Zhang, Tong Wu, Yixuan Li, Gordon Wetzstein, Ziwei Liu, Dahua Lin

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

Comments Project page: https://ys-imtech.github.io/projects/LayerPano3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11532 2025-02-18 cs.CV 70%

Control-CLIP: Decoupling Category and Style Guidance in CLIP for Specific-Domain Generation

Zexi Jia, Chuanwei Huang, Hongyan Fei, Yeshuang Zhu, Zhiqiang Yuan, Jinchao Zhang, Jie Zhou

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04364 2025-02-10 cs.CV cs.AI cs.HC cs.LG 70%

Lost in Edits? A $λ$-Compass for AIGC Provenance

Wenhao You, Bryan Hooi, Yiwei Wang, Euijin Choo, Ming-Hsuan Yang, Junsong Yuan, Zi Huang, Yujun Cai

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12393 2025-01-22 cs.CV 70%

Towards Affordance-Aware Articulation Synthesis for Rigged Objects

Yu-Chu Yu, Chieh Hubert Lin, Hsin-Ying Lee, Chaoyang Wang, Yu-Chiang Frank Wang, Ming-Hsuan Yang

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

Comments Project page: https://chuyu.org/research/a3syn

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12224 2025-01-22 cs.CV 70%

TokenVerse: Versatile Multi-concept Personalization in Token Modulation Space

Daniel Garibi, Shahar Yadin, Roni Paiss, Omer Tov, Shiran Zada, Ariel Ephrat, Tomer Michaeli, Inbar Mosseri, Tali Dekel

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07249 2025-01-14 cs.CV cs.AI cs.LG 70%

Buster: Implanting Semantic Backdoor into Text Encoder to Mitigate NSFW Content Generation

Xin Zhao, Xiaojun Chen, Yuexin Xuan, Zhendong Zhao, Xiaojun Jia, Xinfeng Li, Xiaofeng Wang

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05131 2025-01-10 cs.CV 70%

3DIS-FLUX: simple and efficient multi-instance generation with DiT rendering

Dewei Zhou, Ji Xie, Zongxin Yang, Yi Yang

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16832 2024-12-24 cs.CV 70%

RealisID: Scale-Robust and Fine-Controllable Identity Customization via Local and Global Complementation

Zhaoyang Sun, Fei Du, Weihua Chen, Fan Wang, Yaxiong Chen, Yi Rong, Shengwu Xiong

专题命中 可控生成 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11599 2024-12-17 cs.CV 70%

3D$^2$-Actor: Learning Pose-Conditioned 3D-Aware Denoiser for Realistic Gaussian Avatar Modeling

Zichen Tang, Hongyu Yang, Hanchen Zhang, Jiaxin Chen, Di Huang

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04707 2024-12-09 cs.AI cs.CE cs.CV cs.HC 70%

Parametric-ControlNet: Multimodal Control in Foundation Models for Precise Engineering Design Synthesis

Rui Zhou, Yanxia Zhang, Chenyang Yuan, Frank Permenter, Nikos Arechiga, Matt Klenk, Faez Ahmed

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16749 2024-12-03 cs.CV 70%

AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks

You Li, Fan Ma, Yi Yang

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00345 2024-11-28 cs.CV 70%

MaGRITTe: Manipulative and Generative 3D Realization from Image, Topview and Text

Takayuki Hara, Tatsuya Harada

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Project Page: https://hara012.github.io/MaGRITTe-project

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13579 2024-11-27 cs.CV cs.AI 70%

LTOS: Layout-controllable Text-Object Synthesis via Adaptive Cross-attention Fusions

Xiaoran Zhao, Tianhao Wu, Yu Lai, Zhiliang Tian, Zhen Huang, Yahui Liu, Zejiang He, Dongsheng Li

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07987 2024-11-20 cs.CV cs.AI cs.LG 70%

ControlNet++: Improving Conditional Controls with Efficient Consistency Feedback

Ming Li, Taojiannan Yang, Huafeng Kuang, Jie Wu, Zhaoning Wang, Xuefeng Xiao, Chen Chen

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Camera Ready Version. Project Page: https://liming-ai.github.io/ControlNet_Plus_Plus Code & Data: https://github.com/liming-ai/ControlNet_Plus_Plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03047 2024-11-19 cs.CV 70%

MagicStick: Controllable Video Editing via Control Handle Transformations

Yue Ma, Xiaodong Cun, Sen Liang, Jinbo Xing, Yingqing He, Chenyang Qi, Siran Chen, Qifeng Chen

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by WACV 2025, Project page: https://magic-stick-edit.github.io/ Github repository: https://github.com/mayuelala/MagicStick

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15769 2024-10-30 cs.CV 70%

FastDrag: Manipulate Anything in One Step

Xuanjia Zhao, Jian Guan, Congyi Fan, Dongli Xu, Youtian Lin, Haiwei Pan, Pengming Feng

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

Comments NeurIPS 2024 Accept, Project Page: https://fastdrag-site.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05375 2024-10-23 cs.CV 70%

IPDreamer: Appearance-Controllable 3D Object Generation with Complex Image Prompts

Bohan Zeng, Shanglin Li, Yutang Feng, Ling Yang, Hong Li, Sicheng Gao, Jiaming Liu, Conghui He, Wentao Zhang, Jianzhuang Liu, Baochang Zhang, Shuicheng Yan

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 20 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15488 2024-10-22 cs.CV 70%

DiffX: Guide Your Layout to Cross-Modal Generative Modeling

Zeyu Wang, Jingyu Lin, Yifei Qian, Yi Huang, Shicen Tian, Bosong Chai, Juncan Deng, Qu Yang, Lan Du, Cunjian Chen, Kejie Huang

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10207 2024-10-15 cs.CV 70%

MagicEraser: Erasing Any Objects via Semantics-Aware Control

Fan Li, Zixiao Zhang, Yi Huang, Jianzhuang Liu, Renjing Pei, Bin Shao, Songcen Xu

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09140 2024-10-15 cs.CV 70%

RealEra: Semantic-level Concept Erasure via Neighbor-Concept Mining

Yufan Liu, Jinyang An, Wanqian Zhang, Ming Li, Dayan Wu, Jingzi Gu, Zheng Lin, Weiping Wang

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12624 2024-10-11 cs.RO cs.CV 70%

DragTraffic: Interactive and Controllable Traffic Scene Generation for Autonomous Driving

Sheng Wang, Ge Sun, Fulong Ma, Tianshuai Hu, Qiang Qin, Yongkang Song, Lei Zhu, Junwei Liang

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07913 2024-10-10 cs.CV 70%

CTRLorALTer: Conditional LoRAdapter for Efficient 0-Shot Control & Altering of T2I Models

Nick Stracke, Stefan Andreas Baumann, Joshua M. Susskind, Miguel Angel Bautista, Björn Ommer

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments for the project page and code, view https://compvis.github.io/LoRAdapter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17720 2024-10-08 cs.CV cs.AI cs.LG 70%

MindFormer: Semantic Alignment of Multi-Subject fMRI for Brain Decoding

Inhwa Han, Jaayeon Lee, Jong Chul Ye

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09750 2024-10-03 cs.CV cs.AI 70%

ControlVAR: Exploring Controllable Visual Autoregressive Modeling

Xiang Li, Kai Qiu, Hao Chen, Jason Kuen, Zhe Lin, Rita Singh, Bhiksha Raj

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments 25 pages, 19 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏