arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2509.24893 2025-10-09 cs.CV 57%

HBSplat: Robust Sparse-View Gaussian Reconstruction with Hybrid-Loss Guided Depth and Bidirectional Warping

Yu Ma, Guoliang Wei, Haihong Xiao, Yue Cheng

机构 * University of Shanghai for Science and Technology(上海理工大学) Hefei University of Technology(合肥工业大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments 14 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04438 2025-10-07 cs.CV cs.CL 57%

The Telephone Game: Evaluating Semantic Drift in Unified Models

Sabbir Mollah, Rohit Gupta, Sirnam Swetha, Qingyang Liu, Ahnaf Munir, Mubarak Shah

机构 * Center For Research in Computer Vision, University of Central Florida, USA(计算机视觉研究中心,中央佛罗里达大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02268 2025-10-03 cs.RO cs.CV 57%

Do You Know Where Your Camera Is? View-Invariant Policy Learning with Camera Conditioning

Tianchong Jiang, Jingtian Ji, Xiangshan Tan, Jiading Fang, Anand Bhattad, Vitor Guizilini, Matthew R. Walter

机构 * Toyota Technological Institute at Chicago(丰田技术研究所芝加哥分所) Waymo Johns Hopkins University(约翰霍普金斯大学) Toyota Research Institute(丰田研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Code and project materials are available at ripl.github.io/know_your_camera

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26599 2025-10-01 cs.CV 57%

DiffCamera: Arbitrary Refocusing on Images

Yiyang Wang, Xi Chen, Xiaogang Xu, Yu Liu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23643 2025-10-01 cs.CV 57%

Griffin: Generative Reference and Layout Guided Image Composition

Aryan Mikaeili, Amirhossein Alimohammadi, Negar Hassanpour, Ali Mahdavi-Amiri, Andrea Tagliasacchi

机构 * Simon Fraser University(西蒙弗雷泽大学) Huawei(华为) University of Toronto(多伦多大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24823 2025-09-30 cs.CR cs.AI cs.CV cs.LG 57%

Of-SemWat: High-payload text embedding for semantic watermarking of AI-generated images with arbitrary size

Benedetta Tondi, Andrea Costanzo, Mauro Barni

机构 * University of Siena(锡耶纳大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23911 2025-09-30 cs.CV 57%

MoReact: Generating Reactive Motion from Textual Descriptions

Xiyan Xu, Sirui Xu, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23736 2025-09-30 cs.CV cs.AI 57%

HieraTok: Multi-Scale Visual Tokenizer Improves Image Reconstruction and Generation

Cong Chen, Ziyuan Huang, Cheng Zou, Muzhi Zhu, Kaixiang Ji, Jiajia Liu, Jingdong Chen, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University of Technology(浙江工业大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23708 2025-09-30 cs.CV cs.AI 57%

CrimEdit: Controllable Editing for Counterfactual Object Removal, Insertion, and Movement

Boseong Jeon, Junghyuk Lee, Jimin Park, Kwanyoung Kim, Jingi Jung, Sangwon Lee, Hyunbo Shim

机构 * Samsung Research(三星研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12341 2025-09-30 cs.CV cs.AI 57%

Semantic Discrepancy-aware Detector for Image Forgery Identification

Ziye Wang, Minghang Yu, Chunyan Xu, Zhen Cui

机构 * Nanjing University of Science and Technology(南京理工大学) Beijing Normal University(北京师范大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13838 2025-09-30 eess.SP cs.CV cs.IT eess.IV math.IT 57%

Generative Video Semantic Communication via Multimodal Semantic Fusion with Large Model

Hang Yin, Li Qiao, Yu Ma, Shuo Sun, Kan Li, Zhen Gao, Dusit Niyato

机构 * School of Information and Electronics, Beijing Institute of Technology(信息与电子学院,北京理工大学) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments IEEE Transactions on Vehicular Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22169 2025-09-29 cs.CV cs.LG 57%

DragGANSpace: Latent Space Exploration and Control for GANs

Kirsten Odendaal, Neela Kaushik, Spencer Halverson

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

Comments 6 pages with 7 figures and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22432 2025-09-29 cs.CV 57%

Shape-for-Motion: Precise and Consistent Video Editing with 3D Proxy

Yuhao Liu, Tengfei Wang, Fang Liu, Zhenwei Wang, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学) Tencent(腾讯)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by Siggraph Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21119 2025-09-26 cs.CV 57%

MotionFlow:Learning Implicit Motion Flow for Complex Camera Trajectory Control in Video Generation

Guojun Lei, Chi Wang, Yikai Wang, Hong Li, Ying Song, Weiwei Xu

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学) Beihang University(北航) Zhejiang Gongshang University(浙江工商大学) ShengShu(盛舒)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICME2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15269 2025-09-26 cs.CV cs.AI 57%

Conditional Video Generation for High-Efficiency Video Compression

Fangqiu Yi, Jingyu Xu, Jiawei Shao, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08705 2025-09-26 cs.CV cs.AI 57%

Instance-aware Image Colorization with Controllable Textual Descriptions and Segmentation Masks

Yanru An, Ling Gui, Chunlei Cai, Tianxiao Ye, JIangchao Yao, Guangtao Zhai, Qiang Hu, Xiaoyun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03602 2025-09-25 cs.CV 57%

Ctrl-Room: Controllable Text-to-3D Room Meshes Generation with Layout Constraints

Chuan Fang, Yuan Dong, Kunming Luo, Xiaotao Hu, Rakesh Shrestha, Ping Tan

机构 * Hong Kong University of Science and Technology(香港理工大学) LightIllusion, China(中国LightIllusion公司) Alibaba Group(阿里巴巴集团) Simon Fraser University, Canada(加拿大Simon Fraser大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17476 2025-09-23 cs.CV 57%

Stable Video-Driven Portraits

Mallikarjun B. R., Fei Yin, Vikram Voleti, Nikita Drobyshev, Maksim Lapin, Aaryaman Vasishta, Varun Jampani

机构 * Stability AI University of Cambridge(剑桥大学) Cantina

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments https://stable-video-driven-portraits.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07570 2025-09-22 cs.CV cs.AI 57%

OptiScene: LLM-driven Indoor Scene Layout Generation via Scaled Human-aligned Data Synthesis and Multi-Stage Preference Optimization

Yixuan Yang, Zhen Luo, Tongsheng Ding, Junru Lu, Mingqi Gao, Jinyu Yang, Victor Sanchez, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Shanghai Innovation Institute(上海创新研究院) University of Warwick(沃林顿大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11277 2025-09-19 cs.CV cs.LG 57%

Probing the Representational Power of Sparse Autoencoders in Vision Models

Matthew Lyle Olson, Musashi Hinck, Neale Ratzlaff, Changbai Li, Phillip Howard, Vasudev Lal, Shao-Yen Tseng

机构 * Oracle Intel Labs(英特尔实验室) Oregon State University(俄勒冈州立大学) Thoughtworks

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICCV 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20289 2025-09-17 cs.CV 57%

HierRelTriple: Guiding Indoor Layout Generation with Hierarchical Relationship Triplet Losses

Kaifan Sun, Bingchen Yang, Peter Wonka, Jun Xiao, Haiyong Jiang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11840 2025-09-16 cs.CV 57%

Synthetic Captions for Open-Vocabulary Zero-Shot Segmentation

Tim Lebailly, Vijay Veerabadran, Satwik Kottur, Karl Ridgeway, Michael Louis Iuzzolino

机构 * Meta KU Leuven(鲁汶大学)

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

Comments ICCV 2025 CDEL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19189 2025-09-16 cs.CV cs.LG 57%

An End-to-End Depth-Based Pipeline for Selfie Image Rectification

Ahmed Alhawwary, Janne Mustaniemi, Phong Nguyen-Ha, Janne Heikkilä

机构 * Center for Machine Vision and Signal Analysis (CMVS), University of Oulu(机器视觉与信号分析中心(CMVS)、奥卢大学) Qualcomm AI Research(高通人工智能研究)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Accepted at IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02353 2025-09-16 cs.CV cs.AI cs.LG 57%

Semantic Augmentation in Images using Language

Sahiti Yerramilli, Jayant Sravan Tamarapalli, Tanmay Girish Kulkarni, Jonathan Francis, Eric Nyberg

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10466 2025-09-16 cs.CV cs.HC 57%

A Real-Time Diminished Reality Approach to Privacy in MR Collaboration

Christian Fane

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments 50 pages, 12 figures | Demo video: https://youtu.be/udBxj35GEKI?t=499 | Code: https://github.com/c1h1r1i1s1 (multiple repositories)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20724 2025-09-15 cs.CV 57%

Dynamic Motion Blending for Versatile Motion Editing

Nan Jiang, Hongjie Li, Ziye Yuan, Zimo He, Yixin Chen, Tengyu Liu, Yixin Zhu, Siyuan Huang

机构 * Institute for AI, Peking University(人工智能研究院,北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Yuanpei College, Peking University(元培学院,北京大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07647 2025-09-10 cs.CV 57%

Semantic Watermarking Reinvented: Enhancing Robustness and Generation Quality with Fourier Integrity

Sung Ju Lee, Nam Ik Cho

机构 * Dept. of ECE & INMC, Seoul National University, Korea(电子工程系及智能纳米材料中心,首尔国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted to the IEEE/CVF International Conference on Computer Vision (ICCV) 2025. Project page: https://thomas11809.github.io/SFWMark/ Code: https://github.com/thomas11809/SFWMark

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04819 2025-09-09 eess.IV cs.CV 57%

AURAD: Anatomy-Pathology Unified Radiology Synthesis with Progressive Representations

Shuhan Ding, Jingjing Fu, Yu Gu, Naiteek Sangani, Mu Wei, Paul Vozila, Nan Liu, Jiang Bian, Hoifung Poon

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04631 2025-09-08 cs.CV 57%

Disentangled Clothed Avatar Generation with Layered Representation

Weitian Zhang, Yichao Yan, Sijing Wu, Manwen Liao, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能教育部重点实验室、人工智能研究院、上海交通大学) The University of Hong Kong(香港大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICCV 2025 highlight, project page: https://olivia23333.github.io/LayerAvatar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06002 2025-09-05 cs.CV 57%

Enhanced Generative Data Augmentation for Semantic Segmentation via Stronger Guidance

Quang-Huy Che, Duc-Tri Le, Bich-Nga Pham, Duc-Khai Lam, Vinh-Tiep Nguyen

机构 * University of Information Technology(信息技术大学) Vietnam National University(越南国家大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Published in ICPRAM 2025, ISBN 978-989-758-730-6, ISSN 2184-4313

Journal ref Proceedings of the 14th International Conference on Pattern Recognition Applications and Methods - ICPRAM (2025) 251-262

详情

展开后加载摘要…

URL PDF HTML 收藏