arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4210 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4210 篇

2508.03539 2025-08-06 cs.CV 70%

Quality-Aware Language-Conditioned Local Auto-Regressive Anomaly Synthesis and Detection

Long Qian, Bingke Zhu, Yingying Chen, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(自动化研究所基础模型研究中心,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Objecteye Inc.(Objecteye公司)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03300 2025-08-06 cs.CV 70%

Zero Shot Domain Adaptive Semantic Segmentation by Synthetic Data Generation and Progressive Adaptation

Jun Luo, Zijing Zhao, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00272 2025-08-04 cs.CV 70%

Towards Robust Semantic Correspondence: A Benchmark and Insights

Wenyue Chong

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15867 2025-08-04 cs.CV 70%

PanoLlama: Generating Endless and Coherent Panoramas with Next-Token-Prediction LLMs

Teng Zhou, Xiaoyu Zhang, Yongchuan Tang

机构 * College of Computer Science and Technology(计算机科学与技术学院)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07047 2025-08-01 cs.CV 70%

Recovering Partially Corrupted Objects via Sketch-Guided Bidirectional Feature Interaction

Yongle Zhang, Yimin Liu, Yan Huang, Qiang Wu

机构 * School of Electrical and Data Engineering(电气与数据工程学院) Australian Artificial Intelligence Institute(澳大利亚人工智能研究所) University of Technology Sydney(悉尼科技大学) School of Computer Science and Information Engineering(计算机科学与信息工程学院) Hefei University of Technology(合肥工业大学)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

Comments 13 pages. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18527 2025-07-15 cs.CV 70%

Auto-Regressively Generating Multi-View Consistent Images

JiaKui Hu, Yuxiao Yang, Jialun Liu, Jinbo Wu, Chen Zhao, Yanye Lu

机构 * Institute of Medical Technology, Peking University Health Science Center, Peking University(北京大学医学部医学技术研究所) Baidu VIS(百度VIS) Biomedical Engineering Department, College of Future Technology, Peking University(未来技术学院生物医学工程系) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心) Tsinghua University(清华大学)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by ICCV 2025. Code is at https://github.com/MILab-PKU/MVAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00837 2025-07-08 cs.CV 70%

AniMer: Animal Pose and Shape Estimation Using Family Aware Transformer

Jin Lyu, Tianyi Zhu, Yi Gu, Li Lin, Pujin Cheng, Yebin Liu, Xiaoying Tang, Liang An

机构 * Southern University of Science and Technology(南方科技大学) China Mobile Research Institute(中国移动研究院) The Hong Kong University of Science and Technology(香港科技大学) The University of Hong Kong(香港大学) Tsinghua University(清华大学)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR25

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03402 2025-07-08 cs.CV cs.AI 70%

Pose-Star: Anatomy-Aware Editing for Open-World Fashion Images

Yuran Dong, Mang Ye

机构 * National Engineering Research Center for Multimedia Software(多媒体软件国家工程研究中心) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

Comments 18 pages, 17 figures, ICCV25

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02321 2025-07-04 cs.CV 70%

Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback

Nina Konovalova, Maxim Nikolaev, Andrey Kuznetsov, Aibek Alanov

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments code available at https://github.com/ControlGenAI/InnerControl

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19488 2025-06-25 cs.CV 70%

SceneCrafter: Controllable Multi-View Driving Scene Editing

Zehao Zhu, Yuliang Zou, Chiyu Max Jiang, Bo Sun, Vincent Casser, Xiukun Huang, Jiahao Wang, Zhenpei Yang, Ruiqi Gao, Leonidas Guibas, Mingxing Tan, Dragomir Anguelov

机构 * Waymo University of Texas at Austin(德克萨斯大学奥斯汀分校) Johns Hopkins University(约翰霍普金斯大学) Google DeepMind(谷歌DeepMind)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03147 2025-06-23 cs.CV cs.AI cs.CL 70%

UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation

Bin Lin, Zongjian Li, Xinhua Cheng, Yuwei Niu, Yang Ye, Xianyi He, Shenghai Yuan, Wangbo Yu, Shaodong Wang, Yunyang Ge, Yatian Pang, Li Yuan

机构 * Peking University(北京大学) Shenzhen Graduate School(深圳研究生院) Peng Cheng Laboratory(鹏城实验室) Rabbitpre AI

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05204 2025-06-06 cs.CV 70%

OGGSplat: Open Gaussian Growing for Generalizable Reconstruction with Expanded Field-of-View

Yanbo Wang, Ziyi Wang, Wenzhao Zheng, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00742 2025-06-03 cs.CV cs.AI 70%

ArtiScene: Language-Driven Artistic 3D Scene Generation Through Image Intermediary

Zeqi Gu, Yin Cui, Zhaoshuo Li, Fangyin Wei, Yunhao Ge, Jinwei Gu, Ming-Yu Liu, Abe Davis, Yifan Ding

机构 * NVIDIA Cornell University(康奈尔大学)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted by CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12235 2025-05-20 cs.CV 70%

NOFT: Test-Time Noise Finetune via Information Bottleneck for Highly Correlated Asset Creation

Jia Li, Nan Gao, Huaibo Huang, Ran He

机构 * CASIA(中国科学院自动化研究所) NLPR, CASIA(中国科学院自动化研究所神经网络与模式识别实验室)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09049 2025-05-09 cs.CV 70%

SceneCraft: Layout-Guided 3D Scene Generation

Xiuyu Yang, Yunze Man, Jun-Kun Chen, Yu-Xiong Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments NeurIPS 2024. Code: https://github.com/OrangeSodahub/SceneCraft Project Page: https://orangesodahub.github.io/SceneCraft

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19911 2025-05-08 cs.CV 70%

Replace Anyone in Videos

Xiang Wang, Shiwei Zhang, Haonan Qiu, Ruihang Chu, Zekun Li, Yingya Zhang, Changxin Gao, Yuehuan Wang, Chunhua Shen, Nong Sang

机构 * Key Laboratory of Ministry of Education for Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(教育部图像处理与智能控制重点实验室,人工智能与自动化学院,华中科技大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01428 2025-05-06 cs.CV 70%

Multi-party Collaborative Attention Control for Image Customization

Han Yang, Chuanguang Yang, Qiuli Wang, Zhulin An, Weilun Feng, Libo Huang, Yongjun Xu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Department of Radiology, The First Affiliated Hospital of Army Medical University(中国人民解放军军医大学第一附属医院放射科)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12419 2025-05-02 cs.CV 70%

Scene-Conditional 3D Object Stylization and Composition

Jinghao Zhou, Tomas Jakab, Philip Torr, Christian Rupprecht

机构 * University of Oxford(牛津大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19506 2025-04-29 cs.CV 70%

SynergyAmodal: Deocclude Anything with Text Control

Xinyang Li, Chengjie Yi, Jiawei Lai, Mingbao Lin, Yansong Qu, Shengchuan Zhang, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, China(多媒体可信感知与高效计算重点实验室、教育部、厦门大学)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17712 2025-04-25 cs.CV 70%

Generative Fields: Uncovering Hierarchical Feature Control for StyleGAN via Inverted Receptive Fields

Zhuo He, Paul Henderson, Nicolas Pugeault

专题命中 可控生成 :image generation(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15176 2025-04-22 cs.CV 70%

DSPO: Direct Semantic Preference Optimization for Real-World Image Super-Resolution

Miaomiao Cai, Simiao Li, Wei Li, Xudong Huang, Hanting Chen, Jie Hu, Yunhe Wang

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14335 2025-04-22 cs.CV cs.AI 70%

Visual Prompting for One-shot Controllable Video Editing without Inversion

Zhengbo Zhang, Yuxi Zhou, Duo Peng, Joo-Hwee Lim, Zhigang Tu, De Wen Soh, Lin Geng Foo

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Wuhan University(武汉大学) Institute for Infocomm Research, Agency for Science, Technology and Research, Singapore(新加坡资讯与通信研究院)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

Comments accepted by cvpr2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13224 2025-04-21 cs.CV cs.AI 70%

ICAS: IP Adapter and ControlNet-based Attention Structure for Multi-Subject Style Transfer Optimization

Fuwei Liu

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07963 2025-04-11 cs.CV 70%

PixelFlow: Pixel-Space Generative Models with Flow

Shoufa Chen, Chongjian Ge, Shilong Zhang, Peize Sun, Ping Luo

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Technical report. Code: https://github.com/ShoufaChen/PixelFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06632 2025-04-10 cs.CV 70%

PosterMaker: Towards High-Quality Product Poster Generation with Accurate Text Rendering

Yifan Gao, Zihang Lin, Chuanbin Liu, Min Zhou, Tiezheng Ge, Bo Zheng, Hongtao Xie

专题命中 可控生成 :image generation(abstract);inpainting(abstract);分类 cs.CV

Comments Accepted by CVPR 2025. Project Page: https://poster-maker.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04743 2025-04-08 cs.CV 70%

AnyArtisticGlyph: Multilingual Controllable Artistic Glyph Generation

Xiongbo Lu, Yaxiong Chen, Shengwu Xiong

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01190 2025-04-08 cs.CV 70%

Enhancing Retinal Vessel Segmentation Generalization via Layout-Aware Generative Modelling

Jonathan Fhima, Jan Van Eijgen, Lennert Beeckmans, Thomas Jacobs, Moti Freiman, Luis Filipe Nakayama, Ingeborg Stalmans, Chaim Baskin, Joachim A. Behar

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01255 2025-04-03 cs.CV cs.LG 70%

Meta ControlNet: Enhancing Task Adaptation via Meta Learning

Junjie Yang, Jinze Zhao, Peihao Wang, Zhangyang Wang, Yingbin Liang

专题命中 可控生成 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Codebase link: https://github.com/JunjieYang97/Meta-ControlNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17524 2025-03-31 cs.CV 70%

JoyType: A Robust Design for Multilingual Visual Text Creation

Chao Li, Chen Jiang, Xiaolong Liu, Jun Zhao, Guoxin Wang

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21747 2025-03-28 cs.CV cs.AI cs.LG 70%

CTRL-O: Language-Controllable Object-Centric Visual Representation Learning

Aniket Didolkar, Andrii Zadaianchuk, Rabiul Awal, Maximilian Seitzer, Efstratios Gavves, Aishwarya Agrawal

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏