arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4210 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4210 篇

2509.23607 2026-02-18 cs.GR cs.CV 73%

ZeroScene: A Zero-Shot Framework for 3D Scene Generation from a Single Image and Controllable Texture Editing

ZeroScene: 一种基于单张图像的3D场景生成零样本框架及可控纹理编辑

Xiang Tang, Ruotong Li, Xiaopeng Fan

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Pengcheng Laboratory, China(鹏城实验室) Harbin Institute of Technology, China(哈尔滨工业大学) Harbin Institute of Technology, Suzhou Research Institute, China(哈尔滨工业大学苏州市研究院)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 ZeroScene通过零样本方法实现单图像3D场景生成与可控纹理编辑,结合大视觉模型先验知识,提升场景连贯性和渲染真实感。

Comments 16 pages, 15 figures, Eurographics 2026, Project page: https://xdlbw.github.io/ZeroScene/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06850 2026-02-09 cs.CV cs.AI cs.MM 73%

Rethinking Multi-Condition DiTs: Eliminating Redundant Attention via Position-Alignment and Keyword-Scoping

重新思考多条件DiTs:通过位置对齐和关键词范围消除冗余注意力

Chao Zhou, Tianyi Wei, Yiling Chen, Wenbo Zhou, Nenghai Yu

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出PKA框架,通过位置对齐和关键词范围注意力消除多条件生成中的冗余,提升效率并减少资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13486 2026-02-09 cs.CV cs.CL cs.GR 73%

T$^3$-S2S: Training-free Triplet Tuning for Sketch to Scene Synthesis in Controllable Concept Art Generation

T$^3$-S2S:无训练三元组微调用于可控概念艺术生成中的草图到场景合成

Zhenhong Sun, Yifu Wang, Yonhon Ng, Yongzhi Xu, Daoyi Dong, Hongdong Li, Pan Ji

机构 * Australian National University(澳大利亚国立大学) Vertex Lab(Vertex实验室) University of Technology Sydney(悉尼大学)

专题命中 可控生成 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 本文提出T3-S2S方法,通过三元组微调实现可控概念艺术生成中的草图到场景合成,提升多实例场景生成的可控性和细节精度。

Comments https://openreview.net/forum?id=lyn2BgKQ8F

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02143 2025-12-03 cs.GR cs.CV cs.LG 73%

CoatFusion: Controllable Material Coating in Images

CoatFusion:图像中的可控材料涂层

Sagie Levy, Elad Aharoni, Matan Levy, Ariel Shamir, Dani Lischinski

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Reichman University(雷赫曼大学)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV、cs.GR

AI总结 CoatFusion通过结合2D纹理和PBR参数控制,实现图像中可控的材料涂层生成,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11738 2025-10-15 cs.SD cs.AI cs.CV cs.MM 73%

SeeingSounds: Learning Audio-to-Visual Alignment via Text

Simone Carnemolla, Matteo Pennisi, Chiara Russo, Simone Palazzo, Daniela Giordano, Concetto Spampinato

机构 * University of Catania(卡塔尼亚大学)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV、cs.MM

Comments accepted to ACM Multimedia Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00541 2025-09-03 cs.GR cs.AI cs.CV 73%

LatentEdit: Adaptive Latent Control for Consistent Semantic Editing

Siyi Liu, Weiming Chen, Yushun Tang, Zhihai He

机构 * Southern University of Science and Technology, China(南方科技大学,中国) Pengcheng Laboratory, China(鹏城实验室,中国)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV、cs.GR

Comments Accepted by PRCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13797 2025-08-20 cs.GR cs.CV 73%

Sketch3DVE: Sketch-based 3D-Aware Scene Video Editing

Feng-Lin Liu, Shi-Yang Li, Yan-Pei Cao, Hongbo Fu, Lin Gao

机构 * Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Hong Kong University of Science(香港科学大学)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV、cs.GR

Comments SIGGRAPH 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17707 2025-06-24 cs.CV cs.AI cs.MM 73%

Programmable-Room: Interactive Textured 3D Room Meshes Generation Empowered by Large Language Models

Jihyun Kim, Junho Park, Kyeongbo Kong, Suk-Ju Kang

机构 * Department of Electronic Engineering, Sogang University(电子工程系,ソガン大学) Department of Electrical and Electronics Engineering, Pusan National University(电气电子工程系,釜山国立大学)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV、cs.MM

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07116 2025-06-10 cs.CV cs.GR 73%

Generative Photomontage

Sean J. Liu, Nupur Kumari, Ariel Shamir, Jun-Yan Zhu

机构 * Carnegie Mellon University(卡内基梅隆大学) Reichman University(里赫曼大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments CVPR 2025. Project webpage: https://lseancs.github.io/generativephotomontage/

Journal ref In IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16630 2025-03-24 cs.GR cs.CV 73%

TriTex: Learning Texture from a Single Mesh via Triplane Semantic Features

Dana Cohen-Bar, Daniel Cohen-Or, Gal Chechik, Yoni Kasten

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments Project page: https://danacohen95.github.io/TriTex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08678 2025-03-12 cs.GR cs.AI cs.CV 73%

GarmentCrafter: Progressive Novel View Synthesis for Single-View 3D Garment Reconstruction and Editing

Yuanhao Wang, Cheng Zhang, Gonçalo Frazão, Jinlong Yang, Alexandru-Eugen Ichim, Thabo Beeler, Fernando De la Torre

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments Project Page: https://humansensinglab.github.io/garment-crafter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20904 2025-03-03 cs.CV cs.MM 73%

DiffBrush:Just Painting the Art by Your Hands

Jiaming Chu, Lei Jin, Tao Wang, Junliang Xing, Jian Zhao

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13951 2025-02-20 cs.CV cs.GR 73%

IP-Composer: Semantic Composition of Visual Concepts

Sara Dorfman, Dana Cohen-Bar, Rinon Gal, Daniel Cohen-Or

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments Project Page: https://ip-composer.github.io/IP-Composer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12328 2024-05-30 cs.CV cs.AI cs.MM 73%

InstructVid2Vid: Controllable Video Editing with Natural Language Instructions

Bosheng Qin, Juncheng Li, Siliang Tang, Tat-Seng Chua, Yueting Zhuang

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV、cs.MM

Comments Accepted by ICME 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08054 2024-05-15 cs.GR cs.CV 73%

Coin3D: Controllable and Interactive 3D Assets Generation with Proxy-Guided Conditioning

Wenqi Dong, Bangbang Yang, Lin Ma, Xiao Liu, Liyuan Cui, Hujun Bao, Yuewen Ma, Zhaopeng Cui

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV、cs.GR

Comments Project webpage: https://zju3dv.github.io/coin3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15889 2024-04-25 cs.CV cs.GR 73%

Sketch2Human: Deep Human Generation with Disentangled Geometry and Appearance Control

Linzi Qu, Jiaxiang Shang, Hui Ye, Xiaoguang Han, Hongbo Fu

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05335 2024-01-11 cs.CV cs.GR cs.LG 73%

InseRF: Text-Driven Generative Object Insertion in Neural 3D Scenes

Mohamad Shahbazi, Liesbeth Claessens, Michael Niemeyer, Edo Collins, Alessio Tonioni, Luc Van Gool, Federico Tombari

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03079 2023-12-07 cs.CV cs.GR 73%

LooseControl: Lifting ControlNet for Generalized Depth Conditioning

Shariq Farooq Bhat, Niloy J. Mitra, Peter Wonka

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05461 2023-11-10 cs.CV cs.MM 73%

Control3D: Towards Controllable Text-to-3D Generation

Yang Chen, Yingwei Pan, Yehao Li, Ting Yao, Tao Mei

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.MM

Comments ACM Multimedia 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10735 2023-08-22 cs.CV cs.GR 73%

SKED: Sketch-guided Text-based 3D Editing

Aryan Mikaeili, Or Perel, Mehdi Safaee, Daniel Cohen-Or, Ali Mahdavi-Amiri

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00547 2023-06-05 cs.CV cs.GR 73%

AvatarStudio: Text-driven Editing of 3D Dynamic Human Head Avatars

Mohit Mendiratta, Xingang Pan, Mohamed Elgharib, Kartik Teotia, Mallikarjun B R, Ayush Tewari, Vladislav Golyanik, Adam Kortylewski, Christian Theobalt

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments 17 pages, 17 figures. Project page: https://vcai.mpi-inf.mpg.de/projects/AvatarStudio/

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.01721 2023-02-06 cs.CV cs.GR 73%

TEXTure: Text-Guided Texturing of 3D Shapes

Elad Richardson, Gal Metzer, Yuval Alaluf, Raja Giryes, Daniel Cohen-Or

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments Project page available at https://texturepaper.github.io/TEXTurePaper/

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.04977 2020-10-09 cs.CV cs.GR cs.LG eess.IV 73%

SESAME: Semantic Editing of Scenes by Adding, Manipulating or Erasing Objects

Evangelos Ntavelis, Andrés Romero, Iason Kastanis, Luc Van Gool, Radu Timofte

专题命中 可控生成 :image generation(abstract);image editing(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23361 2026-01-01 cs.CV 72%

OmniVCus: Feedforward Subject-driven Video Customization with Multimodal Control Conditions

OmniVCus: 基于多模态控制条件的前馈主体驱动视频定制

Yuanhao Cai, He Zhang, Xi Chen, Jinbo Xing, Yiwei Hu, Yuqian Zhou, Kai Zhang, Zhifei Zhang, Soo Ye Kim, Tianyu Wang, Yulun Zhang, Xiaokang Yang, Zhe Lin, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) Adobe Research(Adobe研究) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract,comments);image editing(abstract);分类 cs.CV

AI总结 OmniVCus通过多模态控制条件和改进的嵌入机制实现高效的多主体视频定制。

Comments NeurIPS 2025; A data construction pipeline and a diffusion Transformer framework for controllable subject-driven video customization

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04526 2024-08-02 cs.CV 72%

DATENeRF: Depth-Aware Text-based Editing of NeRFs

Sara Rojas, Julien Philip, Kai Zhang, Sai Bi, Fujun Luan, Bernard Ghanem, Kalyan Sunkavall

专题命中 可控生成 :diffusion(abstract,comments);inpainting(abstract);分类 cs.CV

Comments 3D Scene Editing, Neural Rendering, Diffusion Models, Accepted to ECCV24

Journal ref ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27735 2026-08-10 quant-ph 版本更新 71%

An IQP Born Machine for Calorimeter Image Generation at 64 Qubits with Compiled-IQP Deployment

用于64量子比特量热仪图像生成的IQP玻恩机及编译IQP部署

Jamal Slim, Saverio Monaco, Florian Rehm, Dirk Krücker, Kerstin Borras

专题命中 可控生成 :image generation(title)

AI总结 提出一种瞬时量子多项式时间(IQP)玻恩机架构,通过编译为单次采样困难的IQP电路,在64量子比特上实现高能物理量热仪簇射图像的生成,并达到优于经典基线的相关性度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08061 2026-08-04 math.AP math.DS 版本更新 71%

Uniform $L^{\infty}$-Boundedness of Global Attractors for Reaction-Diffusion Equations with Neumann boundary condition in Uniformly Perturbed Non-Smooth Domains

在均匀扰动的非光滑区域中具有诺伊曼边界条件的反应扩散方程全局吸引子的一致\(L^{\infty}\)有界性

Antonio L. Pereira

专题命中 可控生成 :diffusion(title)

AI总结 研究一族在非光滑区域上具诺伊曼边界条件的半线性抛物方程,通过特定条件建立适定性与吸引子存在性,利用多种方法证明吸引子族\(L^\infty\)一致有界,且在区域体积收敛时关于强\(H^1\)拓扑在\(\mu = 0\)处上半连续。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06058 2026-07-15 quant-ph 版本更新 71%

SQGen: Structured Quantum Image Generation with Latent-Modulated Quantized Tensor Trains

SQGen:基于潜变量调制量化张量列车的结构化量子图像生成

Guang Lin, Qibin Zhao

专题命中 可控生成 :image generation(title)

AI总结 研究旨在解决NISQ硬件上直接从量子系统生成图像的问题,核心方法是提出基于潜变量调制量化张量列车的SQGen,主要贡献为能稳定训练,端到端生成图像且无需经典解码器,在真实量子硬件上有可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09171 2026-06-12 cs.HC 新提交 71%

sketch-plot: Progressive Editing for Text-to-Image Academic Figures

sketch-plot:文本到图像学术图形的渐进式编辑

Yinghao Tang, Yupeng Xie, Yingchaojie Feng, Tingfeng Lan, Jiale Lao, Wei Chen

专题命中 可控生成 :text-to-image(title)

AI总结 提出sketch-plot系统,通过三层渐进式编辑流水线(PNG、可编辑拼图、SVG)实现文本生成学术图形的精确编辑,用户按需选择编辑层级,避免全局重绘。

Comments 6 pages, 3 figures. Submitted to the KDD 2026 Workshop on AI Data Scientist

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.08404 2026-06-04 math.OC cs.SY eess.SY 71%

Adaptive Boundary Control of Constant-Parameter Reaction-Diffusion PDEs Using Regulation-Triggered Finite-Time Identification

利用调节触发有限时间识别的常参数反应扩散PDEs自适应边界控制

Iasson Karafyllis, Miroslav Krstic, Katerina Chrysafi

专题命中 可控生成 :diffusion(title)

AI总结 本文提出基于确定性等价的新型自适应边界控制方案,通过事件触发最小二乘识别器实现参数估计的有限时间收敛,针对特定基准问题解决高频率增益未知的挑战。

Comments 26 pages, 4 figures, submitted to Automatica for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏