arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4201 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4201 篇

2607.08741 2026-07-10 cs.GR cs.CV cs.LG cs.RO 新提交 76%

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation

ARDY:用于交互式人体运动生成的具有混合表示的自回归扩散

Kaifeng Zhao, Mathis Petrovich, Haotian Zhang, Tingwu Wang, Siyu Tang, Davis Rempe

机构 * NVIDIA(英伟达) ETH Zürich(苏黎世联邦理工学院)

专题命中 可控生成 :diffusion(title);分类 cs.CV、cs.GR

AI总结 研究旨在解决交互式应用中人体运动生成问题,提出ARDY框架,采用混合表示和两阶段自回归变压器去噪器,能通过在线文本提示和运动学约束实现高保真运动生成,经评估验证了有效性和实用性。

Comments ACM Transactions on Graphics (SIGGRAPH 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03423 2025-11-06 eess.AS cs.CV cs.MM 76%

Seeing What You Say: Expressive Image Generation from Speech

Jiyoung Lee, Song Park, Sanghyuk Chun, Soo-Whan Chung

机构 * Ewha Womans University(东亚大学) Princeton University(普林斯顿大学) NAVER CLOUD

专题命中 可控生成 :image generation(title);分类 cs.CV、cs.MM

Comments In progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18116 2024-10-28 cs.GR cs.CV 76%

Block and Detail: Scaffolding Sketch-to-Image Generation

Vishnu Sarukkai, Lu Yuan, Mia Tang, Maneesh Agrawala, Kayvon Fatahalian

专题命中 可控生成 :image generation(title);分类 cs.CV、cs.GR

Comments UIST 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05919 2024-08-26 cs.CV cs.GR 76%

Collaborative Control for Geometry-Conditioned PBR Image Generation

Shimon Vainer, Mark Boss, Mathias Parger, Konstantin Kutsy, Dante De Nigris, Ciara Rowles, Nicolas Perony, Simon Donné

专题命中 可控生成 :image generation(title);分类 cs.CV、cs.GR

Comments 19 pages, 10 figures; Project page: https://unity-research.github.io/holo-gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17256 2024-08-20 cs.IT cs.CV cs.MM eess.SP math.IT 76%

Latency-Aware Generative Semantic Communications with Pre-Trained Diffusion Models

Li Qiao, Mahdi Boloursaz Mashhadi, Zhen Gao, Chuan Heng Foh, Pei Xiao, Mehdi Bennis

专题命中 可控生成 :diffusion(title);分类 cs.CV、cs.MM

Comments Accepted for publication in IEEE Wireless Communication Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08266 2024-03-14 cs.CV cs.GR 76%

Sketch2Manga: Shaded Manga Screening from Sketch with Diffusion Models

Jian Lin, Xueting Liu, Chengze Li, Minshan Xie, Tien-Tsin Wong

专题命中 可控生成 :diffusion(title);分类 cs.CV、cs.GR

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.10257 2022-07-27 cs.CV cs.GR 76%

Injecting 3D Perception of Controllable NeRF-GAN into StyleGAN for Editable Portrait Image Synthesis

Jeong-gi Kwak, Yuanming Li, Dongsik Yoon, Donghyeon Kim, David Han, Hanseok Ko

专题命中 可控生成 :image synthesis(title);分类 cs.CV、cs.GR

Comments ECCV 2022, project page: https://jgkwak95.github.io/surfgan/

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.02762 2022-06-01 cs.GR cs.CV 76%

DrawingInStyles: Portrait Image Generation and Editing with Spatially Conditioned StyleGAN

Wanchao Su, Hui Ye, Shu-Yu Chen, Lin Gao, Hongbo Fu

专题命中 可控生成 :image generation(title);分类 cs.CV、cs.GR

Comments 15 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.07293 2022-03-15 cs.CV cs.GR cs.LG 76%

InsetGAN for Full-Body Image Generation

Anna Frühstück, Krishna Kumar Singh, Eli Shechtman, Niloy J. Mitra, Peter Wonka, Jingwan Lu

专题命中 可控生成 :image generation(title);分类 cs.CV、cs.GR

Comments Project webpage and video available at http://afruehstueck.github.io/insetgan

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.07874 2021-09-22 cs.CV cs.GR 76%

SketchHairSalon: Deep Sketch-based Hair Image Synthesis

Chufeng Xiao, Deng Yu, Xiaoguang Han, Youyi Zheng, Hongbo Fu

专题命中 可控生成 :image synthesis(title);分类 cs.CV、cs.GR

Comments SIGGRAPH Asia 2021 (https://chufengxiao.github.io/SketchHairSalon/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.14877 2021-05-13 cs.CV cs.GR 76%

Few-shot Semantic Image Synthesis Using StyleGAN Prior

Yuki Endo, Yoshihiro Kanamori

专题命中 可控生成 :image synthesis(title);分类 cs.CV、cs.GR

Comments The source codes are available at https://github.com/endo-yuki-t/Fewshot-SMIS

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.07291 2019-11-06 cs.CV cs.AI cs.GR cs.LG 76%

Semantic Image Synthesis with Spatially-Adaptive Normalization

Taesung Park, Ming-Yu Liu, Ting-Chun Wang, Jun-Yan Zhu

专题命中 可控生成 :image synthesis(title);分类 cs.CV、cs.GR

Comments Accepted as a CVPR 2019 oral paper

Journal ref CVPR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22640 2025-12-01 cs.LG 75%

Flow Density Control: Generative Optimization Beyond Entropy-Regularized Fine-Tuning

流密度控制:超越熵正则化微调的生成优化

Riccardo De Santi, Marin Vlastelica, Ya-Ping Hsieh, Zebang Shen, Niao He, Andreas Krause

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世人工智能中心)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 流密度控制通过简化复杂优化问题,实现超越熵正则化微调的生成模型优化,适用于分子设计和图像生成等任务。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.07431 2021-06-15 cs.SD cs.LG eess.AS 75%

CRASH: Raw Audio Score-based Generative Modeling for Controllable High-resolution Drum Sound Synthesis

Simon Rouard, Gaëtan Hadjeres

专题命中 可控生成 :image generation(abstract);diffusion(abstract);inpainting(abstract)

Comments 12 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09357 2026-08-11 cs.CV 新提交 74%

ControlRadio: Prompt-Driven Controllable Diffusion for Cross-Modal Radio Map Generation

ControlRadio:用于跨模态无线电地图生成的提示驱动可控扩散模型

Kangjun Liu, Xiying Pan, Shuhang Zhang, Xiang Xiang, Ke Chen, Yaowei Wang

机构 * Pengcheng Laboratory(鹏城实验室) South China University of Technology(华南理工大学) Peking University(北京大学) Huazhong University of Science and Technology(华中科技大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 可控生成 :diffusion(title);分类 cs.CV

AI总结 ControlRadio是一种可控生成框架,可根据自然语言描述和环境布局生成无线电地图,在不同城市场景中精度和泛化能力领先,计算时间较传统方法减少四个数量级以上,为无线环境建模提供新范式。

Comments 17 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19982 2026-07-31 cs.CV cs.AI 版本更新 74%

EmoFeedback$^2$: Reinforcement of Continuous Emotional Image Generation via LVLM-based Reward and Textual Feedback

EmoFeedback$^2$:基于LVLM的奖励与文本反馈的连续情绪图像生成强化

Kai Shu, Jingyang Jia, Gang Yang, Long Xing, Xun Chen, Aiping Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 EmoFeedback$^2$通过基于LVLM的奖励与文本反馈机制,提升连续情绪图像生成的质量与情绪保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26016 2026-07-09 cs.CV 新提交 74%

MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation

MIMFlow:将掩码图像建模与归一化流集成用于端到端图像生成

Yang Chen, Xiaowei Xu, Shuai Wang, Xinwen Zhang, Qiushi Guo, Tiezheng Ge, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Alibaba Group(阿里巴巴集团) Shanghai AI Lab(上海人工智能实验室)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 提出MIMFlow框架,通过VAE编码器从掩码图像推断语义潜在变量,使归一化流专注于低频语义流形,解码器处理高频合成,解决NF容量瓶颈,在ImageNet 256×256上达到71.3%线性探测精度和2.50 FID。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31029 2026-07-01 cs.CV 新提交 74%

TerraDiT-$Ω$: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive

TerraDiT-$\Omega$:任意地理基元的卫星图像合成统一空间控制

Brian Wei, Srikumar Sastry, Daniel Cher, Eric Xing, Nathan Jacobs

机构 * Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 可控生成 :image synthesis(title);分类 cs.CV

AI总结 提出TerraDiT-Ω框架,通过几何感知局部注意力机制,支持从任意原生地理基元(多边形、折线、边界框、点)直接生成卫星图像,在多种控制格式下优于密集和稀疏控制基线,并提升下游任务性能。

Comments European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00503 2026-05-04 cs.CV cs.LG 74%

End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer

端到端自回归图像生成与1D语义分词器

Wenda Chu, Bingliang Zhang, Jiaqi Han, Yizhuo Li, Linjie Yang, Yisong Yue, Qiushan Guo

机构 * California Institute of Technology(加州理工学院) Stanford University(斯坦福大学)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 本文提出端到端训练 pipeline,结合重建与生成优化,改进1D分词器,实现自回归图像生成的高FID分数结果。

Comments In ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16680 2026-04-21 cs.CV 74%

C-GenReg: Training-Free 3D Point Cloud Registration by Multi-View-Consistent Geometry-to-Image Generation with Probabilistic Modalities Fusion

C-GenReg:基于多视角一致的几何到图像生成的无训练3D点云配准

Yuval Haitman, Amit Efraim, Joseph M. Francos

机构 * Ben-Gurion University(本·古里安大学)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 C-GenReg通过多视角一致的几何到图像生成,结合概率模态融合,实现无训练的3D点云配准,解决了跨模态、采样差异和环境的泛化问题。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04588 2026-04-17 cs.CV 74%

3D Conditional Image Synthesis of Left Atrial LGE MRI from Composite Semantic Masks

基于复合语义掩码的左心房LGE MRI的3D条件图像合成

Yusri Al-Sanaani, Rebecca Thornhill, Sreeraman Rajan

机构 * Systems and Computer Engineering, Carleton University(卡尔顿大学系统与计算机工程系) Department of Radiology, University of Ottawa(渥太华大学放射科部)

专题命中 可控生成 :image synthesis(title);分类 cs.CV

AI总结 本文提出利用3D条件生成模型增强稀少LGE训练数据,提升左心房分割性能,SPADE-LDM生成最逼真图像,使Dice分数显著提升。

Comments This work has been published in the Proceedings of the 2025 IEEE International Conference on Imaging Systems and Techniques (IST). The final published version is available via IEEE Xplore

Journal ref 2025 IEEE International Conference on Imaging Systems and Techniques (IST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29634 2026-04-01 cs.CV cs.AI 74%

MacTok: Robust Continuous Tokenization for Image Generation

MacTok: 图像生成中的鲁棒连续分词

Hengyu Zeng, Xin Gao, Guanghao Li, Yuxiang Yan, Jiaoyang Ruan, Junpeng Ma, Haoyu Albert Wang, Jian Pu

机构 * Fudan University(复旦大学)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 MacTok通过引入图像掩码和表征对齐,防止后验崩溃,实现高效且高保真的连续分词,仅需64或128个token,在ImageNet上取得优异成绩。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19456 2026-03-23 cs.CV 74%

In-the-Wild Camouflage Attack on Vehicle Detectors through Controllable Image Editing

真实场景中通过可控图像编辑实施车辆检测器的伪装攻击

Xiao Fang, Yiming Gong, Stanislav Panev, Celso de Melo, Shuowen Hu, Shayok Chakraborty, Fernando De la Torre

机构 * Carnegie Mellon University(卡内基梅隆大学) DEVCOM Army Research Laboratory(陆军研究实验室) Florida State University(佛罗里达州立大学)

专题命中 可控生成 :image editing(title);分类 cs.CV

AI总结 本文提出了一种将车辆伪装攻击视为条件图像编辑问题的新框架,通过图像级和场景级生成策略提升攻击效果,实验表明其在COCO和LINZ数据集上显著降低检测器性能,同时保持车辆结构和提升人类感知的隐蔽性。

Comments 45 pages, 35 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18903 2026-02-24 cs.CV cs.HC 74%

SCHEMA for Gemini 3 Pro Image: A Structured Methodology for Controlled AI Image Generation on Google's Native Multimodal Model

Gemini 3 Pro图像的SCHEMA:为Google原生多模态模型的受控AI图像生成的结构化方法

Luca Cazzaniga

机构 * Independent Researcher(独立研究者)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 SCHEMA为Google Gemini 3 Pro图像提供结构化提示工程方法,通过三级系统提升AI图像生成的可控性,实现高合规率和跨领域应用。

Comments 24 pages, 8 tables. Based on SCHEMA Method v1.0 (deposited December 11, 2025). Previously published on Zenodo: doi:10.5281/zenodo.18721380

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09407 2026-02-17 cs.CV 74%

Geometry-to-Image Synthesis-Driven Generative Point Cloud Registration

基于几何到图像合成的生成式点云配准

Haobo Jiang, Jin Xie, Jian Yang, Liang Yu, Jianmin Zheng

机构 * ANGEL CorpLab and College of Computing and Data Science, Nanyang Technological University, Singapore(ANGEL CorpLab和计算与数据科学学院,南洋理工大学,新加坡) Alibaba Cloud, Alibaba Group, China(阿里巴巴云,阿里巴巴集团,中国) PCA Lab, VCIP, College of Computer Science, Nankai University, China(PCA实验室,VCIP,计算机科学学院,南开大学,中国) State Key Laboratory for Novel Software Technology & Schoolof Intelligence Science and Technology, Nanjing University, China(新型软件技术国家重点实验室与智能科学与技术学校,南京大学,中国)

专题命中 可控生成 :image synthesis(title);分类 cs.CV

AI总结 本文提出生成式点云配准方法,通过生成跨视角一致的图像对,结合几何与颜色特征融合,提升3D配准性能。

Comments Journal extension of the ICML 2025 paper "Generative Point Cloud Registration". This version adopts a new title, and includes substantial methodological improvements, additional experiments, and extended analysis. Under review at IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15698 2026-01-23 cs.CV cs.AI 74%

Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs

超越视觉安全:通过语义无关输入对多模态大语言模型进行有害图像生成的劫持

Mingyu Yu, Lana Liu, Zhehao Zhao, Wei Wang, Sujuan Qin

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) School of Cyberspace Security, Beijing University of Posts and Telecommunications(网络安全学院,北京邮电大学)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 本文提出BVS框架,通过语义无关输入对多模态大语言模型进行有害图像生成的劫持,揭示其视觉安全边界的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23320 2025-12-30 cs.MM 74%

Multi Agents Semantic Emotion Aligned Music to Image Generation with Music Derived Captions

多智能体语义情感对齐的音乐到图像生成与音乐衍生标题

Junchang Shi, Gang Li

专题命中 可控生成 :image generation(title);分类 cs.MM

AI总结 MESA MIG通过多智能体协作生成音乐到图像,实现语义和情感对齐,提升生成图像的审美质量和情感一致性。

Comments 10 pages,3 figures.Under review for ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00345 2025-11-04 cs.CV cs.LG 74%

OSMGen: Highly Controllable Satellite Image Synthesis using OpenStreetMap Data

Amir Ziashahabi, Narges Ghasemi, Sajjad Shahabi, John Krumm, Salman Avestimehr, Cyrus Shahabi

机构 * University of Southern California(南加州大学)

专题命中 可控生成 :image synthesis(title);分类 cs.CV

Comments Accepted at NeurIPS 2025 UrbanAI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08441 2025-10-28 cs.CV cs.AI 74%

Vision Foundation Models as Effective Visual Tokenizers for Autoregressive Image Generation

Anlin Zheng, Xin Wen, Xuanyang Zhang, Chuofan Ma, Tiancai Wang, Gang Yu, Xiangyu Zhang, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) StepFun Dexmal MEGVII Technology(MEGVII科技)

专题命中 可控生成 :image generation(title);分类 cs.CV

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15778 2025-10-20 cs.CV cs.AI 74%

Controlling the image generation process with parametric activation functions

Ilia Pavlov

机构 * Creative Computing Institute, University of the Arts London(创意计算研究所,伦敦艺术大学)

专题命中 可控生成 :image generation(title);分类 cs.CV

Comments 5 pages, 5 figures, accepted for the 16th International Conference on Computational Creativity, ICCC'25

详情

展开后加载摘要…

URL PDF HTML 收藏