arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4210 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4210 篇

2012.12109 2021-06-10 cs.CV cs.LG 70%

Enhance Convolutional Neural Networks with Noise Incentive Block

Menghan Xia, Yi Wang, Chu Han, Tien-Tsin Wong

专题命中 可控生成 :image generation(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.10026 2021-05-24 cs.CL cs.AI cs.CV 70%

Improving Generation and Evaluation of Visual Stories via Semantic Consistency

Adyasha Maharana, Darryl Hannan, Mohit Bansal

专题命中 可控生成 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments NAACL 2021 (16 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.16019 2021-03-31 cs.CV 70%

Identity-Aware CycleGAN for Face Photo-Sketch Synthesis and Recognition

Yuke Fang, Jiani Hu, Weihong Deng

专题命中 可控生成 :image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments 36 pages, 11 figures

Journal ref Pattern Recognition, vol.102, pp.107249, 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.06902 2021-03-15 cs.CV 70%

HumanGAN: A Generative Model of Humans Images

Kripasindhu Sarkar, Lingjie Liu, Vladislav Golyanik, Christian Theobalt

专题命中 可控生成 :image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted at CVPR21

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.08128 2020-10-19 cs.CV cs.AI 70%

Semantic Editing On Segmentation Map Via Multi-Expansion Loss

Jianfeng He, Xuchao Zhang, Shuo Lei, Shuhui Wang, Qingming Huang, Chang-Tien Lu, Bei Xiao

专题命中 可控生成 :image generation(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.09106 2020-10-05 cs.CV cs.LG eess.IV 70%

Generative View Synthesis: From Single-view Semantics to Novel-view Images

Tewodros Habtegebrial, Varun Jampani, Orazio Gallo, Didier Stricker

专题命中 可控生成 :image editing(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted at Neurips-2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.10132 2020-07-24 cs.CV cs.LG stat.ML 70%

Interpreting the Latent Space of GANs via Correlation Analysis for Controllable Concept Manipulation

Ziqiang Li, Rentuo Tao, Hongjing Niu, Bin Li

专题命中 可控生成 :image generation(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.04082 2018-07-25 cs.CV 70%

Ranking CGANs: Subjective Control over Semantic Image Attributes

Yassir Saquil, Kwang In Kim, Peter Hall

专题命中 可控生成 :image generation(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.00421 2017-10-03 cs.MM 70%

Video Generation From Text

Yitong Li, Martin Renqiang Min, Dinghan Shen, David Carlson, Lawrence Carin

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05478 2026-08-07 cs.GR cs.CL cs.CV cs.HC cs.LG cs.MM 新提交 67%

GenGA: Editable and Data-Grounded Graphical Abstract Generation for Academic Papers

GenGA:面向学术论文的可编辑且基于数据的图形摘要生成

Takuro Kawada, Shunsuke Kitada, Hitoshi Iyatomi

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 GenGA是一种直接生成矢量格式图形摘要的框架,可实现便捷的元素级编辑,其编辑简易性优于传统方法,且在简洁性和语义对齐上超过人工生成的图形摘要,还提出了量化编辑简易性的SIC指标。

Comments 20 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17916 2026-07-21 cs.GR cs.CV cs.MM 新提交 67%

Packet-Loss Robust 3D Gaussian Compression via Atomic Packaging and GNN-based Error Concealment

通过原子封装和基于GNN的错误隐藏实现抗丢包的3D高斯压缩

Yuxuan Tao, Xuerui Ma, Hao Zhang, Chunhua Peng

机构 * Central South University Changsha China Malanshan Audio \& Video Laboratory Changsha China Central South University Malanshan Audio \& Video Laboratory

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 研究3D高斯压缩在网络流传输中丢包问题,提出通过原子封装、分层随机分组及基于GNN的错误隐藏框架,改进丢包时的渲染效果,相比无隐藏传输有显著提升,平均PSNR退化限制在约3dB。

Comments 21 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13041 2026-06-12 cs.CV cs.GR cs.MM 新提交 67%

SeamEdit: A Black-Box VLM-Agnostic Pipeline for Large-Image Semantic Editing

SeamEdit: 一种用于大图像语义编辑的黑盒VLM无关流水线

Xiangyu Lyu, Dan Lei

机构 * Technische Universität Darmstadt(达姆施塔特工业大学) Fine-Arts Educator, Yuncheng Middle School(运城中学美术教师)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 提出SeamEdit,一种无需训练、模型无关的流水线,通过五阶段后处理解决大图像分块编辑中的语义变形、对齐漂移和接缝伪影问题,实现高质量语义编辑。

Comments 19 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09024 2026-05-12 cs.CV cs.GR cs.MM eess.IV 67%

Relightable Gaussian Splatting for Virtual Production Using Image-Based Illumination

可重照明高斯点散布用于虚拟制作的基于图像的照明

Adrian Azzarelli, Nantheera Anantrasirichai, James Pollock, David R. Bull

机构 * University of Bristol, UK(英国布里斯托大学) Lux Aeterna, Bristol, UK(卢克斯艾特纳,布里斯托,英国)

专题命中 可控生成 :image editing(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 本文提出一种针对虚拟制作的3D重建与重照明框架,利用高斯点散布技术,通过已知背景图像条件重照明过程,避免使用环境映射,提高3D重建质量和可控性,方法高效且支持多种输出变量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16472 2026-05-08 cs.CR eess.SP 67%

Secure Intellicise Wireless Network: Agentic AI for Coverless Semantic Steganography Communication

安全智能无线网络:面向无载体语义隐写通信的智能体AI

Rui Meng, Song Gao, Bingxuan Xu, Xiaodong Xu, Jianqiao Chen, Nan Ma, Pei Xiao, Ping Zhang, Rahim Tafazolli

专题命中 可控生成 :image generation(abstract);diffusion(abstract)

AI总结 本文提出基于智能体AI的无载体语义隐写通信方案,通过消除载体图像和私有语义密钥的需求,提升隐写容量与传输安全。

Comments 16 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10720 2026-04-03 cs.LG 67%

Beyond the Black Box: Identifiable Interpretation and Control in Generative Models via Causal Minimality

超越黑箱:通过因果最小性在生成模型中实现可识别的解释与控制

Lingjing Kong, Shaoan Xie, Guangyi Chen, Yuewen Sun, Xiangchen Song, Eric P. Xing, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract)

AI总结 本文通过因果最小性原则,在生成模型中建立可解释性基础,提出层级选择模型框架,实现对生成模型的可控性与解释性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25441 2026-03-27 eess.IV 67%

Language-Free Generative Editing from One Visual Example

无需语言的生成编辑:一个视觉示例

Omar Elezabi, Eduard Zamfir, Zongwei Wu, Radu Timofte

专题命中 可控生成 :diffusion(abstract);image editing(abstract)

AI总结 本文提出无需语言指导的视觉编辑方法VDC,通过直接从视觉示例学习条件信号,实现高精度图像编辑,优于现有无训练和全微调方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18356 2026-03-20 cs.AI 67%

LGESynthNet: Controlled Scar Synthesis for Improved Scar Segmentation in Cardiac LGE-MRI Imaging

LGESynthNet:用于改进心脏LGE-MRI成像瘢痕分割的受控瘢痕合成

Athira J. Jacob, Puneet Sharma, Daniel Rueckert

机构 * Digital Technology and Innovation, Siemens Healthineers(西门子医疗数字化技术与创新部) Al in Healthcare and Medicine, Klinikum rechts der Isar, Technical University of Munich(医疗与医学AI,慕尼黑工业大学右侧医院) Department of Computing, Imperial College London(伦敦帝国理工学院计算机系)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract)

AI总结 本文提出LGESynthNet,一种基于潜在扩散模型的可控合成框架,通过奖励模型、提示模块和生物医学文本编码器,利用少量标注数据生成高质量瘢痕图像,提升后续分割和检测性能。

Comments Accepted at MICCAI STACOM workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00782 2026-03-17 cs.GR cs.AI cs.CV cs.MM cs.SD eess.AS 67%

SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation

SpA2V: 利用空间听觉线索进行音频驱动的空间感知视频生成

Kien T. Pham, Yingqing He, Yazhou Xing, Qifeng Chen, Long Chen

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 SpA2V通过利用空间听觉线索生成与输入音频在语义和空间上一致的视频,改进了现有方法对语义信息的依赖,提出两阶段框架实现视频场景布局生成与生成。

Comments The 33rd ACM Multimedia Conference (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13233 2026-03-17 cs.HC cs.AI 67%

From Prompts to Worlds: How Users Iterate, Explore, and Make Sense of AI-Generated 3D Environments

从提示到世界:用户如何迭代、探索和理解AI生成的3D环境

Aung Pyae

专题命中 可控生成 :image generation(abstract);text-to-image(abstract)

AI总结 研究探讨用户如何通过迭代和探索理解AI生成的3D环境,发现语言到空间表达的不对称性、沉浸感的间歇性以及结构迭代中的障碍,强调需要混合输入方式和透明反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11161 2026-03-10 cs.CV cs.GR cs.MM 67%

altiro3D: Scene representation from single image and novel view synthesis

altiro3D: 从单张图像和新视角合成生成场景表示

E. Canessa, L. Tenze

机构 * The Abdus Salam International Centre for Theoretical Physics, ICTP, Trieste 34151, Italy(阿布杜斯·萨拉姆国际理论物理学中心,ICTP,特里埃斯特)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 altiro3D通过单张图像生成多视角和视频,结合深度估计与快速算法实现逼真3D体验。

Comments In press (2023) Springer International Journal of Information Technology (IJIT) 10 pages, 3 figures

Journal ref International Journal of Information Technology 16 (2024) 33

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17690 2026-02-24 cs.GR cs.AI cs.CV cs.LG cs.MM 67%

DesignAsCode: Bridging Structural Editability and Visual Fidelity in Graphic Design Generation

DesignAsCode:在图形设计生成中弥合结构可编辑性与视觉保真度

Ziyuan Liu, Shizhao Sun, Danqing Huang, Yingdong Shi, Meisheng Zhang, Ji Li, Jingsong Yu, Jiang Bian

机构 * School of Software and Microelectronics, Peking University, Beijing, China(软件与微电子学院,北京大学,北京,中国) Microsoft(微软公司) ShanghaiTech University, Shanghai, China(上海交通大学,上海,中国)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 DesignAsCode 通过 HTML/CSS 程序化合成方法,实现了图形设计生成中结构可编辑性与视觉保真度的平衡,提升了设计质量和生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08531 2026-01-14 cs.AI 67%

Sketch-Based Facade Renovation With Generative AI: A Streamlined Framework for Bypassing As-Built Modelling in Industrial Adaptive Reuse

基于草图的立面修复与生成式AI:一种简化框架,用于在工业适应性再利用中绕过实际建成建模

Warissara Booranamaitree, Xusheng Du, Yushu Cai, Zhengyang Wang, Ye Zhang, Haoran Xie

专题命中 可控生成 :diffusion(abstract);inpainting(abstract)

AI总结 本文提出了一种结合生成式AI和视觉-语言模型的三阶段框架,通过处理粗糙草图和文本描述,快速生成保留原结构且提高细节质量的立面修复提案,从而绕过传统详细建模流程。

Comments 10 pages, 9 figures, Proceedings of CAADRIA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05637 2026-01-12 cs.AI cs.LG cs.SY eess.SY 67%

GenCtrl -- A Formal Controllability Toolkit for Generative Models

GenCtrl -- 生成模型的正式可控性工具包

Emily Cheng, Carmen Amo Alonso, Federico Danieli, Arno Blaas, Luca Zappella, Pau Rodriguez, Xavier Suau

机构 * Apple(苹果公司) Universitat Pompeu Fabra(庞培法布拉大学) Stanford(斯坦福大学)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract)

AI总结 GenCtrl 提出了一种理论框架,用于评估生成模型的可控性,并通过实验展示了可控性在不同任务中的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18053 2025-10-22 cs.LG cs.AI 67%

Adaptive Divergence Regularized Policy Optimization for Fine-tuning Generative Models

Jiajun Fan, Tong Wei, Chaoran Cheng, Yuxin Chen, Ge Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract)

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09657 2025-10-14 cs.LG cs.AI cs.NA eess.SP math.NA 67%

Generative Models for Helmholtz Equation Solutions: A Dataset of Acoustic Materials

Riccardo Fosco Gramaccioni, Christian Marinoni, Fabrizio Frezza, Aurelio Uncini, Danilo Comminiello

机构 * 1Department of Information Engineering, Electronics Telecommunications (DIET),\ University of Rome, Rome. Italy, \ riccardofosco.gramaccioni

专题命中 可控生成 :image generation(abstract);diffusion(abstract)

Comments Accepted at EUSIPCO 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21928 2025-09-29 cs.RO cs.AI 67%

SAGE: Scene Graph-Aware Guidance and Execution for Long-Horizon Manipulation Tasks

Jialiang Li, Wenzheng Wu, Gaojing Zhang, Yifan Han, Wenzhao Lian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ShanghaiTech University(上海科技大学) University of Sussex(Sussex大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 可控生成 :image editing(abstract);inpainting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11096 2025-07-16 cs.SD cs.AI eess.AS 67%

EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing

Vassilis Sioros, Alexandros Potamianos, Giorgos Paraskevopoulos

机构 * Department of Informatics and Telecommunications, UoA NCSR "Demokritos"(信息与电信系,雅典国家科研中心"Demokritos") School of Electrical and Computer Engineering, NTUA(电气与计算机工程学院,国家技术研究院)

专题命中 可控生成 :diffusion(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04621 2025-07-08 cs.LG cs.AI cs.NI 67%

Multimodal LLM Integrated Semantic Communications for 6G Immersive Experiences

Yusong Zhang, Yuxuan Sun, Lei Guo, Wei Chen, Bo Ai, Deniz Gunduz

机构 * School of Electronic and Information Engineering, Beijing Jiaotong University(电子信息工程学院,北京交通大学) School of Electrical and Electronic Engineering, Imperial College London(电子电气工程学院,帝国理工学院伦敦分校)

专题命中 可控生成 :image generation(abstract);diffusion(abstract)

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18729 2025-06-25 cs.SD cs.AI eess.AS 67%

MuseControlLite: Multifunctional Music Generation with Lightweight Conditioners

Fang-Duo Tsai, Shih-Lun Wu, Weijaw Lee, Sheng-Ping Yang, Bo-Rui Chen, Hao-Chung Cheng, Yi-Hsuan Yang

机构 * National Taiwan University(国立台湾大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract)

Comments Accepted by the 42nd International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01672 2025-06-03 cs.LG 67%

Minimal Impact ControlNet: Advancing Multi-ControlNet Integration

Shikun Sun, Min Zhou, Zixuan Wang, Xubin Li, Tiezheng Ge, Zijie Ye, Xiaoyu Qin, Junliang Xing, Bo Zheng, Jia Jia

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) BNRist, Tsinghua University(清华大学BNRist) Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室)

专题命中 可控生成 :image generation(abstract);diffusion(abstract)

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏