Enhance Convolutional Neural Networks with Noise Incentive Block
专题命中 可控生成 :image generation(abstract);image synthesis(abstract);分类 cs.CV
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 可控生成 :image generation(abstract);image synthesis(abstract);分类 cs.CV
专题命中 可控生成 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV
Comments NAACL 2021 (16 pages)
专题命中 可控生成 :image generation(abstract);image synthesis(abstract);分类 cs.CV
Comments 36 pages, 11 figures
Journal ref Pattern Recognition, vol.102, pp.107249, 2020
专题命中 可控生成 :image generation(abstract);image synthesis(abstract);分类 cs.CV
Comments Accepted at CVPR21
专题命中 可控生成 :image generation(abstract);inpainting(abstract);分类 cs.CV
专题命中 可控生成 :image editing(abstract);image synthesis(abstract);分类 cs.CV
Comments Accepted at Neurips-2020
专题命中 可控生成 :image generation(abstract);inpainting(abstract);分类 cs.CV
专题命中 可控生成 :image generation(abstract);image editing(abstract);分类 cs.CV
专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.MM
GenGA:面向学术论文的可编辑且基于数据的图形摘要生成
专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR、cs.MM
AI总结 GenGA是一种直接生成矢量格式图形摘要的框架,可实现便捷的元素级编辑,其编辑简易性优于传统方法,且在简洁性和语义对齐上超过人工生成的图形摘要,还提出了量化编辑简易性的SIC指标。
Comments 20 pages, 11 figures, 4 tables
通过原子封装和基于GNN的错误隐藏实现抗丢包的3D高斯压缩
机构 * Central South University Changsha China ; Malanshan Audio \& Video Laboratory Changsha China ; Central South University ; Malanshan Audio \& Video Laboratory
专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR、cs.MM
AI总结 研究3D高斯压缩在网络流传输中丢包问题,提出通过原子封装、分层随机分组及基于GNN的错误隐藏框架,改进丢包时的渲染效果,相比无隐藏传输有显著提升,平均PSNR退化限制在约3dB。
Comments 21 pages, 3 figures, 3 tables
SeamEdit: 一种用于大图像语义编辑的黑盒VLM无关流水线
机构 * Technische Universität Darmstadt(达姆施塔特工业大学) ; Fine-Arts Educator, Yuncheng Middle School(运城中学美术教师)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR、cs.MM
AI总结 提出SeamEdit,一种无需训练、模型无关的流水线,通过五阶段后处理解决大图像分块编辑中的语义变形、对齐漂移和接缝伪影问题,实现高质量语义编辑。
Comments 19 pages, 9 figures, 2 tables
可重照明高斯点散布用于虚拟制作的基于图像的照明
机构 * University of Bristol, UK(英国布里斯托大学) ; Lux Aeterna, Bristol, UK(卢克斯艾特纳,布里斯托,英国)
专题命中 可控生成 :image editing(abstract);分类 cs.CV、cs.GR、cs.MM
AI总结 本文提出一种针对虚拟制作的3D重建与重照明框架,利用高斯点散布技术,通过已知背景图像条件重照明过程,避免使用环境映射,提高3D重建质量和可控性,方法高效且支持多种输出变量。
安全智能无线网络:面向无载体语义隐写通信的智能体AI
专题命中 可控生成 :image generation(abstract);diffusion(abstract)
AI总结 本文提出基于智能体AI的无载体语义隐写通信方案,通过消除载体图像和私有语义密钥的需求,提升隐写容量与传输安全。
Comments 16 pages, 14 figures
超越黑箱:通过因果最小性在生成模型中实现可识别的解释与控制
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract)
AI总结 本文通过因果最小性原则,在生成模型中建立可解释性基础,提出层级选择模型框架,实现对生成模型的可控性与解释性提升。
无需语言的生成编辑:一个视觉示例
专题命中 可控生成 :diffusion(abstract);image editing(abstract)
AI总结 本文提出无需语言指导的视觉编辑方法VDC,通过直接从视觉示例学习条件信号,实现高精度图像编辑,优于现有无训练和全微调方法。
Comments Accepted at CVPR 2026
LGESynthNet:用于改进心脏LGE-MRI成像瘢痕分割的受控瘢痕合成
机构 * Digital Technology and Innovation, Siemens Healthineers(西门子医疗数字化技术与创新部) ; Al in Healthcare and Medicine, Klinikum rechts der Isar, Technical University of Munich(医疗与医学AI,慕尼黑工业大学右侧医院) ; Department of Computing, Imperial College London(伦敦帝国理工学院计算机系)
专题命中 可控生成 :diffusion(abstract);inpainting(abstract)
AI总结 本文提出LGESynthNet,一种基于潜在扩散模型的可控合成框架,通过奖励模型、提示模块和生物医学文本编码器,利用少量标注数据生成高质量瘢痕图像,提升后续分割和检测性能。
Comments Accepted at MICCAI STACOM workshop 2025
SpA2V: 利用空间听觉线索进行音频驱动的空间感知视频生成
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM
AI总结 SpA2V通过利用空间听觉线索生成与输入音频在语义和空间上一致的视频,改进了现有方法对语义信息的依赖,提出两阶段框架实现视频场景布局生成与生成。
Comments The 33rd ACM Multimedia Conference (MM '25)
从提示到世界:用户如何迭代、探索和理解AI生成的3D环境
专题命中 可控生成 :image generation(abstract);text-to-image(abstract)
AI总结 研究探讨用户如何通过迭代和探索理解AI生成的3D环境,发现语言到空间表达的不对称性、沉浸感的间歇性以及结构迭代中的障碍,强调需要混合输入方式和透明反馈。
altiro3D: 从单张图像和新视角合成生成场景表示
机构 * The Abdus Salam International Centre for Theoretical Physics, ICTP, Trieste 34151, Italy(阿布杜斯·萨拉姆国际理论物理学中心,ICTP,特里埃斯特)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR、cs.MM
AI总结 altiro3D通过单张图像生成多视角和视频,结合深度估计与快速算法实现逼真3D体验。
Comments In press (2023) Springer International Journal of Information Technology (IJIT) 10 pages, 3 figures
Journal ref International Journal of Information Technology 16 (2024) 33
DesignAsCode:在图形设计生成中弥合结构可编辑性与视觉保真度
机构 * School of Software and Microelectronics, Peking University, Beijing, China(软件与微电子学院,北京大学,北京,中国) ; Microsoft(微软公司) ; ShanghaiTech University, Shanghai, China(上海交通大学,上海,中国)
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV、cs.GR、cs.MM
AI总结 DesignAsCode 通过 HTML/CSS 程序化合成方法,实现了图形设计生成中结构可编辑性与视觉保真度的平衡,提升了设计质量和生成能力。
基于草图的立面修复与生成式AI:一种简化框架,用于在工业适应性再利用中绕过实际建成建模
专题命中 可控生成 :diffusion(abstract);inpainting(abstract)
AI总结 本文提出了一种结合生成式AI和视觉-语言模型的三阶段框架,通过处理粗糙草图和文本描述,快速生成保留原结构且提高细节质量的立面修复提案,从而绕过传统详细建模流程。
Comments 10 pages, 9 figures, Proceedings of CAADRIA 2026
GenCtrl -- 生成模型的正式可控性工具包
机构 * Apple(苹果公司) ; Universitat Pompeu Fabra(庞培法布拉大学) ; Stanford(斯坦福大学)
专题命中 可控生成 :image generation(abstract);text-to-image(abstract)
AI总结 GenCtrl 提出了一种理论框架,用于评估生成模型的可控性,并通过实验展示了可控性在不同任务中的脆弱性。
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 可控生成 :image generation(abstract);text-to-image(abstract)
Comments 30 pages
机构 * 1Department of Information Engineering, Electronics ; Telecommunications (DIET),\ University of Rome, Rome. Italy, \ riccardofosco.gramaccioni
专题命中 可控生成 :image generation(abstract);diffusion(abstract)
Comments Accepted at EUSIPCO 2025
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; ShanghaiTech University(上海科技大学) ; University of Sussex(Sussex大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 可控生成 :image editing(abstract);inpainting(abstract)
机构 * Department of Informatics and Telecommunications, UoA NCSR "Demokritos"(信息与电信系,雅典国家科研中心"Demokritos") ; School of Electrical and Computer Engineering, NTUA(电气与计算机工程学院,国家技术研究院)
专题命中 可控生成 :diffusion(abstract);image editing(abstract)
机构 * School of Electronic and Information Engineering, Beijing Jiaotong University(电子信息工程学院,北京交通大学) ; School of Electrical and Electronic Engineering, Imperial College London(电子电气工程学院,帝国理工学院伦敦分校)
专题命中 可控生成 :image generation(abstract);diffusion(abstract)
Comments This work has been submitted to the IEEE for possible publication
机构 * National Taiwan University(国立台湾大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 可控生成 :diffusion(abstract);inpainting(abstract)
Comments Accepted by the 42nd International Conference on Machine Learning (ICML 2025)
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) ; BNRist, Tsinghua University(清华大学BNRist) ; Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室)
专题命中 可控生成 :image generation(abstract);diffusion(abstract)
Comments ICLR 2025