Adjusting Image Attributes of Localized Regions with Low-level Dialogue
专题命中 图像编辑 :image editing(abstract)
Comments Accepted as a Poster presentation at the 12th International Conference on Language Resources and Evaluation (LREC 2020)
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 图像编辑 :image editing(abstract)
Comments Accepted as a Poster presentation at the 12th International Conference on Language Resources and Evaluation (LREC 2020)
专题命中 图像编辑 :image editing(abstract)
Comments Project page: http://knitskel.csail.mit.edu
专题命中 图像编辑 :image generation(abstract)
Comments Accepted to ICASSP 2018
专题命中 图像编辑 :diffusion(abstract)
Nemotron-Labs-Diffusion-Image:推进掩码离散扩散用于高分辨率图像合成
机构 * NVIDIA
专题命中 扩散模型 :diffusion(title,title_cn);image synthesis(title,abstract);image generation(abstract);text-to-image(abstract)
AI总结 提出Nemotron-Labs-Diffusion-Image模型,通过令牌编辑机制和分组交叉熵目标解决掩码离散扩散模型的自校正缺失和训练信号稀疏问题,实现高分辨率文本到图像合成。
Comments 23 pages, 12 figures
Bokeh Diffusion:文本到图像扩散模型中的散焦模糊控制
机构 * S-Lab, Nanyang Technological University(S实验室,南洋理工大学)
专题命中 扩散模型 :diffusion(title,title_cn);text-to-image(title,abstract);image editing(abstract);分类 cs.CV、cs.GR
AI总结 提出Bokeh Diffusion框架,通过物理散焦模糊参数条件化扩散模型,结合混合训练流程和接地自注意力机制,实现场景一致的散景模糊控制,支持双向模糊强度调整和真实图像编辑。
Comments SIGGRAPH Asia 2025. Project page: https://atfortes.github.io/projects/bokeh-diffusion/
EmCom-Diffusion:通过图像生成探究新兴语言中的视觉反射
机构 * Graduate School of Informatics, Kyoto University, Kyoto, Japan(京都大学信息学研究科) ; Research Organization of Science and Technology, Ritsumeikan University, Shiga, Japan(立命馆大学科学技术研究机构)
专题命中 扩散模型 :diffusion(title,title_cn);image generation(title);text-to-image(abstract);分类 cs.CV
AI总结 研究新兴语言编码输入视觉内容程度的问题,提出EmCom-Diffusion框架,直接测量视觉反射,通过微调文本到图像扩散模型,以重建图像与原图的感知相似性评分,验证其优于现有指标。
专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title);image generation(abstract)
专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV
Comments Accepted by CVPR 2023. Code at https://github.com/drboog/Shifted_Diffusion
TrioPose: 用于姿态引导文本到图像生成的原生三流扩散变换器
机构 * Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
AI总结 提出TrioPose,基于SD3.5M架构的原生三流姿态感知DiT,通过逐层激活和零初始化双残差注入保持预训练稳定性,并设计可学习关系偏置掩码和姿态引导空间损失加权,在多人姿态引导生成中实现SOTA性能,Human-Art上AP达64.33。
Comments 15 pages (9 pages main body, 6 pages references and appendix), 3 figures, 5 tables
机构 * Sun Yat-sen University(中山大学) ; ByteDance Intelligent Creation(字节跳动智能创作) ; ByteDance Seed Vision(字节跳动种子视觉) ; Guangdong Province Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) ; Pazhou Lab (Huangpu)(琶洲实验室(黄埔))
专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
Comments Accepted by ICCV 2025
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
机构 * Department of Applied Mathematics and Computer Science(应用数学与计算机科学系)
专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
Comments The project is available at \url{https://medart-ai.github.io}
专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(title);personalized generation(abstract)
Comments Accepted by SIGGRAPH 2024
专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
Comments ICLR 2024
专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
Comments Project Page: https://pixart-alpha.github.io/PixArt-sigma-project/
专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);text-to-image(title,abstract)
Comments Taiyi-Diffusion-XL Tech Report
扩散模型与流匹配的对齐方法用于文本到图像生成
机构 * Department of Statistics, University of California, Los Angeles(加州大学洛杉矶分校统计学系) ; Department of Industrial and Systems Engineering, University of Minneasota(明尼苏达大学工业与系统工程系) ; School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)
专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract)
AI总结 本文提出了一种无需微调的对齐框架,通过分数指导和速度指导分别优化扩散模型和流匹配模型,显著降低计算成本并提升生成质量。
异步补丁扩散:空间灵活的图像生成
机构 * Google DeepMind(谷歌DeepMind) ; University of Amsterdam(阿姆斯特丹大学) ; The Netherlands Cancer Institute(荷兰癌症研究所)
专题命中 扩散模型 :diffusion(title,summary_cn);image generation(title);inpainting(abstract);分类 cs.CV
AI总结 提出AsyncPatch Diffusion框架,通过为不同空间区域分配不同噪声水平实现异质去噪轨迹,在保持生成质量的同时原生支持图像修复和自适应生成。
Comments 36 pages, 14 figures
纪律性扩散:对抗生成不适宜内容的文本到图像扩散模型
机构 * Bellini College of Artificial Intelligence, Cybersecurity(人工智能与网络安全学院) ; Department of Electrical and Computer Engineering, College of Engineering(电气与计算机工程系) ; University of South Florida(佛罗里达州立大学)
专题命中 扩散模型 :diffusion(title,summary_cn);text-to-image(title,abstract);分类 cs.CV
AI总结 本文提出Disciplined Diffusion,通过语义检索和局部编辑技术,有效识别并抑制生成图像中的恶意内容,提升文本到图像扩散模型的安全性与生成质量。
专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);image generation(abstract);image editing(abstract)
机构 * Apple(苹果公司)
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);image editing(abstract)
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);image editing(abstract)
专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);image generation(abstract);text-to-image(abstract)
专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);image editing(abstract)
Comments NeurIPS 2023
专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);text-to-image(abstract);inpainting(abstract)
Comments 10 pages, 12 figures
Delta-Diffusion: 通过条件泊松扩散桥建模纵向脑淀粉样蛋白-PET轨迹
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 扩散模型 :diffusion(title,title_cn);image synthesis(abstract);分类 cs.CV
AI总结 提出Delta-Diffusion框架,将纵向PET合成建模为条件泊松扩散桥过程,结合扩散Transformer和物理启发的泊松扰动,在542名受试者上优于现有方法,准确捕捉淀粉样蛋白沉积的纵向变化。
超越成对偏好:扩散模型的列表级奖励感知对齐
机构 * Caltech(加州理工学院) ; Stanford University(斯坦福大学)
专题命中 扩散模型 :diffusion(title,summary_cn);image generation(abstract);text-to-image(abstract);image editing(abstract)
AI总结 提出Diffusion LAIR方法,通过列表级奖励感知优化,利用连续奖励分数和所有候选图像同时优化扩散模型,在文本到图像生成等任务上超越成对偏好基线。