SemanticAdv: Generating Adversarial Examples via Attribute-conditional Image Editing
专题命中 图像编辑 :image editing(title);分类 cs.CV
Comments To appear at ECCV 2020
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 图像编辑 :image editing(title);分类 cs.CV
Comments To appear at ECCV 2020
专题命中 图像编辑 :image editing(title);分类 cs.CV
Comments 17 pages, single column scientific paper. Patent submitted
专题命中 图像编辑 :image synthesis(title);分类 cs.CV
Comments 6 pages, 4 figures, accepted to the 24th International Conference on Methods and Models in Automation and Robotics (MMAR 2019)
专题命中 图像编辑 :image editing(title);分类 cs.CV
Comments Accepted paper at NIPS 2016 Workshop on Adversarial Training
FreeOrbit4D: 通过前景完整4D重建实现免训练的任意相机重定向
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Pennsylvania(宾夕法尼亚大学) ; Eyeline Labs(Eyeline实验室)
专题命中 图像编辑 :diffusion(abstract,abstract_cn);分类 cs.CV、cs.GR
AI总结 本文提出FreeOrbit4D,一种无需训练的框架,通过恢复完整的前景4D代理来解决大角度重定向中的几何模糊问题,从而生成更真实且时间一致的视频。
Comments 12 pages, 10 figures. Accepted to SIGGRAPH Conference Papers 2026
多模态标记文档模型用于图形设计完成
机构 * Waseda University(早稻田大学)
专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV、cs.MM
AI总结 MarkupDM是一种多模态标记文档模型,通过统一处理图形设计任务,实现文本、图像和属性值的完成,展示了其在设计自动化中的广泛适用性。
Comments Accepted by ACM Multimedia 2025, Project page: https://cyberagentailab.github.io/MarkupDM/
Journal ref Proceedings of the 33rd ACM International Conference on Multimedia. 2025. p.11022-11031
机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) ; University of Pisa(比萨大学) ; University of Trento(特伦托大学) ; IIT-CNR
专题命中 图像编辑 :image editing(abstract);inpainting(abstract);分类 cs.CV、cs.MM
机构 * Max-Planck-Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校园) ; Adobe Research(Adobe研究)
专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV、cs.GR
Comments SIGGRAPH 2025 Journal track
专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV、cs.GR
Comments accepted to ECCV 2024
专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV、cs.GR
Comments project page at: https://garibida.github.io/ReNoise-Inversion/
专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV、cs.GR
Comments Project page: https://github.com/xiaorongjun000/Self-Rectification
专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV、cs.MM
Comments 10 pages, 5 figures, 5 tables, Neurips Proceedings
专题命中 图像编辑 :image editing(abstract);inpainting(abstract);分类 cs.CV、cs.MM
专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV、cs.GR
Comments 13 pages, Toby Chong Long Hin and I-Chao Shen contributed equally to the paper
专题命中 图像编辑 :image editing(abstract);inpainting(abstract);分类 cs.CV、cs.GR
Comments CVPR 2020 " For the video, visit https://youtu.be/yd5WczbFt68 "
专题命中 图像编辑 :image editing(title)
面向卫星图像篡改与深度伪造定位的基准数据集
机构 * Oak Ridge National Laboratory(橡树岭国家实验室)
专题命中 图像编辑 :diffusion(abstract);inpainting(abstract);分类 cs.CV
AI总结 针对遥感领域缺乏合适卫星图像篡改定位基准数据集的问题,构建含60张图像的原型数据集,支持像素级定位等分析,以推动相关研究。
Comments Accepted at IEEE IGARSS 2026
弥合微-宏观差距:面向图像操纵本地化的频率感知语义对齐
机构 * School of Computer Science ; Engineering, Sun Yat-sen University Guangzhou China ; Engineering, Sun Yat-sen University
专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 本文提出FASA框架,通过自适应双频带DCT模块提取操纵敏感频率特征,结合冻结CLIP表示的补丁级对比对齐学习语义先验,实现传统和扩散生成操纵的精准本地化。
MusicWeaver: 作曲家风格的结构编辑与分钟级连贯音乐生成
机构 * The University of Sydney(悉尼大学)
专题命中 图像编辑 :diffusion(abstract);inpainting(abstract);分类 cs.MM
AI总结 MusicWeaver通过结构化计划和全局-局部扩散变换器实现作曲家风格的音乐生成与编辑,具备分钟级连贯性和高保真度。
Comments 15 pages, 3 figures
STBridge:用于在统一多模态模型中弥合理解与生成的共享目标对齐
专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV
AI总结 研究统一多模态模型中理解与生成的对齐差距,提出STBridge共享目标对齐框架,通过共同目标状态连接二者,采用对齐然后优化策略,经实验验证该框架能缩小模型描述与生成间差距,有效弥合理解与生成。
Boogu-Image-0.1:提升开源统一多模态理解与生成能力
专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 介绍开源统一多模态模型Boogu-Image-0.1,通过改进模型理解、数据质量和训练管道等,结合智能推理扩展,提升生成和编辑性能,在标准基准测试中表现出色,成本低,还分享实践讨论并开源代码等推动相关生态发展。
让 RGB 成为视觉的语言
机构 * Johns Hopkins University(约翰·霍普金斯大学) ; UC Santa Cruz(加州大学圣克鲁兹分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Rice University(莱斯大学)
专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV
AI总结 该研究为视觉模型引入统一表述 RGB In and RGB Out(RINO),将多种视觉信息转为 RGB 图像编辑问题,共享架构参数,基于通用主干无需微调,在多视觉任务上有强大零样本性能,为统一视觉语言系统提供见解。
生成树自回归视觉生成
机构 * Yonsei University(延世大学) ; Korea Institute of Science and Technology(韩国科学技术院) ; LG AI Research(LG人工智能研究) ; University of Michigan(密歇根大学) ; Seoul National University(首尔国立大学)
专题命中 图像编辑 :image editing(abstract);inpainting(abstract);分类 cs.CV
AI总结 提出生成树自回归(STAR)建模,通过均匀生成树的遍历顺序在保持采样性能的同时提供灵活序列顺序,支持图像编辑。
Comments Published as a main conference paper at ECCV 2026
MindAU: 基于双流流形对齐的脑电条件面部动作单元编辑
机构 * Binghamton University(宾汉姆顿大学) ; Massachusetts General Hospital(马萨诸塞综合医院) ; Harvard Medical School(哈佛医学院)
专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 提出MindAU框架,通过双流流形对齐将EEG特征与AU文本语义和视觉位移对齐,实现高保真身份保持的面部动作单元编辑。
一次性编辑所有内容
机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) ; ETH Zurich(苏黎世联邦理工学院) ; Google(谷歌)
专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 提出MICE方法,通过修改联合注意力机制中的加性偏置来调控多实例编辑中的交互,实现无需训练的多实例图像编辑,在保持全局一致性的同时增强属性绑定。
Comments Accepted at ECCV 2026
FlowID: 利用潜在流匹配模型增强法医鉴定
机构 * INSA Toulouse(图卢兹理工学院) ; La Sorbonne Université(索邦大学) ; International Committee of the Red Cross(国际红十字委员会)
专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV
AI总结 提出FlowID方法,结合单图像微调与注意力掩码,修复暴力死亡面部损伤并保留身份特征,在InjuredFaces基准上优于现有开源方法。
S1-Omni-Image:面向科学图像理解、生成与编辑的统一模型
机构 * XScience Lab(XScience实验室) ; Wenge AI(文阁人工智能)
专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV
AI总结 提出S1-Omni-Image,基于S1-VL-32B和“先思考后生成”范式,统一实现科学图像的理解、生成与编辑,在多个基准上达到领先性能。
Comments 32 pages, 15 figures
Rel-Zero:利用补丁对不变性实现鲁棒的零水印以抵御AI编辑
专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 针对AI编辑对图像真实性的威胁,提出Rel-Zero零水印框架,利用编辑中补丁对关系距离的不变性,无需修改原图即可生成鲁棒水印,实验证明其优于现有方法。
Comments accepted to CVPR 2026
混沌中的秩序:捕捉AI操纵图像伪造定位的内在能量异常
机构 * Zhejiang University(浙江大学)
专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 本文提出FLAME框架,利用扩散过程抑制局部高频方差产生的统计能量间隙,结合LAD图和SAM适配器实现像素级伪造定位,并引入EditStream流水线持续合成训练数据,在AI生成伪造数据集上达到最先进性能。
Comments Accepted by ICML 2026
ProductWebGen: 多模态产品网页生成基准测试
机构 * School of Computer Science & Zhiyuan College(计算机科学学院及智远学院) ; Shanghai Jiao Tong University(上海交通大学) ; Kuaishou Technology(快手科技)
专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV
AI总结 提出ProductWebGen基准,用于评估多模态生成模型从产品图像和指令生成一致产品展示网页的能力,并比较了基于编辑和基于统一模型两种工作流。
Comments Accepted by KDD 2026