arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1258 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1258 篇

1906.07927 2020-07-06 cs.LG cs.CR cs.CV eess.IV 74%

SemanticAdv: Generating Adversarial Examples via Attribute-conditional Image Editing

Haonan Qiu, Chaowei Xiao, Lei Yang, Xinchen Yan, Honglak Lee, Bo Li

专题命中 图像编辑 :image editing(title);分类 cs.CV

Comments To appear at ECCV 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.00176 2019-07-03 cs.CV cs.DM 74%

Fast and Optimal Laplacian Solver for Gradient-Domain Image Editing using Green Function Convolution

Dominique Beaini, Sofiane Achiche, Fabrice Nonez, Olivier Brochu Dufour, Cédric Leblond-Ménard, Mahdis Asaadi, Maxime Raison

专题命中 图像编辑 :image editing(title);分类 cs.CV

Comments 17 pages, single column scientific paper. Patent submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.10974 2019-05-28 cs.CV cs.LG eess.IV 74%

Style transfer-based image synthesis as an efficient regularization technique in deep learning

Agnieszka Mikołajczyk, Michał Grochowski

专题命中 图像编辑 :image synthesis(title);分类 cs.CV

Comments 6 pages, 4 figures, accepted to the 24th International Conference on Methods and Models in Automation and Robotics (MMAR 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.06355 2016-11-22 cs.CV cs.AI 74%

Invertible Conditional GANs for image editing

Guim Perarnau, Joost van de Weijer, Bogdan Raducanu, Jose M. Álvarez

专题命中 图像编辑 :image editing(title);分类 cs.CV

Comments Accepted paper at NIPS 2016 Workshop on Adversarial Training

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18993 2026-05-20 cs.CV cs.AI cs.GR 73%

FreeOrbit4D: Training-Free Arbitrary Camera Redirection for Monocular Videos via Foreground-Complete 4D Reconstruction

FreeOrbit4D: 通过前景完整4D重建实现免训练的任意相机重定向

Wei Cao, Hao Zhang, Fengrui Tian, Yulun Wu, Yingying Li, Shenlong Wang, Ning Yu, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pennsylvania(宾夕法尼亚大学) Eyeline Labs(Eyeline实验室)

专题命中 图像编辑 :diffusion(abstract,abstract_cn);分类 cs.CV、cs.GR

AI总结 本文提出FreeOrbit4D,一种无需训练的框架,通过恢复完整的前景4D代理来解决大角度重定向中的几何模糊问题,从而生成更真实且时间一致的视频。

Comments 12 pages, 10 figures. Accepted to SIGGRAPH Conference Papers 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19051 2025-12-05 cs.CV cs.AI cs.MM 73%

Multimodal Markup Document Models for Graphic Design Completion

多模态标记文档模型用于图形设计完成

Kotaro Kikuchi, Ukyo Honda, Naoto Inoue, Mayu Otani, Edgar Simo-Serra, Kota Yamaguchi

机构 * Waseda University(早稻田大学)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV、cs.MM

AI总结 MarkupDM是一种多模态标记文档模型,通过统一处理图形设计任务,实现文本、图像和属性值的完成,展示了其在设计自动化中的广泛适用性。

Comments Accepted by ACM Multimedia 2025, Project page: https://cyberagentailab.github.io/MarkupDM/

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia. 2025. p.11022-11031

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20405 2025-05-28 cs.CV cs.AI cs.CL cs.MM 73%

What Changed? Detecting and Evaluating Instruction-Guided Image Edits with Multimodal Large Language Models

Lorenzo Baraldi, Davide Bucciarelli, Federico Betti, Marcella Cornia, Lorenzo Baraldi, Nicu Sebe, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学) University of Trento(特伦托大学) IIT-CNR

专题命中 图像编辑 :image editing(abstract);inpainting(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08889 2025-05-16 cs.GR cs.CV 73%

IntrinsicEdit: Precise generative image manipulation in intrinsic space

Linjie Lyu, Valentin Deschaintre, Yannick Hold-Geoffroy, Miloš Hašan, Jae Shin Yoon, Thomas Leimkühler, Christian Theobalt, Iliyan Georgiev

机构 * Max-Planck-Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校园) Adobe Research(Adobe研究)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV、cs.GR

Comments SIGGRAPH 2025 Journal track

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11868 2025-02-18 cs.GR cs.CV 73%

View-Consistent 3D Editing with Gaussian Splatting

Yuxuan Wang, Xuanyu Yi, Zike Wu, Na Zhao, Long Chen, Hanwang Zhang

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV、cs.GR

Comments accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14602 2024-03-22 cs.CV cs.GR cs.LG eess.IV 73%

ReNoise: Real Image Inversion Through Iterative Noising

Daniel Garibi, Or Patashnik, Andrey Voynov, Hadar Averbuch-Elor, Daniel Cohen-Or

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV、cs.GR

Comments project page at: https://garibida.github.io/ReNoise-Inversion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02847 2024-01-31 cs.CV cs.GR cs.LG 73%

Generating Non-Stationary Textures using Self-Rectification

Yang Zhou, Rongjun Xiao, Dani Lischinski, Daniel Cohen-Or, Hui Huang

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV、cs.GR

Comments Project page: https://github.com/xiaorongjun000/Self-Rectification

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.14461 2022-10-28 cs.CV cs.MM 73%

TPFNet: A Novel Text In-painting Transformer for Text Removal

Onkar Susladkar, Dhruv Makwana, Gayatri Deshmukh, Sparsh Mittal, Sai Chandra Teja R, Rekha Singhal

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV、cs.MM

Comments 10 pages, 5 figures, 5 tables, Neurips Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.15078 2021-12-01 cs.CV cs.MM 73%

SketchEdit: Mask-Free Local Image Manipulation with Partial Sketches

Yu Zeng, Zhe Lin, Vishal M. Patel

专题命中 图像编辑 :image editing(abstract);inpainting(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.09840 2020-09-01 cs.GR cs.CV cs.HC cs.LG 73%

Interactive Optimization of Generative Image Modeling using Sequential Subspace Search and Content-based Guidance

Toby Chong Long Hin, I-Chao Shen, Issei Sato, Takeo Igarashi

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV、cs.GR

Comments 13 pages, Toby Chong Long Hin and I-Chao Shen contributed equally to the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.11544 2020-08-10 cs.CV cs.GR 73%

Image2StyleGAN++: How to Edit the Embedded Images?

Rameen Abdal, Yipeng Qin, Peter Wonka

专题命中 图像编辑 :image editing(abstract);inpainting(abstract);分类 cs.CV、cs.GR

Comments CVPR 2020 " For the video, visit https://youtu.be/yd5WczbFt68 "

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07925 2024-02-14 cs.AI cs.HC 71%

Point and Instruct: Enabling Precise Image Editing by Unifying Direct Manipulation and Text Instructions

Alec Helbling, Seongmin Lee, Polo Chau

专题命中 图像编辑 :image editing(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04840 2026-08-06 cs.CV cs.AI 新提交 70%

Towards a satellite image manipulation and deepfake localization benchmark dataset

面向卫星图像篡改与深度伪造定位的基准数据集

Jacob Arndt, Debvrat Varshney, Philipe Dias, Nivedita Nukavarapu

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 图像编辑 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 针对遥感领域缺乏合适卫星图像篡改定位基准数据集的问题,构建含60张图像的原型数据集,支持像素级定位等分析,以推动相关研究。

Comments Accepted at IEEE IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12341 2026-08-05 cs.CV 版本更新 70%

Bridging the Micro--Macro Gap: Frequency-Aware Semantic Alignment for Image Manipulation Localization

弥合微-宏观差距:面向图像操纵本地化的频率感知语义对齐

Xiaojie Liang, Zhimin Chen, Ziqi Sheng, Wei Lu

机构 * School of Computer Science Engineering, Sun Yat-sen University Guangzhou China Engineering, Sun Yat-sen University

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出FASA框架,通过自适应双频带DCT模块提取操纵敏感频率特征,结合冻结CLIP表示的补丁级对比对齐学习语义先验,实现传统和扩散生成操纵的精准本地化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21714 2026-07-31 cs.SD cs.MM 版本更新 70%

MusicWeaver: Programmable Long-Form Music Generation with Provably Local Editing

MusicWeaver: 作曲家风格的结构编辑与分钟级连贯音乐生成

Xuanchen Wang, Heng Wang, Weidong Cai

机构 * The University of Sydney(悉尼大学)

专题命中 图像编辑 :diffusion(abstract);inpainting(abstract);分类 cs.MM

AI总结 MusicWeaver通过结构化计划和全局-局部扩散变换器实现作曲家风格的音乐生成与编辑,具备分钟级连贯性和高保真度。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17140 2026-07-21 cs.CV 新提交 70%

STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs

STBridge:用于在统一多模态模型中弥合理解与生成的共享目标对齐

Ye Wang, Hongjun Wang, Hao Fang, Tongyuan Bai, Zuwei Long, Peixian Chen, Wei Liu, Weibo Gu, Xing Sun, Rui Ma

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 研究统一多模态模型中理解与生成的对齐差距,提出STBridge共享目标对齐框架,通过共同目标状态连接二者,采用对齐然后优化策略,经实验验证该框架能缩小模型描述与生成间差距,有效弥合理解与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13125 2026-07-21 cs.CV cs.AI 版本更新 70%

Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget

Boogu-Image-0.1:提升开源统一多模态理解与生成能力

Guoxuan Chen, Chufeng Xiao, Haoran Yang, Siyue Xie, Binxiao Huang, Ming Zhang, Cheuk Him Chau, Xinyu Fu, Yingzhao Lian, Tom S. Y. Li, Jintao Lin, Bowen Dong, Zian Qian, Yuhao Liu, Yuxuan Hu, Weikang Shi, Bin Zou, Bowen Zheng, Haoxuan Che, Chang Chen, Yuyang He, Heyang Sun, Tianyu Huang, Chong Hou Choi, Cheng Gong, Han Shi, Haoli Bai, Xihui Liu, Hongsheng Li, Qifeng Chen, Chao Huang, Rui Liu, Chenyang Lei

专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 介绍开源统一多模态模型Boogu-Image-0.1,通过改进模型理解、数据质量和训练管道等,结合智能推理扩展,提升生成和编辑性能,在标准基准测试中表现出色,成本低,还分享实践讨论并开源代码等推动相关生态发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12450 2026-07-15 cs.CV 新提交 70%

Let RGB Be the Language of Vision

让 RGB 成为视觉的语言

Timing Yang, Jinrui Yang, Xinlong Li, Yuhan Wang, Haoran Li, Yanqing Liu, Guoyizhe Wei, Jixuan Ying, Chen Wei, Rama Chellappa, Yuyin Zhou, Cihang Xie, Alan Yuille, Feng Wang

机构 * Johns Hopkins University(约翰·霍普金斯大学) UC Santa Cruz(加州大学圣克鲁兹分校) Carnegie Mellon University(卡内基梅隆大学) Rice University(莱斯大学)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 该研究为视觉模型引入统一表述 RGB In and RGB Out(RINO),将多种视觉信息转为 RGB 图像编辑问题,共享架构参数,基于通用主干无需微调,在多视觉任务上有强大零样本性能,为统一视觉语言系统提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17089 2026-07-03 cs.CV cs.AI 版本更新 70%

Spanning Tree Autoregressive Visual Generation

生成树自回归视觉生成

Sangkyu Lee, Changho Lee, Janghoon Han, Hosung Song, Tackgeun You, Hwasup Lim, Stanley Jungkyu Choi, Honglak Lee, Youngjae Yu

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术院) LG AI Research(LG人工智能研究) University of Michigan(密歇根大学) Seoul National University(首尔国立大学)

专题命中 图像编辑 :image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出生成树自回归(STAR)建模,通过均匀生成树的遍历顺序在保持采样性能的同时提供灵活序列顺序,支持图像编辑。

Comments Published as a main conference paper at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00410 2026-07-02 cs.CV cs.LG 新提交 70%

MindAU: EEG-Conditioned Facial Action Unit Editing via Dual-Stream Manifold Alignment

MindAU: 基于双流流形对齐的脑电条件面部动作单元编辑

Zhenhang Li, Xin Zhou, Hao Deng, Lijun Yin

机构 * Binghamton University(宾汉姆顿大学) Massachusetts General Hospital(马萨诸塞综合医院) Harvard Medical School(哈佛医学院)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 提出MindAU框架,通过双流流形对齐将EEG特征与AU文本语义和视觉位移对齐,实现高保真身份保持的面部动作单元编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31278 2026-07-01 cs.CV 新提交 70%

Editing Everything Everywhere All at Once

一次性编辑所有内容

Fabio Quattrini, Carmine Zaccagnino, Enis Simsar, Marta Tintoré Gazulla, Rita Cucchiara, Alessio Tonioni, Silvia Cascianelli

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 提出MICE方法,通过修改联合注意力机制中的加性偏置来调控多实例编辑中的交互,实现无需训练的多实例图像编辑,在保持全局一致性的同时增强属性绑定。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29591 2026-06-25 cs.CV 版本更新 70%

FlowID : Enhancing Forensic Identification with Latent Flow-Matching Models

FlowID: 利用潜在流匹配模型增强法医鉴定

Jules Ripoll, David Bertoin, Alasdair Newson, Charles Dossal, Jose Pablo Baraybar

机构 * INSA Toulouse(图卢兹理工学院) La Sorbonne Université(索邦大学) International Committee of the Red Cross(国际红十字委员会)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 提出FlowID方法,结合单图像微调与注意力掩码,修复暴力死亡面部损伤并保留身份特征,在InjuredFaces基准上优于现有开源方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24441 2026-06-24 cs.CV 新提交 70%

S1-Omni-Image: A Unified Model for Scientific Image Understanding, Generation, and Editing

S1-Omni-Image:面向科学图像理解、生成与编辑的统一模型

Qingxiao Li, Zikai Wang, Qingli Wang, Nan Xu

机构 * XScience Lab(XScience实验室) Wenge AI(文阁人工智能)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 提出S1-Omni-Image,基于S1-VL-32B和“先思考后生成”范式,统一实现科学图像的理解、生成与编辑,在多个基准上达到领先性能。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17531 2026-06-16 cs.CV cs.AI cs.CR 版本更新 70%

Rel-Zero: Harnessing Patch-Pair Invariance for Robust Zero-Watermarking Against AI Editing

Rel-Zero:利用补丁对不变性实现鲁棒的零水印以抵御AI编辑

Pengzhen Chen, Yanwei Liu, Xiaoyan Gu, Xiaojun Chen, Wu Liu, Weiping Wang

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 针对AI编辑对图像真实性的威胁,提出Rel-Zero零水印框架,利用编辑中补丁对关系距离的不变性,无需修改原图即可生成鲁棒水印,实验证明其优于现有方法。

Comments accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02178 2026-06-02 cs.CV cs.AI 70%

Order within Chaos: Capturing Intrinsic Energy Anomalies for AI-Manipulated Image Forgery Localization

混沌中的秩序:捕捉AI操纵图像伪造定位的内在能量异常

Yiming Wang, Baiqi Wu, Qingming Li, Jiahao Chen, Tong Zhang, Shouling Ji

机构 * Zhejiang University(浙江大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出FLAME框架,利用扩散过程抑制局部高频方差产生的统计能量间隙,结合LAD图和SAM适配器实现像素级伪造定位,并引入EditStream流水线持续合成训练数据,在AI生成伪造数据集上达到最先进性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01022 2026-06-02 cs.CV cs.AI 70%

ProductWebGen: Benchmarking Multimodal Product Webpage Generation

ProductWebGen: 多模态产品网页生成基准测试

Zhihong Liu, Siqi Kou, Zheng Li, Ye Ma, Quan Chen, Peng Jiang, Kai Yu, Zhijie Deng

机构 * School of Computer Science & Zhiyuan College(计算机科学学院及智远学院) Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 提出ProductWebGen基准,用于评估多模态生成模型从产品图像和指令生成一致产品展示网页的能力,并比较了基于编辑和基于统一模型两种工作流。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏