arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1257 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1257 篇

2409.14720 2024-09-24 cs.CV 85%

ControlEdit: A MultiModal Local Clothing Image Editing Method

Di Cheng, YingJie Shi, ShiXin Sun, JiaFu Zhang, WeiJing Wang, Yu Liu

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11010 2024-09-18 cs.CV 85%

MM2Latent: Text-to-facial image generation and editing in GANs with multimodal assistance

Debin Meng, Christos Tzelepis, Ioannis Patras, Georgios Tzimiropoulos

专题命中 图像编辑 :image generation(title,abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

Comments Accepted at ECCV 2024 AIM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14785 2024-06-05 cs.CV cs.AI cs.LG 85%

EditWorld: Simulating World Dynamics for Instruction-Following Image Editing

Ling Yang, Bohan Zeng, Jiaming Liu, Hong Li, Minghao Xu, Wentao Zhang, Shuicheng Yan

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

Comments Project: https://github.com/YangLing0818/EditWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16803 2024-05-28 cs.CV 85%

TIE: Revolutionizing Text-based Image Editing for Complex-Prompt Following and High-Fidelity Editing

Xinyu Zhang, Mengxue Kang, Fei Wei, Shuang Xu, Yuhe Liu, Lin Ma

专题命中 图像编辑 :image editing(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01496 2024-05-03 cs.CV 85%

LocInv: Localization-aware Inversion for Text-Guided Image Editing

Chuanming Tang, Kai Wang, Fei Yang, Joost van de Weijer

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2024 Workshop AI4CC

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04860 2024-04-09 cs.CV 85%

ByteEdit: Boost, Comply and Accelerate Generative Image Editing

Yuxi Ren, Jie Wu, Yanzuo Lu, Huafeng Kuang, Xin Xia, Xionghui Wang, Qianqian Wang, Yixing Zhu, Pan Xie, Shiyin Wang, Xuefeng Xiao, Yitong Wang, Min Zheng, Lean Fu

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16432 2024-04-04 cs.CV cs.AI cs.LG 85%

Text-Driven Image Editing via Learnable Regions

Yuanze Lin, Yi-Wen Chen, Yi-Hsuan Tsai, Lu Jiang, Ming-Hsuan Yang

专题命中 图像编辑 :image editing(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted to CVPR 2024 Project webpage: https://yuanze-lin.me/LearnableRegions_page

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04625 2024-02-08 cs.CV 85%

Noise Map Guidance: Inversion with Spatial Context for Real Image Editing

Hansam Cho, Jonghyun Lee, Seoung Bum Kim, Tae-Hyun Oh, Yonghyun Jeong

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11396 2023-12-22 cs.CV cs.AI 85%

MAG-Edit: Localized Image Editing in Complex Scenarios via Mask-Based Attention-Adjusted Guidance

Qi Mao, Lan Chen, Yuchao Gu, Zhen Fang, Mike Zheng Shou

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

Comments for project page, see https://mag-edit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19145 2023-10-31 cs.CL cs.CV 85%

Learning to Follow Object-Centric Image Editing Instructions Faithfully

Tuhin Chakrabarty, Kanishk Singh, Arkadiy Saakyan, Smaranda Muresan

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Findings of EMNLP 2023 (Long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15664 2023-09-28 cs.CV 85%

Dynamic Prompt Learning: Addressing Cross-Attention Leakage for Text-Based Image Editing

Kai Wang, Fei Yang, Shiqi Yang, Muhammad Atif Butt, Joost van de Weijer

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Neurips 2023. The code page: https://github.com/wangkai930418/DPL

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14331 2023-07-27 cs.CV 85%

Visual Instruction Inversion: Image Editing via Visual Prompting

Thao Nguyen, Yuheng Li, Utkarsh Ojha, Yong Jae Lee

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project page: https://thaoshibe.github.io/visii/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04632 2023-06-08 cs.CV cs.GR 85%

Designing a Better Asymmetric VQGAN for StableDiffusion

Zixin Zhu, Xuelu Feng, Dongdong Chen, Jianmin Bao, Le Wang, Yinpeng Chen, Lu Yuan, Gang Hua

专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

Comments code is available at https://github.com/buxiangzhiren/Asymmetric_VQGAN

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05950 2026-06-29 cs.AI 版本更新 85%

Edit-R2: Context-Aware Reinforcement Learning for Multi-Turn Image Editing

Edit-R2:面向多轮图像编辑的上下文感知强化学习

Yuxiao Ye, Haoran He, Fangyuan Kong, Xintao Wang, Pengfei Wan, Kun Gai, Ling Pan

机构 * Hong Kong University of Science and Technology(香港理工大学) Kuaishou Technology(快手科技)

专题命中 图像编辑 :image editing(title,abstract);image generation(abstract);diffusion(abstract)

AI总结 提出Edit-R2框架,通过重构会话意图和联合优化推理与生成的强化学习,解决多轮图像编辑中的长上下文稀释和状态污染问题,并在MICE-Bench基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09901 2026-06-10 cs.GR cs.CV cs.HC cs.LG cs.MM 新提交 85%

On the Controllability-Fidelity Frontier in Diffusion Editing

扩散编辑中的可控性-保真度前沿

Yi Hu, Leying Yi, Emily Davis, Finn Carter

机构 * Xidian University(西安电子科技大学)

专题命中 图像编辑 :diffusion(title,abstract);image editing(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 本文理论结合实证研究扩散图像编辑中用户意图遵循、非目标内容保持与输出质量间的权衡,提出算法框架并揭示关键失败模式,讨论伦理考量。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05899 2023-07-13 cs.CV 84%

DiffuseGAE: Controllable and High-fidelity Image Manipulation from Disentangled Representation

Yipeng Leng, Qiangjuan Huang, Zhiyuan Wang, Yangyang Liu, Haoyu Zhang

专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);diffusion(abstract);inpainting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09697 2025-10-20 cs.GR cs.CV cs.LG 84%

SPICE: A Synergistic, Precise, Iterative, and Customizable Image Editing Workflow

Kenan Tang, Yanhong Li, Yao Qin

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments The paper has been accepted to NeurIPS Creative AI Track 2025. Figure 4(c) has been accepted to CVPR AI Art Gallery 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14430 2025-09-10 cs.CV cs.GR cs.LG 84%

Stable Flow: Vital Layers for Training-Free Image Editing

Omri Avrahami, Or Patashnik, Ohad Fried, Egor Nemchinov, Kfir Aberman, Dani Lischinski, Daniel Cohen-Or

机构 * Snap Research The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Tel Aviv University(特拉维夫大学) Reichman University(里赫曼大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments CVPR 2025. Project page is available at https://omriavrahami.com/stable-flow

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03869 2025-06-04 cs.CL cs.AI cs.CR cs.CV cs.MM 84%

Chain-of-Jailbreak Attack for Image Generation Models via Editing Step by Step

Wenxuan Wang, Kuiyi Gao, Youliang Yuan, Jen-tse Huang, Qiuzhi Liu, Shuai Wang, Wenxiang Jiao, Zhaopeng Tu

机构 * Renmin University of China(中国人民大学) Chinese University of Hong Kong(香港大学) Chinese University of Hong Kong, Shenzhen(香港大学(深圳)) Johns Hopkins University(约翰霍普金斯大学) Tencent(腾讯) Hong Kong University of Science and Technology(香港科技大学)

专题命中 图像编辑 :image generation(title,abstract);diffusion(abstract);分类 cs.CV、cs.MM

Comments Accepted by ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14011 2025-04-22 cs.CV cs.AI cs.MM 84%

Fashion-RAG: Multimodal Fashion Image Editing via Retrieval-Augmented Generation

Fulvio Sanguigni, Davide Morelli, Marcella Cornia, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV、cs.MM

Comments IJCNN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00763 2024-08-21 cs.SE cs.AI cs.CL cs.CV cs.MM 84%

New Job, New Gender? Measuring the Social Bias in Image Generation Models

Wenxuan Wang, Haonan Bai, Jen-tse Huang, Yuxuan Wan, Youliang Yuan, Haoyi Qiu, Nanyun Peng, Michael R. Lyu

专题命中 图像编辑 :image generation(title,abstract);diffusion(abstract);分类 cs.CV、cs.MM

Comments ACM MM 2024 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.01626 2022-08-03 cs.CV cs.CL cs.GR cs.LG 84%

Prompt-to-Prompt Image Editing with Cross Attention Control

Amir Hertz, Ron Mokady, Jay Tenenbaum, Kfir Aberman, Yael Pritch, Daniel Cohen-Or

专题命中 图像编辑 :image editing(title,abstract);image synthesis(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.08222 2021-05-19 cs.CV cs.GR 84%

Decorating Your Own Bedroom: Locally Controlling Image Generation with Generative Adversarial Networks

Chen Zhang, Yinghao Xu, Yujun Shen

专题命中 图像编辑 :image generation(title,abstract);image editing(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25642 2026-07-29 cs.CV cs.CL 新提交 84%

Instruction-based Image Editing: A Survey on Data, Models, Evaluation, and Applications

基于指令的图像编辑:数据、模型、评估及应用综述

Xianghao Zang, Zijian Jiang, Jiarong Cheng, Qianrui Teng, Ying He, Yuxuan Mu, Chao Ban, Huayu Zhang, Lanxiang Zhou, Zerun Feng, Chi Zhang

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 综述基于指令的图像编辑研究,围绕任务定义、数据构建、模型架构、评估指标及商业应用五个维度展开,提出综合深度诊断基准,通过开源方案比较揭示优缺点,探讨未来研究方向以推动该领域发展。

Comments 33 pages, 7 figures, Vicinagearth

Journal ref Zang, X., Jiang, Z., Cheng, J. et al. Instruction-based image editing: a survey on data, models, evaluation, and applications. Vicinagearth 3, 3 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10284 2025-12-16 cs.CV cs.AI cs.CL 84%

MotionEdit: Benchmarking and Learning Motion-Centric Image Editing

MotionEdit: 动作导向图像编辑的基准测试与学习

Yixin Wan, Lei Ke, Wenhao Yu, Kai-Wei Chang, Dong Yu

机构 * Tencent AI(腾讯AI) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 MotionEdit提出一个动作导向图像编辑数据集及评估基准,通过MotionNFT框架提升编辑质量和运动保真度。

Comments Technical Report. We propose MotionEdit, a dataset and benchmark for motion-centric image editing. We also introduce MotionNFT, a reward training framework to improve existing models with motion-aware guidance. Github: https://github.com/elainew728/motion-edit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17302 2026-08-11 cs.CV 版本更新 83%

PosBridge: Multi-View Positional Embedding Transplant for Identity-Aware Image Editing

PosBridge:用于身份感知图像编辑的多视图位置嵌入迁移

Peilin Xiong, Junwen Chen, Honghui Yuan, Keiji Yanai

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 PosBridge是一种高效灵活的图像编辑框架,通过位置嵌入迁移与角点居中布局,实现自定义对象的无缝插入,在结构一致性、保真度和效率上优于主流基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16898 2026-08-04 cs.CV cs.CL cs.CR 版本更新 83%

Cross-Branch Conflict as a Shield: Safeguarding Facial Identities in Unified Multimodal Image Editing

跨分支冲突作为一种保护手段:在统一多模态图像编辑中保护面部身份

Weiwei Tan, Junxian Li, Rui Wang, Zhenhua Xu, Yanjun Zhang, Yu Leo Zhang

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 研究统一多模态模型中个人肖像编辑的安全问题,提出CCS统一对抗保护框架,通过联合驱动ViT和VAE表示及破坏跨分支兼容性,防止模型恢复身份信息,在抑制身份保留编辑上表现优于现有方法。

Comments 14 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29367 2026-08-03 cs.CV 新提交 83%

SatEdit: Mask-Conditioned Image Editing via VLM-Guided Segment Annotation

SatEdit:基于VLM引导的区域标注的掩码条件卫星图像编辑

Muhammad Talha, Muhammad Ahmed Amer

专题命中 图像编辑 :image editing(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 SatEdit是基于VLM引导区域标注的卫星图像编辑框架,通过未标注图像构建监督信号,经LoRA微调后在对比中实现最高掩码区域语义对齐,为卫星图像编辑提供了数据高效的可行方案。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10800 2026-07-14 cs.CV 新提交 83%

h-Flow: Flexible Flow-based Image Editing via Doob's h-Transform

h-Flow:通过杜布h变换实现基于灵活流的图像编辑

Zehui Guo, Zhen Wang, Junwei Shu, Yang Li, Changbo Wang, Long Chen

机构 * East China Normal University(华东师范大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出h-Flow,一个无需训练且基于理论的基于流的图像编辑框架。受杜布h变换启发,将图像编辑重述为条件生成,通过构建等效SDE扩展h变换,设计专用h函数并引入速度正交分解,实现有效、稳健且灵活的图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17565 2026-06-29 cs.CV 版本更新 83%

UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models

UniGeo:通过视频模型统一几何指导以实现相机可控的图像编辑

Hong Jiang, Wensong Song, Zongxin Yang, Ruijie Quan, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学) DBMI, HMS, Harvard University(DBMI、HMS、哈佛大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 UniGeo通过统一的几何指导在三个层面提升相机可控图像编辑的几何一致性与视觉质量,克服传统方法在连续相机运动下的几何漂移和结构退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏