arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1258 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1258 篇

2606.08016 2026-06-09 cs.CV cs.AI cs.CL 新提交 79%

IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment

IEA:通过三阶段多任务对齐的业余友好型对话式图像编辑代理

Zichen Zhu, Yuheng Sun, Mingxuan Zhu, Wenjie Ma, Situo Zhang, Zhexiang Wang, Ziyue Yang, Danyang Zhang, Kunyao Lan, Zihan Zhao, Dingye Liu, Siqi Xiang, Lu Chen, Kai Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institution(上海创新研究院) Huawei Technologies Ltd.(华为技术有限公司) Nanyang Technological University(南洋理工大学) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出IEA对话式图像编辑代理,通过三阶段多任务训练学习操作参数化工具,实现可解释编辑轨迹,在像素距离和ROUGE-L指标上优于基线,用户研究中指令跟随和感知质量表现最佳。

Comments [CVPR 2026 Findings] Our data and code are released at https://github.com/OpenDFM/Image_Edit_Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09233 2026-06-03 cs.CV cs.AI 79%

Towards Robust Sequential Decomposition for Complex Image Editing

面向复杂图像编辑的鲁棒顺序分解

Zilai Zeng, Mingdeng Cao, Zijie Li, Xiaochen Lian, Yichun Shi, Peihao Zhu, Chen Sun, Peng Wang

机构 * Brown University(布朗大学) ByteDance Seed(字节跳动种子) The University of Tokyo(东京大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出通过顺序分解将复杂编辑任务拆解为简单步骤,并利用合成数据训练模型,在统一上下文编辑框架下平衡分解优势与误差累积,实现鲁棒改进和从模拟到真实的泛化。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01985 2026-06-02 cs.CV 79%

MT-EditFlow: Reinforcement Learning for Multi-Turn Image Editing with Flow Matching

MT-EditFlow:基于流匹配的多轮图像编辑强化学习

Jiahui Huang, Yasi Zhang, Tianyu Chen, Shu Wang, Jianwen Xie, Oscar Leong, Mingyuan Zhou, Nanzhu Wang, Ying Nian Wu

机构 * Apple(苹果公司) University of California, Los Angeles(加州大学洛杉矶分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) Lambda, Inc(Lambda公司)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出MT-EditFlow框架,通过流匹配强化学习优化多轮图像编辑的奖励信号,解决单轮编辑模型在多轮交互中的失败和误差传播问题,显著提升多轮编辑性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25568 2026-05-26 cs.CV 79%

Rethinking Scribble-Guided Image Editing: Generalization, Instruction Adherence, and Multi-Tasking

重新思考涂鸦引导的图像编辑:泛化、指令遵循与多任务

Mingyi Xu, Jinpeng Lin, Min Zhou, Tiezheng Ge, Ming Zeng

机构 * Xiamen University(厦门大学) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 针对涂鸦引导图像编辑在多任务场景下性能不稳定的问题,通过实证研究揭示指令级泛化瓶颈,提出覆盖-真实课程、多任务拼接和编辑聚焦损失三种策略,在VIBE基准上实现单任务和多任务的最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08213 2026-05-26 cs.CV cs.AI 79%

EditCaption: Human-Refined SFT and HAE-DPO for Image Editing Instruction Synthesis

EditCaption: 用于图像编辑指令合成的人工精炼SFT与HAE-DPO

Xiangyuan Wang, Honghao Cai, Yunhao Bai, Chao Hui, Tianze Zhou, Haohua Chen, Hao Shi, Yuling Wu, Yao Hu, Xu Tang, Yibo Chen, Wei Zhu

机构 * Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Xiaohongshu Inc.(小红书公司)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出EditCaption两阶段后训练流程,通过人工精炼SFT和基于难度自适应错误感知DPO(HAE-DPO)提升图像编辑指令合成质量,显著降低关键错误率并超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01382 2026-05-26 cs.CV 79%

Reversible Inversion for Training-Free Exemplar-guided Image Editing

可逆反演用于免训练示例引导图像编辑

Yuke Li, Lianli Gao, Ji Zhang, Pengpeng Zeng, Lichuan Xiang, Hongkai Wen, Heng Tao Shen, Jingkuan Song

机构 * school of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) School of Computing and Artificial Intelligence, Southwest Jiaotong University, China(西南交通大学计算机科学与人工智能学院) School of Computer Science and Technology, Tongji University, China(同济大学计算机科学与技术学院) Department of Computer Science, University of Warwick, United Kingdom(英国沃里克大学计算机科学系)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出可逆反演(ReInversion)方法,通过两阶段去噪和掩码引导选择性去噪策略,实现免训练的高效示例引导图像编辑,达到最优性能且计算开销最低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23518 2026-05-25 cs.CV 79%

VINS-120K: Ultra High-Resolution Image Editing with A Large-Scale Dataset

VINS-120K:基于大规模数据集的超高分辨率图像编辑

Zhizhou Chen, Shanyan Guan, Zhanxin Gao, En Ci, Yanhao Ge, Wei Li, Zhenyu Zhang, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) vivo

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出首个大规模指令式超高分辨率图像编辑数据集VINS-120K(120K三元组,每张图像≥4K分辨率),并开发高频感知后适应策略以扩展预训练模型至UHR领域,提升细粒度细节合成与纹理真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01851 2026-05-22 cs.CV 79%

How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing

模型能多好地遵循视觉指令?VIBE:一个系统性的视觉指令驱动图像编辑基准

Huanyu Zhang, Xuehai Bai, Chengzu Li, Chen Liang, Haochen Tian, Haodong Li, Ruichuan An, Yifan Zhang, Anna Korhonen, Zhang Zhang, Liang Wang, Tieniu Tan

机构 * School of Artificial Intelligence, University of Chinese Academy of Science(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Peking University(北京大学) South China University of Technology(华南理工大学) Nanjing University(南京大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出VIBE基准,用于评估视觉指令驱动的图像编辑模型,通过三级交互层次评估指涉 grounding、形态操作和因果推理,并发现专有模型在早期阶段表现优异但随着任务难度增加性能下降。

Comments https://vibe-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19511 2026-05-20 cs.CV 79%

Are Watermarked Images Editable? SafeMark for Watermark-Preserving Text-Guided Image Editing

水印图像可编辑吗?SafeMark用于水印保持的文本引导图像编辑

Xiaodong Wu, Qi Li, Xiangman Li, Zelin Zhang, Lingshuang Liu, Jianbing Ni

机构 * Queen’s University(皇后大学) University of Waterloo(滑铁卢大学)

专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV

AI总结 本文研究了一个基础但未被充分探索的问题:水印图像能否在不损害水印完整性的情况下保持可编辑?我们提出了SafeMark框架,该框架在图像编辑过程中显式地将水印完整性整合进去。具体来说,SafeMark将阈值化的水印解码损失直接添加到扩散编辑器的训练目标中,微调编辑器,使得语义上有效的编辑也能够在最终输出中保留嵌入的水印。这种设计具有清晰的信息论依据:在编辑图像上保持高比特准确性下限界了编辑通道所保持的水印与编辑输出之间的互信息,这一量根本控制着水印恢复能力。SafeMark与可微扩散编辑器兼容,不需要架构修改。在多个数据集、文本引导编辑方法和编辑后失真设置上的广泛评估表明,SafeMark在多种编辑设置中实现了高水印比特准确性,同时保持高质量的语义编辑,而不会牺牲对常见编辑后失真的鲁棒性。这些结果表明,语义可编辑性和水印完整性本质上是兼容的,使生成编辑管道中的图像溯源变得可信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23622 2026-05-20 cs.CV cs.AI 79%

DLEBench: Evaluating Small-scale Object Editing Ability for Instruction-based Image Editing Model

DLEBench: 评估基于指令的图像编辑模型在小规模物体编辑能力

Shibo Hong, Boxian Ai, Jun Kuang, Wei Wang, FengJiao Chen, Zhongyuan Peng, Chenhao Huang, Yixin Cao

机构 * College of Computer Science(计算机科学学院) Artificial Intelligence(人工智能) Fudan University(复旦大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出DLEBench,首个专门评估基于指令的图像编辑模型在小规模物体编辑能力的基准,通过1889个样本覆盖复杂场景,揭示了现有模型在小物体编辑上的性能差距,强调了专用基准的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08163 2026-05-19 cs.CV cs.AI cs.CL 79%

MULTITEXTEDIT: Benchmarking Cross-Lingual Degradation in Text-in-Image Editing

MULTITEXTEDIT:跨语言文本-图像编辑中退化程度的基准测试

Liwei Cheng, Shibo Feng, Lunjie Zhou, Yixuan Guan, Dayan Guan

机构 * Harbin Institute of Technology(哈尔滨理工大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出MULTITEXTEDIT基准测试,通过12种语言、5种视觉领域和7种编辑操作的3600个实例,评估跨语言文本-图像编辑中退化问题,引入语言保真度指标并发现模型在文本准确性和脚本保真度上的显著退化。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16951 2026-05-19 cs.CV 79%

Edit-GRPO: A Locality-Preserving Policy Optimization Framework for Image Editing

Edit-GRPO: 一种用于图像编辑的保持局部性的策略优化框架

Shaodong Xu, Zexian Li, Zhendong Wang, Litong Gong, Tiezheng Ge, Wengang Zhou, Bo Zheng, Houqiang Li

机构 * Alibaba Group(阿里巴巴集团)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出Edit-GRPO框架,通过分离编辑与保留目标,解决图像编辑中保持局部性与全局一致性的问题,提升编辑效果并减少上下文扭曲等常见伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15181 2026-05-15 cs.CV 79%

From Plans to Pixels: Learning to Plan and Orchestrate for Open-Ended Image Editing

从计划到像素:学习计划与协调以实现开放性图像编辑

Anirudh Sundara Rajan, Krishna Kumar Singh, Yong Jae Lee

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe研究)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出一种长期视图图像编辑框架,通过规划器生成结构化原子分解和协调器选择工具和区域执行每一步,结合视觉语言判断者提供基于结果的奖励,提升编辑的连贯性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13609 2026-05-15 cs.CV cs.LG 79%

Do-Undo Bench: Reversibility for Action Understanding in Image Generation

Do-Undo基准:图像生成中动作理解的可逆性

Shweta Mahajan, Shreya Kadambi, Hoang Le, Rajeev Yasarla, Apratim Bhattacharyya, Munawar Hayat, Fatih Porikli

机构 * York University(约克大学) Vector Institute for AI(人工智能向量研究所) Qualcomm AI Research(高通人工智能研究)

专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出Do-Undo任务和基准,解决视觉-语言模型在理解并生成由现实动作驱动的场景变换中的关键缺口。通过要求模型模拟现实动作的后果并逆转至原始状态,测试真正的因果理解。实验表明当前模型在动作可逆性上存在困难,凸显评估动作理解的必要性。

Comments Project page: https://s-mahajan.github.io/Do-Undo-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14842 2026-05-15 cs.CV 79%

Editor's Choice: Evaluating Abstract Intent in Image Editing through Atomic Entity Analysis

编辑推荐:通过原子实体分析评估图像编辑中的抽象意图

Mor Ventura, Roy Hirsch, Yonatan Bitton, Regev Cohen, Roi Reichart

机构 * Technion – Israel Institute of Technology(技术ion – 以色列理工学院) Google Research(谷歌研究)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出通过原子实体分析评估图像编辑中抽象意图的方法,引入Entity-Rubrics框架并构建AbstractEdit基准,揭示现有模型在平衡意图与保留之间的挑战,强调结合先进LLM和迭代思维的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14068 2026-05-15 cs.CV 79%

CoCoEdit: Content-Consistent Image Editing via Region Regularized Reinforcement Learning

CoCoEdit:通过区域正则化的强化学习实现内容一致的图像编辑

Yuhui Wu, Chenxi Xie, Ruibin Li, Liyi Chen, Qiaosi Yi, Lei Zhang

机构 * The Hong Kong Polytechnic University, Hong Kong(香港理工大学) OPPO Research Institute, ShenZhen, China(OPPO研究院,深圳,中国)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出CoCoEdit框架,通过区域正则化强化学习提升图像编辑内容一致性,利用改进的指令和掩码生成高质量训练集,并引入像素相似度奖励和区域正则化器,提升编辑质量和一致性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02521 2026-05-14 cs.CV 79%

MooD: Perception-Enhanced Efficient Affective Image Editing via Continuous Valence-Arousal Modeling

MooD:通过连续的效价-唤醒建模提升的感知增强高效情感图像编辑

Xinyi Yin, Yiduo Wang, Tingqi Hu, Meicong Si, Yunyun Shi, Shi Chen, Hao Wang, Junxiao Xue, Xuecheng Wu

机构 * School of Cyber Science and Engineering, Zhengzhou University(郑州大学信息科学与工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Journalism and New Media, Xi’an Jiaotong University(西安交通大学新闻与传播学院) Research Center for Space Computing System, Zhejiang Lab(浙江实验室空间计算系统研究中心)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 MooD通过连续效价-唤醒建模实现高效情感图像编辑,结合视觉迁移与感知增强的语义引导,提升情感可控性和视觉保真度,同时保持高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07458 2026-05-14 cs.CV 79%

SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning

SpatialReward: 通过显式空间推理弥合在线强化学习中图像编辑的感知差距

Yancheng Long, Yankai Yang, Hongyang Wei, Wei Chen, Tianke Zhang, Haonan fan, Changyi Liu, Kaiyu Jiang, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院,清华大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出SpatialReward,通过显式空间推理提升在线强化学习中图像编辑的感知准确性,其在MMRB2和EditReward-Bench上表现优异,并在MultiEditReward-Bench上超越专用评估器。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13062 2026-05-14 cs.CV 79%

Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling

Edit-Compass 与 EditReward-Compass:图像编辑与奖励建模的统一基准

Xuehai Bai, Yang Shi, Yi-Fan Zhang, Xuanyu Zhu, Yuran Wang, Yifan Dai, Xinyu Liu, Yiyan Ji, Xiaoling Gu, Yuanxing Zhang

机构 * HDU(杭州大学) PKU(北京大学) Kling Team(Kling团队) CASIA(中国科学院自动化研究所)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出Edit-Compass和EditReward-Compass,通过精细多维评估框架和真实奖励建模场景,解决现有图像编辑和奖励模型评估中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12724 2026-05-14 cs.CV cs.AI 79%

Inline Critic Steers Image Editing

内联批评引导图像编辑

Weitai Kang, Xiaohang Zhan, Yizhou Wang, Mang Tik Chiu, Jason Kuen, Kangning Liu, Yan Yan

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Adobe

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出内联批评方法,通过在图像编辑过程中实时修正模型输出,提升生成质量,在多个基准测试中取得优异成绩。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09587 2026-05-13 cs.CV cs.AI 79%

MieDB-100k: A Comprehensive Dataset for Medical Image Editing

MieDB-100k:用于医学图像编辑的综合数据集

Yongfan Lai, Wen Qian, Bo Liu, Hongyan Li, Hao Luo, Fan Wang, Bohan Zhuang, Shenda Hong

机构 * State Key Laboratory of General Artificial Intelligence, Beijing, China(1 国家一般人工智能重点实验室,北京,中国) School of Intelligence Science and Technology, Peking University, Beijing, China(2 智能科学与技术学院,北京大学,北京,中国) National Institute of Health Data Science, Peking University, Beijing, China(3 国家健康数据科学研究院,北京大学,北京,中国) DAMO Academy, Alibaba Group, Zhejiang, China(4 阿里巴巴集团 DAMO 院,浙江,中国) hupan lab, zhejiang province(5 鹏元实验室,浙江省) Zhejiang University, Zhejiang, China(6 浙江大学,浙江,中国)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出MieDB-100k数据集,通过数据筛选流程结合专家模型与规则生成方法,解决医学图像编辑中数据质量、多样性与可扩展性不足的问题,实验表明其在医学图像编辑任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07940 2026-05-11 cs.CV 79%

Delta-Adapter: Scalable Exemplar-Based Image Editing with Single-Pair Supervision

Delta-Adapter:基于单对监督的可扩展示例图像编辑

Jiacheng Chen, Songze Li, Han Fu, Baoquan Zhao, Wei Liu, Yanyan Liang, Li Qing, Xudong Mao

机构 * Sun Yat-sen University(中山大学) Video Rebirth Macau University of Science and Technology(澳门科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 Delta-Adapter通过单对监督学习可迁移的编辑语义,利用预训练视觉编码器提取语义差异,并通过Perceiver-based适配器注入图像编辑模型,提升编辑准确性和内容一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07477 2026-05-11 cs.CV 79%

ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning

ReasonEdit:通过强化学习实现可解释图像编辑评估

Honghua Chen, Zitong Xu, Huiyu Duan, Xinyun Zhang, Xiongkuo Min, Guangtao Zhai

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出ReasonEdit,通过引入ReasonEdit-22K数据集和RE-Reward模型,训练出可解释的图像编辑评估模型,提升评估的可解释性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07457 2026-05-11 cs.CV 79%

EditRefiner: A Human-Aligned Agentic Framework for Image Editing Refinement

EditRefiner:一种对齐人类的代理框架用于图像编辑细化

Zitong Xu, Huiyu Duan, Yifei Nie, Mingda Du, Sijing Wu, Xiongkuo Min, Tianyi Zheng, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(Vivo移动通信有限公司) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出EditRefiner,一种对齐人类的代理框架,通过人类反馈数据集改进图像编辑的细粒度问题,通过感知-推理-行动-评估循环提升编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01586 2026-05-11 cs.CV 79%

InterCoG: Towards Spatially Precise Image Editing with Interleaved Chain-of-Grounding Reasoning

InterCoG:迈向空间精确图像编辑的交错链式 grounding 推理

Yecong Wan, Fan Li, Chunwei Wang, Hao Wu, Mingwen Shao, Wangmeng Zuo

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Zhengzhou Advanced Research Institute of Harbin Institute of Technology(哈尔滨工业大学郑州先进研究院) Huawei Noah’s Ark Lab(华为诺亚实验室) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出InterCoG框架,通过文本与视觉的交错链式推理实现复杂场景中精细图像编辑,结合文本空间关系和视觉定位提升编辑精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00707 2026-05-04 cs.CV 79%

PhysEdit: Physically-Consistent Region-Aware Image Editing via Adaptive Spatio-Temporal Reasoning

PhysEdit: 一种通过自适应时空推理实现物理一致的区域感知图像编辑

Guandong Li, Mengxia Ye

机构 * iFLYTEK Aegon THTF

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 PhysEdit通过自适应时空推理实现物理一致的区域感知图像编辑,提升编辑效率和准确性,适用于不同复杂度的图像编辑任务。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23763 2026-05-01 cs.CV 79%

Edit Where You Mean: Region-Aware Adapter Injection for Mask-Free Local Image Editing

在需要的地方编辑:区域感知的适配器注入用于无掩码的局部图像编辑

Honghao Cai, Xiangyuan Wang, Yunhao Bai, Haohua Chen, Tianze Zhou, Runqi Wang, Wei Zhu, Yibo Chen, Xu Tang, Yao Hu, Zhen Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Tsinghua University(清华大学) Peking University(北京大学) Xiaohongshu Inc.(小红书公司)

专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出AdaptEdit框架,通过区域感知适配器实现无掩码的局部图像编辑,结合轻量级Block Adapter和SpatialGate提升编辑精度,同时通过Region-Aware Loss优化训练目标,实现无需用户掩码的高质量编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25477 2026-04-29 cs.CV cs.AI 79%

DDA-Thinker: Decoupled Dual-Atomic Reinforcement Learning for Reasoning-Driven Image Editing

DDA-Thinker: 解耦双原子强化学习用于推理驱动的图像编辑

Hanqing Yang, Qiang Zhou, Yongchao Du, Sashuai Zhou, Zhibin Wang, Jun Song, Tiezheng Ge, Cheng Yu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出DDA-Thinker框架,通过解耦的规划模块与固定生成模型,提升图像编辑中的推理能力,采用双原子强化学习分解反馈,结合可验证检查清单提升训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22868 2026-04-28 cs.CV cs.AI 79%

Probing Visual Planning in Image Editing Models

探测图像编辑模型中的视觉规划

Zhimu Zhou, Yanpeng Zhao, Qiuyu Liao, Bo Zhao, Xiaojian Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出EAR框架,通过抽象谜题和生成数据集AMAZE,评估图像编辑模型的视觉规划能力,发现模型在零样本设置下表现不佳,但微调后能有效泛化。

Comments Accepted to ES-Reasoning Workshop @ ICLR 2026. Our code is available at https://github.com/spatigen/amaze

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09386 2026-04-13 cs.CV 79%

Region-Constrained Group Relative Policy Optimization for Flow-Based Image Editing

区域约束的群相对策略优化用于基于流的图像编辑

Zhuohan Ouyang, Zhe Qian, Wenhuo Cui, Chaoqun Wang

机构 * South China Normal University(华南师范大学) South China Agricultural University(华南农业大学) Monash University(莫纳什大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出RC-GRPO-Editing框架,通过区域约束的GRPO后训练提升流基图像编辑中目标区域指令遵循和非目标区域保留。

详情

展开后加载摘要…

URL PDF HTML 收藏