arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86585 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1264 篇

2302.06588 2023-02-14 cs.LG 82%

Raising the Cost of Malicious AI-Powered Image Editing

Hadi Salman, Alaa Khaddaj, Guillaume Leclerc, Andrew Ilyas, Aleksander Madry

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25578 2026-07-21 cs.CV 版本更新 81%

H-Adapter: Pose-Robust Hairstyle Transfer via Attention-Derived, Source-Aligned Hair Masks

H-Adapter: 通过注意力导出的源对齐头发掩码实现姿态鲁棒的发型迁移

Seulgi Jeong, Yunseong Cho, Sanghun Park

机构 * SNOW Corp.(SNOW公司)

专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);diffusion(abstract);inpainting(abstract)

AI总结 提出H-Adapter,利用区域特定损失解耦头发与非头发目标,导出源对齐头发编辑掩码引导扩散修复,实现大姿态差异下的鲁棒发型迁移,在FID、FID_CLIP和CLIP-I指标上取得最优。

Comments Accepted at ECCV 2026. Project page: https://sanghunpark.github.io/hadapter_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16794 2024-04-15 cs.CV 81%

ZONE: Zero-Shot Instruction-Guided Local Editing

Shanglin Li, Bohan Zeng, Yutang Feng, Sicheng Gao, Xuhui Liu, Jiaming Liu, Li Lin, Xu Tang, Yao Hu, Jianzhuang Liu, Baochang Zhang

专题命中 图像编辑 :text-to-image(abstract);diffusion(abstract);image editing(abstract);image synthesis(abstract)

Comments Accepted at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04372 2024-04-02 cs.CV cs.CL 81%

MoEController: Instruction-based Arbitrary Image Manipulation with Mixture-of-Expert Controllers

Sijia Li, Chen Chen, Haonan Lu

专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);image synthesis(abstract)

Comments 6 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02059 2026-08-04 cs.CV cs.MM 新提交 81%

MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing

MIEScore:面向多源图像编辑的人类对齐评估方法

Zitong Xu, Huiyu Duan, Xinyun Zhang, Weifei Xiong, Tianyi Zheng, Xiongkuo Min, Qiang Hu, Zhengxue Cheng, Bo Li, Guangtao Zhai

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.MM

AI总结 针对多源图像编辑(MIE)缺乏人类对齐评估基准的问题,研究构建了首个MIE基准MIE-Bench,并提出基于MLLM的评估模型MIEScore,其对齐人类偏好性能最优且泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16457 2026-06-16 cs.CV cs.GR 新提交 81%

ResEdit: Residual embeddings for precise generative image editing

ResEdit:用于精确生成式图像编辑的残差嵌入

Ahmet Canberk Baykal, Valentin Deschaintre, Yannick Hold-Geoffroy, Michael Fischer, Anna Frühstück, Cengiz Öztireli, Iliyan Georgiev

机构 * Adobe Research(Adobe研究院) University of Cambridge(剑桥大学)

专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出残差图像编码作为额外条件,结合梯度反转优化策略,在保持图像身份和全局一致性的同时实现高保真精确编辑。

Comments Accepted to the EGSR 2026 journal track

Journal ref Computer Graphics Forum 45(4), e70551 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00122 2026-06-12 cs.CV cs.AI cs.MM 版本更新 81%

VDE Bench: Evaluating The Capability of Image Editing Models to Modify Visual Documents

VDE Bench: 评估图像编辑模型对视觉文档进行修改的能力

Hongzhu Yi, Yujia Yang, Yuanxiang Wang, Tong Li, Zhenyu Guan, Tianyu Zong, Jiahuan Chen, Chenxi Bao, Tiankun Yang, Haopeng Jin, Yixuan Yuan, Xinming Wang, Tao Yu, Ruilin Gao, Ruiwen Tao, Haijin Liang, Jin Ma, Jinwen Luo, Yeshani, Xinyu Zuo, Jungang Xu

机构 * UCAS(中国科学院大学) CASIA(中国科学院自动化研究所) Tencent(腾讯) CMU(卡内基梅隆大学) WashU(华盛顿大学) SJTU(上海交通大学) XDU(北京理工大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出VDE Bench,一个专门评估图像编辑模型在双语中文-英文和复杂视觉文档编辑任务性能的基准,通过高质量数据集和新的评估框架,系统量化了文本修改的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00801 2026-06-04 cs.CV cs.MM 81%

Med-Banana: Learning Quality-Controlled Medical Image Editing from Success-and-Failure Trajectories

Med-Banana:从成功与失败轨迹中学习质量可控的医学图像编辑

Zhihui Chen, Qingyuan Lei, Kai He, Yanrui Du, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.MM

AI总结 提出Med-Banana框架,通过收集成功与失败编辑轨迹数据集Med-Banana-80K,联合训练编辑器、验证器和优化器,实现质量可控的医学图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24625 2026-04-28 cs.CV cs.AI cs.LG cs.MM 81%

Meta-CoT: Enhancing Granularity and Generalization in Image Editing

Meta-CoT:提升图像编辑的粒度与泛化能力

Shiyi Zhang, Yiji Cheng, Tiankai Hang, Zijin Yin, Runze He, Yu Xu, Wenxun Dai, Yunlong Lin, Chunyu Wang, Qinglin Lu, Yansong Tang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Hunyuan, Tencent(腾讯 Hunyuan)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.MM

AI总结 Meta-CoT通过双重分解提升图像编辑的粒度和泛化能力,通过任务-目标-理解能力三元组分解和五元基本元任务训练策略,显著提高编辑性能。

Comments Accepted by CVPR2026, Project Page: https://shiyi-zh0408.github.io/projectpages/Meta-CoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29602 2026-04-01 cs.GR cs.AI cs.CV cs.MA 81%

IMAGAgent: Orchestrating Multi-Turn Image Editing via Constraint-Aware Planning and Reflection

IMAGAgent:通过约束感知规划与反思协调多轮图像编辑

Fei Shen, Chengyu Xie, Lihong Wang, Zhanyi Zhang, Xin Jiang, Xiaoyu Du, Jinhui Tang

机构 * National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学) Nanjing Forestry University(南京林业大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.GR

AI总结 IMAGAgent通过闭环机制整合指令解析、工具调度与自适应修正,解决多轮图像编辑中的上下文感知与反馈问题,提升编辑精度与整体质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14916 2026-03-17 cs.CV cs.MM 81%

EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing

EditHF-1M: 一个百万级的丰富人类偏好反馈用于图像编辑

Zitong Xu, Huiyu Duan, Zhongpeng Ji, Xinyun Zhang, Yutao Liu, Xiongkuo Min, Ke Gu, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) University of Electronic and Science Technology of China(电子科技大学) Ocean University of China(海洋大学) Beijing University of Technology(北京理工大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出EditHF-1M百万级图像编辑数据集及基于其的EditHF评估模型和EditHF-Reward奖励模型,通过强化学习优化文本引导图像编辑模型,实验表明其在对齐人类偏好和泛化能力方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04280 2025-05-07 cs.CV cs.GR 81%

HumanEdit: A High-Quality Human-Rewarded Dataset for Instruction-based Image Editing

Jinbin Bai, Wei Chow, Ling Yang, Xiangtai Li, Juncheng Li, Hanwang Zhang, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Skywork AI Peking University(北京大学) Nanyang Technological University(南洋理工大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.GR

Comments Accepted to CVPR 2025 AI for Content Creation (AI4CC) Workshop. Codes and Supplementary Material: https://github.com/viiika/HumanEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15007 2024-10-22 cs.CV cs.MM 81%

DiffuseST: Unleashing the Capability of the Diffusion Model for Style Transfer

Ying Hu, Chenyi Zhuang, Pan Gao

专题命中 图像编辑 :diffusion(title,abstract);分类 cs.CV、cs.MM

Comments Accepted to ACMMM Asia 2024. Code is available at https://github.com/I2-Multimedia-Lab/DiffuseST

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06646 2024-08-08 cs.GR cs.CV 81%

Diffusion-based Human Motion Style Transfer with Semantic Guidance

Lei Hu, Zihao Zhang, Yongjing Ye, Yiwen Xu, Shihong Xia

专题命中 图像编辑 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18660 2024-03-28 cs.GR cs.CV 81%

InstructBrush: Learning Attention-based Instruction Optimization for Image Editing

Ruoyu Zhao, Qingnan Fan, Fei Kou, Shuai Qin, Hong Gu, Wei Wu, Pengcheng Xu, Mingrui Zhu, Nannan Wang, Xinbo Gao

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.GR

Comments Project Page: https://royzhao926.github.io/InstructBrush/

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.11073 2023-07-21 cs.CV cs.AI cs.GR 81%

OBJECT 3DIT: Language-guided 3D-aware Image Editing

Oscar Michel, Anand Bhattad, Eli VanderBilt, Ranjay Krishna, Aniruddha Kembhavi, Tanmay Gupta

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.01160 2022-08-23 cs.CV cs.MM 81%

DE-Net: Dynamic Text-guided Image Editing Adversarial Networks

Ming Tao, Bing-Kun Bao, Hao Tang, Fei Wu, Longhui Wei, Qi Tian

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.00180 2021-12-02 cs.CV cs.GR 81%

SpaceEdit: Learning a Unified Editing Space for Open-Domain Image Editing

Jing Shi, Ning Xu, Haitian Zheng, Alex Smith, Jiebo Luo, Chenliang Xu

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.14825 2021-11-30 cs.CV cs.GR cs.LG 81%

Latent Transformations via NeuralODEs for GAN-based Image Editing

Valentin Khrulkov, Leyla Mirvakhabova, Ivan Oseledets, Artem Babenko

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.GR

Comments Published at ICCV 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.11159 2021-10-22 cs.CV cs.LG cs.MM 81%

Each Attribute Matters: Contrastive Attention for Sentence-based Image Editing

Liuqing Zhao, Fan Lyu, Fuyuan Hu, Kaizhu Huang, Fenglei Xu, Linyan Li

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by BMVC 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.12799 2020-12-04 cs.CV cs.GR cs.LG 81%

StyleSpace Analysis: Disentangled Controls for StyleGAN Image Generation

Zongze Wu, Dani Lischinski, Eli Shechtman

专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV、cs.GR

Comments 25 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.00986 2020-01-07 cs.CV cs.GR eess.IV 81%

Inverse Rendering Techniques for Physically Grounded Image Editing

Kevin Karsch

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.GR

Comments PhD thesis, Computer Science, University of Illinois at Urbana-Champaign, 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.08972 2018-06-08 cs.CV cs.GR 81%

FaceShop: Deep Sketch-based Face Image Editing

Tiziano Portenier, Qiyang Hu, Attila Szabó, Siavash Arjomand Bigdeli, Paolo Favaro, Matthias Zwicker

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.GR

Comments 13 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01915 2026-01-06 cs.CV 80%

TalkPhoto: A Versatile Training-Free Conversational Assistant for Intelligent Image Editing

TalkPhoto: 一种多功能的无需训练的对话式智能图像编辑助手

Yujie Hu, Zecheng Tang, Xu Jiang, Weiqi Li, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 TalkPhoto通过对话交互实现无需训练的多功能图像编辑,利用提示模板分层调用现有高级编辑方法,提升编辑精度与质量。

Comments a Conversational Assistant for Intelligent Image Editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12149 2024-03-19 cs.CV 80%

Object-aware Inversion and Reassembly for Image Editing

Zhen Yang, Ganggui Ding, Wen Wang, Hao Chen, Bohan Zhuang, Chunhua Shen

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV;diffusion(comments)

Comments Project Page: https://aim-uofa.github.io/OIR-Diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12289 2026-08-21 cs.CV cs.AI cs.HC 版本更新 79%

Regressor-Guided Image Editing Shifts Emotion and Disengagement Timing in Social Media

回归引导的生成图像编辑通过平衡用户情绪以减少在线时间

Christoph Gebhardt, Robin Willardt, Seyedmorteza Sadat, Chih-Wei Ning, Andreas Brombach, Jie Song, Otmar Hilliges, Christian Holz

机构 * Eastern Switzerland University of Applied Sciences \& ETH Z\"urich St.Gallen Switzerland ETH Z\"urich Z\"urich Switzerland The Hong Kong University of Science Eastern Switzerland University of Applied Sciences \& ETH Z\"urich ETH Z\"urich

专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出回归引导的生成图像编辑方法,通过调节图像情感影响以非强制性减少用户在线时间,实验表明该方法能平衡情绪反应并降低使用时长。

Comments 40 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14546 2026-08-19 cs.CV 版本更新 79%

CPI-Bench: A Comprehensive, Practical and Intelligent Benchmark for Real-World Image Editing

CPI-Bench:面向真实世界图像编辑的综合、实用且智能的基准测试

Qinye Zhou, Jun Zheng, Yongchao Du, Yuan Wang, Zhengrui Chen, Zuan Gao, Taihang Hu, Chao Lin, Yefeng Shen, Xingjian Wang, Zhao Wang, Zhengtao Wu, Xiaoli Xu, Zhengze Xu, Hao Yan, Denghui Yang, Yuhang Yu, Huayu Zhang, Mingzhou Zhang, Mengting Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 该研究针对现有图像编辑基准测试的局限,提出CPI-Bench这一综合实用的智能基准,其含三个核心子集,可有效区分模型性能,与人类评估偏好高度对齐,为模型优化提供指导。

Comments 13 pages, benchmark report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24900 2026-08-18 cs.CV cs.AI 版本更新 79%

OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing

OpenGPT-4o-Image:用于高级图像生成与编辑的综合数据集

Zhihong Chen, Xuehai Bai, Yang Shi, Chaoyou Fu, Huanyu Zhang, Haotian Wang, Xiaoyan Sun, Zhang Zhang, Liang Wang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang

机构 * USTC(中国科学技术大学) Kling Team(Kling团队) HDU(华中科技大学) PKU(北京大学) NJU(南京大学) CASIA(中国科学院自动化研究所) THU(清华大学)

专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV

AI总结 该研究构建了涵盖11个领域51个子任务的OpenGPT-4o-Image数据集,经其微调主流模型后,图像编辑任务性能最高提升18%、生成任务最高提升13%,证实系统化数据构建对多模态AI的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12122 2026-08-13 cs.RO cs.CV 新提交 79%

HandEdit: A Unified Benchmark for Egocentric Human-to-Robot Dexterous Hand Image Editing

HandEdit:用于自我中心视角下人类到机器人灵巧手图像编辑的统一基准

Zhenjie Yang, Xingyu Jiao, Guopeng Zhong, Shuzhe Yang, Shi Che, Chao Wu, Chenyu Jiang, Dongjie Zhang, Yideng Zhang, Zheng Zhang, Muyun Jiang, Haisheng Su, Shuang Jin, Donghang Zhang, Chao Yang, Li Chen, Hongyang Li, Zuxuan Wu, Yu-Gang Jiang, Xiaosong Jia, Junchi Yan

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 HandEdit是含2亿+实例、覆盖26种URDF的统一具身感知图像编辑基准,用于弥合人类与机器人数据差异,可评估11种图像编辑基线,助力具身人工智能发展。

Comments Technical Report. Project Page: https://handedit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06929 2026-08-12 cs.CV cs.AI 版本更新 79%

MaskFlow: Precise, Consistent and Seamless Regional Image Editing

MaskFlow:精准、一致且无缝的区域图像编辑

Rui Xu, Yang Yong, Shunzi Yang, Ruihao Gong, Chengtao Lv

机构 * SenseTime Research(商汤科技研究院) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 MaskFlow框架通过融合掩码的流匹配目标与Soft-Poisson去接缝模块,结合MEData数据集,实现了精准可控、无缝融合的区域图像编辑,性能优于现有方法。

Comments 18 pages, 6 figures. Project page: https://reychiaro.github.io/MaskFlow

详情

展开后加载摘要…

URL PDF HTML 收藏