arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86585 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1264 篇

2607.16898 2026-08-04 cs.CV cs.CL cs.CR 版本更新 83%

Cross-Branch Conflict as a Shield: Safeguarding Facial Identities in Unified Multimodal Image Editing

跨分支冲突作为一种保护手段:在统一多模态图像编辑中保护面部身份

Weiwei Tan, Junxian Li, Rui Wang, Zhenhua Xu, Yanjun Zhang, Yu Leo Zhang

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 研究统一多模态模型中个人肖像编辑的安全问题,提出CCS统一对抗保护框架,通过联合驱动ViT和VAE表示及破坏跨分支兼容性,防止模型恢复身份信息,在抑制身份保留编辑上表现优于现有方法。

Comments 14 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29367 2026-08-03 cs.CV 新提交 83%

SatEdit: Mask-Conditioned Image Editing via VLM-Guided Segment Annotation

SatEdit:基于VLM引导的区域标注的掩码条件卫星图像编辑

Muhammad Talha, Muhammad Ahmed Amer

专题命中 图像编辑 :image editing(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 SatEdit是基于VLM引导区域标注的卫星图像编辑框架,通过未标注图像构建监督信号,经LoRA微调后在对比中实现最高掩码区域语义对齐,为卫星图像编辑提供了数据高效的可行方案。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10800 2026-07-14 cs.CV 新提交 83%

h-Flow: Flexible Flow-based Image Editing via Doob's h-Transform

h-Flow:通过杜布h变换实现基于灵活流的图像编辑

Zehui Guo, Zhen Wang, Junwei Shu, Yang Li, Changbo Wang, Long Chen

机构 * East China Normal University(华东师范大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出h-Flow,一个无需训练且基于理论的基于流的图像编辑框架。受杜布h变换启发,将图像编辑重述为条件生成,通过构建等效SDE扩展h变换,设计专用h函数并引入速度正交分解,实现有效、稳健且灵活的图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17565 2026-06-29 cs.CV 版本更新 83%

UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models

UniGeo:通过视频模型统一几何指导以实现相机可控的图像编辑

Hong Jiang, Wensong Song, Zongxin Yang, Ruijie Quan, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学) DBMI, HMS, Harvard University(DBMI、HMS、哈佛大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 UniGeo通过统一的几何指导在三个层面提升相机可控图像编辑的几何一致性与视觉质量,克服传统方法在连续相机运动下的几何漂移和结构退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26947 2026-06-26 cs.CV cs.AI 新提交 83%

Scaling Multi-Reference Image Generation with Dynamic Reward Optimization

缩放多参考图像生成与动态奖励优化

Wenwang Huang, Yusen Fu, Junjie Wang, Mengfei Huang, Yulin Li, Gan Liu, Jing Cai, Yancheng He, Zhuotao Tian

机构 * Harbin Institute of Technology(哈尔滨工业大学) Independent Researcher(独立研究者) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 图像编辑 :image generation(title,abstract);image editing(abstract);分类 cs.CV

AI总结 提出OmniRef-Bench基准和DyRef两阶段训练框架,通过动态奖励优化解决多参考图像生成中参考图像类型和数量增加导致的性能下降问题。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18906 2026-06-18 cs.CV 新提交 83%

BindEdit: Taming Attention Leakage for Precise Multi-Object Image Editing

BindEdit: 驯服注意力泄漏以实现精确的多目标图像编辑

Chaewon Park, Soyoon Lee, Naeun Lee, Minjung Shin, Seogkyu Jeon, Kibeom Hong

机构 * Sookmyung Women’s University(成均女性大学) Yonsei University(延世大学) Samsung Research(三星研究院)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 针对多目标图像编辑中的语义混合和对象重复问题,提出BindEdit方法,通过联合正则化交叉注意力和自注意力、交叉注意力重平衡机制及区域保真项,在单次扩散轨迹内抑制注意力泄漏,实现精确编辑。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11751 2026-06-16 cs.CV cs.AI 新提交 83%

AnchorEdit: Maintaining Temporal Consistency in Multi-turn Image Editing via Causal Memory

AnchorEdit: 通过因果记忆在多轮图像编辑中保持时间一致性

Hang Xu, Xiaoxiao Ma, Guohui Zhang, Yu Hu, Siming Fu, Jie Huang, Lin Song, Haoyang Huang, Nan Duan, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) JD Explore Academy(京东探索研究院)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出首个自回归扩散框架AnchorEdit,通过因果记忆机制和自展开策略解决多轮编辑中的身份漂移和误差累积问题,在10轮以上交互中保持高保真度。

Comments Code: https://github.com/xuhang07/AnchorEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13898 2026-06-15 cs.CV cs.AI 新提交 83%

HiLo-Token: Input-Adaptive High-Low Frequency Token Compression for Efficient Image Editing

HiLo-Token: 输入自适应的高低频令牌压缩用于高效图像编辑

Haoran You, Yotam Nitzan, Lingzhi Zhang, Yifan Gong, Mang-Tik Chiu, Connelly Barnes, Yan Kang, Yuqian Zhou, Eli Shechtman, Sohrab Amirghodsi

机构 * Adobe ART AI Lab(Adobe ART AI实验室) Adobe Research(Adobe研究院)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 针对扩散变换器(DiT)在图像编辑中延迟高的问题,提出输入自适应的令牌压缩框架HiLo-Token,根据空间频率分配令牌预算,在保持生成质量的同时实现高达3.13倍加速。

Comments 14 pages, 10 figures, Patent filled

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05172 2026-06-05 cs.HC cs.CV 83%

Is This Edit Correct? A Multi-Dimensional Benchmark for Reasoning-Aware Image Editing

这个编辑正确吗?面向推理感知图像编辑的多维度基准

Yixuan Ding, Wei Huang, Ruijie Quan, Xiaojuan Qi, Yi Yang

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出RE-Edit基准,从物理、环境、文化、因果和指代五个推理维度评估图像编辑系统,发现现有模型在隐式逻辑约束推理上存在不足,并引入轻量级推理引导后编辑基线。

Comments 23 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02417 2026-05-28 cs.CV 83%

DirectEdit: Step-Level Accurate Inversion for Flow-Based Image Editing

DirectEdit: 基于流的图像编辑的逐步骤精确反演

Desong Yang, Mang Ye

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University, Wuhan, China(多媒体软件国家工程研究中心,计算机科学学院,武汉大学,中国武汉)

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出DirectEdit方法,通过直接对齐前向路径消除反演过程中的累积漂移,实现精确重建和可靠特征共享,无需额外神经函数评估,在多种场景下优于现有方法。

Comments ICML 2026. Project page: https://desongyang.github.io/Directedit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21190 2026-05-26 cs.CV 83%

Semantic Granularity Navigation in Image Editing

图像编辑中的语义粒度导航

Liangsi Lu, Minzhe Guo, Xuhang Chen, Yang Shi

机构 * Guangdong University of Technology, Guangzhou, China(广东工业大学,广州,中国) Huizhou University, Huizhou, China(惠州市大学,惠州,中国)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出NaviEdit,一种无需训练、推理时控制的解耦方法,通过自一致性约束将编辑进度与模型尺度解耦,在保持结构保真度的同时提升语义可编辑性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04513 2026-05-26 cs.GR cs.NA math.NA physics.app-ph 83%

Fidelity-preserving enhancement of ptychography with foundational text-to-image models

基于基础文本到图像模型的叠层衍射成像保真增强

Ming Du, Volker Rose, Junjing Deng, Dileep Singh, Si Chen, Mathew J. Cherukara

专题命中 图像编辑 :text-to-image(title);diffusion(abstract);image editing(abstract);分类 cs.GR

AI总结 提出一种即插即用框架,结合基于物理模型的相位恢复与文本引导的扩散模型图像编辑,通过交替方向乘子法保持数据保真度并消除伪影,显著提升叠层衍射成像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19319 2026-05-20 cs.CV 83%

SWEET: Sparse World Modeling with Image Editing for Embodied Task Execution

SWEET:基于图像编辑的稀疏世界建模用于具身任务执行

Yiren Song, Yihan Wang, Xiyao Deng, Zhuoran Yan, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) Central South University(中南大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文研究图像编辑模型能否作为稀疏视觉世界模型用于机器人操作,通过预测任务级未来状态而非密集视频生成,提出SWEET框架实现稀疏视觉规划,结合语言指令和空间引导生成关键帧,并通过扩散动作预测器生成可执行动作,实验表明其在不同场景中提升关键帧预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13708 2026-05-19 cs.CV 83%

RSEdit: Text-Guided Image Editing for Remote Sensing

RSEdit:面向遥感的文本引导图像编辑

Chen Zhenyuan, Zhang Zechuan, Zhang Feng

机构 * School of Earth Sciences, Zhejiang University(浙江大学地球科学学院) Zhejiang Provincial Key Laboratory of Geographic Information Science(浙江省地理信息科学重点实验室) Key Laboratory of Spatio-temporal Information and Intelligent Services (LSIIS), Ministry of Natural Resources of the People’s Republic of China(中华人民共和国自然资源部时空信息与智能服务重点实验室) ReLER, CCAI, Zhejiang University(ReLER,中国人工智能学会,浙江大学)

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出RSEdit,一种基于生成模型的遥感图像编辑方法,通过研究文本到图像模型的条件策略,实现了在保持地理空间结构的同时,生成指令忠实的图像编辑结果。

Comments accepted by IEEE GRSL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22244 2026-05-19 cs.CV 83%

FlashEdit: Decoupling Speed, Structure, and Semantics for Precise Image Editing

FlashEdit: 解耦速度、结构和语义以实现精确图像编辑

Junyi Wu, Zhiteng Li, Haotong Qin, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出FlashEdit,一种高效的局部图像编辑框架,通过解耦速度、结构和语义来实现精确编辑,实验表明其在保真度和效率之间取得了良好的平衡。

Comments Our code will be made publicly available at https://github.com/JunyiWuCode/FlashEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14948 2026-05-15 cs.CV 83%

ACE-LoRA: Adaptive Orthogonal Decoupling for Continual Image Editing

ACE-LoRA:适应性正交解耦用于持续图像编辑

Yuehao Liu, Weijia Zhang, Xuanming Shang, Zhizhou Chen, Yanhao Ge, Shanyan Guan, Chao Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) VIVO

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 ACE-LoRA通过动态正则化框架解决持续图像编辑中的灾难性遗忘问题,采用适应性正交解耦和历史信息压缩策略,提出首个全面的CIE-Bench基准,验证方法在指令忠实度、视觉真实性和抗遗忘性上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13349 2026-05-14 cs.CV 83%

Drag within Prior Distribution: Text-Conditioned Point-Based Image Editing within Distribution Constraints

在先验分布中进行拖拽:基于文本的点基图像编辑在分布约束内

Haoyang Hu, Masataka Seo, Yen-Wei Chen

机构 * Ritsumeikan University, Graduate School of Information(日光大学信息工程研究生院) Engineering, Osaka Institute of Technology(工程学,大阪技术学院)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出基于CLIP模型的编辑引导方法和先验保留损失,以提高图像编辑的语义一致性和生成质量,同时减少编辑时间。

Comments ICASSP 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13122 2026-05-14 cs.CV 83%

Early Semantic Grounding in Image Editing Models for Zero-Shot Referring Image Segmentation

图像编辑模型中的早期语义接地用于零样本指引用图像分割

Jingxuan He, Xiyu Wang, Yunke Wang, Mengyu Zheng, Chang Xu

机构 * The University of Sydney(悉尼大学)

专题命中 图像编辑 :image editing(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文探讨利用图像编辑模型的隐含语义接地能力进行零样本指引用图像分割,通过分析发现早期去噪步骤即可实现前景背景分离,提出无需训练的框架利用预训练模型的中间表示进行分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10859 2026-05-12 cs.CV cs.LG 83%

Masked Generative Transformer Is What You Need for Image Editing

你需要Masked Generative Transformer来进行图像编辑

Wei Chow, Linfeng Li, Xian Sun, Lingdong Kong, Zefeng Li, Qi Xu, Hang Song, Tian Ye, Xian Wang, Jinbin Bai, Shilin Xu, Xiangtai Li, Junting Pan, Shaoteng Liu, Ran Zhou, Tianshu Yang, Songhua Liu

机构 * ByteDance(字节跳动) National University of Singapore(新加坡国立大学) Duke University(杜克大学) Shanghai Jiao Tong University(上海交通大学) HKUST(GZ)(香港科技大学(广州))

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出EditMGT框架,利用Masked Generative Transformers实现局部化编辑,通过多层注意力整合和区域保持采样提升编辑精度,使用CrispEdit-2M数据集在多个基准上取得最佳性能。

Comments CVPR 2026 HiGen Workshop; Project Page at https://weichow23.github.io/EditMGT/ GitHub at https://github.com/weichow23/EditMGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10319 2026-05-12 cs.CV 83%

LimeCross: Context-Conditioned Layered Image Editing with Structural Consistency

LimeCross:基于结构一致性的上下文条件分层图像编辑

Ryugo Morita, Stanislav Frolov, Brian Bernhard Moser, Ko Watanabe, Riku Takahashi, Issey Sukeda, Andreas Dengel

机构 * RPTU Kaiserslautern-Landau \& DFKI GmbH, Kaiserslautern, Germany Faculty of Science Engineering, Hosei University, Tokyo, Japan EQUES, Tokyo, Japan

专题命中 图像编辑 :image editing(title,abstract);image generation(abstract);分类 cs.CV

AI总结 LimeCross通过上下文条件分层图像编辑框架,实现基于文本的可控编辑,保持结构一致性,提升图像合成的真实性和透明度稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07455 2026-05-11 cs.CV 83%

EditTransfer++: Toward Faithful and Efficient Visual-Prompt-Guided Image Editing

EditTransfer++:迈向精确且高效的视觉提示引导图像编辑

Lan Chen, Qi Mao, Yiren Song, Yuchao Gu, Siwei Ma

机构 * School of Information and Communication Engineering and the State Key Laboratory of Media Convergence and Communication, Communication University of China(信息与通信工程学院和媒体融合与通信国家重点实验室,中国传媒大学) ShowLab, National University of Singapore(新加坡国立大学ShowLab)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 EditTransfer++通过渐进式结构训练和高效条件方案提升视觉提示的准确性与推理效率,结合文本解耦训练和对比细化机制,实现更稳定的图像编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01480 2026-05-05 cs.CV 83%

AttnRouter: Per-Category Attention Routing for Training-Free Image Editing on MMDiT

AttnRouter:基于MMDiT的无训练图像编辑的类别级注意力路由

Guandong Li, Mengxia Ye

机构 * iFLYTEK Aegon THTF

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出AttnRouter,通过类别级路由表优化MMDiT的无训练图像编辑,实验显示其在CLIP-T+DINO-I复合指标上提升6.4%,且自动分类器在仅55%类别准确率下关闭98%的差距。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14978 2026-04-28 cs.CV cs.LG 83%

Learning an Image Editing Model without Image Editing Pairs

无需图像编辑配对学习图像编辑模型

Nupur Kumari, Sheng-Yu Wang, Nanxuan Zhao, Yotam Nitzan, Yuheng Li, Krishna Kumar Singh, Richard Zhang, Eli Shechtman, Jun-Yan Zhu, Xun Huang

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe Research(Adobe研究)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出无需配对数据的图像编辑模型训练方法,通过扩散模型解卷积和视觉语言模型反馈实现端到端优化,同时结合分布匹配损失提升视觉真实性。

Comments project page: https://nupurkmr9.github.io/npedit/ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20258 2026-04-23 cs.CV 83%

Rethinking Where to Edit: Task-Aware Localization for Instruction-Based Image Editing

重新思考编辑位置:面向任务的指令式图像编辑定位

Jingxuan He, Xiyu Wang, Mengyu Zheng, Xiangyu Zeng, Yunke Wang, Chang Xu

机构 * The University of Sydney(悉尼大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的任务感知编辑定位框架,通过分析源和目标图像流,提升非编辑区域一致性并保持指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19587 2026-04-22 cs.CV 83%

SmartPhotoCrafter: Unified Reasoning, Generation and Optimization for Automatic Photographic Image Editing

SmartPhotoCrafter: 统一推理、生成与优化用于自动摄影图像编辑

Ying Zeng, Miaosen Luo, Guangyuan Li, Yang Yang, Ruiyang Fan, Linxiao Shi, Qirui Yang, Jian Zhang, Chengcheng Liu, Siming Zheng, Jinwei Chen, Bo Li, Peng-Tao Jiang

机构 * vivo BlueImage Lab, vivo Mobile Communication Co., Ltd.(vivo蓝影实验室,vivo移动通信有限公司)

专题命中 图像编辑 :image editing(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出SmartPhotoCrafter,通过统一推理生成过程实现自动摄影图像编辑,提升图像质量与美观,无需人工指令。

Comments tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15948 2026-04-20 cs.CV 83%

From Competition to Coopetition: Coopetitive Training-Free Image Editing Based on Text Guidance

从竞争到协竞:基于文本引导的无训练图像编辑协竞训练方法

Jinhao Shen, Haoqian Du, Xulu Zhang, Xiao-Yong Wei, Qing Li

机构 * Department of Computing, Hong Kong Polytechnic University(香港理工大学计算机系) Department of Computer Science, Sichuan University(四川大学计算机科学系)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出CoEdit,通过将注意力控制从竞争转为协竞谈判,提升图像编辑的时空一致性,引入双熵注意力操控和熵 latent 修正机制,改进可编辑区域定位并增强语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14591 2026-04-17 cs.CV 83%

Prompt-Guided Image Editing with Masked Logit Nudging in Visual Autoregressive Models

基于视觉自回归模型的掩码logit调整的提示引导图像编辑

Amir El-Ghoussani, Marc Hölle, Gustavo Carneiro, Vasileios Belagiannis

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) University of Surrey(萨里大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出掩码logit调整方法,通过调整模型预测logits实现提示引导的图像编辑,保留无关区域,提升编辑质量和重建效果,优于现有方法。

Comments Accepted at the 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Findings (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01986 2026-04-09 cs.CV cs.AI 83%

Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing

Draw-In-Mind: 在统一多模态模型中重新平衡设计师-画家角色有助于图像编辑

Ziyun Zeng, David Junhao Zhang, Wei Li, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab) TikTok

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Draw-In-Mind模型,通过重新分配设计职责提升图像编辑性能,展示了在统一多模态模型中平衡理解与生成模块的重要性。

Comments ICLR 2026 Camera Ready Version; Add more discussions and fix typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03741 2026-04-08 cs.CV 83%

I2E: From Image Pixels to Actionable Interactive Environments for Text-Guided Image Editing

I2E: 从图像像素到可操作的交互环境:用于文本引导的图像编辑

Jinghan Yu, Junhao Xiao, Chenyu Zhu, Jiaming Li, Jia Li, HanMing Deng, Xirui Wang, Guoli Jia, Jianjun Li, Xiang Bai, Bowen Zhou, Zhiyuan Ma

机构 * Huazhong University of Science and Technology(华中科技大学) Kuaishou Technology(快手科技) Central China Normal University(华中师范大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 图像编辑 :image editing(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 I2E提出一种'分解-然后-行动'范式,通过分解器将无结构图像转换为可操作的对象层,并利用物理感知的视觉-语言-行动代理进行复杂指令解析,同时构建I2E-Bench基准测试集,实验表明其在处理复杂组合指令和保持物理合理性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04487 2026-04-07 cs.CV 83%

Training-Free Image Editing with Visual Context Integration and Concept Alignment

无需训练的图像编辑与视觉上下文整合与概念对齐

Rui Song, Guo-Hua Wang, Qing-Guo Chen, Weihua Luo, Tongda Xu, Zhening Liu, Yan Wang, Zehong Lin, Jun Zhang

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) Institute for AI Industry Research (AIR), Tsinghua University(清华大学智能产业研究院(AIR)) School of Data Science, Lingnan University(岭南大学数据科学学院)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出VicoEdit,一种无需训练和反向扩散的图像编辑方法,通过视觉上下文直接转换源图像至目标图像,提升编辑一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏