arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-19 至 2026-05-19 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 7 篇

2603.13708 2026-05-19 cs.CV 83%

RSEdit: Text-Guided Image Editing for Remote Sensing

RSEdit:面向遥感的文本引导图像编辑

Chen Zhenyuan, Zhang Zechuan, Zhang Feng

机构 * School of Earth Sciences, Zhejiang University(浙江大学地球科学学院) Zhejiang Provincial Key Laboratory of Geographic Information Science(浙江省地理信息科学重点实验室) Key Laboratory of Spatio-temporal Information and Intelligent Services (LSIIS), Ministry of Natural Resources of the People’s Republic of China(中华人民共和国自然资源部时空信息与智能服务重点实验室) ReLER, CCAI, Zhejiang University(ReLER,中国人工智能学会,浙江大学)

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出RSEdit,一种基于生成模型的遥感图像编辑方法,通过研究文本到图像模型的条件策略,实现了在保持地理空间结构的同时,生成指令忠实的图像编辑结果。

Comments accepted by IEEE GRSL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22244 2026-05-19 cs.CV 83%

FlashEdit: Decoupling Speed, Structure, and Semantics for Precise Image Editing

FlashEdit: 解耦速度、结构和语义以实现精确图像编辑

Junyi Wu, Zhiteng Li, Haotong Qin, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出FlashEdit,一种高效的局部图像编辑框架,通过解耦速度、结构和语义来实现精确编辑,实验表明其在保真度和效率之间取得了良好的平衡。

Comments Our code will be made publicly available at https://github.com/JunyiWuCode/FlashEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08163 2026-05-19 cs.CV cs.AI cs.CL 79%

MULTITEXTEDIT: Benchmarking Cross-Lingual Degradation in Text-in-Image Editing

MULTITEXTEDIT:跨语言文本-图像编辑中退化程度的基准测试

Liwei Cheng, Shibo Feng, Lunjie Zhou, Yixuan Guan, Dayan Guan

机构 * Harbin Institute of Technology(哈尔滨理工大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出MULTITEXTEDIT基准测试,通过12种语言、5种视觉领域和7种编辑操作的3600个实例,评估跨语言文本-图像编辑中退化问题,引入语言保真度指标并发现模型在文本准确性和脚本保真度上的显著退化。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16951 2026-05-19 cs.CV 79%

Edit-GRPO: A Locality-Preserving Policy Optimization Framework for Image Editing

Edit-GRPO: 一种用于图像编辑的保持局部性的策略优化框架

Shaodong Xu, Zexian Li, Zhendong Wang, Litong Gong, Tiezheng Ge, Wengang Zhou, Bo Zheng, Houqiang Li

机构 * Alibaba Group(阿里巴巴集团)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出Edit-GRPO框架,通过分离编辑与保留目标,解决图像编辑中保持局部性与全局一致性的问题,提升编辑效果并减少上下文扭曲等常见伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00924 2026-05-19 cs.AI 75%

Supervised sparse auto-encoders for interpretable and compositional representations

监督稀疏自编码器用于可解释和组合性表示

Ouns El Harzli, Hugo Wallner, Yoonsoo Nam, Haixuan Xavier Tao

机构 * Department of Computer Science, University of Oxford, Oxford, UK(牛津大学计算机科学系) KAIST AI, Korean Advanced Institute of Science(韩国科学技术高级研究院AI研究所) Independent researcher(独立研究者)

专题命中 图像编辑 :diffusion(abstract,abstract_cn);image editing(abstract)

AI总结 本文提出了一种监督稀疏自编码器,通过结合无约束特征模型和监督学习,解决稀疏自编码器在非光滑性及特征与人类语义对齐方面的不足,实现了组合性泛化和语义图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18748 2026-05-19 cs.CV 57%

Aurora: Unified Video Editing with a Tool-Using Agent

Aurora: 一种基于工具使用的统一视频编辑框架

Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao, Zhenghong Zhou, Hang Hua, Wei Xiong, Jiebo Luo

机构 * MIT-IBM(MIT-IBM研究院) NVIDIA(NVIDIA公司)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Aurora框架,通过结合增强的视觉语言模型(VLM)代理和统一视频扩散变换器,解决视频编辑中的文本和视觉不充分问题,提升了视频编辑的灵活性和准确性。

Comments Code: https://github.com/yeates/Aurora

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16879 2026-05-19 cs.CV 57%

Towards Generalized Image Manipulation Localization via Score-based Model

通过基于分数的模型实现通用图像操纵定位

Yunfei Wang, Bo Du, Zhe Yang, Xin Liu, Zhiyu Lin, Tianxin Xu, Ji-Zhe Zhou

机构 * Sichuan University(四川大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DiffIML框架,通过引入基于分数的生成模型来解决图像操纵定位中的泛化问题,利用结构先验迭代恢复相干掩码,提升模型鲁棒性,并在多个基准测试中证明其优越的泛化能力。

Comments Accepted to ICMR 2026. 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏