arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-20 至 2026-05-20 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 5 篇

2605.19319 2026-05-20 cs.CV 83%

SWEET: Sparse World Modeling with Image Editing for Embodied Task Execution

SWEET:基于图像编辑的稀疏世界建模用于具身任务执行

Yiren Song, Yihan Wang, Xiyao Deng, Zhuoran Yan, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) Central South University(中南大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文研究图像编辑模型能否作为稀疏视觉世界模型用于机器人操作,通过预测任务级未来状态而非密集视频生成,提出SWEET框架实现稀疏视觉规划,结合语言指令和空间引导生成关键帧,并通过扩散动作预测器生成可执行动作,实验表明其在不同场景中提升关键帧预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19511 2026-05-20 cs.CV 79%

Are Watermarked Images Editable? SafeMark for Watermark-Preserving Text-Guided Image Editing

水印图像可编辑吗?SafeMark用于水印保持的文本引导图像编辑

Xiaodong Wu, Qi Li, Xiangman Li, Zelin Zhang, Lingshuang Liu, Jianbing Ni

机构 * Queen’s University(皇后大学) University of Waterloo(滑铁卢大学)

专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV

AI总结 本文研究了一个基础但未被充分探索的问题:水印图像能否在不损害水印完整性的情况下保持可编辑?我们提出了SafeMark框架,该框架在图像编辑过程中显式地将水印完整性整合进去。具体来说,SafeMark将阈值化的水印解码损失直接添加到扩散编辑器的训练目标中,微调编辑器,使得语义上有效的编辑也能够在最终输出中保留嵌入的水印。这种设计具有清晰的信息论依据:在编辑图像上保持高比特准确性下限界了编辑通道所保持的水印与编辑输出之间的互信息,这一量根本控制着水印恢复能力。SafeMark与可微扩散编辑器兼容,不需要架构修改。在多个数据集、文本引导编辑方法和编辑后失真设置上的广泛评估表明,SafeMark在多种编辑设置中实现了高水印比特准确性,同时保持高质量的语义编辑,而不会牺牲对常见编辑后失真的鲁棒性。这些结果表明,语义可编辑性和水印完整性本质上是兼容的,使生成编辑管道中的图像溯源变得可信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23622 2026-05-20 cs.CV cs.AI 79%

DLEBench: Evaluating Small-scale Object Editing Ability for Instruction-based Image Editing Model

DLEBench: 评估基于指令的图像编辑模型在小规模物体编辑能力

Shibo Hong, Boxian Ai, Jun Kuang, Wei Wang, FengJiao Chen, Zhongyuan Peng, Chenhao Huang, Yixin Cao

机构 * College of Computer Science(计算机科学学院) Artificial Intelligence(人工智能) Fudan University(复旦大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出DLEBench,首个专门评估基于指令的图像编辑模型在小规模物体编辑能力的基准,通过1889个样本覆盖复杂场景,揭示了现有模型在小物体编辑上的性能差距,强调了专用基准的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18993 2026-05-20 cs.CV cs.AI cs.GR 73%

FreeOrbit4D: Training-Free Arbitrary Camera Redirection for Monocular Videos via Foreground-Complete 4D Reconstruction

FreeOrbit4D: 通过前景完整4D重建实现免训练的任意相机重定向

Wei Cao, Hao Zhang, Fengrui Tian, Yulun Wu, Yingying Li, Shenlong Wang, Ning Yu, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pennsylvania(宾夕法尼亚大学) Eyeline Labs(Eyeline实验室)

专题命中 图像编辑 :diffusion(abstract,abstract_cn);分类 cs.CV、cs.GR

AI总结 本文提出FreeOrbit4D,一种无需训练的框架,通过恢复完整的前景4D代理来解决大角度重定向中的几何模糊问题,从而生成更真实且时间一致的视频。

Comments 12 pages, 10 figures. Accepted to SIGGRAPH Conference Papers 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20174 2026-05-20 cs.CV cs.LG 70%

Multi-axis Analysis of Image Manipulation Localization

多轴分析图像操纵定位

Keanu Nichols, Divya Appapogu, Giscard Biamby, Dina Bashkirova, Anna Rohrbach, Bryan A. Plummer

机构 * Boston University(波士顿大学) University of California, Berkeley(加州大学伯克利分校) Technical University of Darmstadt(德累斯顿技术大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出AUDITS基准,用于多轴分析图像操纵检测,通过不同领域转移类型评估现有方法的鲁棒性,以推动更可靠和通用的图像操纵检测方法的发展。

Comments 28 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏