arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-26 至 2026-05-26 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 7 篇

2605.21190 2026-05-26 cs.CV 83%

Semantic Granularity Navigation in Image Editing

图像编辑中的语义粒度导航

Liangsi Lu, Minzhe Guo, Xuhang Chen, Yang Shi

机构 * Guangdong University of Technology, Guangzhou, China(广东工业大学,广州,中国) Huizhou University, Huizhou, China(惠州市大学,惠州,中国)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出NaviEdit,一种无需训练、推理时控制的解耦方法,通过自一致性约束将编辑进度与模型尺度解耦,在保持结构保真度的同时提升语义可编辑性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04513 2026-05-26 cs.GR cs.NA math.NA physics.app-ph 83%

Fidelity-preserving enhancement of ptychography with foundational text-to-image models

基于基础文本到图像模型的叠层衍射成像保真增强

Ming Du, Volker Rose, Junjing Deng, Dileep Singh, Si Chen, Mathew J. Cherukara

专题命中 图像编辑 :text-to-image(title);diffusion(abstract);image editing(abstract);分类 cs.GR

AI总结 提出一种即插即用框架,结合基于物理模型的相位恢复与文本引导的扩散模型图像编辑,通过交替方向乘子法保持数据保真度并消除伪影,显著提升叠层衍射成像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25568 2026-05-26 cs.CV 79%

Rethinking Scribble-Guided Image Editing: Generalization, Instruction Adherence, and Multi-Tasking

重新思考涂鸦引导的图像编辑:泛化、指令遵循与多任务

Mingyi Xu, Jinpeng Lin, Min Zhou, Tiezheng Ge, Ming Zeng

机构 * Xiamen University(厦门大学) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 针对涂鸦引导图像编辑在多任务场景下性能不稳定的问题,通过实证研究揭示指令级泛化瓶颈,提出覆盖-真实课程、多任务拼接和编辑聚焦损失三种策略,在VIBE基准上实现单任务和多任务的最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08213 2026-05-26 cs.CV cs.AI 79%

EditCaption: Human-Refined SFT and HAE-DPO for Image Editing Instruction Synthesis

EditCaption: 用于图像编辑指令合成的人工精炼SFT与HAE-DPO

Xiangyuan Wang, Honghao Cai, Yunhao Bai, Chao Hui, Tianze Zhou, Haohua Chen, Hao Shi, Yuling Wu, Yao Hu, Xu Tang, Yibo Chen, Wei Zhu

机构 * Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Xiaohongshu Inc.(小红书公司)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出EditCaption两阶段后训练流程,通过人工精炼SFT和基于难度自适应错误感知DPO(HAE-DPO)提升图像编辑指令合成质量,显著降低关键错误率并超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01382 2026-05-26 cs.CV 79%

Reversible Inversion for Training-Free Exemplar-guided Image Editing

可逆反演用于免训练示例引导图像编辑

Yuke Li, Lianli Gao, Ji Zhang, Pengpeng Zeng, Lichuan Xiang, Hongkai Wen, Heng Tao Shen, Jingkuan Song

机构 * school of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) School of Computing and Artificial Intelligence, Southwest Jiaotong University, China(西南交通大学计算机科学与人工智能学院) School of Computer Science and Technology, Tongji University, China(同济大学计算机科学与技术学院) Department of Computer Science, University of Warwick, United Kingdom(英国沃里克大学计算机科学系)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出可逆反演(ReInversion)方法,通过两阶段去噪和掩码引导选择性去噪策略,实现免训练的高效示例引导图像编辑,达到最优性能且计算开销最低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24794 2026-05-26 cs.CV cs.CL 57%

DUEL: Adversarial Self-Play for Multimodal Reasoning

DUEL: 用于多模态推理的对抗性自我对弈

Lin Qiu, Hanqing Zeng, Yao Liu, Bingjun Sun, Guangdeng Liao, Ji Liu

机构 * Meta AI

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出DUEL框架,通过对抗性自我对弈从预训练VLM生成监督信号,结合长度归一化对数似然奖励,无需人工标注即可提升视觉推理与判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24735 2026-05-26 cs.CY 50%

Dual-Use AI Face Swap Apps Are Mostly Unsafe: A Systematic Safety Audit

双用途AI换脸应用大多不安全:系统性安全审计

Alaa Daffalla, Sarah Chao, Eric Zeng

专题命中 图像编辑 :image editing(abstract)

AI总结 本研究系统审计了iOS和Android平台上的420款AI换脸应用,发现70%缺乏防止生成裸体图像的技术保障,且多数应用的服务条款未禁止此类滥用,建议平台和立法者强制要求安全过滤措施。

详情

展开后加载摘要…

URL PDF HTML 收藏