arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-29 至 2026-06-29 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 6 篇

2606.05950 2026-06-29 cs.AI 版本更新 85%

Edit-R2: Context-Aware Reinforcement Learning for Multi-Turn Image Editing

Edit-R2:面向多轮图像编辑的上下文感知强化学习

Yuxiao Ye, Haoran He, Fangyuan Kong, Xintao Wang, Pengfei Wan, Kun Gai, Ling Pan

机构 * Hong Kong University of Science and Technology(香港理工大学) Kuaishou Technology(快手科技)

专题命中 图像编辑 :image editing(title,abstract);image generation(abstract);diffusion(abstract)

AI总结 提出Edit-R2框架,通过重构会话意图和联合优化推理与生成的强化学习,解决多轮图像编辑中的长上下文稀释和状态污染问题,并在MICE-Bench基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17565 2026-06-29 cs.CV 版本更新 83%

UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models

UniGeo:通过视频模型统一几何指导以实现相机可控的图像编辑

Hong Jiang, Wensong Song, Zongxin Yang, Ruijie Quan, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学) DBMI, HMS, Harvard University(DBMI、HMS、哈佛大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 UniGeo通过统一的几何指导在三个层面提升相机可控图像编辑的几何一致性与视觉质量,克服传统方法在连续相机运动下的几何漂移和结构退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26872 2026-06-29 cs.CV 新提交 79%

SpatialFlow-GRPO: Where Spatial Credit Drives Image Editing

SpatialFlow-GRPO:空间信用驱动图像编辑

Yankai Yang, Yancheng Long, Wei Chen, Xingyu Lu, Hongyang Wei, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Kuaishou Technology(快手科技)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出SpatialFlow-GRPO框架,通过引入空间细粒度奖励反馈,将区域感知奖励转化为语义区域级优化信号,解决图像编辑中空间均匀性假设问题,显著提升编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26551 2026-06-29 cs.CV 新提交 79%

PhyEditBench: A Real-World Multi-Stage Benchmark for Physics-Aware Image Editing

PhyEditBench: 一个用于物理感知图像编辑的真实世界多阶段基准

Shengbin Guo, Shaokang He, Chaoyue Meng, Shengpeng Xiao, Xunzhi Xiang, Shaofeng Zhang, Qi Fan

机构 * Nanjing University(南京大学) SDU(山东大学) HRBEU(哈尔滨工程大学) SDUTCM(山东中医药大学) USTC(中国科学技术大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出PhyEditBench基准,通过分层分类和真实/反物理实例评估编辑模型的物理理解能力,并引入训练无关基线PhyWorld利用视频生成推理。

Comments 19 pages, 6 figures, 2 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10179 2026-06-29 cs.CV cs.AI 版本更新 79%

When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models

当提示变为视觉:面向大型图像编辑模型的以视觉为中心的越狱攻击

Jiacheng Hou, Yining Sun, Ruochong Jin, Haochen Han, Fangming Liu, Wai Kin Victor Chan, Alex Jinpeng Wang

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出首个视觉到视觉的越狱攻击VJA,通过纯视觉输入传递恶意指令,并构建安全基准IESBench,在商业模型上攻击成功率高达80.9%,同时提出无需训练的内省多模态推理防御方法。

Comments Accepted for spotlight and oral presentation at ICML 2026 (Project: https://csu-jpg.github.io/vja.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26199 2026-06-29 cs.CR 新提交 78%

MIRAGE: Protecting against Malicious Image Editing via False Moderation

MIRAGE: 通过虚假审核保护图像免受恶意编辑

Anshul Nasery, Ramnath Kumar, Cho-Jui Hsieh, Sewoong Oh

专题命中 图像编辑 :image editing(title,abstract)

AI总结 提出MIRAGE方法,通过对抗性扰动使审核分类器将图像标记为违规,从而阻止AI图像编辑,无需模型权重或提示,在商业API上成功率超88%。

详情

展开后加载摘要…

URL PDF HTML 收藏