arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-17 至 2026-03-17 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 6 篇

2409.02374 2026-03-17 cs.CV cs.LG 90%

Exploring Low-Dimensional Subspaces in Diffusion Models for Controllable Image Editing

在扩散模型中探索低维子空间以实现可控图像编辑

Siyi Chen, Huijie Zhang, Minzhe Guo, Yifu Lu, Peng Wang, Qing Qu

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文通过分析扩散模型中后验均值预测器的局部线性和Jacobian奇异向量的低维特性,提出无需训练的LOCO Edit方法,实现精准局部图像编辑,并扩展至文本监督下的图像编辑。

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14916 2026-03-17 cs.CV cs.MM 81%

EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing

EditHF-1M: 一个百万级的丰富人类偏好反馈用于图像编辑

Zitong Xu, Huiyu Duan, Zhongpeng Ji, Xinyun Zhang, Yutao Liu, Xiongkuo Min, Ke Gu, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) University of Electronic and Science Technology of China(电子科技大学) Ocean University of China(海洋大学) Beijing University of Technology(北京理工大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出EditHF-1M百万级图像编辑数据集及基于其的EditHF评估模型和EditHF-Reward奖励模型,通过强化学习优化文本引导图像编辑模型,实验表明其在对齐人类偏好和泛化能力方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01893 2026-03-17 cs.CV 79%

Generative Visual Chain-of-Thought for Image Editing

生成式视觉链式思维用于图像编辑

Zijin Yin, Tiankai Hang, Yiji Cheng, Shiyi Zhang, Runze He, Yu Xu, Chunyu Wang, Bing Li, Zheng Chang, Kongming Liang, Qinglin Lu, Zhanyu Ma

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出GVCoT框架,通过生成空间线索实现视觉推理与编辑,解决复杂场景下的编辑定位问题,提出GVCoT-Edit-Instruct数据集和SREdit-Bench基准,实验表明其在图像编辑任务中表现优异。

Comments Project page: https://pris-cv.github.io/GVCoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13388 2026-03-17 cs.CV 79%

VeloEdit: Training-Free Consistent and Continuous Instruction-Based Image Editing via Velocity Field Decomposition

VeloEdit: 无需训练的一致且连续的基于指令的图像编辑 via 速度场分解

Zongqing Li, Zhihui Liu, Yujie Xie, Shansiyuan Wu, Hongshen Lv, Songzhi Su

机构 * Xiamen University(厦门大学) Truesight

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 VeloEdit通过速度场分解实现无需训练的一致且连续的基于指令的图像编辑,通过动态识别编辑区域并采用速度插值控制编辑强度,提升视觉一致性和编辑连续性。

Comments 26 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15003 2026-03-17 cs.CV 57%

Edit2Interp: Adapting Image Foundation Models from Spatial Editing to Video Frame Interpolation with Few-Shot Learning

Edit2Interp:从空间编辑到视频帧插值的图像基础模型适应

Nasrin Rahimi, Mısra Yavuz, Burak Can Biner, Yunus Bilge Kurt, Ahmet Rasim Emirdağı, Süleyman Aslan, Görkay Aydemir, M. Akın Yılmaz, A. Murat Tekalp

机构 * Codeway AI Research Dept. of Electrical \& Electronics Engineering, Ko c University, \. I stanbul, T\" u rkiye

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文通过少量样本学习,将图像编辑模型适应于视频帧插值,揭示了静态场景中物体变换的理解可激活潜在的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14153 2026-03-17 cs.CV 57%

Garments2Look: A Multi-Reference Dataset for High-Fidelity Outfit-Level Virtual Try-On with Clothing and Accessories

Garments2Look:用于高保真服装级虚拟试穿的多参考数据集

Junyao Hu, Zhongwei Cheng, Waikeung Wong, Xingxing Zou

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出Garments2Look数据集,用于高保真的服装级虚拟试穿,包含8万对多件服装到一套搭配的样本,涵盖40大类和300+细分类别,通过合成流程提升数据质量和任务难度,验证现有方法在完整服装试穿和层叠推断上的不足。

Comments CVPR 2026; Project Page: https://artmesciencelab.github.io/Garments2Look

详情

展开后加载摘要…

URL PDF HTML 收藏