arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-07 至 2026-04-07 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 5 篇

2512.08477 2026-04-07 cs.CV cs.AI 85%

ContextDrag: Precise Drag-Based Image Editing via Context-Preserving Token Injection and Position-Aligned Attention

ContextDrag: 通过上下文保留的标记注入和位置对齐注意力实现精确的拖动式图像编辑

Huiguo He, Pengyu Yan, Ziqi Yi, Weizhi Zhong, Zheng Liu, Yejun Tang, Huan Yang, Guanbin Li, Lianwen Jin

机构 * School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息学院) KlingAI Research, Kuaishou Technology(快手科技KlingAI研究) The University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出ContextDrag,首个将拖动式操作引入上下文图像编辑的框架,通过上下文保留的标记注入和位置对齐注意力实现精确拖动编辑,提升编辑精度与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04487 2026-04-07 cs.CV 83%

Training-Free Image Editing with Visual Context Integration and Concept Alignment

无需训练的图像编辑与视觉上下文整合与概念对齐

Rui Song, Guo-Hua Wang, Qing-Guo Chen, Weihua Luo, Tongda Xu, Zhening Liu, Yan Wang, Zehong Lin, Jun Zhang

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) Institute for AI Industry Research (AIR), Tsinghua University(清华大学智能产业研究院(AIR)) School of Data Science, Lingnan University(岭南大学数据科学学院)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出VicoEdit,一种无需训练和反向扩散的图像编辑方法,通过视觉上下文直接转换源图像至目标图像,提升编辑一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00698 2026-04-07 cs.CV cs.LG 70%

Concept-Centric Token Interpretation for Vector-Quantized Generative Models

面向概念的标记解释方法用于向量量化生成模型

Tianze Yang, Yucheng Shi, Mengnan Du, Xuansheng Wu, Qiaoyu Tan, Jin Sun, Ninghao Liu

机构 * School of Computing, University of Georgia(佐治亚大学计算学院) Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系) Department of Computer Science, New York University(纽约大学计算机科学系)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出CORTEX方法,通过分析标记重要性及代码本来解释VQGMs生成过程,提升模型透明度并应用于图像编辑和特征检测。

Comments 17 pages, 7 figures

Journal ref In Proceedings of the 42nd International Conference on Machine Learning (ICML), PMLR 267:71034-71050, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03400 2026-04-07 cs.CV cs.AI cs.LG 57%

Banana100: Breaking NR-IQA Metrics by 100 Iterative Image Replications with Nano Banana Pro

Banana100: 通过100次迭代图像复制打破NR-IQA度量标准

Kenan Tang, Praveen Arunshankar, Andong Hua, Anthony Yang, Yao Qin

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 Banana100通过100次迭代编辑生成28000张退化图像,揭示多轮编辑中图像质量退化问题,发现现有NR-IQA度量标准无法检测严重退化图像,威胁未来模型训练稳定性。

Comments Accepted to CVPR 2026 Workshop on Agentic AI for Visual Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07469 2026-04-07 cs.CV 57%

VideoCoF: Unified Video Editing with Temporal Reasoner

VideoCoF:基于时间推理的统一视频编辑

Xiangpeng Yang, Ji Xie, Yiyuan Yang, Yue Ma, Yan Huang, Min Xu, Qiang Wu

机构 * University of Technology Sydney(悉尼科技大学) Zhejiang University(浙江大学) HKUST(香港科技大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 VideoCoF通过引入时间推理机制,解决视频编辑中精度与统一性的矛盾,实现无需掩码的精确区域映射和细粒度编辑,验证了方法的高效性与有效性。

Comments Accepted by CVPR 2026, Project Page: https://videocof.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏