arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1258 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1258 篇

2507.08285 2025-07-14 cs.GR cs.CV 76%

FlowDrag: 3D-aware Drag-based Image Editing with Mesh-guided Deformation Vector Flow Fields

Gwanhyeong Koo, Sunjae Yoon, Younghwan Lee, Ji Woo Hong, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 图像编辑 :image editing(title);分类 cs.CV、cs.GR

Comments ICML 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.04040 2022-02-09 cs.CV cs.GR cs.LG 76%

Self-Conditioned Generative Adversarial Networks for Image Editing

Yunzhe Liu, Rinon Gal, Amit H. Bermano, Baoquan Chen, Daniel Cohen-Or

专题命中 图像编辑 :image editing(title);分类 cs.CV、cs.GR

Comments Project page: https://github.com/yzliu567/sc-gan

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11643 2026-07-14 cs.RO cs.AI 新提交 75%

Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

小米机器人-U0:基于世界基础模型的统一具身合成

Xinghang Li, Jun Guo, Qiwei Li, Long Qian, Hang Lai, Yueze Wang, Hongyu Yan, Jiahang Cao, Xi Chen, Jingen Qu, Jiaxi Song, Nan Sun, Hanye Zhao, Futeng Liu, Wanli Peng, Heyun Wang, Yunhong Wang, Caoyu Xia, Jack Zhao, Diyun Xiang, Hangjun Ye, Heng Qu, Huaping Liu, Jason Li

机构 * Xiaomi Robotics(小米机器人)

专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 研究针对基础模型应用于具身场景受限问题,提出小米机器人-U0多模态自回归模型,将具身生成扩展为基础图像和视频生成的形式,联合优化多种生成任务,在多方面取得领先成果,证明基础世界模型可用于具身智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00924 2026-05-19 cs.AI 75%

Supervised sparse auto-encoders for interpretable and compositional representations

监督稀疏自编码器用于可解释和组合性表示

Ouns El Harzli, Hugo Wallner, Yoonsoo Nam, Haixuan Xavier Tao

机构 * Department of Computer Science, University of Oxford, Oxford, UK(牛津大学计算机科学系) KAIST AI, Korean Advanced Institute of Science(韩国科学技术高级研究院AI研究所) Independent researcher(独立研究者)

专题命中 图像编辑 :diffusion(abstract,abstract_cn);image editing(abstract)

AI总结 本文提出了一种监督稀疏自编码器,通过结合无约束特征模型和监督学习,解决稀疏自编码器在非光滑性及特征与人类语义对齐方面的不足,实现了组合性泛化和语义图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08354 2026-05-12 cs.AI 75%

Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria

Auto-Rubric as Reward:从隐含偏好到显式多模态生成标准

Juanxi Tian, Fengyuan Liu, Jiaming Han, Yilei Jiang, Yongliang Wu, Yesheng Liu, Haodong Li, Furong Xu, Wanhua Li

机构 * Nanyang Technological University(南洋理工大学) Ant Group(蚂蚁集团) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) UIUC(伊利诺伊大学香槟分校)

专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 本文提出Auto-Rubric as Reward框架,通过显式标准分解替代隐含权重优化,提升多模态生成模型对人类偏好的对齐效果,实验证明显式标准能更可靠地实现数据高效对齐。

Comments 28 pages, 10 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03506 2025-12-11 cs.AI 75%

OneFlow: Concurrent Mixed-Modal and Interleaved Generation with Edit Flows

OneFlow:并发混合模态与交错生成的编辑流

John Nguyen, Marton Havasi, Tariq Berrada, Luke Zettlemoyer, Ricky T. Q. Chen

机构 * FAIR at Meta(Meta 的 FAIR 部门) Univ. Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK, France(格勒诺布尔阿尔卑斯大学、法国国家科学研究中心、法国国家信息与自动化技术研究所、格勒诺布尔理工大学、LJK、法国)

专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 OneFlow是一种非自回归多模态模型,通过编辑流和流匹配实现并发混合模态生成,优于自回归和扩散方法,提升生成效率和推理能力。

Comments https://oneflow.framer.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06075 2026-08-07 cs.CV cs.AI 新提交 74%

Domain-Grounded Candidate Selection for Agentic Image Editing: A Shadow Removal Case

面向智能体图像编辑的领域 grounded 候选选择:以阴影去除为例

Shilin Hu, Jingyi Xu, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(石溪大学) UNC Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 图像编辑 :image editing(title);分类 cs.CV

AI总结 该研究以阴影去除为例,提出领域 grounded 的智能体候选选择流程,结合物理原理约束商用视觉-语言模型的生成,在 ShadowRemovalRefine 基准上使 CDD 降低至少 47%,证明经典低级视觉先验仍具实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18787 2026-07-22 cs.CV 新提交 74%

Image Editing Models are Numerical Solvers

图像编辑模型是数值求解器

Ulysse Mizrahi

机构 * Tel Aviv University(特拉维夫大学)

专题命中 图像编辑 :image editing(title);分类 cs.CV

AI总结 研究预训练生成式图像编辑模型能否为数值模拟提供通用接口,通过既定求解器监督,将相同架构和协议应用于多种方程,结果显示该模型可表示多样物理映射,还识别了相关基本约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07236 2026-06-19 cs.CV 版本更新 74%

HY-WU (Part I): An Extensible Functional Neural Memory Framework and An Instantiation in Text-Guided Image Editing

HY-WU (第一部分): 一种可扩展的功能性神经记忆框架及其在文本引导图像编辑中的应用

Mengxuan Wu, Xuanlei Zhao, Ziqiao Wang, Ruicheng Feng, Zhangyang Wang, Kai Wang

机构 * Tencent HY Team(腾讯 HY 团队)

专题命中 图像编辑 :image editing(title);分类 cs.CV

AI总结 提出HY-WU框架,通过功能性神经记忆模块即时生成实例特定权重更新,避免共享权重覆盖导致的干扰,解决持续学习与个性化中的灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30437 2026-06-11 cs.CV 版本更新 74%

Mitigating Content Shift and Hallucination in GenAI Image Editing via Structural Refinement

通过结构细化减轻生成式AI图像编辑中的内容偏移和幻觉

Luxi Zhao, Michael S. Brown

机构 * Department of Electrical Engineering & Computer Science(电气工程与计算机科学系)

专题命中 图像编辑 :image editing(title);分类 cs.CV

AI总结 提出一种后处理框架,通过建立粗空间和光度对应关系并融合输入图像与GenAI增强图像,在保留感知增强的同时抑制幻觉内容,从而解决黑盒GenAI图像编辑中的结构保持问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25491 2026-05-28 cs.CV cs.AI 74%

The Forensic Cost of Watermark Removal: From Dedicated Attacks to Image Editing

水印移除的法医成本:从专用攻击到图像编辑

Gautier Evennou, Ewa Kijak

机构 * IMATAG(IMATAG机构) IRISA, Univ. Rennes, INRIA, CNRS(IRISA大学、INRIA和CNRS)

专题命中 图像编辑 :image editing(title);分类 cs.CV

AI总结 本文提出水印移除检测(WRD)作为新评估维度,通过训练分类器检测移除痕迹,在10^{-3}假阳性率下实现最优检测,证明法医隐蔽性是水印移除的必要条件。

Comments v1:The Forensic Cost of Watermark Removal, accepted at IH&MMSEC 2026, Special Session "Watermarking Across the Lifecycle of Generative Models". v2: extended version, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15661 2026-05-18 cs.CV cs.AI 74%

VAGS: Velocity Adaptive Guidance Scale for Image Editing and Generation

VAGS:图像编辑与生成的速率自适应引导尺度

Yan Luo, Ahmadou Aidara, Jingyi Lu, Jeremy Moebel, Kai Han, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) Harvard University(哈佛大学) School of Computing and Data Science(计算与数据科学学院) The University of Hong Kong(香港大学) Kempner Institute for the Study of Natural and Artificial Intelligence(自然与人工智能研究学院)

专题命中 图像编辑 :image editing(title);分类 cs.CV

AI总结 VAGS通过自适应引导尺度提升图像编辑和生成的结构保真度和生成质量,无需微调或额外计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13551 2026-01-21 cs.CV 74%

DiffFace-Edit: A Diffusion-Based Facial Dataset for Forgery-Semantic Driven Deepfake Detection Analysis

DiffFace-Edit: 一种基于扩散的面部数据集用于伪造-语义驱动的深度伪造检测分析

Feng Ding, Wenhui Yi, Xinan He, Mengyao Xiao, Jianfeng Xu, Jianqiang Du

机构 * NanChang University(南昌大学)

专题命中 图像编辑 :diffusion(title);分类 cs.CV

AI总结 DiffFace-Edit数据集通过引入细粒度面部编辑和检测器逃避样本分析,提升深度伪造检测的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11295 2025-11-17 cs.CV 74%

SimuFreeMark: A Noise-Simulation-Free Robust Watermarking Against Image Editing

Yichao Tang, Mingyang Li, Di Miao, Sheng Li, Zhenxing Qian, Xinpeng Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 图像编辑 :image editing(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01173 2025-10-02 cs.CR cs.AI cs.CV cs.LG 74%

EditTrack: Detecting and Attributing AI-assisted Image Editing

Zhengyuan Jiang, Yuyang Zhang, Moyang Guo, Neil Zhenqiang Gong

专题命中 图像编辑 :image editing(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09420 2025-01-17 cs.CV cs.AI cs.LG eess.IV 74%

Dynamic Neural Style Transfer for Artistic Image Generation using VGG19

Kapil Kashyap, Mehak Garg, Sean Fargose, Sindhu Nair

专题命中 图像编辑 :image generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05325 2024-12-10 cs.CV eess.IV 74%

The Role of Text-to-Image Models in Advanced Style Transfer Applications: A Case Study with DALL-E 3

Ebubechukwu Ike

专题命中 图像编辑 :text-to-image(title);分类 cs.CV

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04413 2024-07-25 cs.CV cs.AI 74%

Efficient 3D-Aware Facial Image Editing via Attribute-Specific Prompt Learning

Amandeep Kumar, Muhammad Awais, Sanath Narayan, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer

专题命中 图像编辑 :image editing(title);分类 cs.CV

Comments Accepted at ECCV, 2024. Amandeep Kumar and Muhammad Awais are joint first authors. More details are available at https://awaisrauf.github.io/3d_face_editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10601 2024-06-18 cs.CV 74%

The Devil is in the Details: StyleFeatureEditor for Detail-Rich StyleGAN Inversion and High Quality Image Editing

Denis Bobkov, Vadim Titov, Aibek Alanov, Dmitry Vetrov

专题命中 图像编辑 :image editing(title);分类 cs.CV

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.12123 2024-05-31 cs.CV 74%

GAN Inversion for Image Editing via Unsupervised Domain Adaptation

Siyu Xing, Chen Gong, Hewei Guo, Xiao-Yu Zhang, Xinwen Hou, Yu Liu

专题命中 图像编辑 :image editing(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04376 2024-04-09 cs.CV cs.AI 74%

ClickDiffusion: Harnessing LLMs for Interactive Precise Image Editing

Alec Helbling, Seongmin Lee, Polo Chau

专题命中 图像编辑 :image editing(title);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2402.07925

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11422 2023-12-19 cs.CV 74%

Warping the Residuals for Image Editing with StyleGAN

Ahmet Burak Yildirim, Hamza Pehlivan, Aysegul Dundar

专题命中 图像编辑 :image editing(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06135 2023-12-12 cs.CV 74%

ArtBank: Artistic Style Transfer with Pre-trained Diffusion Model and Implicit Style Prompt Bank

Zhanjie Zhang, Quanwei Zhang, Guangyuan Li, Wei Xing, Lei Zhao, Jiakai Sun, Zehua Lan, Junsheng Luan, Yiling Huang, Huaizhong Lin

专题命中 图像编辑 :diffusion(title);分类 cs.CV

Comments Accepted by AAAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17953 2023-12-01 cs.CV 74%

Rethinking Image Editing Detection in the Era of Generative AI Revolution

Zhihao Sun, Haipeng Fang, Xinying Zhao, Danding Wang, Juan Cao

专题命中 图像编辑 :image editing(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11448 2023-03-28 cs.CV 74%

Delving StyleGAN Inversion for Image Editing: A Foundation Latent Space Viewpoint

Hongyu Liu, Yibing Song, Qifeng Chen

专题命中 图像编辑 :image editing(title);分类 cs.CV

Comments Accepted by CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14552 2023-03-28 cs.CV eess.IV 74%

Spatial Latent Representations in Generative Adversarial Networks for Image Generation

Maciej Sypetkowski

专题命中 图像编辑 :image generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.11876 2022-05-25 cs.CV 74%

Unsupervised Misaligned Infrared and Visible Image Fusion via Cross-Modality Image Generation and Registration

Di Wang, Jinyuan Liu, Xin Fan, Risheng Liu

专题命中 图像编辑 :image generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.15666 2022-03-30 cs.CV 74%

HyperStyle: StyleGAN Inversion with HyperNetworks for Real Image Editing

Yuval Alaluf, Omer Tov, Ron Mokady, Rinon Gal, Amit H. Bermano

专题命中 图像编辑 :image editing(title);分类 cs.CV

Comments Accepted to CVPR 2022; Project page available at http://yuval-alaluf.github.io/hyperstyle/

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.14754 2021-06-24 cs.CV cs.LG 74%

Exploiting Spatial Dimensions of Latent in GAN for Real-time Image Editing

Hyunsu Kim, Yunjey Choi, Junho Kim, Sungjoo Yoo, Youngjung Uh

专题命中 图像编辑 :image editing(title);分类 cs.CV

Comments Accepted to CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.03921 2021-01-12 cs.CV cs.LG eess.IV 74%

Cycle Generative Adversarial Networks Algorithm With Style Transfer For Image Generation

Anugrah Akbar Praramadhan, Guntur Eka Saputra

专题命中 图像编辑 :image generation(title);分类 cs.CV

Comments in Indonesian language

详情

展开后加载摘要…

URL PDF HTML 收藏