arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1258 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1258 篇

1808.07535 2018-08-29 cs.CV 70%

Learning Hierarchical Semantic Image Manipulation through Structured Representations

Seunghoon Hong, Xinchen Yan, Thomas Huang, Honglak Lee

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.07035 2018-02-14 cs.CV 70%

Generative Adversarial Networks: An Overview

Antonia Creswell, Tom White, Vincent Dumoulin, Kai Arulkumaran, Biswa Sengupta, Anil A Bharath

专题命中 图像编辑 :image editing(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted in the IEEE Signal Processing Magazine Special Issue on Deep Learning for Visual Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22304 2026-06-23 cs.LG 新提交 67%

Encoder-Decoder Manifold Alignment for Idempotent Generation

用于幂等生成的编码器-解码器流形对齐

Dareen Alharthi, Abdul Waheed, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 图像编辑 :image generation(abstract);image editing(abstract)

AI总结 针对生成模型中幂等性不足导致的重复应用不稳定问题,提出通过对齐编码器和解码器学习的流形来训练模型,显著降低幂等误差并提升生成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13028 2026-03-16 cs.CR cs.AI 67%

Purify Once, Edit Freely: Breaking Image Protections under Model Mismatch

一次净化,自由编辑:在模型不匹配下突破图像保护

Qichen Zhao, Shengfang Zhai, Xinjian Bai, Qingni Shen, Qiqi Lin, Yansong Gao, Zhonghai Wu

机构 * Peking University(北京大学) National University of Singapore(国立新加坡大学) The University of Western Australia(西澳大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract)

AI总结 研究提出统一的后期净化框架,评估模型不匹配下的保护有效性,提出VAE-Trans和EditorClean两种实用净化器,显著提升图像编辑质量,揭示一次净化后保护信号失效的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25682 2026-02-10 cs.CL 67%

PairUni: Pairwise Training for Unified Multimodal Language Models

PairUni: 用于统一多模态语言模型的成对训练

Jiani Zheng, Zhiyang Teng, Kunpeng Qiu, Xiangtai Li, Anran Wang, Yu Tian, Ye Tian, Haochen Wang, Zhuochen Wang

机构 * ByteDance(字节跳动)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract)

AI总结 PairUni通过成对训练提升统一多模态语言模型的理解与生成能力,采用配对数据集和PairGRPO算法实现更有效的策略学习。

Comments 22 pages, 11 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22688 2025-12-01 cs.LG cs.AI 67%

Test-time scaling of diffusions with flow maps

扩散模型测试时间缩放与流映射

Amirmojtaba Sabour, Michael S. Albergo, Carles Domingo-Enrich, Nicholas M. Boffi, Sanja Fidler, Karsten Kreis, Eric Vanden-Eijnden

机构 * NVIDIA(NVIDIA公司) University of Toronto(多伦多大学) Vector Institute(向量研究所) Harvard University(哈佛大学) Kempner Institute(凯姆纳研究所) IAIFI(IAIFI机构) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学) Courant Institute, New York University(纽约大学应用数学学院) ML Lab at Capital Fund Management (CFM)(Capital Fund Management (CFM)机器学习实验室)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract)

AI总结 本文提出通过流映射改进扩散模型测试时间性能,通过流映射与速度场关系构建FMTT算法,实现更优奖励上升并支持复杂图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17219 2025-04-25 cs.LG cs.AI cs.CR 67%

Enhancing Variational Autoencoders with Smooth Robust Latent Encoding

Hyomin Lee, Minseon Kim, Sangwon Jang, Jongheon Jeong, Sung Ju Hwang

机构 * Korea University(韩国大学) Microsoft(微软) KAIST(韩国科学技术院)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract)

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06575 2025-02-11 cs.RO cs.AI cs.LG cs.SY eess.SY 67%

Predictive Red Teaming: Breaking Policies Without Breaking Robots

Anirudha Majumdar, Mohit Sharma, Dmitry Kalashnikov, Sumeet Singh, Pierre Sermanet, Vikas Sindhwani

专题命中 图像编辑 :diffusion(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14966 2024-10-22 cs.CR 67%

Attack as Defense: Run-time Backdoor Implantation for Image Content Protection

Haichuan Zhang, Meiyu Lin, Zhaoyi Liu, Renyuan Li, Zhiyuan Cheng, Carl Yang, Mingjie Tang

专题命中 图像编辑 :diffusion(abstract);image editing(abstract)

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16285 2024-10-15 cs.LG 67%

ModelLock: Locking Your Model With a Spell

Yifeng Gao, Yuhua Sun, Xingjun Ma, Zuxuan Wu, Yu-Gang Jiang

专题命中 图像编辑 :diffusion(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13006 2024-01-25 cs.AI cs.LG eess.IV 67%

CIMGEN: Controlled Image Manipulation by Finetuning Pretrained Generative Models on Limited Data

Chandrakanth Gudavalli, Erik Rosten, Lakshmanan Nataraj, Shivkumar Chandrasekaran, B. S. Manjunath

专题命中 图像编辑 :image generation(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.09346 2023-02-21 cs.AI 67%

Redes Generativas Adversarias (GAN) Fundamentos Teóricos y Aplicaciones

Jordi de la Torre

专题命中 图像编辑 :image generation(abstract);image editing(abstract)

Comments 14 pages, in Spanish language, 2 figures, review

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.00925 2018-04-04 cs.LG stat.ML 67%

Correlated discrete data generation using adversarial training

Shreyas Patel, Ashutosh Kakadiya, Maitrey Mehta, Raj Derasari, Rahul Patel, Ratnik Gandhi

专题命中 图像编辑 :image generation(abstract);inpainting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16981 2026-05-15 cs.CV cs.GR 62%

SyncLight: Single-Edit Multi-View Relighting

SyncLight:单编辑多视角光照

David Serrano-Lozano, Anand Bhattad, Luis Herranz, Jean-François Lalonde, Javier Vazquez-Corral

机构 * Computer Vision Center Universitat Autònoma de Barcelona(Autonomous University of Barcelona计算机视觉中心) Johns Hopkins University(约翰霍普金斯大学) Universidad Politécnica de Madrid(马德里理工大学) Université Laval(拉瓦尔大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 SyncLight通过单视角参考编辑实现多视角一致的参数化光照控制,采用多视角扩散变压器实现高保真多视角图像集重绘。

Comments Project page: http://sync-light.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03717 2026-05-13 cs.CV cs.AI cs.GR 62%

Materialist: Physically Based Editing Using Single-Image Inverse Rendering

Materialist: 基于物理的单图像逆渲染中的材质编辑

Lezhong Wang, Duc Minh Tran, Ruiqi Cui, Thomson TG, Anders Bjorholm Dahl, Siavash Arjomand Bigdeli, Jeppe Revall Frisvad, Manmohan Chandraker

机构 * Technical University of Denmark(丹麦技术大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.GR

AI总结 Materialist提出一种基于物理的单图像逆渲染方法,利用神经网络预测初始材质属性并优化,实现材质编辑、物体插入和光照调整,同时引入高效的光线追踪折射方法进行透明度编辑。

Comments More Comprehensive IJCV Camera-Ready Version. Project website: https://lez-s.github.io/materialist_project/

Journal ref International Journal of Computer Vision (IJCV), 134(6), 267 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09096 2026-04-13 cs.CV cs.MM eess.IV 62%

Off-the-shelf Vision Models Benefit Image Manipulation Localization

现成视觉模型助力图像篡改定位

Zhengxuan Zhang, Keji Song, Junmin Hu, Ao Luo, Yuezun Li

机构 * School of Computer Science and Technology, Ocean University of China(中国海洋大学计算机科学与技术学院) Southwest Jiaotong University(西南交通大学)

专题命中 图像编辑 :image generation(abstract);分类 cs.CV、cs.MM

AI总结 本文提出ReVi适配器,利用现成通用视觉模型提升图像篡改定位性能,通过解耦语义冗余与篡改信息实现高效训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14925 2026-03-19 cs.CV cs.GR 62%

Workflow-Aware Structured Layer Decomposition for Illustration Production

面向流程的结构化分层分解用于插图生产

Tianyu Zhang, Dongchi Li, Keiichi Sawada, Haoran Xie

机构 * Japan Advanced Institute of Science and Technology(日本科学技术先进研究院) Live2D Inc.(Live2D公司) Waseda University(早稻田大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种面向流程的结构化分层分解框架,用于动漫插图生产,通过分解线稿、平面色、阴影和高光等生产层,提升插图的可控性和生成质量。

Comments 17 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04058 2026-01-27 cs.GR cs.CV 62%

SMooGPT: Stylized Motion Generation using Large Language Models

SMooGPT:利用大语言模型进行风格化动作生成

Lei Zhong, Yi Yang, Changjian Li

机构 * University of Edinburgh(爱丁堡大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 SMooGPT通过利用大语言模型的推理、组合和生成能力,实现风格化动作生成,提升动作控制和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12234 2026-01-21 cs.GR cs.AI cs.CV 62%

Proc3D: Procedural 3D Generation and Parametric Editing of 3D Shapes with Large Language Models

Proc3D: 基于大语言模型的3D形状过程生成与参数编辑

Fadlullah Raji, Stefano Petrangeli, Matheus Gadelha, Yu Shen, Uttaran Bhattacharya, Gang Wu

专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.GR

AI总结 Proc3D利用大语言模型实现3D形状的可编辑生成,通过参数化编辑提升设计效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15512 2025-12-18 cs.CV cs.MM 62%

VAAS: Vision-Attention Anomaly Scoring for Image Manipulation Detection in Digital Forensics

VAAS:面向数字取证中图像篡改检测的视觉-注意力异常评分

Opeyemi Bamigbade, Mark Scanlon, John Sheppard

机构 * Forensics and Security Research Group, South East Technological University(法医与安全研究组,南东技术大学) Security Research Group, School of Computer Science, University College Dublin(安全研究组,计算机科学学院,都柏林大学学院)

专题命中 图像编辑 :image generation(abstract);分类 cs.CV、cs.MM

AI总结 VAAS通过整合视觉注意力和片段一致性评分,提出一种双模块框架用于图像篡改检测,提升检测精度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00269 2025-12-15 cs.GR cs.CV 62%

3D-LATTE: Latent Space 3D Editing from Textual Instructions

3D-LATTE: 从文本指令进行3D编辑的潜在空间方法

Maria Parelli, Michael Oechsle, Michael Niemeyer, Federico Tombari, Andreas Geiger

机构 * University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) Google Zurich(谷歌瑞士总部)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 3D-LATTE通过在潜在空间中直接操控3D几何,实现高质量的文本指令驱动3D编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20640 2025-11-26 cs.CV cs.AI cs.GR cs.LG 62%

MotionV2V: Editing Motion in a Video

MotionV2V: 视频中运动的编辑

Ryan Burgert, Charles Herrmann, Forrester Cole, Michael S Ryoo, Neal Wadhwa, Andrey Voynov, Nataniel Ruiz

机构 * Google(谷歌) Stony Brook University(石溪大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 MotionV2V通过直接编辑稀疏轨迹实现视频运动编辑,利用生成性主干提升视频编辑能力,在用户研究中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14809 2025-11-05 cs.CV cs.MM cs.RO 62%

Light Future: Multimodal Action Frame Prediction via InstructPix2Pix

Zesen Zhong, Duomin Zhang, Yijia Li

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))

专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.MM

Comments 9 pages including appendix, 4 tables, 8 figures, to be submitted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21917 2025-09-29 cs.CV cs.MM 62%

Taming Flow-based I2V Models for Creative Video Editing

Xianghao Kong, Hansheng Chen, Yuwei Guo, Lvmin Zhang, Gordon Wetzstein, Maneesh Agrawala, Anyi Rao

机构 * HKUST(香港科技大学) Stanford University(斯坦福大学) CUHK(香港中文大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10066 2025-08-13 cs.MM cs.CV 62%

LayLens: Improving Deepfake Understanding through Simplified Explanations

Abhijeet Narang, Parul Gupta, Liuyijia Su, Abhinav Dhall

机构 * Monash University(墨尔本大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.MM

Comments Accepted to ACM ICMI 2025 Demos

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20652 2025-06-26 cs.GR cs.CV 62%

EditP23: 3D Editing via Propagation of Image Prompts to Multi-View

Roi Bar-On, Dana Cohen-Bar, Daniel Cohen-Or

机构 * Tel-Aviv University(特拉维夫大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Code, supplementary videos, interactive 3D visualizations, and additional results are available at https://editp23.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09023 2025-06-12 cs.GR cs.CV 62%

Fine-Grained Spatially Varying Material Selection in Images

Julia Guerrero-Viu, Michael Fischer, Iliyan Georgiev, Elena Garces, Diego Gutierrez, Belen Masia, Valentin Deschaintre

机构 * Adobe Research(Adobe研究)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23586 2025-05-30 cs.CV cs.MM eess.IV 62%

Weakly-supervised Localization of Manipulated Image Regions Using Multi-resolution Learned Features

Ziyong Wang, Charith Abhayaratne

机构 * Department of Electronic and Electrical Engineering, The University of Sheffield(电子与电气工程系,谢菲尔德大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.MM

Comments This paper was presented at the British Machine Vision Conference 2024 workshop on Media authenticity in the age of artificial intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14510 2025-04-15 cs.CV cs.AI cs.GR 62%

V-LASIK: Consistent Glasses-Removal from Videos Using Synthetic Data

Rotem Shalev-Arkushin, Aharon Azulay, Tavi Halperin, Eitan Richardson, Amit H. Bermano, Ohad Fried

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12831 2025-03-28 cs.CV cs.AI cs.MM 62%

VIA: Unified Spatiotemporal Video Adaptation Framework for Global and Local Video Editing

Jing Gu, Yuwei Fang, Ivan Skorokhodov, Peter Wonka, Xinya Du, Sergey Tulyakov, Xin Eric Wang

专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.MM

Comments 18 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏