arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1258 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1258 篇

2408.06632 2024-08-14 cs.HC cs.AI cs.CL 78%

EditScribe: Non-Visual Image Editing with Natural Language Verification Loops

Ruei-Che Chang, Yuxuan Liu, Lotus Zhang, Anhong Guo

专题命中 图像编辑 :image editing(title,abstract)

Comments ASSETS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14771 2024-04-24 cs.SD cs.AI 78%

Music Style Transfer With Diffusion Model

Hong Huang, Yuyi Wang, Luyao Li, Jun Lin

专题命中 图像编辑 :diffusion(title,abstract)

Comments 8 pages, 6 figures, ICMC 2023

Journal ref International Computer Music Conference (ICMC 2023) pp. 40-47, October 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.15459 2024-02-26 cs.CL cs.AI 78%

ParaGuide: Guided Diffusion Paraphrasers for Plug-and-Play Textual Style Transfer

Zachary Horvitz, Ajay Patel, Chris Callison-Burch, Zhou Yu, Kathleen McKeown

专题命中 图像编辑 :diffusion(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13763 2024-02-22 cs.SD eess.AS 78%

Music Style Transfer with Time-Varying Inversion of Diffusion Models

Sifei Li, Yuxin Zhang, Fan Tang, Chongyang Ma, Weiming dong, Changsheng Xu

专题命中 图像编辑 :diffusion(title,abstract)

Comments 7 pages, 4 figures, AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14772 2023-08-30 eess.IV 78%

Copy-Paste Image Augmentation with Poisson Image Editing for Ultrasound Instance Segmentation Learning

Wei-Hsiang Shen, Meng-Lin Li

专题命中 图像编辑 :image editing(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19512 2023-06-13 cs.CL cs.AI cs.LG 78%

Fine-grained Text Style Transfer with Diffusion-Based Language Models

Yiwei Lyu, Tiange Luo, Jiacheng Shi, Todd C. Hollon, Honglak Lee

专题命中 图像编辑 :diffusion(title,abstract)

Comments Accepted at Repl4NLP workshop at ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.16886 2022-11-01 cs.CL cs.LG 78%

DiffusER: Discrete Diffusion via Edit-based Reconstruction

Machel Reid, Vincent J. Hellendoorn, Graham Neubig

专题命中 图像编辑 :diffusion(title,abstract)

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.06484 2020-02-18 cs.CL 78%

A Multimodal Dialogue System for Conversational Image Editing

Tzu-Hsiang Lin, Trung Bui, Doo Soon Kim, Jean Oh

专题命中 图像编辑 :image editing(title,abstract)

Comments Accepted at 2nd Conversational AI Workshop at NeurIPS 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.01083 2018-12-05 cs.CL 78%

A System for Automated Image Editing from Natural Language Commands

Jacqueline Brixey, Ramesh Manuvinakurike, Nham Le, Tuan Lai, Walter Chang, Trung Bui

专题命中 图像编辑 :image editing(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08676 2026-08-11 cs.CV cs.AI 新提交 77%

UniSpace: Unified Visual Representation and Scalable Multimodal Modeling

UniSpace:统一视觉表示与可扩展多模态建模

Jinbo Yan, Limeng Qiao, Jie Qin, Junyan He, Feize Wu, Guanglu Wan

机构 * Meituan(美团)

专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出 UniSpace,通过 Patch Reparameterization 改进语义 ViT,构建 80 亿参数的 Transformer 专家混合模型,实现同一视觉空间内的理解、生成与编辑,提升重建效果,支持文本到图像生成和指令式图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27292 2026-07-31 cs.CV 新提交 77%

VETO: Towards Protecting Images From Frontier AI Editing

VETO:面向保护图像免受前沿AI编辑的侵害

Jonas Grebe, Hossein Shakibania, Tobias Braun, Marcus Rohrbach, Anna Rohrbach

专题命中 图像编辑 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对前沿AI图像编辑模型的滥用问题,提出抗编辑伪装VETO,引入评估基准VetoBench,实验显示其在保护与保真度权衡上优于现有防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02290 2026-07-03 cs.CV 新提交 77%

DisciplineGen-1M: A Large-Scale Dataset for Multidisciplinary Visual Generation and Editing

DisciplineGen-1M:用于多学科视觉生成与编辑的大规模数据集

Zhaokai Wang, Mingxin Liu, Zirun Zhu, Ziqian Fan, Yiguo He, Mohan Zhang, Leyao Gu, Xiangyu Zhao, Ning Liao, Shaofeng Zhang, Xuanhe Zhou, Zhihang Zhong, Junchi Yan, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Xiamen University(厦门大学) University of Science and Technology of China(中国科学技术大学)

专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 提出百万级多学科数据集DisciplineGen-1M,涵盖10个学科,通过可扩展框架构建,并基于此开发学科感知推理生成模型,在学科和通用推理基准上显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18249 2026-06-19 cs.CV 新提交 77%

Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification

统一多模态自回归建模:共享上下文-视觉分词器是实现统一的关键

Wujian Peng, Lingchen Meng, Yuxuan Cai, Xianwei Zhuang, Yuhuan Yang, Rongyao Fang, Chenfei Wu, Junyang Lin, Zuxuan Wu, Shuai Bai

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身AI研究院,复旦大学) Shanghai Innovation Institute(上海创新研究院) Qwen Team, Alibaba Inc.(通义实验室,阿里公司)

专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 提出UniAR框架,通过单一离散视觉分词器桥接视觉理解与生成,采用并行位预测和扩散解码,在图像生成和编辑上达到最优,同时保持多模态理解竞争力。

Comments ICML2026. Project page https://sharelab-sii.github.io/uniar-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13344 2026-06-16 cs.CV eess.IV 版本更新 77%

FireRed-Image-Edit-1.0 Technical Report

FireRed-Image-Edit-1.0 技术报告

Super Intelligence Team, Changhao Qiao, Chao Hui, Chen Li, Cunzheng Wang, Dejia Song, Jiale Zhang, Jing Li, Qiang Xiang, Runqi Wang, Shuang Sun, Wei Zhu, Xu Tang, Yao Hu, Yibo Chen, Yuhao Huang, Yuxuan Duan, Zhiyi Chen, Ziyuan Guo

机构 * Super Intelligence Team(超级智能团队) Xiaohongshu Inc.(小红书公司)

专题命中 图像编辑 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 提出FireRed-Image-Edit扩散变换器,通过数据整理、多阶段训练和评估优化,在指令图像编辑上达到最先进性能,并开源代码、模型和基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27924 2026-05-28 cs.CV 77%

SIGMA: Semantic-Difference Instruction-Grounding Mask Annotator for Text-Driven Image Manipulation Localization

SIGMA: 基于语义差异的指令引导掩码标注器用于文本驱动图像操作定位

Peiyu Zhuang, Jianquan Yang, Haodong Li, Zhuoying Cai, Ruitao Xie, Jishen Zeng, Baoying Chen, Jiwu Huang, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Guangdong Provincial Key Laboratory of Intelligent Information Processing and Shenzhen Key Laboratory of Media Security(广东省智能信息处理重点实验室和深圳媒体安全重点实验室) Shenzhen University of Advanced Technology and Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术大学和深圳先进技术研究所,中国科学院) Alibaba Group(阿里巴巴集团) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出SIGMA方法,通过视觉基础模型中的语义特征差异和指令引导的空间先验,自动从公开编辑数据集中生成像素级掩码,用于训练图像操作定位模型,在五个基准上F1提升12.20%,并生成约110万训练集使六个检测器平均F1提升18.34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10730 2026-05-12 cs.CV 77%

Qwen-Image-2.0 Technical Report

Qwen-Image-2.0 技术报告

Bing Zhao, Chenfei Wu, Deqing Li, Hao Meng, Jiahao Li, Jie Zhang, Jingren Zhou, Junyang Lin, Kaiyuan Gao, Kuan Cao, Kun Yan, Liang Peng, Lihan Jiang, Niantong Li, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue Chen, Xihua Wang, Yan Shu, Yanran Zhang, Yi Wang, Yilei Chen, Ying Ba, Yixian Xu, Yujia Wu, Yuxiang Chen, Zecheng Tang, Zekai Zhang, Zhendong Wang, Zihao Liu, Zikai Zhou, An Yang, Chen Cheng, Chenxu Lv, Dayiheng Liu, Fan Zhou, Hantian Xiong, Hongzhu Shi, Hu Wei, Huihong Zhao, Ivy Liu, Jianwei Zhang, Jiawei Zhang, Kai Chen, Kang He, Levon Xue, Lin Qu, Linhan Tang, Luwen Feng, Minggang Wu, Minmin Sun, Na Ni, Rui Men, Shuai Bai, Sishou Zheng, Tao Lan, Tianqi Zhang, Tingkun Wen, Wei Wang, Weixu Qiao, Weiyi Lu, Wenmeng Zhou, Xiaodong Deng, Xiaoxiao Xu, Xinlei Fang, Xionghui Chen, Yanan Wang, Yang Fan, Yichang Zhang, Yixuan Xu, Yu Wu, Zhiyuan Ma, Zhizhi Cai

机构 * Qwen Team(通义实验室)

专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 Qwen-Image-2.0 通过多模态扩散变换器和定制化训练流程,统一高保真生成与精确图像编辑,提升多语言文本精度、高分辨率逼真度及复杂指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18871 2026-04-22 cs.CV cs.AI cs.CL 77%

OmniGen2: Towards Instruction-Aligned Multimodal Generation

OmniGen2:面向指令对齐的多模态生成

Chenyuan Wu, Pengfei Zheng, Ruiran Yan, Shitao Xiao, Xin Luo, Yueze Wang, Wanli Li, Xiyan Jiang, Yexin Liu, Junjie Zhou, Ze Liu, Ziyi Xia, Chaofan Li, Haoge Deng, Jiahao Wang, Kun Luo, Bo Zhang, Defu Lian, Xinlong Wang, Zhongyuan Wang, Tiejun Huang, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhejiang University(浙江大学)

专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 OmniGen2通过双解码路径和解耦图像分词器,实现文本和图像生成的统一解决方案,提升多模态生成任务的性能与一致性,同时提供开源模型和数据集支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02242 2026-01-06 cs.CV cs.AI cs.LG 77%

VIBE: Visual Instruction Based Editor

基于视觉指令的编辑器:VIBE

Grigorii Alekseenko, Aleksandr Gordeev, Irina Tolstykh, Bulat Suleimanov, Vladimir Dokholyan, Georgii Fedorov, Sergey Yakubson, Aleksandra Tsybina, Mikhail Chernyshov, Maksim Kuprashevich

机构 * R&D Department, SALUTEDEV(SALUTEDEV 研发部)

专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 VIBE提出一种轻量级基于指令的图像编辑方法,使用2B参数模型和1.6B参数扩散模型,在保持高质量的同时实现低推理成本和源一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15603 2025-12-18 cs.CV 77%

Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition

Qwen-Image-Layered: 通过层分解实现内在可编辑性

Shengming Yin, Zekai Zhang, Zecheng Tang, Kaiyuan Gao, Xiao Xu, Kun Yan, Jiahao Li, Yilei Chen, Yuxiang Chen, Heung-Yeung Shum, Lionel M. Ni, Jingren Zhou, Junyang Lin, Chenfei Wu

机构 * HKUST(GZ)(香港科技大学(广州)) Alibaba(阿里巴巴)

专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 Qwen-Image-Layered通过层分解实现图像的内在可编辑性,提出端到端扩散模型及多阶段训练策略,提升图像分解质量与编辑一致性。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14333 2025-12-17 cs.CV cs.AI cs.CY cs.LG 77%

Dual Attention Guided Defense Against Malicious Edits

双关注引导的对抗恶意编辑防御

Jie Zhang, Shuai Dong, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of China Academy of Sciences(中国科学院大学) School of Computer Science, China University of Geosciences(中国地质大学(武汉)计算机学院)

专题命中 图像编辑 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出双关注引导的噪声扰动方法,通过干扰模型的注意力和噪声预测机制,有效防御恶意编辑攻击。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25776 2025-10-28 cs.CV cs.AI 77%

Editable Noise Map Inversion: Encoding Target-image into Noise For High-Fidelity Image Manipulation

Mingyu Kang, Yong Suk Choi

机构 * Department of Artificial Intelligence, University of Hanyang, Seoul, Korea(人工智能系,翰阳大学,韩国首尔) Department of Computer Science, University of Hanyang, Seoul, Korea(计算机科学系,翰阳大学,韩国首尔)

专题命中 图像编辑 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23676 2025-07-01 cs.CV 77%

A Unified Framework for Stealthy Adversarial Generation via Latent Optimization and Transferability Enhancement

Gaozheng Pei, Ke Ma, Dongpeng Zhang, Chengzhi Sun, Qianqian Xu, Qingming Huang

机构 * EECE, UCAS(UCAS电子工程系) UCAS Beijing China(UCAS北京) IIP, ICT, CAS(中国科学院信息工程研究所) SCST, UCAS(UCAS软件学院) ICT, CAS Beijing China(中国科学院信息工程研究所)

专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08257 2025-06-11 cs.CV cs.AI 77%

Highly Compressed Tokenizer Can Generate Without Training

L. Lao Beyer, T. Li, X. Chen, S. Karaman, K. He

机构 * MIT LIDS(麻省理工学院LIDS) MIT CSAIL(麻省理工学院CSAIL) Meta FAIR

专题命中 图像编辑 :image generation(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

Comments Main manuscript: 9 pages, 7 figures. Appendix: 8 pages, 9 figures. To appear in the Proceedings of the 42nd International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06256 2025-04-09 cs.CV 77%

Transfer between Modalities with MetaQueries

Xichen Pan, Satya Narayan Shukla, Aashu Singh, Zhuokai Zhao, Shlok Kumar Mishra, Jialiang Wang, Zhiyang Xu, Jiuhai Chen, Kunpeng Li, Felix Juefei-Xu, Ji Hou, Saining Xie

专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

Comments Project Page: https://xichenpan.com/metaquery

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18212 2025-03-21 cs.CV cs.AI 77%

Paint by Inpaint: Learning to Add Image Objects by Removing Them First

Navve Wasserman, Noam Rotstein, Roy Ganz, Ron Kimmel

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13734 2024-12-19 cs.CV 77%

Text2Relight: Creative Portrait Relighting with Text Guidance

Junuk Cha, Mengwei Ren, Krishna Kumar Singh, He Zhang, Yannick Hold-Geoffroy, Seunghyun Yoon, HyunJoon Jung, Jae Shin Yoon, Seungryul Baek

专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13081 2024-12-18 cs.CV 77%

Prompt Augmentation for Self-supervised Text-guided Image Manipulation

Rumeysa Bodur, Binod Bhattarai, Tae-Kyun Kim

专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00906 2023-08-03 cs.CV 77%

ImageBrush: Learning Visual In-Context Instructions for Exemplar-Based Image Manipulation

Yasheng Sun, Yifan Yang, Houwen Peng, Yifei Shen, Yuqing Yang, Han Hu, Lili Qiu, Hideki Koike

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.13505 2022-07-28 cs.CV 77%

Multi-Forgery Detection Challenge 2022: Push the Frontier of Unconstrained and Diverse Forgery Detection

Jianshu Li, Man Luo, Jian Liu, Tao Chen, Chengjie Wang, Ziwei Liu, Shuo Liu, Kewei Yang, Xuning Shao, Kang Chen, Boyuan Liu, Mingyu Guo, Ying Guo, Yingying Ao, Pengfei Gao

专题命中 图像编辑 :image generation(abstract);image editing(abstract);image synthesis(abstract);分类 cs.CV

Comments Workshop and challenge summary paper, containing technical reports from different teams

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.04200 2022-02-10 cs.CV 77%

MaskGIT: Masked Generative Image Transformer

Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, William T. Freeman

专题命中 图像编辑 :image editing(abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏