arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86585 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1264 篇

2603.29591 2026-06-25 cs.CV 版本更新 70%

FlowID : Enhancing Forensic Identification with Latent Flow-Matching Models

FlowID: 利用潜在流匹配模型增强法医鉴定

Jules Ripoll, David Bertoin, Alasdair Newson, Charles Dossal, Jose Pablo Baraybar

机构 * INSA Toulouse(图卢兹理工学院) La Sorbonne Université(索邦大学) International Committee of the Red Cross(国际红十字委员会)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 提出FlowID方法,结合单图像微调与注意力掩码,修复暴力死亡面部损伤并保留身份特征,在InjuredFaces基准上优于现有开源方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24441 2026-06-24 cs.CV 新提交 70%

S1-Omni-Image: A Unified Model for Scientific Image Understanding, Generation, and Editing

S1-Omni-Image:面向科学图像理解、生成与编辑的统一模型

Qingxiao Li, Zikai Wang, Qingli Wang, Nan Xu

机构 * XScience Lab(XScience实验室) Wenge AI(文阁人工智能)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 提出S1-Omni-Image,基于S1-VL-32B和“先思考后生成”范式,统一实现科学图像的理解、生成与编辑,在多个基准上达到领先性能。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17531 2026-06-16 cs.CV cs.AI cs.CR 版本更新 70%

Rel-Zero: Harnessing Patch-Pair Invariance for Robust Zero-Watermarking Against AI Editing

Rel-Zero:利用补丁对不变性实现鲁棒的零水印以抵御AI编辑

Pengzhen Chen, Yanwei Liu, Xiaoyan Gu, Xiaojun Chen, Wu Liu, Weiping Wang

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 针对AI编辑对图像真实性的威胁,提出Rel-Zero零水印框架,利用编辑中补丁对关系距离的不变性,无需修改原图即可生成鲁棒水印,实验证明其优于现有方法。

Comments accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02178 2026-06-02 cs.CV cs.AI 70%

Order within Chaos: Capturing Intrinsic Energy Anomalies for AI-Manipulated Image Forgery Localization

混沌中的秩序:捕捉AI操纵图像伪造定位的内在能量异常

Yiming Wang, Baiqi Wu, Qingming Li, Jiahao Chen, Tong Zhang, Shouling Ji

机构 * Zhejiang University(浙江大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出FLAME框架,利用扩散过程抑制局部高频方差产生的统计能量间隙,结合LAD图和SAM适配器实现像素级伪造定位,并引入EditStream流水线持续合成训练数据,在AI生成伪造数据集上达到最先进性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01022 2026-06-02 cs.CV cs.AI 70%

ProductWebGen: Benchmarking Multimodal Product Webpage Generation

ProductWebGen: 多模态产品网页生成基准测试

Zhihong Liu, Siqi Kou, Zheng Li, Ye Ma, Quan Chen, Peng Jiang, Kai Yu, Zhijie Deng

机构 * School of Computer Science & Zhiyuan College(计算机科学学院及智远学院) Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 提出ProductWebGen基准,用于评估多模态生成模型从产品图像和指令生成一致产品展示网页的能力,并比较了基于编辑和基于统一模型两种工作流。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20758 2026-05-21 cs.AI cs.CV cs.LG cs.RO 70%

Conflict-Aware Additive Guidance for Flow Models under Compositional Rewards

面向组合奖励的冲突感知加法引导:流模型中的对抗性生成

Xuehui Yu, Fucheng Cai, Meiyi Wang, Xiaopeng Fan, Harold Soh

机构 * Smart Systems Institute, National University of Singapore, Singapore(新加坡国立大学智能系统研究所) Faculty of Computing, Harbin Institute of Technology, Harbin, China(哈尔滨工业大学计算机学院) School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出了一种面向组合奖励的冲突感知加法引导方法,用于在流模型中处理对抗性生成问题,通过动态检测和解决梯度冲突来纠正离曼福德漂移,提升了生成保真度。

Comments Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13109 2026-05-21 cs.CV 70%

UniEdit-Flow: Unleashing Inversion and Editing in the Era of Flow Models

UniEdit-Flow:在流模型时代释放反向与编辑

Guanlong Jiao, Biqing Huang, Kuan-Chieh Wang, Renjie Liao

机构 * The University of British Columbia(不列颠哥伦比亚大学) Tsinghua University(清华大学) Snap Inc.(Snap公司) Vector Institute(向量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出了一种基于预测-校正框架的流模型反向与编辑方法,通过Uni-Inv实现准确重建,并通过Uni-Edit实现区域感知的图像编辑,方法无需调优,具有通用性和高效性,实验表明其在多种生成模型中均表现出色。

Comments ICLR 2026. Project Page: https://uniedit-flow.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20174 2026-05-20 cs.CV cs.LG 70%

Multi-axis Analysis of Image Manipulation Localization

多轴分析图像操纵定位

Keanu Nichols, Divya Appapogu, Giscard Biamby, Dina Bashkirova, Anna Rohrbach, Bryan A. Plummer

机构 * Boston University(波士顿大学) University of California, Berkeley(加州大学伯克利分校) Technical University of Darmstadt(德累斯顿技术大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出AUDITS基准,用于多轴分析图像操纵检测,通过不同领域转移类型评估现有方法的鲁棒性,以推动更可靠和通用的图像操纵检测方法的发展。

Comments 28 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12305 2026-05-13 cs.CV 70%

Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation

图像与句子:扩展交错指令以实现统一的视觉生成

Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

机构 * ByteDance Seed(字节跳动种子)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出INSET模型,通过将图像作为文本指令中的原生词汇,解决复杂交错指令下的视觉生成问题,提升多图像一致性和文本对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05127 2026-04-24 cs.GR 70%

LooseRoPE: Content-aware Attention Manipulation for Semantic Harmonization

LooseRoPE:基于内容的注意力操控用于语义和谐化

Etai Sella, Yoav Baron, Hadar Averbuch-Elor, Daniel Cohen-Or, Or Patashnik

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.GR

AI总结 本文提出LooseRoPE,通过松驰旋转位置编码实现无提示图像编辑,平衡对象身份保留与上下文融合,实现无缝合成。

Comments Accepted to SIGGRAPH 2026. Project Page: https://snap-research.github.io/LooseRoPE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20038 2026-04-23 cs.CV 70%

FluSplat: Sparse-View 3D Editing without Test-Time Optimization

FluSplat:无需测试时优化的稀疏视角3D编辑

Haitao Huang, Shin-Fang Chng, Huangying Zhan, Qingan Yan, Yi Xu

机构 * Goertek Alpha Labs(科特克阿尔法实验室)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出一种无需测试时优化的稀疏视角3D编辑框架,通过图像域中的跨视角正则化方案实现视图一致性,提升编辑质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20570 2026-04-23 cs.CV 70%

Exploring Spatial Intelligence from a Generative Perspective

从生成视角探索空间智能

Muzhi Zhu, Shunyao Jiang, Huanyi Zheng, Zekai Luo, Hao Zhong, Anzhou Li, Kaijun Wang, Jintao Rong, Yang Liu, Hao Chen, Tao Lin, Chunhua Shen

机构 * Zhejiang University(浙江大学) State Key Laboratory of CAD & CG(计算机辅助设计与图形学国家重点实验室) Ant Group(蚂蚁集团) Westlake University(西湖大学) Zhejiang University of Technology(浙江工业大学)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出GSI-Bench,首个评估生成空间智能的基准,通过空间 grounded 图像编辑量化空间合规性与编辑保真度,实验表明生成训练可提升空间推理能力。

Comments Accepted by CVPR 2026. Project page: https://aim-uofa.github.io/GSI-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22171 2026-04-20 cs.CV 70%

An Empirical Study of Validating Synthetic Data for Text-Based Person Retrieval

基于文本的人检索中合成数据验证的实证研究

Min Cao, Yuxin Lu, Ziyin Zeng, Dong Yi, Jinqiao Wang, Mang Ye

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Frontis Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artifcial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research, Wuhan, China(武汉人工智能研究所,武汉,中国) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 本文首次系统研究文本基于人检索中合成数据的有效性,提出统一合成 pipeline 并通过实验揭示其作为替代或补充的真实数据的实用性。

Comments 20 pages,13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10954 2026-04-14 cs.CV 70%

FineEdit: Fine-Grained Image Edit with Bounding Box Guidance

FineEdit: 基于边界框引导的细粒度图像编辑

Haohang Xu, Lin Liu, Zhibo Zhang, Rong Cong, Xiaopeng Zhang, Qi Tian

机构 * Huawei Inc(华为公司)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出FineEdit,通过多级边界框注入方法提升图像编辑的精确度与背景一致性,结合120万对精细标注图像数据集和FineEdit-Bench基准测试,验证其在指令遵循和背景保留方面的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08536 2026-04-10 cs.CV cs.AI 70%

RewardFlow: Generate Images by Optimizing What You Reward

RewardFlow: 通过优化所奖励的内容生成图像

Onkar Susladkar, Dong-Hwan Jang, Tushar Prakash, Adheesh Juvekar, Vedant Shah, Ayush Barik, Nabeel Bashir, Muntasir Wahed, Ritish Shrirao, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Sony Research, India(索尼印度研究院)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 RewardFlow通过多奖励Langevin动力学优化预训练扩散和流匹配模型,统一了语义对齐、感知保真度等不同可微奖励,并引入基于VQA的可微奖励提升语义监督。

Comments CVPR 2026. Project page: https://plan-lab.github.io/rewardflow

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00698 2026-04-07 cs.CV cs.LG 70%

Concept-Centric Token Interpretation for Vector-Quantized Generative Models

面向概念的标记解释方法用于向量量化生成模型

Tianze Yang, Yucheng Shi, Mengnan Du, Xuansheng Wu, Qiaoyu Tan, Jin Sun, Ninghao Liu

机构 * School of Computing, University of Georgia(佐治亚大学计算学院) Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系) Department of Computer Science, New York University(纽约大学计算机科学系)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出CORTEX方法,通过分析标记重要性及代码本来解释VQGMs生成过程,提升模型透明度并应用于图像编辑和特征检测。

Comments 17 pages, 7 figures

Journal ref In Proceedings of the 42nd International Conference on Machine Learning (ICML), PMLR 267:71034-71050, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08881 2026-03-27 cs.CV cs.AI 70%

TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Experts

TAG-MoE:基于任务的门控用于统一的生成混合专家

Yu Xu, Hongbin Yan, Juan Cao, Yiji Cheng, Tiankai Hang, Runze He, Zijin Yin, Shiyi Zhang, Yuxin Zhang, Jintao Li, Chunyu Wang, Qinglin Lu, Tong-Yee Lee, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文言) National Cheng-Kung University(国立成功大学)

专题命中 图像编辑 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出TAG-MoE框架,通过引入层次化任务语义标注方案和预测对齐正则化,解决密集扩散变换器架构中任务干扰问题,提升生成质量和保真度。

Comments Accept by CVPR 2026. Project page: https://yuci-gpt.github.io/TAG-MoE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22228 2026-03-23 cs.CV cs.AI cs.LG 70%

3D-Consistent Multi-View Editing by Correspondence Guidance

通过对应引导的3D一致多视角编辑

Josef Bengtson, David Nilsson, Dong In Lee, Yaroslava Lochman, Fredrik Kahl

机构 * Chalmers University of Technology(查尔姆斯理工大学) Korea University(韩国大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的引导框架,通过在图像编辑过程中强制多视角一致性,提升3D表示如NeRF或高斯点云模型的编辑一致性,实验表明其显著优于现有方法。

Comments Added experiments with FLUX.1 editing method

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14341 2026-03-03 cs.CV cs.AI cs.CY cs.LG 70%

Towards Transferable Defense Against Malicious Image Edits

面向恶意图像编辑的可迁移防御

Jie Zhang, Shuai Dong, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of China Academy of Sciences(中国科学院大学) School of Computer Science, China University of Geosciences(中国地质大学(武汉)计算机学院)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 TDAE通过双模优化提升图像对恶意编辑的免疫性,实现跨模型的可迁移防御。

Comments 14 pages, 5 figures, accepted by IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19542 2026-02-24 cs.CV 70%

Vinedresser3D: Agentic Text-guided 3D Editing

Vinedresser3D: 基于代理的文本引导3D编辑

Yankuan Chi, Xiang Li, Zixuan Huang, James M. Rehg

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 图像编辑 :image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 Vinedresser3D通过多模态大语言模型和潜在空间编辑技术实现高质量文本引导的3D编辑,提升编辑精度与一致性。

Comments CVPR 2026, Project website:https://vinedresser3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19219 2026-02-24 cs.CV cs.LG 70%

Controlled Face Manipulation and Synthesis for Data Augmentation

可控面部操纵与合成用于数据增强

Joris Kirchner, Amogh Gudi, Marian Bittner, Chirag Raman

机构 * Vicarious Perception Technologies (VicarVision)(维卡里斯感知技术(VicarVision)) Delft University of Technology(代尔夫特理工大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出了一种在语义潜在空间中进行可控面部操纵的方法,通过减少语义特征交织和去除噪声属性,提升AU检测器的准确性和解耦预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10509 2026-01-23 cs.CV 70%

A Segmentation-driven Editing Method for Bolt Defect Augmentation and Detection

基于分割的螺栓缺陷增强与检测方法

Yangjie Xiao, Ke Zhang, Jiacun Wang, Xin Sheng, Yurong Guo, Meijuan Chen, Zehua Ren, Zhaoye Zheng, Zhenbing Zhao

专题命中 图像编辑 :image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出基于分割的螺栓缺陷增强与检测方法,通过属性分割和编辑技术生成缺陷图像,提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06835 2026-01-16 cs.CV 70%

Tuning-Free Adaptive Style Incorporation for Structure-Consistent Text-Driven Style Transfer

无需调优的自适应风格融合用于结构一致的文本驱动风格迁移

Yanqi Ge, Jiaqi Liu, Qingnan Fan, Xi Jiang, Ye Huang, Shuai Qin, Hong Gu, Wen Li, Lixin Duan

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Sichuan Provincial Key Laboratory for Human Disease Gene Study and the Center for Medical Genetics, Department of Laboratory Medicine, Sichuan Academy of Medical Sciences and Sichuan Provincial People’s Hospital, UESTC(四川省人类疾病基因研究重点实验室和医学遗传中心,四川省医学研究院及四川省人民医院,电子科技大学) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(深圳先进研究院,电子科技大学) Department of Computer Science and Engineering, Southern University of Science and Technology(计算机科学与工程系,南方科技大学) VIVO

专题命中 图像编辑 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出自适应风格融合方法,通过双通道结构解耦和结构一致的融合机制,提升文本驱动风格迁移的结构一致性和风格效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07219 2026-01-13 cs.CV 70%

VENUS: Visual Editing with Noise Inversion Using Scene Graphs

VENUS: 使用场景图进行视觉编辑的噪声反演

Thanh-Nhan Vo, Trong-Thuan Nguyen, Tam V. Nguyen, Minh-Triet Tran

机构 * University of Science, VNU-HCM(越南胡志明市科学大学) Vietnam National University(越南国家大学) University of Dayton(戴维森大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 VENUS是一种无需训练的场景图引导图像编辑框架,通过噪声反演和拆分提示策略提升图像编辑的保真度和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02204 2026-01-06 cs.CV cs.AI 70%

NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation

NextFlow:统一的序列建模激活多模态理解和生成

Huichao Zhang, Liao Qu, Yiheng Liu, Hang Chen, Yangyang Song, Yongsheng Dong, Shikun Sun, Xian Li, Xu Wang, Yi Jiang, Hu Ye, Bo Chen, Yiming Gao, Peng Liu, Akide Liu, Zhipeng Yang, Qili Deng, Linjie Xing, Jiyang Liu, Zhao Wang, Yang Zhou, Mingcong Liu, Yi Zhang, Qian He, Xiwei Hu, Zhongqi Qi, Jie Shao, Zhiye Fu, Shuai Wang, Fangmin Chen, Xuezhi Chai, Zhihua Wu, Yitong Wang, Zehuan Yuan, Daniel K. Du, Xinglong Wu

机构 * TsingHua University(清华大学) Monash University(墨尔本大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 NextFlow通过统一的自回归架构实现多模态理解和生成,以高效生成高分辨率图像并提升视觉质量。

Comments Project page: https://github.com/ByteVisionLab/NextFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21560 2025-12-29 cs.CV 70%

Toward Intelligent Scene Augmentation for Context-Aware Object Placement and Sponsor-Logo Integration

迈向智能场景增强以实现情境感知的对象放置和赞助商-标志集成

Unnati Saraswat, Tarun Rao, Namah Gupta, Shweta Swami, Shikhar Sharma, Prateek Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science(巴里尔理工学院和科学研究院)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出两个新任务:情境感知的对象插入和赞助商-产品标志增强,并构建了相应数据集以支持这些任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07247 2025-12-09 cs.CV cs.CR cs.LG 70%

AdLift: Lifting Adversarial Perturbations to Safeguard 3D Gaussian Splatting Assets Against Instruction-Driven Editing

AdLift: 将对抗扰动提升以保护3D高斯点云资产免受指令驱动编辑的影响

Ziming Hong, Tianyu Huang, Runnan Chen, Shanshan Ye, Mingming Gong, Bo Han, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) University of Technology Sydney(技术大学悉尼) University of Melbourne(墨尔本大学) Hong Kong Baptist University(香港 Baptist 大学) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed 人工智能大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 AdLift通过提升2D对抗扰动至3D高斯表示,有效保护3DGS资产免受指令驱动编辑攻击。

Comments 40 pages, 34 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05965 2025-12-08 cs.CV 70%

EditThinker: Unlocking Iterative Reasoning for Any Image Editor

EditThinker: 解锁任何图像编辑器的迭代推理

Hongyu Li, Manyuan Zhang, Dian Zheng, Ziyu Guo, Yimeng Jia, Kaituo Feng, Hao Yu, Yexin Liu, Yan Feng, Peng Pei, Xunliang Cai, Linjiang Huang, Hongsheng Li, Si Liu

机构 * Beihang University(北航大学) Meituan(美团) CUHK MMLab CUHK IMIXR Tsinghua University(清华大学)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 EditThinker通过迭代推理框架提升图像编辑指令遵循能力,利用强化学习优化编辑过程,显著提高模型性能。

Comments Project page: https://appletea233.github.io/think-while-edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16567 2025-12-08 cs.CV cs.AI 70%

V-CECE: Visual Counterfactual Explanations via Conceptual Edits

V-CECE:通过概念编辑生成视觉反事实解释

Nikolaos Spanos, Maria Lymperaiou, Giorgos Filandrianos, Konstantinos Thomas, Athanasios Voulodimos, Giorgos Stamou

机构 * National Technical University of Athens(国家技术大学雅典)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 V-CECE通过概念编辑生成反事实解释,无需训练即可产生人类水平的可解释性结果。

Comments Accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23199 2025-12-01 cs.CV cs.AI 70%

Vision Bridge Transformer at Scale

大规模 Vision Bridge Transformer

Zhenxiong Tan, Zeqing Wang, Xingyi Yang, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 ViBT 是一种大规模 Bridge 模型,通过 Transformer 架构和方差稳定的速度匹配目标,实现高效图像和视频翻译任务。

详情

展开后加载摘要…

URL PDF HTML 收藏