arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1258 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1258 篇

2511.14259 2026-01-21 cs.CV 57%

ManipShield: A Unified Framework for Image Manipulation Detection, Localization and Explanation

ManipShield: 一种用于图像篡改检测、定位和解释的统一框架

Zitong Xu, Huiyu Duan, Xiaoyu Wang, Zhaolin Cai, Kaiwei Zhang, Qiang Hu, Jing Liu, Xiongkuo Min, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) University of Electronic and Science Technology of China(电子科技大学) Tianjin University(天津大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 ManipShield基于多模态大语言模型,通过对比学习LoRA微调和任务特定解码器,实现图像篡改的统一检测、定位和解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08040 2026-01-14 cs.CV 57%

Rescind: Countering Image Misconduct in Biomedical Publications with Vision-Language and State-Space Modeling

Rescind: 通过视觉-语言和状态空间建模对抗生物医学出版物中的图像不当行为

Soumyaroop Nandi, Prem Natarajan

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 Rescind通过视觉-语言和状态空间建模方法,提出首个生物医学图像伪造生成与检测框架,实现高精度伪造定位与验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06202 2026-01-13 cs.CV 57%

QwenStyle: Content-Preserving Style Transfer with Qwen-Image-Edit

QwenStyle: 保留内容的风格迁移与Qwen-Image-Edit

Shiwen Zhang, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究所)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 QwenStyle通过课程持续学习框架,在保留内容的同时实现高质量风格迁移,达到最先进的性能。

Comments The codes and models are released at https://github.com/witcherofresearch/Qwen-Image-Style-Transfer

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03114 2026-01-07 cs.GR 57%

Stroke Patches: Customizable Artistic Image Styling Using Regression

笔触补丁:通过回归实现可定制的艺术图像风格化

Ian Jaffray, John Bronskill

专题命中 图像编辑 :diffusion(abstract);分类 cs.GR

AI总结 本文提出了一种基于回归的图像风格化方法,通过可扩展的笔触补丁集实现对图像风格的定制化控制。

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Creative AI Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02566 2026-01-07 cs.CV 57%

Shallow- and Deep-fake Image Manipulation Localization Using Vision Mamba and Guided Graph Neural Network

使用视觉Mamba和引导图神经网络进行浅层和深层伪造图像篡改定位

Junbin Zhang, Hamid Reza Tohidypour, Yixiao Wang, Panos Nasiopoulos

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出利用视觉Mamba和引导图神经网络,实现对浅层和深层伪造图像中篡改区域的高效定位与区分。

Comments Under review for journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20987 2025-12-29 cs.CV 57%

Webly-Supervised Image Manipulation Localization via Category-Aware Auto-Annotation

通过类别感知自动标注实现Web监督的图像操纵定位

Chenfan Qu, Yiwu Zhong, Huiguo He, Bin Li, Lianwen Jin

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 通过类别感知自动标注和网络监督,提出 Web-IML 模型以有效定位图像操纵区域,显著提升性能并扩大数据集规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18853 2025-12-23 cs.CV cs.HC 57%

VizDefender: Unmasking Visualization Tampering through Proactive Localization and Intent Inference

VizDefender:通过主动定位和意图推断揭示可视化篡改

Sicheng Song, Yanjie Zhang, Zixin Chen, Huamin Qu, Changbo Wang, Chenhui Li

机构 * East China Normal University(华东师范大学) Hong Kong University of Science and Technology(香港科学与技术大学) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 VizDefender通过半脆弱水印和意图分析模块,主动定位和推断可视化篡改,有效检测和分析数据篡改与视觉编码篡改。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE PacificVis'26 TVCG Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25141 2025-12-23 cs.CV 57%

EIRES:Training-free AI-Generated Image Detection via Edit-Induced Reconstruction Error Shift

EIRES: 通过编辑诱导的重建误差偏移实现无需训练的AI生成图像检测

Wan Jiang, Jing Yan, Xiaojing Chen, Lin Shen, Chenhao Lin, Yunfeng Diao, Richang Hong

机构 * HFUT(合肥大学) AHU(安徽大学) XJTU(西安交通大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 EIRES通过编辑诱导的重建误差偏移实现无需训练的AI生成图像检测,利用结构编辑揭示真实与生成图像的固有差异,提高检测可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17459 2025-12-22 cs.CV 57%

3D-RE-GEN: 3D Reconstruction of Indoor Scenes with a Generative Framework

3D-RE-GEN:基于生成框架的室内场景三维重建

Tobias Sautter, Jan-Niklas Dihlmann, Hendrik P. A. Lensch

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 3D-RE-GEN通过生成框架实现单图像室内场景的高质量三维重建,结合多领域模型提升重建精度与实用性。

Comments Project Page: https://3dregen.jdihlmann.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16920 2025-12-19 cs.CV cs.AI 57%

EasyV2V: A High-quality Instruction-based Video Editing Framework

EasyV2V: 一种高质量的基于指令的视频编辑框架

Jinjie Mai, Chaoyang Wang, Guocheng Gordon Qian, Willi Menapace, Sergey Tulyakov, Bernard Ghanem, Peter Wonka, Ashkan Mirzaei

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 EasyV2V通过简化设计和灵活输入实现高质量视频编辑,超越现有系统。

Comments Project page: https://snap-research.github.io/easyv2v/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16906 2025-12-19 cs.CV 57%

VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization

VIVA: 基于VLM的指令式视频编辑与奖励优化

Xiaoyan Cong, Haotian Yang, Angtian Wang, Yizhi Wang, Yiding Yang, Canyu Zhang, Chongyang Ma

机构 * Brown University(布朗大学) Intelligent Creation, ByteDance(字节跳动智能创作)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 VIVA通过VLM引导编码和奖励优化,实现更高效、高质量的指令式视频编辑,提升对复杂指令的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23002 2025-12-05 cs.CV 57%

JarvisEvo: Towards a Self-Evolving Photo Editing Agent with Synergistic Editor-Evaluator Optimization

JarvisEvo: 向自进化式照片编辑代理迈进:协同编辑器-评估器优化

Yunlong Lin, Linqing Wang, Kunjie Lin, Zixu Lin, Kaixiong Gong, Wenbo Li, Bin Lin, Zhenxi Li, Shiyi Zhang, Yuyang Peng, Wenxun Dai, Xinghao Ding, Chunyu Wang, Qinglin Lu

机构 * Tencent Hunyuan(腾讯文元)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 JarvisEvo通过协同编辑器-评估器优化,实现自进化式照片编辑代理,提升编辑质量和内容保真度。

Comments 31 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02014 2025-12-02 cs.CV 57%

TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models

TUNA: 降低统一视觉表示以适应原生统一多模态模型

Zhiheng Liu, Weiming Ren, Haozhe Liu, Zijian Zhou, Shoufa Chen, Haonan Qiu, Xiaoke Huang, Zhaochong An, Fanny Yang, Aditya Patel, Viktar Atliha, Tony Ng, Xiao Han, Chuyan Zhu, Chenyang Zhang, Ding Liu, Juan-Manuel Perez-Rua, Sen He, Jürgen Schmidhuber, Wenhu Chen, Ping Luo, Wei Liu, Tao Xiang, Jonas Schult, Yuren Cong

机构 * Meta BizAI University of Waterloo(滑铁卢大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 TUNA通过统一视觉表示提升多模态模型的性能,实现端到端理解和生成任务的高效处理。

Comments Project page: https://tuna-ai.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22237 2025-12-01 cs.CV 57%

Creating Blank Canvas Against AI-enabled Image Forgery

对抗AI图像伪造的空白画布创建

Qi Song, Ziyuan Luo, Renjie Wan

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出了一种基于Segment Anything Model的对抗性方法,通过将图像转换为空白画布来检测AI图像伪造,利用频率感知优化策略提升篡改定位能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20957 2025-11-27 cs.CV 57%

Beyond Realism: Learning the Art of Expressive Composition with StickerNet

超越现实:利用StickerNet学习表现性创作

Haoming Lu, David Kocharian, Humphrey Shi

机构 * Picsart AI Research(Picsart人工智能研究) Picsart Inc(Picsart公司) College of Computing(计算学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 StickerNet通过学习真实世界编辑模式,实现了表现性图像合成,超越传统真实感追求,提升艺术性和用户意图的表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17614 2025-11-25 cs.CV cs.LG 57%

HSMix: Hard and Soft Mixing Data Augmentation for Medical Image Segmentation

HSMix:用于医学图像分割的硬软混合数据增强

Danyang Sun, Fadi Dornaika, Nagore Barrena

机构 * University of the Basque Country(巴斯克大学) IKERBASQUE(ikerbasque研究所)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 HSMix通过硬软混合数据增强技术提升医学图像分割性能,结合同质区域混合与亮度调整,增强数据多样性并保留语义信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12267 2025-11-18 cs.CV 57%

ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks

Ruixun Liu, Bowen Fu, Jiayi Song, Kaiyu Li, Wanchen Li, Lanxuan Xue, Hui Qiao, Weizhan Zhang, Deyu Meng, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) China Telecom Shaanxi Branch(中国电信陕西分公司)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07938 2025-11-18 cs.LG cs.CV stat.ME 57%

CAD-VAE: Leveraging Correlation-Aware Latents for Comprehensive Fair Disentanglement

Chenrui Ma, Xi Xiao, Tianyang Wang, Xiao Wang, Yanning Shen

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08251 2025-11-12 cs.CV 57%

LayerEdit: Disentangled Multi-Object Editing via Conflict-Aware Multi-Layer Learning

Fengyi Fu, Mengqi Huang, Lei Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

Comments The 40th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06365 2025-11-11 cs.CV 57%

V-Shuffle: Zero-Shot Style Transfer via Value Shuffle

Haojun Tang, Qiwei Lin, Tongda Xu, Lida Huang, Yan Wang

机构 * Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Beijing Institute of Radio Measurement(北京无线电测量研究所)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17899 2025-11-07 cs.CV 57%

What Time Tells Us? An Explorative Study of Time Awareness Learned from Static Images

Dongheng Lin, Han Hu, Jianbo Jiao

机构 * University of Birmingham(伯明翰大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

Comments Accepted by TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14648 2025-10-17 cs.CV cs.AI 57%

In-Context Learning with Unpaired Clips for Instruction-based Video Editing

Xinyao Liao, Xianfang Zeng, Ziye Song, Zhoujie Fu, Gang Yu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) StepFun

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13652 2025-10-16 cs.CV 57%

EditCast3D: Single-Frame-Guided 3D Editing with Video Propagation and View Selection

Huaizhi Qu, Ruichen Zhang, Shuqing Luo, Luchao Qi, Zhihao Zhang, Xiaoming Liu, Roni Sengupta, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Michigan State University(密歇根州立大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07546 2025-10-10 cs.CV 57%

PickStyle: Video-to-Video Style Transfer with Context-Style Adapters

Soroush Mehraban, Vida Adeli, Jacob Rommann, Babak Taati, Kyryl Truskovskyi

机构 * Pickford AI University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06679 2025-10-09 cs.CV 57%

DreamOmni2: Multimodal Instruction-based Editing and Generation

Bin Xia, Bohao Peng, Yuechen Zhang, Junjia Huang, Jiyang Liu, Jingyao Li, Haoru Tan, Sitong Wu, Chengyao Wang, Yitong Wang, Xinglong Wu, Bei Yu, Jiaya Jia

机构 * CUHK(香港中文大学) HKUST(香港科技大学) HKU(香港大学) ByteDance Inc(字节跳动公司)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18538 2025-10-08 cs.CV 57%

GeoRemover: Removing Objects and Their Causal Visual Artifacts

Zixin Zhu, Haoxiang Li, Xuelu Feng, He Wu, Chunming Qiao, Junsong Yuan

机构 * University at Buffalo(布法罗大学) Pixocial Technology(Pixocial科技)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

Comments Accepted as Spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01715 2025-10-03 cs.CV cs.AI 57%

PyramidStyler: Transformer-Based Neural Style Transfer with Pyramidal Positional Encoding and Reinforcement Learning

Raahul Krishna Durairaju, K. Saruladha

专题命中 图像编辑 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05424 2025-09-18 cs.LG cs.CV 57%

Locally Explaining Prediction Behavior via Gradual Interventions and Measuring Property Gradients

Niklas Penzel, Joachim Denzler

机构 * Computer Vision Group, Friedrich Schiller University Jena(耶拿弗里德里希·施勒尔大学计算机视觉组)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

Comments Accepted at WACV-2026, 45 pages, 39 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08640 2025-09-11 eess.IV cs.AI cs.CV 57%

RoentMod: A Synthetic Chest X-Ray Modification Model to Identify and Correct Image Interpretation Model Shortcuts

Lauren H. Cooke, Matthias Jung, Jan M. Brendel, Nora M. Kerkovits, Borek Foldyna, Michael T. Lu, Vineet K. Raghu

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

Comments 25 + 8 pages, 4 + 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08583 2025-09-11 cs.CV 57%

EfficientIML: Efficient High-Resolution Image Manipulation Localization

Jinhan Li, Haoyang He, Lei Xie, Jiangning Zhang

机构 * New York University(纽约大学) Zhejiang University(浙江大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏