arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86585 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1264 篇

2603.05518 2026-03-09 cs.HC cs.CV 57%

CoEditor++: Instruction-based Visual Editing via Cognitive Reasoning

CoEditor++:基于指令的视觉编辑 via 认知推理

Minheng Ni, Yutao Fan, Zhengyuan Yang, Yeli Shen, Yuxiang Wei, Yaowen Zhang, Lijuan Wang, Lei Zhang, Wangmeng Zuo

机构 * Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) Microsoft(微软公司)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 CoEditor++通过认知推理实现基于指令的视觉编辑,无需训练即可在通用和负责任的编辑任务中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10082 2026-02-26 cs.CV 57%

LoRA-Edit: Controllable First-Frame-Guided Video Editing via Mask-Aware LoRA Fine-Tuning

LoRA-Edit: 通过掩码感知LoRA微调实现可控的第一帧引导视频编辑

Chenjian Gao, Lihe Ding, Xin Cai, Zhanpeng Huang, Zibin Wang, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) SenseTime Research(商汤科技研究院)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 LoRA-Edit通过时空掩码引导LoRA微调,实现对视频编辑全过程的可控编辑,支持生成动态变化的视频内容。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18742 2026-02-24 cs.RO cs.AI cs.CV 57%

RoboCurate: Harnessing Diversity with Action-Verified Neural Trajectory for Robot Learning

RoboCurate: 利用动作验证的神经轨迹 harnessing 多样性以促进机器人学习

Seungku Kim, Suhyeok Jang, Byungjun Yoon, Dongyoung Kim, John Won, Jinwoo Shin

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 RoboCurate通过动作验证的神经轨迹和图像编辑技术,提升机器人学习中合成数据的质量和多样性,显著提高任务成功率。

Comments 20 pages; 6 figures; Project page is available at https://seungkukim.github.io/robocurate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00618 2026-02-03 cs.CV 57%

Tune-Your-Style: Intensity-tunable 3D Style Transfer with Gaussian Splatting

Tune-Your-Style: 可调强度的3D风格迁移与高斯点散布

Yian Zhao, Rushi Ye, Ruochong Zheng, Zesen Cheng, Chaoran Feng, Jiashu Yang, Pengchong Qiao, Chang Liu, Jie Chen

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(电子与计算机工程学院,北京大学深圳校区) Pengcheng Laboratory, Shenzhen, China(鹏城实验室) AI for Science (AI4S)-Preferred Program, Peking University Shenzhen Graduate School, China(人工智能科学(AI4S)优选计划,北京大学深圳研究生院) Department of Automation and BNRist, Tsinghua University, Beijing, China(自动化系和BNRist,清华大学,北京,中国) Dalian University of Technology, China(大连理工大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 Tune-Your-Style通过可调强度的3D风格迁移方法,实现灵活的内容-风格平衡,提升3D风格迁移的定制性。

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00265 2026-02-03 cs.CV 57%

World-Shaper: A Unified Framework for 360° Panoramic Editing

World-Shaper:360°全景编辑的统一框架

Dong Liang, Yuhao Liu, Jinyuan Jia, Youjun Zhao, Rynson W. H. Lau

机构 * Tongji University(同济大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 World-Shaper通过统一的几何感知框架,实现360°全景生成与编辑的统一控制,提升编辑一致性与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20175 2026-01-29 cs.CV 57%

TeleStyle: Content-Preserving Style Transfer in Images and Videos

TeleStyle: 图像和视频中的内容保持风格迁移

Shiwen Zhang, Xiaoyan Yang, Bojia Zi, Haibin Huang, Chi Zhang, Xuelong Li

机构 * TeleAI

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 TeleStyle通过课程持续学习框架实现图像和视频内容保持的风格迁移,提升风格相似性和内容一致性,达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12954 2026-01-27 cs.CV 57%

StyMam: A Mamba-Based Generator for Artistic Style Transfer

StyMam:基于Mamba的风格迁移生成器

Zhou Hong, Ning Dong, Yicheng Di, Xiaolong Xu, Rongsheng Hu, Yihua Shao, Run Ling, Yun Wang, Juqin Wang, Zhanjie Zhang, Ao Ma

机构 * School of Information Engineering, Suqian University(信息工程学院,苏庆大学) School of Artificial Intelligence and Computer Science, Jiangnan University(人工智能与计算机科学学院,江南大学) Jiangsu Province Engineering Research Center of Smart Poultry Farming and Intelligent Equipment(江苏省智能养鸡场与智能设备工程研究中心) School of Computer Science, Nanjing University of Posts and Telecommunications(计算机科学学院,南京邮电大学) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) School of Internet of Things, Wuxi University of Technology(物联网学院,无锡科技大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 StyMam通过引入基于Mamba的生成器,结合残差双路径扫描机制和通道加权空间注意力模块,实现了高质量且快速的图像风格迁移。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15664 2026-01-23 cs.CV cs.AI 57%

Skywork UniPic 3.0: Unified Multi-Image Composition via Sequence Modeling

Skywork UniPic 3.0:通过序列建模实现统一的多图像合成

Hongyang Wei, Hongbo Liu, Zidong Wang, Yi Peng, Baixin Xu, Size Wu, Xuying Zhang, Xianglong He, Zexiang Liu, Peiyu Wang, Xuchen Song, Yangguang Li, Yang Liu, Yahui Zhou

机构 * Skywork

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 Skywork UniPic 3.0通过序列建模实现统一的多图像合成,采用新颖的训练范式和高效的数据流程,在单图像编辑和多图像合成任务中均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14259 2026-01-21 cs.CV 57%

ManipShield: A Unified Framework for Image Manipulation Detection, Localization and Explanation

ManipShield: 一种用于图像篡改检测、定位和解释的统一框架

Zitong Xu, Huiyu Duan, Xiaoyu Wang, Zhaolin Cai, Kaiwei Zhang, Qiang Hu, Jing Liu, Xiongkuo Min, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) University of Electronic and Science Technology of China(电子科技大学) Tianjin University(天津大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 ManipShield基于多模态大语言模型,通过对比学习LoRA微调和任务特定解码器,实现图像篡改的统一检测、定位和解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08040 2026-01-14 cs.CV 57%

Rescind: Countering Image Misconduct in Biomedical Publications with Vision-Language and State-Space Modeling

Rescind: 通过视觉-语言和状态空间建模对抗生物医学出版物中的图像不当行为

Soumyaroop Nandi, Prem Natarajan

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 Rescind通过视觉-语言和状态空间建模方法,提出首个生物医学图像伪造生成与检测框架,实现高精度伪造定位与验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06202 2026-01-13 cs.CV 57%

QwenStyle: Content-Preserving Style Transfer with Qwen-Image-Edit

QwenStyle: 保留内容的风格迁移与Qwen-Image-Edit

Shiwen Zhang, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究所)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 QwenStyle通过课程持续学习框架,在保留内容的同时实现高质量风格迁移,达到最先进的性能。

Comments The codes and models are released at https://github.com/witcherofresearch/Qwen-Image-Style-Transfer

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03114 2026-01-07 cs.GR 57%

Stroke Patches: Customizable Artistic Image Styling Using Regression

笔触补丁:通过回归实现可定制的艺术图像风格化

Ian Jaffray, John Bronskill

专题命中 图像编辑 :diffusion(abstract);分类 cs.GR

AI总结 本文提出了一种基于回归的图像风格化方法,通过可扩展的笔触补丁集实现对图像风格的定制化控制。

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Creative AI Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02566 2026-01-07 cs.CV 57%

Shallow- and Deep-fake Image Manipulation Localization Using Vision Mamba and Guided Graph Neural Network

使用视觉Mamba和引导图神经网络进行浅层和深层伪造图像篡改定位

Junbin Zhang, Hamid Reza Tohidypour, Yixiao Wang, Panos Nasiopoulos

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出利用视觉Mamba和引导图神经网络,实现对浅层和深层伪造图像中篡改区域的高效定位与区分。

Comments Under review for journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20987 2025-12-29 cs.CV 57%

Webly-Supervised Image Manipulation Localization via Category-Aware Auto-Annotation

通过类别感知自动标注实现Web监督的图像操纵定位

Chenfan Qu, Yiwu Zhong, Huiguo He, Bin Li, Lianwen Jin

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 通过类别感知自动标注和网络监督,提出 Web-IML 模型以有效定位图像操纵区域,显著提升性能并扩大数据集规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18853 2025-12-23 cs.CV cs.HC 57%

VizDefender: Unmasking Visualization Tampering through Proactive Localization and Intent Inference

VizDefender:通过主动定位和意图推断揭示可视化篡改

Sicheng Song, Yanjie Zhang, Zixin Chen, Huamin Qu, Changbo Wang, Chenhui Li

机构 * East China Normal University(华东师范大学) Hong Kong University of Science and Technology(香港科学与技术大学) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 VizDefender通过半脆弱水印和意图分析模块,主动定位和推断可视化篡改,有效检测和分析数据篡改与视觉编码篡改。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE PacificVis'26 TVCG Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25141 2025-12-23 cs.CV 57%

EIRES:Training-free AI-Generated Image Detection via Edit-Induced Reconstruction Error Shift

EIRES: 通过编辑诱导的重建误差偏移实现无需训练的AI生成图像检测

Wan Jiang, Jing Yan, Xiaojing Chen, Lin Shen, Chenhao Lin, Yunfeng Diao, Richang Hong

机构 * HFUT(合肥大学) AHU(安徽大学) XJTU(西安交通大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 EIRES通过编辑诱导的重建误差偏移实现无需训练的AI生成图像检测,利用结构编辑揭示真实与生成图像的固有差异,提高检测可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17459 2025-12-22 cs.CV 57%

3D-RE-GEN: 3D Reconstruction of Indoor Scenes with a Generative Framework

3D-RE-GEN:基于生成框架的室内场景三维重建

Tobias Sautter, Jan-Niklas Dihlmann, Hendrik P. A. Lensch

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 3D-RE-GEN通过生成框架实现单图像室内场景的高质量三维重建,结合多领域模型提升重建精度与实用性。

Comments Project Page: https://3dregen.jdihlmann.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16920 2025-12-19 cs.CV cs.AI 57%

EasyV2V: A High-quality Instruction-based Video Editing Framework

EasyV2V: 一种高质量的基于指令的视频编辑框架

Jinjie Mai, Chaoyang Wang, Guocheng Gordon Qian, Willi Menapace, Sergey Tulyakov, Bernard Ghanem, Peter Wonka, Ashkan Mirzaei

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 EasyV2V通过简化设计和灵活输入实现高质量视频编辑,超越现有系统。

Comments Project page: https://snap-research.github.io/easyv2v/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16906 2025-12-19 cs.CV 57%

VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization

VIVA: 基于VLM的指令式视频编辑与奖励优化

Xiaoyan Cong, Haotian Yang, Angtian Wang, Yizhi Wang, Yiding Yang, Canyu Zhang, Chongyang Ma

机构 * Brown University(布朗大学) Intelligent Creation, ByteDance(字节跳动智能创作)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 VIVA通过VLM引导编码和奖励优化,实现更高效、高质量的指令式视频编辑,提升对复杂指令的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23002 2025-12-05 cs.CV 57%

JarvisEvo: Towards a Self-Evolving Photo Editing Agent with Synergistic Editor-Evaluator Optimization

JarvisEvo: 向自进化式照片编辑代理迈进:协同编辑器-评估器优化

Yunlong Lin, Linqing Wang, Kunjie Lin, Zixu Lin, Kaixiong Gong, Wenbo Li, Bin Lin, Zhenxi Li, Shiyi Zhang, Yuyang Peng, Wenxun Dai, Xinghao Ding, Chunyu Wang, Qinglin Lu

机构 * Tencent Hunyuan(腾讯文元)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 JarvisEvo通过协同编辑器-评估器优化,实现自进化式照片编辑代理,提升编辑质量和内容保真度。

Comments 31 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02014 2025-12-02 cs.CV 57%

TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models

TUNA: 降低统一视觉表示以适应原生统一多模态模型

Zhiheng Liu, Weiming Ren, Haozhe Liu, Zijian Zhou, Shoufa Chen, Haonan Qiu, Xiaoke Huang, Zhaochong An, Fanny Yang, Aditya Patel, Viktar Atliha, Tony Ng, Xiao Han, Chuyan Zhu, Chenyang Zhang, Ding Liu, Juan-Manuel Perez-Rua, Sen He, Jürgen Schmidhuber, Wenhu Chen, Ping Luo, Wei Liu, Tao Xiang, Jonas Schult, Yuren Cong

机构 * Meta BizAI University of Waterloo(滑铁卢大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 TUNA通过统一视觉表示提升多模态模型的性能,实现端到端理解和生成任务的高效处理。

Comments Project page: https://tuna-ai.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22237 2025-12-01 cs.CV 57%

Creating Blank Canvas Against AI-enabled Image Forgery

对抗AI图像伪造的空白画布创建

Qi Song, Ziyuan Luo, Renjie Wan

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出了一种基于Segment Anything Model的对抗性方法,通过将图像转换为空白画布来检测AI图像伪造,利用频率感知优化策略提升篡改定位能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20957 2025-11-27 cs.CV 57%

Beyond Realism: Learning the Art of Expressive Composition with StickerNet

超越现实:利用StickerNet学习表现性创作

Haoming Lu, David Kocharian, Humphrey Shi

机构 * Picsart AI Research(Picsart人工智能研究) Picsart Inc(Picsart公司) College of Computing(计算学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 StickerNet通过学习真实世界编辑模式,实现了表现性图像合成,超越传统真实感追求,提升艺术性和用户意图的表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17614 2025-11-25 cs.CV cs.LG 57%

HSMix: Hard and Soft Mixing Data Augmentation for Medical Image Segmentation

HSMix:用于医学图像分割的硬软混合数据增强

Danyang Sun, Fadi Dornaika, Nagore Barrena

机构 * University of the Basque Country(巴斯克大学) IKERBASQUE(ikerbasque研究所)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 HSMix通过硬软混合数据增强技术提升医学图像分割性能,结合同质区域混合与亮度调整,增强数据多样性并保留语义信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12267 2025-11-18 cs.CV 57%

ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks

Ruixun Liu, Bowen Fu, Jiayi Song, Kaiyu Li, Wanchen Li, Lanxuan Xue, Hui Qiao, Weizhan Zhang, Deyu Meng, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) China Telecom Shaanxi Branch(中国电信陕西分公司)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07938 2025-11-18 cs.LG cs.CV stat.ME 57%

CAD-VAE: Leveraging Correlation-Aware Latents for Comprehensive Fair Disentanglement

Chenrui Ma, Xi Xiao, Tianyang Wang, Xiao Wang, Yanning Shen

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08251 2025-11-12 cs.CV 57%

LayerEdit: Disentangled Multi-Object Editing via Conflict-Aware Multi-Layer Learning

Fengyi Fu, Mengqi Huang, Lei Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

Comments The 40th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06365 2025-11-11 cs.CV 57%

V-Shuffle: Zero-Shot Style Transfer via Value Shuffle

Haojun Tang, Qiwei Lin, Tongda Xu, Lida Huang, Yan Wang

机构 * Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Beijing Institute of Radio Measurement(北京无线电测量研究所)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17899 2025-11-07 cs.CV 57%

What Time Tells Us? An Explorative Study of Time Awareness Learned from Static Images

Dongheng Lin, Han Hu, Jianbo Jiao

机构 * University of Birmingham(伯明翰大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

Comments Accepted by TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14648 2025-10-17 cs.CV cs.AI 57%

In-Context Learning with Unpaired Clips for Instruction-based Video Editing

Xinyao Liao, Xianfang Zeng, Ziye Song, Zhoujie Fu, Gang Yu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) StepFun

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏