arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1258 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1258 篇

2605.10887 2026-05-12 cs.CV 57%

Count Anything at Any Granularity

按任意粒度计数

Chang Liu, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(人工智能学院,上海交通大学,中国) CMIC, Shanghai Jiao Tong University, China(计算机医学研究所,上海交通大学,中国)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出多粒度计数框架,通过显式定义计数粒度解决开放世界计数问题,构建了最大的标注数据集KubriCount,并训练了HieraCount模型提升计数精度与泛化能力。

Comments Project page: https://verg-avesta.github.io/KubriCount/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08820 2026-05-12 cs.CV cs.AI cs.CR 57%

FraudBench: A Multimodal Benchmark for Detecting AI-Generated Fraudulent Refund Evidence

FraudBench: 一个多模态基准用于检测AI生成的欺诈性退款证据

Xinyu Yan, Boyang Chen, Jiaming Zhang, Tiantong Wu, Hong Xi Tae, Yichen He, Tiantong Wang, Yachun Mi, Yurong Hao, Yilei Zhao, Lei Xiao, Longtao Huang, Pengjun Xie, Wei Liu, Wei Yang Bryan Lim

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-NTU全球可持续性科技实验室) Alibaba Group(阿里巴巴集团)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出FraudBench,一个用于检测AI生成欺诈性退款证据的多模态基准。通过真实用户评价证据构建,结合图像编辑模型生成伪造证据,并评估不同模型在不同生成器下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08167 2026-05-12 cs.CV cs.AI 57%

Digital Image Forgery Detection Using Transfer Learning

利用迁移学习的数字图像伪造检测

Fatma Betul Buyuk, Gozde Karatas Baydogmus, Ali Buldu, Ayaulym Tulendiyeva, Zhuldyz Baizhumanova

机构 * Marmara University, Department of Computer Engineering(马尔马拉大学计算机工程系) Loyola University Chicago, Department of Computer Science(芝加哥洛伊拉大学计算机科学系) Biruni University, Department of Computer Engineering(比鲁尼大学计算机工程系)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出一种基于迁移学习的数字图像伪造检测框架,结合压缩感知特征增强与深度卷积神经网络,通过混合输入表示和自适应阈值优化策略提升检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07767 2026-05-11 cs.CV 57%

SIMI: Self-information Mining Network for Low-light Image Enhancement

Xuanshuo Fu, Lei Kang, Javier Vazquez-Corral

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 在低光环境下,图像质量受到严重影响,给图像编辑和可视化带来挑战。本文提出了一种名为SIMI的自信息挖掘网络,该网络基于位平面分解技术,无需外部数据即可从低光图像中挖掘内在信息,实现了高效的无监督增强。该方法不仅加快了模型收敛速度,降低了计算开销,还在标准基准测试中取得了当前最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19974 2026-05-11 cs.CV 57%

RL-RIG: A Generative Spatial Reasoner via Intrinsic Reflection

基于内在反思的生成式空间推理器:RL-RIG

Tianyu Wang, Zhiyuan Ma, Qian Wang, Xinyi Zhang, Xinwei Long, Bowen Zhou

机构 * Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫元学院) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 图像编辑 :image generation(abstract);分类 cs.CV

AI总结 RL-RIG通过生成-反思-编辑范式,提升图像生成的精细空间关系捕捉能力,采用Scene Graph IoU和VLM评估策略,在空间一致性上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22859 2026-05-08 cs.CV 57%

From Blind Spots to Gains: Diagnostic-Driven Iterative Training for Large Multimodal Models

从盲点到收益:面向大型多模态模型的诊断驱动迭代训练

Hongrui Jia, Chaoya Jiang, Yongrui Heng, Shikun Zhang, Wei Ye

机构 * Peking University(北京大学) Shandong University(山东大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出DPE方法,通过诊断驱动的数据生成和强化学习,实现大型多模态模型的持续改进,实验表明在多个基准测试中取得稳定收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23774 2026-04-30 cs.GR 57%

Prox-E: Fine-Grained 3D Shape Editing via Primitive-Based Abstractions

Prox-E:基于原始抽象的细粒度3D形状编辑

Etai Sella, Hao Phung, Nitay Amiel, Or Litany, Or Patashnik, Hadar Averbuch-Elor

专题命中 图像编辑 :image editing(abstract);分类 cs.GR

AI总结 本文提出Prox-E,一种无需训练的框架,通过显式的原始几何抽象实现细粒度3D控制,有效平衡身份保持、形状质量和指令忠实度。

Comments Accepted to SIGGRAPH 2026. Project page: https://etaisella.github.io/Prox-E/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22103 2026-04-27 cs.CY cs.CV 57%

How Many Visual Levers Drive Urban Perception? Interventional Counterfactuals via Multiple Localised Edits

有多少视觉杠杆驱动城市感知?通过多重局部编辑进行干预性反事实

Jason Tang, Stephen Law

机构 * University College London(伦敦大学学院)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出基于杠杆的干预性反事实框架,通过结构化反事实编辑探索场景可解释性,通过局部编辑生成候选编辑并验证其有效性,揭示了城市安全的辅助变化模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17500 2026-04-21 cs.CV 57%

Edit Fidelity Field: Semantics-Aware Region Isolation for Training-Free Scene Text Editing

编辑保真场:面向免训练场景文本编辑的语义感知区域隔离

Guandong Li, Mengxia Ye

机构 * iFLYTEK Aegon THTF

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Edit Fidelity Field,通过语义感知的连续场控制每个像素的编辑保真度,解决场景文本编辑中非目标区域的编辑溢出问题,实验显示保真度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17021 2026-04-21 cs.CV 57%

LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing

LIVE: 利用图像篡改先验知识进行基于指令的视频编辑

Weicheng Wang, Zhicheng Zhang, Zhongqi Zhang, Juncheng Zhou, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan, Jufeng Yang

机构 * Nankai University(南开大学) Pengcheng Laboratory(鹏城实验室) Kuaishou Technology(快手科技) Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开国际先进研究院(深圳·福田))

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出LIVE框架,结合大规模高质量图像编辑数据和视频数据提升编辑能力,通过帧级噪声策略和两阶段训练策略,构建包含60多项挑战性任务的评估基准,实验表明方法达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10454 2026-04-14 cs.CV 57%

AIM-Bench: Benchmarking and Improving Affective Image Manipulation via Fine-Grained Hierarchical Control

AIM-Bench:通过细粒度分层控制进行情感图像操纵的基准测试与改进

Shi Chen, Xuecheng Wu, Heli Sun, Yunyun Shi, Xinyi Yin, Fengjian Xue, Jinheng Xie, Dingkang Yang, Hao Wang, Junxiao Xue, Liang He

机构 * Xi'an Jiaotong University(西安交通大学) Zhengzhou University(郑州大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Zhejiang Lab(之江实验室)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出AIM-Bench,通过细粒度分层控制进行情感图像操纵的基准测试,改进了现有图像编辑基准的不足,提出了AIM-40k数据集并提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06849 2026-04-14 cs.CV cs.LG 57%

Hide-and-Seek Attribution: Weakly Supervised Segmentation of Vertebral Metastases in CT

隐匿与寻找归因:基于弱监督的CT椎体转移瘤分割

Matan Atad, Alexander W. Marka, Lisa Steinhelfer, Anna Curto-Vilalta, Yannik Leonhardt, Sarah C. Foreman, Anna-Sophia Walburga Dietrich, Robert Graf, Alexandra S. Gersing, Bjoern Menze, Daniel Rueckert, Jan S. Kirschke, Hendrik Möller

机构 * Institute of Neuroradiology, TUM University Hospital, School of Medicine and Health, Technical University of Munich (TUM)(慕尼黑工业大学大学医院神经放射学研究所,医学与健康学院,慕尼黑工业大学) Chair for AI in Healthcare and Medicine, TUM and TUM University Hospital(慕尼黑工业大学及大学医院医疗与医学人工智能教席) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Institute of Diagnostic and Interventional Radiology, TUM University Hospital, School of Medicine and Health, Technical University of Munich (TUM)(慕尼黑工业大学大学医院诊断与介入放射学研究所,医学与健康学院,慕尼黑工业大学) Department of Neuroradiology, University Hospital Munich (LMU)(慕尼黑大学医院神经放射学系) Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) Department of Computing, Imperial College London(伦敦帝国理工学院计算系) Department of Diagnostic and Interventional Radiology, University Hospital Frankfurt(法兰克福大学医院诊断与介入放射学系) Department of Orthopedics and Sports Orthopedics, TUM University Hospital, School of Medicine and Health, Technical University of Munich (TUM)(慕尼黑工业大学大学医院骨科与运动骨科,医学与健康学院,慕尼黑工业大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种基于椎体级别标签的弱监督分割方法,通过扩散自编码器和像素差异图识别可疑病变区域,利用隐匿与寻找归因机制在数据流形上投影并量化恶性贡献,实现高精度的椎体转移瘤分割。

Comments Accepted to MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09231 2026-04-13 cs.CV 57%

Hitem3D 2.0: Multi-View Guided Native 3D Texture Generation

Hitem3D 2.0:多视角引导的原生3D纹理生成

Huiang He, Shengchu Zhao, Jianwen Huang, Jie Li, Jiaqi Wu, Hu Zhang, Pei Tang, Heliang Zheng, Yukun Li, Rongfei Jia

机构 * Math Magic South China University of Technology(华南理工大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 Hitem3D 2.0通过整合2D多视角生成先验和原生3D纹理表示,提升3D纹理质量,解决纹理不完整、视角不一致和几何对齐问题。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03400 2026-04-07 cs.CV cs.AI cs.LG 57%

Banana100: Breaking NR-IQA Metrics by 100 Iterative Image Replications with Nano Banana Pro

Banana100: 通过100次迭代图像复制打破NR-IQA度量标准

Kenan Tang, Praveen Arunshankar, Andong Hua, Anthony Yang, Yao Qin

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 Banana100通过100次迭代编辑生成28000张退化图像,揭示多轮编辑中图像质量退化问题,发现现有NR-IQA度量标准无法检测严重退化图像,威胁未来模型训练稳定性。

Comments Accepted to CVPR 2026 Workshop on Agentic AI for Visual Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07469 2026-04-07 cs.CV 57%

VideoCoF: Unified Video Editing with Temporal Reasoner

VideoCoF:基于时间推理的统一视频编辑

Xiangpeng Yang, Ji Xie, Yiyuan Yang, Yue Ma, Yan Huang, Min Xu, Qiang Wu

机构 * University of Technology Sydney(悉尼科技大学) Zhejiang University(浙江大学) HKUST(香港科技大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 VideoCoF通过引入时间推理机制,解决视频编辑中精度与统一性的矛盾,实现无需掩码的精确区域映射和细粒度编辑,验证了方法的高效性与有效性。

Comments Accepted by CVPR 2026, Project Page: https://videocof.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29386 2026-04-01 cs.CV cs.AI 57%

PromptForge-350k: A Large-Scale Dataset and Contrastive Framework for Prompt-Based AI Image Forgery Localization

PromptForge-350k:一种大规模数据集和对比框架用于基于提示的AI图像伪造定位

Jianpeng Wang, Haoyu Wang, Baoying Chen, Jishen Zeng, Yiming Qin, Yiqi Yang, Zhongjie Ba

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出PromptForge-350k数据集和ICL-Net网络,通过自动化标注框架和对比学习提升伪造定位精度,实验显示在IoU指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26174 2026-03-30 cs.CV 57%

CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions

CREval: 一种自动化可解释的评估方法用于复杂指令下的创意图像操纵

Chonghuinan Wang, Zihan Chen, Yuxiang Wei, Tianyi Jiang, Xiaohe Wu, Fan Li, Wangmeng Zuo, Hongxun Yao

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Pengcheng Lab, Guangzhou(广州鹏城实验室)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出CREval,一种基于问答的自动化评估框架,用于评估复杂指令下的创意图像编辑任务,通过CREval-Bench基准测试揭示模型在复杂创意任务中的表现及挑战。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22883 2026-03-27 cs.CV 57%

Group Editing: Edit Multiple Images in One Go

组级编辑:一次操作编辑多张图像

Yue Ma, Xinyu Wang, Qianli Ma, Qinghe Wang, Mingzhe Zheng, Xiangpeng Yang, Hao Li, Chongbo Zhao, Jixuan Ying, Harry Yang, Hongyu Liu, Qifeng Chen

机构 * HKUST(香港科技大学) THU(清华大学) SJTU(上海交通大学) University of Technology Sydney(悉尼科技大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出组级编辑框架,通过显式和隐式关系建立实现多图像一致修改,引入融合机制和新数据集提升编辑质量与一致性。

Comments Accepted by CVPR 2026, Project page: https://group-editing.github.io/, Github: https://github.com/mayuelala/GroupEditing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23374 2026-03-26 cs.CV 57%

NeXT-IMDL: Build Benchmark for NeXT-Generation Image Manipulation Detection & Localization

NeXT-IMDL:构建下一代图像篡改检测与定位的基准测试

Yifei Li, Haoyuan He, Yu Zheng, Bingyao Yu, Wenzhao Zheng, Lei Chen, Jie Zhou, Jiwen Lu

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出NeXT-IMDL基准测试,通过系统性评估揭示现有图像篡改检测模型在多样化的现实场景中的局限性,推动构建更稳健的下一代检测模型。

Comments Duplicate experiment results in Table 3 (Set-1 & Set-2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20924 2026-03-26 cs.CV 57%

GaINeR: Geometry-Aware Implicit Network Representation

GaINeR:基于几何的隐式神经表示

Weronika Jakubowska, Mikołaj Zieliński, Rafał Tobiasz, Krzysztof Byrski, Maciej Zięba, Dominik Belter, Przemysław Spurek

机构 * Wrocław University of Science and Technology(沃拉夫大学科学与技术学院) Poznań University of Technology(波兹南技术大学) IDEAS Research Institute(IDEAS研究所) Jagiellonian University(雅盖隆大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 GaINeR结合可训练高斯分布与神经网络,实现具有可解释几何结构的连续图像表示,支持几何一致变换、超分辨率和物理模拟集成,提升图像编辑的灵活性和物理一致性。

Comments 22 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15003 2026-03-17 cs.CV 57%

Edit2Interp: Adapting Image Foundation Models from Spatial Editing to Video Frame Interpolation with Few-Shot Learning

Edit2Interp:从空间编辑到视频帧插值的图像基础模型适应

Nasrin Rahimi, Mısra Yavuz, Burak Can Biner, Yunus Bilge Kurt, Ahmet Rasim Emirdağı, Süleyman Aslan, Görkay Aydemir, M. Akın Yılmaz, A. Murat Tekalp

机构 * Codeway AI Research Dept. of Electrical \& Electronics Engineering, Ko c University, \. I stanbul, T\" u rkiye

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文通过少量样本学习,将图像编辑模型适应于视频帧插值,揭示了静态场景中物体变换的理解可激活潜在的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14153 2026-03-17 cs.CV 57%

Garments2Look: A Multi-Reference Dataset for High-Fidelity Outfit-Level Virtual Try-On with Clothing and Accessories

Garments2Look:用于高保真服装级虚拟试穿的多参考数据集

Junyao Hu, Zhongwei Cheng, Waikeung Wong, Xingxing Zou

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出Garments2Look数据集,用于高保真的服装级虚拟试穿,包含8万对多件服装到一套搭配的样本,涵盖40大类和300+细分类别,通过合成流程提升数据质量和任务难度,验证现有方法在完整服装试穿和层叠推断上的不足。

Comments CVPR 2026; Project Page: https://artmesciencelab.github.io/Garments2Look

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05518 2026-03-09 cs.HC cs.CV 57%

CoEditor++: Instruction-based Visual Editing via Cognitive Reasoning

CoEditor++:基于指令的视觉编辑 via 认知推理

Minheng Ni, Yutao Fan, Zhengyuan Yang, Yeli Shen, Yuxiang Wei, Yaowen Zhang, Lijuan Wang, Lei Zhang, Wangmeng Zuo

机构 * Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) Microsoft(微软公司)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 CoEditor++通过认知推理实现基于指令的视觉编辑,无需训练即可在通用和负责任的编辑任务中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10082 2026-02-26 cs.CV 57%

LoRA-Edit: Controllable First-Frame-Guided Video Editing via Mask-Aware LoRA Fine-Tuning

LoRA-Edit: 通过掩码感知LoRA微调实现可控的第一帧引导视频编辑

Chenjian Gao, Lihe Ding, Xin Cai, Zhanpeng Huang, Zibin Wang, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) SenseTime Research(商汤科技研究院)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 LoRA-Edit通过时空掩码引导LoRA微调,实现对视频编辑全过程的可控编辑,支持生成动态变化的视频内容。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18742 2026-02-24 cs.RO cs.AI cs.CV 57%

RoboCurate: Harnessing Diversity with Action-Verified Neural Trajectory for Robot Learning

RoboCurate: 利用动作验证的神经轨迹 harnessing 多样性以促进机器人学习

Seungku Kim, Suhyeok Jang, Byungjun Yoon, Dongyoung Kim, John Won, Jinwoo Shin

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 RoboCurate通过动作验证的神经轨迹和图像编辑技术,提升机器人学习中合成数据的质量和多样性,显著提高任务成功率。

Comments 20 pages; 6 figures; Project page is available at https://seungkukim.github.io/robocurate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00618 2026-02-03 cs.CV 57%

Tune-Your-Style: Intensity-tunable 3D Style Transfer with Gaussian Splatting

Tune-Your-Style: 可调强度的3D风格迁移与高斯点散布

Yian Zhao, Rushi Ye, Ruochong Zheng, Zesen Cheng, Chaoran Feng, Jiashu Yang, Pengchong Qiao, Chang Liu, Jie Chen

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(电子与计算机工程学院,北京大学深圳校区) Pengcheng Laboratory, Shenzhen, China(鹏城实验室) AI for Science (AI4S)-Preferred Program, Peking University Shenzhen Graduate School, China(人工智能科学(AI4S)优选计划,北京大学深圳研究生院) Department of Automation and BNRist, Tsinghua University, Beijing, China(自动化系和BNRist,清华大学,北京,中国) Dalian University of Technology, China(大连理工大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 Tune-Your-Style通过可调强度的3D风格迁移方法,实现灵活的内容-风格平衡,提升3D风格迁移的定制性。

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00265 2026-02-03 cs.CV 57%

World-Shaper: A Unified Framework for 360° Panoramic Editing

World-Shaper:360°全景编辑的统一框架

Dong Liang, Yuhao Liu, Jinyuan Jia, Youjun Zhao, Rynson W. H. Lau

机构 * Tongji University(同济大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 World-Shaper通过统一的几何感知框架,实现360°全景生成与编辑的统一控制,提升编辑一致性与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20175 2026-01-29 cs.CV 57%

TeleStyle: Content-Preserving Style Transfer in Images and Videos

TeleStyle: 图像和视频中的内容保持风格迁移

Shiwen Zhang, Xiaoyan Yang, Bojia Zi, Haibin Huang, Chi Zhang, Xuelong Li

机构 * TeleAI

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 TeleStyle通过课程持续学习框架实现图像和视频内容保持的风格迁移,提升风格相似性和内容一致性,达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12954 2026-01-27 cs.CV 57%

StyMam: A Mamba-Based Generator for Artistic Style Transfer

StyMam:基于Mamba的风格迁移生成器

Zhou Hong, Ning Dong, Yicheng Di, Xiaolong Xu, Rongsheng Hu, Yihua Shao, Run Ling, Yun Wang, Juqin Wang, Zhanjie Zhang, Ao Ma

机构 * School of Information Engineering, Suqian University(信息工程学院,苏庆大学) School of Artificial Intelligence and Computer Science, Jiangnan University(人工智能与计算机科学学院,江南大学) Jiangsu Province Engineering Research Center of Smart Poultry Farming and Intelligent Equipment(江苏省智能养鸡场与智能设备工程研究中心) School of Computer Science, Nanjing University of Posts and Telecommunications(计算机科学学院,南京邮电大学) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) School of Internet of Things, Wuxi University of Technology(物联网学院,无锡科技大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 StyMam通过引入基于Mamba的生成器,结合残差双路径扫描机制和通道加权空间注意力模块,实现了高质量且快速的图像风格迁移。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15664 2026-01-23 cs.CV cs.AI 57%

Skywork UniPic 3.0: Unified Multi-Image Composition via Sequence Modeling

Skywork UniPic 3.0:通过序列建模实现统一的多图像合成

Hongyang Wei, Hongbo Liu, Zidong Wang, Yi Peng, Baixin Xu, Size Wu, Xuying Zhang, Xianglong He, Zexiang Liu, Peiyu Wang, Xuchen Song, Yangguang Li, Yang Liu, Yahui Zhou

机构 * Skywork

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 Skywork UniPic 3.0通过序列建模实现统一的多图像合成,采用新颖的训练范式和高效的数据流程,在单图像编辑和多图像合成任务中均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏