arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86585 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1264 篇

2605.21487 2026-05-25 cs.CV 57%

Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning

Uni-Edit: 智能编辑作为统一模型调优的通用任务

Dian Zheng, Manyuan Zhang, Hongyu Li, Hongbo Liu, Kai Zou, Kaituo Feng, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Meituan(美团) TJU(天津大学) USTC(中国科学技术大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出将智能图像编辑作为统一多模态模型调优的通用任务,通过单一任务、单阶段训练和单一数据集同时提升图像理解、生成和编辑能力,并引入自动化数据合成流水线构建推理密集型指令数据集Uni-Edit-148k。

Comments Project Page: https://zhengdian1.github.io/Uni-Edit-proj/ Code: https://github.com/zhengdian1/Uni-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22126 2026-05-22 cs.CV 57%

AesFormer: Transform Everyday Photos into Beautiful Memories

AesFormer: 将日常照片转化为美丽的记忆

Tianxiang Du, Hulingxiao He, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(王轩计算机技术研究所,北京大学,北京,中国)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出AesFormer框架,通过将审美规划与图像编辑解耦,改进照片的审美质量,同时保持主体身份和场景语义,构建了包含9071对严格对齐图像对的AesRecon基准数据集。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18748 2026-05-19 cs.CV 57%

Aurora: Unified Video Editing with a Tool-Using Agent

Aurora: 一种基于工具使用的统一视频编辑框架

Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao, Zhenghong Zhou, Hang Hua, Wei Xiong, Jiebo Luo

机构 * MIT-IBM(MIT-IBM研究院) NVIDIA(NVIDIA公司)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Aurora框架,通过结合增强的视觉语言模型(VLM)代理和统一视频扩散变换器,解决视频编辑中的文本和视觉不充分问题,提升了视频编辑的灵活性和准确性。

Comments Code: https://github.com/yeates/Aurora

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16879 2026-05-19 cs.CV 57%

Towards Generalized Image Manipulation Localization via Score-based Model

通过基于分数的模型实现通用图像操纵定位

Yunfei Wang, Bo Du, Zhe Yang, Xin Liu, Zhiyu Lin, Tianxin Xu, Ji-Zhe Zhou

机构 * Sichuan University(四川大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DiffIML框架,通过引入基于分数的生成模型来解决图像操纵定位中的泛化问题,利用结构先验迭代恢复相干掩码,提升模型鲁棒性,并在多个基准测试中证明其优越的泛化能力。

Comments Accepted to ICMR 2026. 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03161 2026-05-18 cs.CV cs.AI 57%

UniShield: An Adaptive Multi-Agent Framework for Unified Forgery Image Detection and Localization

UniShield: 一种适应性多智能体框架用于统一的伪造图像检测与定位

Qing Huang, Zhipei Xu, Xuanyu Zhang, Xiangyu Yu, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(北京大学深圳研究生院超高清沉浸媒体技术省重点实验室)

专题命中 图像编辑 :image generation(abstract);分类 cs.CV

AI总结 UniShield通过多智能体框架实现跨领域伪造图像检测与定位,提升检测的适应性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.12784 2026-05-14 cs.CV 57%

The GAN that Warped: Semantic Attribute Editing with Unpaired Data

扭曲的GAN:无配对数据下的语义属性编辑

Gara Dorta, Sara Vicente, Neill D. F. Campbell, Ivor J. A. Simpson

机构 * University of Bath(巴斯大学) Anthropics Technology Ltd.(Anthropics技术有限公司) University of Sussex(苏塞克斯大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出通过平滑扭曲场进行语义图像编辑,利用生成对抗网络在无配对数据下实现高分辨率人脸编辑,有效保持身份特征。

Comments CVPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12826 2026-05-14 cs.CV cs.AI 57%

FRAME: Forensic Routing and Adaptive Multi-path Evidence Fusion for Image Manipulation Detection

FRAME:图像篡改检测的取证路由与自适应多路径证据融合

Kaixiang Zhao, Tianrun Yu, Aoxu Zhang, Junhao Su, Porter Jenkins, Amanda Hughes

机构 * Brigham Young University Rutgers University

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 FRAME通过多路径分析空间整合多种取证算法,自适应选择信息量大的路径并融合互补证据,提升图像篡改检测与定位性能。

Comments Accepted to CVPR 2026 SAFE Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11203 2026-05-13 cs.LG cs.CV 57%

FeatMap: Understanding image manipulation in the feature space and its implications for feature space geometry

FeatMap: 在特征空间中理解图像篡改及其对特征空间几何的影响

Elias B. Krey, Nils Neukirch, Nils Strodthoff

机构 * Division AI4Health(AI4Health部门) Carl von Ossietzky Universität Oldenburg(奥尔登堡卡尔·冯·奥西特齐克大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文通过在输入空间中应用多种篡改方法,探讨特征空间中的映射学习,发现线性模型在特征空间中能有效重建复杂语义篡改。

Comments 27 pages, 24 figures, 3 tables, Code is available at https://github.com/AI4HealthUOL/FeatMap

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10887 2026-05-12 cs.CV 57%

Count Anything at Any Granularity

按任意粒度计数

Chang Liu, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(人工智能学院,上海交通大学,中国) CMIC, Shanghai Jiao Tong University, China(计算机医学研究所,上海交通大学,中国)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出多粒度计数框架,通过显式定义计数粒度解决开放世界计数问题,构建了最大的标注数据集KubriCount,并训练了HieraCount模型提升计数精度与泛化能力。

Comments Project page: https://verg-avesta.github.io/KubriCount/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08820 2026-05-12 cs.CV cs.AI cs.CR 57%

FraudBench: A Multimodal Benchmark for Detecting AI-Generated Fraudulent Refund Evidence

FraudBench: 一个多模态基准用于检测AI生成的欺诈性退款证据

Xinyu Yan, Boyang Chen, Jiaming Zhang, Tiantong Wu, Hong Xi Tae, Yichen He, Tiantong Wang, Yachun Mi, Yurong Hao, Yilei Zhao, Lei Xiao, Longtao Huang, Pengjun Xie, Wei Liu, Wei Yang Bryan Lim

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-NTU全球可持续性科技实验室) Alibaba Group(阿里巴巴集团)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出FraudBench,一个用于检测AI生成欺诈性退款证据的多模态基准。通过真实用户评价证据构建,结合图像编辑模型生成伪造证据,并评估不同模型在不同生成器下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08167 2026-05-12 cs.CV cs.AI 57%

Digital Image Forgery Detection Using Transfer Learning

利用迁移学习的数字图像伪造检测

Fatma Betul Buyuk, Gozde Karatas Baydogmus, Ali Buldu, Ayaulym Tulendiyeva, Zhuldyz Baizhumanova

机构 * Marmara University, Department of Computer Engineering(马尔马拉大学计算机工程系) Loyola University Chicago, Department of Computer Science(芝加哥洛伊拉大学计算机科学系) Biruni University, Department of Computer Engineering(比鲁尼大学计算机工程系)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出一种基于迁移学习的数字图像伪造检测框架,结合压缩感知特征增强与深度卷积神经网络,通过混合输入表示和自适应阈值优化策略提升检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07767 2026-05-11 cs.CV 57%

SIMI: Self-information Mining Network for Low-light Image Enhancement

Xuanshuo Fu, Lei Kang, Javier Vazquez-Corral

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 在低光环境下,图像质量受到严重影响,给图像编辑和可视化带来挑战。本文提出了一种名为SIMI的自信息挖掘网络,该网络基于位平面分解技术,无需外部数据即可从低光图像中挖掘内在信息,实现了高效的无监督增强。该方法不仅加快了模型收敛速度,降低了计算开销,还在标准基准测试中取得了当前最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19974 2026-05-11 cs.CV 57%

RL-RIG: A Generative Spatial Reasoner via Intrinsic Reflection

基于内在反思的生成式空间推理器:RL-RIG

Tianyu Wang, Zhiyuan Ma, Qian Wang, Xinyi Zhang, Xinwei Long, Bowen Zhou

机构 * Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫元学院) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 图像编辑 :image generation(abstract);分类 cs.CV

AI总结 RL-RIG通过生成-反思-编辑范式,提升图像生成的精细空间关系捕捉能力,采用Scene Graph IoU和VLM评估策略,在空间一致性上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22859 2026-05-08 cs.CV 57%

From Blind Spots to Gains: Diagnostic-Driven Iterative Training for Large Multimodal Models

从盲点到收益:面向大型多模态模型的诊断驱动迭代训练

Hongrui Jia, Chaoya Jiang, Yongrui Heng, Shikun Zhang, Wei Ye

机构 * Peking University(北京大学) Shandong University(山东大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出DPE方法,通过诊断驱动的数据生成和强化学习,实现大型多模态模型的持续改进,实验表明在多个基准测试中取得稳定收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23774 2026-04-30 cs.GR 57%

Prox-E: Fine-Grained 3D Shape Editing via Primitive-Based Abstractions

Prox-E:基于原始抽象的细粒度3D形状编辑

Etai Sella, Hao Phung, Nitay Amiel, Or Litany, Or Patashnik, Hadar Averbuch-Elor

专题命中 图像编辑 :image editing(abstract);分类 cs.GR

AI总结 本文提出Prox-E,一种无需训练的框架,通过显式的原始几何抽象实现细粒度3D控制,有效平衡身份保持、形状质量和指令忠实度。

Comments Accepted to SIGGRAPH 2026. Project page: https://etaisella.github.io/Prox-E/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22103 2026-04-27 cs.CY cs.CV 57%

How Many Visual Levers Drive Urban Perception? Interventional Counterfactuals via Multiple Localised Edits

有多少视觉杠杆驱动城市感知?通过多重局部编辑进行干预性反事实

Jason Tang, Stephen Law

机构 * University College London(伦敦大学学院)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出基于杠杆的干预性反事实框架,通过结构化反事实编辑探索场景可解释性,通过局部编辑生成候选编辑并验证其有效性,揭示了城市安全的辅助变化模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17500 2026-04-21 cs.CV 57%

Edit Fidelity Field: Semantics-Aware Region Isolation for Training-Free Scene Text Editing

编辑保真场:面向免训练场景文本编辑的语义感知区域隔离

Guandong Li, Mengxia Ye

机构 * iFLYTEK Aegon THTF

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Edit Fidelity Field,通过语义感知的连续场控制每个像素的编辑保真度,解决场景文本编辑中非目标区域的编辑溢出问题,实验显示保真度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17021 2026-04-21 cs.CV 57%

LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing

LIVE: 利用图像篡改先验知识进行基于指令的视频编辑

Weicheng Wang, Zhicheng Zhang, Zhongqi Zhang, Juncheng Zhou, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan, Jufeng Yang

机构 * Nankai University(南开大学) Pengcheng Laboratory(鹏城实验室) Kuaishou Technology(快手科技) Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开国际先进研究院(深圳·福田))

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出LIVE框架,结合大规模高质量图像编辑数据和视频数据提升编辑能力,通过帧级噪声策略和两阶段训练策略,构建包含60多项挑战性任务的评估基准,实验表明方法达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10454 2026-04-14 cs.CV 57%

AIM-Bench: Benchmarking and Improving Affective Image Manipulation via Fine-Grained Hierarchical Control

AIM-Bench:通过细粒度分层控制进行情感图像操纵的基准测试与改进

Shi Chen, Xuecheng Wu, Heli Sun, Yunyun Shi, Xinyi Yin, Fengjian Xue, Jinheng Xie, Dingkang Yang, Hao Wang, Junxiao Xue, Liang He

机构 * Xi'an Jiaotong University(西安交通大学) Zhengzhou University(郑州大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Zhejiang Lab(之江实验室)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出AIM-Bench,通过细粒度分层控制进行情感图像操纵的基准测试,改进了现有图像编辑基准的不足,提出了AIM-40k数据集并提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06849 2026-04-14 cs.CV cs.LG 57%

Hide-and-Seek Attribution: Weakly Supervised Segmentation of Vertebral Metastases in CT

隐匿与寻找归因:基于弱监督的CT椎体转移瘤分割

Matan Atad, Alexander W. Marka, Lisa Steinhelfer, Anna Curto-Vilalta, Yannik Leonhardt, Sarah C. Foreman, Anna-Sophia Walburga Dietrich, Robert Graf, Alexandra S. Gersing, Bjoern Menze, Daniel Rueckert, Jan S. Kirschke, Hendrik Möller

机构 * Institute of Neuroradiology, TUM University Hospital, School of Medicine and Health, Technical University of Munich (TUM)(慕尼黑工业大学大学医院神经放射学研究所,医学与健康学院,慕尼黑工业大学) Chair for AI in Healthcare and Medicine, TUM and TUM University Hospital(慕尼黑工业大学及大学医院医疗与医学人工智能教席) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Institute of Diagnostic and Interventional Radiology, TUM University Hospital, School of Medicine and Health, Technical University of Munich (TUM)(慕尼黑工业大学大学医院诊断与介入放射学研究所,医学与健康学院,慕尼黑工业大学) Department of Neuroradiology, University Hospital Munich (LMU)(慕尼黑大学医院神经放射学系) Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) Department of Computing, Imperial College London(伦敦帝国理工学院计算系) Department of Diagnostic and Interventional Radiology, University Hospital Frankfurt(法兰克福大学医院诊断与介入放射学系) Department of Orthopedics and Sports Orthopedics, TUM University Hospital, School of Medicine and Health, Technical University of Munich (TUM)(慕尼黑工业大学大学医院骨科与运动骨科,医学与健康学院,慕尼黑工业大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种基于椎体级别标签的弱监督分割方法,通过扩散自编码器和像素差异图识别可疑病变区域,利用隐匿与寻找归因机制在数据流形上投影并量化恶性贡献,实现高精度的椎体转移瘤分割。

Comments Accepted to MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09231 2026-04-13 cs.CV 57%

Hitem3D 2.0: Multi-View Guided Native 3D Texture Generation

Hitem3D 2.0:多视角引导的原生3D纹理生成

Huiang He, Shengchu Zhao, Jianwen Huang, Jie Li, Jiaqi Wu, Hu Zhang, Pei Tang, Heliang Zheng, Yukun Li, Rongfei Jia

机构 * Math Magic South China University of Technology(华南理工大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 Hitem3D 2.0通过整合2D多视角生成先验和原生3D纹理表示,提升3D纹理质量,解决纹理不完整、视角不一致和几何对齐问题。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03400 2026-04-07 cs.CV cs.AI cs.LG 57%

Banana100: Breaking NR-IQA Metrics by 100 Iterative Image Replications with Nano Banana Pro

Banana100: 通过100次迭代图像复制打破NR-IQA度量标准

Kenan Tang, Praveen Arunshankar, Andong Hua, Anthony Yang, Yao Qin

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 Banana100通过100次迭代编辑生成28000张退化图像,揭示多轮编辑中图像质量退化问题,发现现有NR-IQA度量标准无法检测严重退化图像,威胁未来模型训练稳定性。

Comments Accepted to CVPR 2026 Workshop on Agentic AI for Visual Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07469 2026-04-07 cs.CV 57%

VideoCoF: Unified Video Editing with Temporal Reasoner

VideoCoF:基于时间推理的统一视频编辑

Xiangpeng Yang, Ji Xie, Yiyuan Yang, Yue Ma, Yan Huang, Min Xu, Qiang Wu

机构 * University of Technology Sydney(悉尼科技大学) Zhejiang University(浙江大学) HKUST(香港科技大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 VideoCoF通过引入时间推理机制,解决视频编辑中精度与统一性的矛盾,实现无需掩码的精确区域映射和细粒度编辑,验证了方法的高效性与有效性。

Comments Accepted by CVPR 2026, Project Page: https://videocof.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29386 2026-04-01 cs.CV cs.AI 57%

PromptForge-350k: A Large-Scale Dataset and Contrastive Framework for Prompt-Based AI Image Forgery Localization

PromptForge-350k:一种大规模数据集和对比框架用于基于提示的AI图像伪造定位

Jianpeng Wang, Haoyu Wang, Baoying Chen, Jishen Zeng, Yiming Qin, Yiqi Yang, Zhongjie Ba

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出PromptForge-350k数据集和ICL-Net网络,通过自动化标注框架和对比学习提升伪造定位精度,实验显示在IoU指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26174 2026-03-30 cs.CV 57%

CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions

CREval: 一种自动化可解释的评估方法用于复杂指令下的创意图像操纵

Chonghuinan Wang, Zihan Chen, Yuxiang Wei, Tianyi Jiang, Xiaohe Wu, Fan Li, Wangmeng Zuo, Hongxun Yao

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Pengcheng Lab, Guangzhou(广州鹏城实验室)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出CREval,一种基于问答的自动化评估框架,用于评估复杂指令下的创意图像编辑任务,通过CREval-Bench基准测试揭示模型在复杂创意任务中的表现及挑战。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22883 2026-03-27 cs.CV 57%

Group Editing: Edit Multiple Images in One Go

组级编辑:一次操作编辑多张图像

Yue Ma, Xinyu Wang, Qianli Ma, Qinghe Wang, Mingzhe Zheng, Xiangpeng Yang, Hao Li, Chongbo Zhao, Jixuan Ying, Harry Yang, Hongyu Liu, Qifeng Chen

机构 * HKUST(香港科技大学) THU(清华大学) SJTU(上海交通大学) University of Technology Sydney(悉尼科技大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出组级编辑框架,通过显式和隐式关系建立实现多图像一致修改,引入融合机制和新数据集提升编辑质量与一致性。

Comments Accepted by CVPR 2026, Project page: https://group-editing.github.io/, Github: https://github.com/mayuelala/GroupEditing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23374 2026-03-26 cs.CV 57%

NeXT-IMDL: Build Benchmark for NeXT-Generation Image Manipulation Detection & Localization

NeXT-IMDL:构建下一代图像篡改检测与定位的基准测试

Yifei Li, Haoyuan He, Yu Zheng, Bingyao Yu, Wenzhao Zheng, Lei Chen, Jie Zhou, Jiwen Lu

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出NeXT-IMDL基准测试,通过系统性评估揭示现有图像篡改检测模型在多样化的现实场景中的局限性,推动构建更稳健的下一代检测模型。

Comments Duplicate experiment results in Table 3 (Set-1 & Set-2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20924 2026-03-26 cs.CV 57%

GaINeR: Geometry-Aware Implicit Network Representation

GaINeR:基于几何的隐式神经表示

Weronika Jakubowska, Mikołaj Zieliński, Rafał Tobiasz, Krzysztof Byrski, Maciej Zięba, Dominik Belter, Przemysław Spurek

机构 * Wrocław University of Science and Technology(沃拉夫大学科学与技术学院) Poznań University of Technology(波兹南技术大学) IDEAS Research Institute(IDEAS研究所) Jagiellonian University(雅盖隆大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 GaINeR结合可训练高斯分布与神经网络,实现具有可解释几何结构的连续图像表示,支持几何一致变换、超分辨率和物理模拟集成,提升图像编辑的灵活性和物理一致性。

Comments 22 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15003 2026-03-17 cs.CV 57%

Edit2Interp: Adapting Image Foundation Models from Spatial Editing to Video Frame Interpolation with Few-Shot Learning

Edit2Interp:从空间编辑到视频帧插值的图像基础模型适应

Nasrin Rahimi, Mısra Yavuz, Burak Can Biner, Yunus Bilge Kurt, Ahmet Rasim Emirdağı, Süleyman Aslan, Görkay Aydemir, M. Akın Yılmaz, A. Murat Tekalp

机构 * Codeway AI Research Dept. of Electrical \& Electronics Engineering, Ko c University, \. I stanbul, T\" u rkiye

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文通过少量样本学习,将图像编辑模型适应于视频帧插值,揭示了静态场景中物体变换的理解可激活潜在的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14153 2026-03-17 cs.CV 57%

Garments2Look: A Multi-Reference Dataset for High-Fidelity Outfit-Level Virtual Try-On with Clothing and Accessories

Garments2Look:用于高保真服装级虚拟试穿的多参考数据集

Junyao Hu, Zhongwei Cheng, Waikeung Wong, Xingxing Zou

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出Garments2Look数据集,用于高保真的服装级虚拟试穿,包含8万对多件服装到一套搭配的样本,涵盖40大类和300+细分类别,通过合成流程提升数据质量和任务难度,验证现有方法在完整服装试穿和层叠推断上的不足。

Comments CVPR 2026; Project Page: https://artmesciencelab.github.io/Garments2Look

详情

展开后加载摘要…

URL PDF HTML 收藏