Learning Hierarchical Semantic Image Manipulation through Structured Representations
专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV
专题命中 图像编辑 :image editing(abstract);image synthesis(abstract);分类 cs.CV
Comments Accepted in the IEEE Signal Processing Magazine Special Issue on Deep Learning for Visual Understanding
用于幂等生成的编码器-解码器流形对齐
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 图像编辑 :image generation(abstract);image editing(abstract)
AI总结 针对生成模型中幂等性不足导致的重复应用不稳定问题,提出通过对齐编码器和解码器学习的流形来训练模型,显著降低幂等误差并提升生成稳定性。
一次净化,自由编辑:在模型不匹配下突破图像保护
机构 * Peking University(北京大学) ; National University of Singapore(国立新加坡大学) ; The University of Western Australia(西澳大学)
专题命中 图像编辑 :diffusion(abstract);image editing(abstract)
AI总结 研究提出统一的后期净化框架,评估模型不匹配下的保护有效性,提出VAE-Trans和EditorClean两种实用净化器,显著提升图像编辑质量,揭示一次净化后保护信号失效的问题。
PairUni: 用于统一多模态语言模型的成对训练
机构 * ByteDance(字节跳动)
专题命中 图像编辑 :diffusion(abstract);image editing(abstract)
AI总结 PairUni通过成对训练提升统一多模态语言模型的理解与生成能力,采用配对数据集和PairGRPO算法实现更有效的策略学习。
Comments 22 pages, 11 figures, and 10 tables
扩散模型测试时间缩放与流映射
机构 * NVIDIA(NVIDIA公司) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; Harvard University(哈佛大学) ; Kempner Institute(凯姆纳研究所) ; IAIFI(IAIFI机构) ; Microsoft Research(微软研究院) ; Carnegie Mellon University(卡内基梅隆大学) ; Courant Institute, New York University(纽约大学应用数学学院) ; ML Lab at Capital Fund Management (CFM)(Capital Fund Management (CFM)机器学习实验室)
专题命中 图像编辑 :diffusion(abstract);image editing(abstract)
AI总结 本文提出通过流映射改进扩散模型测试时间性能,通过流映射与速度场关系构建FMTT算法,实现更优奖励上升并支持复杂图像编辑。
机构 * Korea University(韩国大学) ; Microsoft(微软) ; KAIST(韩国科学技术院)
专题命中 图像编辑 :diffusion(abstract);image editing(abstract)
Comments Under review
专题命中 图像编辑 :diffusion(abstract);image editing(abstract)
专题命中 图像编辑 :diffusion(abstract);image editing(abstract)
Comments 10 pages, 6 figures
专题命中 图像编辑 :diffusion(abstract);image editing(abstract)
专题命中 图像编辑 :image generation(abstract);image editing(abstract)
专题命中 图像编辑 :image generation(abstract);image editing(abstract)
Comments 14 pages, in Spanish language, 2 figures, review
专题命中 图像编辑 :image generation(abstract);inpainting(abstract)
SyncLight:单编辑多视角光照
机构 * Computer Vision Center Universitat Autònoma de Barcelona(Autonomous University of Barcelona计算机视觉中心) ; Johns Hopkins University(约翰霍普金斯大学) ; Universidad Politécnica de Madrid(马德里理工大学) ; Université Laval(拉瓦尔大学)
专题命中 图像编辑 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 SyncLight通过单视角参考编辑实现多视角一致的参数化光照控制,采用多视角扩散变压器实现高保真多视角图像集重绘。
Comments Project page: http://sync-light.github.io
Materialist: 基于物理的单图像逆渲染中的材质编辑
机构 * Technical University of Denmark(丹麦技术大学) ; University of California San Diego(加州大学圣地亚哥分校)
专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.GR
AI总结 Materialist提出一种基于物理的单图像逆渲染方法,利用神经网络预测初始材质属性并优化,实现材质编辑、物体插入和光照调整,同时引入高效的光线追踪折射方法进行透明度编辑。
Comments More Comprehensive IJCV Camera-Ready Version. Project website: https://lez-s.github.io/materialist_project/
Journal ref International Journal of Computer Vision (IJCV), 134(6), 267 (2026)
现成视觉模型助力图像篡改定位
机构 * School of Computer Science and Technology, Ocean University of China(中国海洋大学计算机科学与技术学院) ; Southwest Jiaotong University(西南交通大学)
专题命中 图像编辑 :image generation(abstract);分类 cs.CV、cs.MM
AI总结 本文提出ReVi适配器,利用现成通用视觉模型提升图像篡改定位性能,通过解耦语义冗余与篡改信息实现高效训练。
面向流程的结构化分层分解用于插图生产
机构 * Japan Advanced Institute of Science and Technology(日本科学技术先进研究院) ; Live2D Inc.(Live2D公司) ; Waseda University(早稻田大学)
专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.GR
AI总结 本文提出一种面向流程的结构化分层分解框架,用于动漫插图生产,通过分解线稿、平面色、阴影和高光等生产层,提升插图的可控性和生成质量。
Comments 17 pages, 15 figures
SMooGPT:利用大语言模型进行风格化动作生成
机构 * University of Edinburgh(爱丁堡大学)
专题命中 图像编辑 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 SMooGPT通过利用大语言模型的推理、组合和生成能力,实现风格化动作生成,提升动作控制和泛化能力。
Proc3D: 基于大语言模型的3D形状过程生成与参数编辑
专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.GR
AI总结 Proc3D利用大语言模型实现3D形状的可编辑生成,通过参数化编辑提升设计效率和准确性。
VAAS:面向数字取证中图像篡改检测的视觉-注意力异常评分
机构 * Forensics and Security Research Group, South East Technological University(法医与安全研究组,南东技术大学) ; Security Research Group, School of Computer Science, University College Dublin(安全研究组,计算机科学学院,都柏林大学学院)
专题命中 图像编辑 :image generation(abstract);分类 cs.CV、cs.MM
AI总结 VAAS通过整合视觉注意力和片段一致性评分,提出一种双模块框架用于图像篡改检测,提升检测精度和可解释性。
3D-LATTE: 从文本指令进行3D编辑的潜在空间方法
机构 * University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) ; Google Zurich(谷歌瑞士总部)
专题命中 图像编辑 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 3D-LATTE通过在潜在空间中直接操控3D几何,实现高质量的文本指令驱动3D编辑。
MotionV2V: 视频中运动的编辑
机构 * Google(谷歌) ; Stony Brook University(石溪大学)
专题命中 图像编辑 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 MotionV2V通过直接编辑稀疏轨迹实现视频运动编辑,利用生成性主干提升视频编辑能力,在用户研究中表现优异。
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))
专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.MM
Comments 9 pages including appendix, 4 tables, 8 figures, to be submitted to WACV 2026
机构 * HKUST(香港科技大学) ; Stanford University(斯坦福大学) ; CUHK(香港中文大学)
专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.MM
机构 * Monash University(墨尔本大学)
专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.MM
Comments Accepted to ACM ICMI 2025 Demos
机构 * Tel-Aviv University(特拉维夫大学)
专题命中 图像编辑 :diffusion(abstract);分类 cs.CV、cs.GR
Comments Code, supplementary videos, interactive 3D visualizations, and additional results are available at https://editp23.github.io/
机构 * Adobe Research(Adobe研究)
专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.GR
机构 * Department of Electronic and Electrical Engineering, The University of Sheffield(电子与电气工程系,谢菲尔德大学)
专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.MM
Comments This paper was presented at the British Machine Vision Conference 2024 workshop on Media authenticity in the age of artificial intelligence
专题命中 图像编辑 :diffusion(abstract);分类 cs.CV、cs.GR
专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.MM
Comments 18 pages, 16 figures