arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1655 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 37 篇

2602.00032 2026-06-23 cs.CY cs.AI cs.CV 版本更新 57%

Happy Young Women, Grumpy Old Men? Emotion-Driven Demographic Biases in Synthetic Face Generation

快乐年轻女性,暴躁老年男性?合成人脸生成中情绪驱动的人口统计偏见

Mengting Wei, Aditya Gulati, Guoying Zhao, Nuria Oliver

机构 * University of Oulu(奥卢大学) ELLIS Alicante(阿利坎特ELLIS)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本研究系统审计了文本到图像模型在情绪提示下生成人脸的人口统计偏见,发现模型过度代表年轻面孔和白人特征,负面情绪提示加剧了特定群体的缺失,并降低了感知吸引力。

Comments 39 pages, 16 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10705 2026-06-23 eess.IV cs.CV 版本更新 57%

3D Vessel Reconstruction from Sparse-View Dynamic DSA Images via Vessel Probability Guided Attenuation Learning

基于血管概率引导衰减学习的稀疏视角动态DSA图像三维血管重建

Zhentao Liu, Huangxuan Zhao, Wenhui Qin, Zhenghong Zhou, Xinggang Wang, Wenping Wang, Xiaochun Lai, Chuansheng Zheng, Dinggang Shen, Zhiming Cui

机构 * School of Biomedical Engineering \& State Key Laboratory of Advanced Medical Materials Devices, ShanghaiTech University, Shanghai, China National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University, Wuhan, China School of Electronic Information Communications, Huazhong University of Science Department of Computer Science \& Engineering, Texas A\&M University, USA

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出血管概率引导衰减学习框架,通过静态与动态衰减场互补加权实现稀疏视角DSA重建,降低辐射剂量,并采用渐进训练和时间扰动损失提升质量。

Comments Accepted by Medical Image Analysis (MedIA), 2026; code: https://github.com/ShanghaiTech-IMPACT/VPAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00222 2026-06-16 cs.RO cs.AI cs.CV 版本更新 57%

MapDream: Task-Driven Map Learning for Vision-Language Navigation

MapDream: 面向视觉-语言导航的任务驱动地图学习

Guoxin Lian, Shuo Wang, Yucheng Wang, Yongcai Wang, Maiyue Chen, Kaihui Wang, Bo Zhang, Zhizhong Su, Deying Li, Zhaoxin Fan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出MapDream框架,通过自回归鸟瞰图生成联合学习地图与动作预测,在R2R-CE和RxR-CE上达到单目最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09250 2026-06-15 cs.CV cs.AI cs.LG 版本更新 57%

MirrorCheck: Efficient Adversarial Defense for Vision-Language Models

MirrorCheck: 视觉-语言模型的高效对抗防御

Samar Fares, Klea Ziu, Toluwani Aremu, Nikita Durasov, Martin Takáč, Pascal Fua, Ivan Laptev, Karthik Nandakumar

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能大学) NVIDIA École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Michigan State University(密歇根州立大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出MirrorCheck框架,利用文本到图像模型和随机化策略检测并防御针对视觉-语言模型的自适应对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15947 2026-06-15 eess.IV cs.CV 版本更新 57%

MCR-VQGAN: A Scalable and Cost-Effective Tau PET Synthesis Approach for Alzheimer's Disease Imaging

MCR-VQGAN:一种用于阿尔茨海默病成像的可扩展且经济高效的Tau PET合成方法

Jin Young Kim, Jeremy Hudson, Jeongchul Kim, Qing Lyu, Christopher T. Whitlow

机构 * Department of Biomedical Engineering, Wake Forest University School of Medicine(生物医学工程系,威克森林大学医学院) Department of Radiology, Wake Forest School of Medicine(放射学系,威克森林医学院) Department of Radiology and Biomedical Imaging, Yale School of Medicine(放射学与生物医学成像系,耶鲁医学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出MCR-VQGAN模型,通过多尺度卷积、ResNet块和CBAM模块改进VQGAN,从T1加权MRI合成高保真tau PET图像,在ADNI数据集上优于cGAN等方法,且合成图像保留诊断特征,区域SUVR等效分析显示与真实图像高度一致。

Comments Accepted for publication in IEEE Access. 14 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04498 2026-06-09 cs.LG cs.CV 版本更新 57%

IGenBench: Benchmarking the Reliability of Text-to-Infographic Generation

IGenBench:文本到信息图生成可靠性基准测试

Yinghao Tang, Xueding Liu, Boyuan Zhang, Tingfeng Lan, Yupeng Xie, Jiale Lao, Yiyao Wang, Haoxuan Li, Tingting Gao, Bo Pan, Luoxuan Weng, Xiuqi Huang, Minfeng Zhu, Yingchaojie Feng, Yuyu Luo, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) UESTC University of Virginia(弗吉尼亚大学) HKUST(GZ)(香港科技大学(广州)) Cornell University(康奈尔大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出IGENBENCH基准,包含30种信息图类型和600个测试用例,通过多模态大语言模型分解为10类原子问题评估10种T2I模型,发现数据完整性等维度是普遍瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05949 2026-06-08 cs.CV 版本更新 57%

Faithful, Enriched, and Precise: Benchmarking Natural-Science Illustration Generation by T2I models

忠实、丰富且精确:T2I模型在自然科学插图生成中的基准测试

Yifan Chang, Jiaxin Ai, Jianwen Sun, Yuandong Pu, Siqi Luo, Liangliang Zhao, Yuchen Ren, Minghao Liu, Yunfei Yu, Yu Qiao, Kaipeng Zhang, Yihao Liu

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Nankai University(南开大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) ZODA Alaya Studio(Alaya工作室)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出FEPBench基准,通过细粒度原子集标注和三维评估(指令忠实性、推理丰富性、语义精确性)系统评估T2I模型在自然科学插图生成中的表现,发现即使最先进的闭源模型仍存在文本渲染瓶颈、推理丰富性有限以及生成丰富性与精确性难以平衡的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 51 篇

2606.13303 2026-08-03 cs.CV 版本更新 88%

DuET: Dual Expert Trajectories for Diffusion Image Editing

DuET: 双专家轨迹用于扩散图像编辑

Lidia Troeshestova, Alexander Ustyuzhanin, Sergey Kastryulin

机构 * HSE University(高等经济大学) Yandex

专题命中 图像编辑 :diffusion(title,abstract);image editing(title);text-to-image(abstract);分类 cs.CV

AI总结 提出训练自由的DuET方法,通过临时切换到文本到图像阶段再返回编辑模式,缓解源图像条件限制,提升编辑指令相关性、语义保真度和感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16399 2026-07-01 cs.CV cs.LG 版本更新 88%

Stable and Near-Reversible Diffusion ODE Solvers for Image Editing

稳定且近可逆的图像编辑扩散ODE求解器

Barbora Barancikova, Daniil Shmelev, Cristopher Salvi

机构 * Department of Computing, Imperial College London, London, United Kingdom(帝国理工学院伦敦分校计算机系,伦敦,英国) Department of Mathematics, Imperial College London, London, United Kingdom(帝国理工学院伦敦分校数学系,伦敦,英国)

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 本文提出近可逆Runge-Kutta方法以提升图像编辑的稳定性与精度,平衡可逆性与数值稳定性,保留背景保真优势。

Comments ICML 2026 Workshop on Structured Probabilistic Inference & Generative Modeling (SPIGM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16864 2026-07-17 cs.CV 版本更新 86%

RePlan: Reasoning-guided Region Planning for Complex Instruction-based Image Editing

RePlan:基于推理的复杂基于指令的图像编辑区域规划

Tianyuan Qu, Lei Ke, Xiaohang Zhan, Longxiang Tang, Yuqi Liu, Bohao Peng, Bei Yu, Dong Yu, Jiaya Jia

机构 * Tencent AI Lab(腾讯人工智能实验室) CUHK(香港中文大学) HKUST(香港科技大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 研究针对复杂指令图像编辑中现有模型在IV-复杂性下的不足,提出RePlan框架,结合视觉语言规划器与扩散编辑器,经强化学习提升性能,还推出IV-Edit基准,该框架在相关设置中优于强大基线,提高了区域精度和整体一致性。

Comments [ECCV2026] Precise multi-region control and planning for instruction-based image editing. Our project page: https://replan-iv-edit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29025 2026-08-06 cs.CV 版本更新 85%

Evaluation-Verification Reward for Consistent Multi-Reference Image Editing

用于一致多参考图像编辑的评估-验证奖励

Yingmao Miao, Pengfei Zhang, Xiaochen Lv, Meng Yu, Lei Sun, Xiangxiang Chu, Chao Shen, Chenhao Lin

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba(高德,阿里巴巴) Shanghai Jiao Tong University(上海交通大学)

专题命中 图像编辑 :image editing(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对多参考图像编辑的视觉一致性与奖励模型缺失问题,提出多维度评估-验证奖励EVR,实现无需架构改动的现成编辑器RL微调,性能优于Qwen-Image-Edit并达到或超NanoBanana。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18438 2026-06-12 cs.CV 版本更新 85%

CPAM: Context-Preserving Adaptive Manipulation for Zero-Shot Real Image Editing

CPAM: 保持上下文的自适应操作用于零样本真实图像编辑

Dinh-Khoi Vo, Thanh-Toan Do, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * Faculty of Information Technology, University of Science, Ho Chi Minh City, Vietnam(越南科学大学信息科技学院) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学) Faculty of Information Technology, Monash University, Melbourne, Victoria, Australia(莫纳什大学信息科技学院) Department of Computer Science, University of Dayton, Dayton, Ohio, US(Dayton 大学计算机科学系)

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出CPAM零样本框架,通过保持上下文的自适应操作和掩码引导,实现复杂非刚性真实图像的编辑,保留纹理和身份,无需微调。

Comments Accepted to IEEE Transactions on Multimedia. Project page: https://vdkhoi20.github.io/CPAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05950 2026-06-29 cs.AI 版本更新 85%

Edit-R2: Context-Aware Reinforcement Learning for Multi-Turn Image Editing

Edit-R2:面向多轮图像编辑的上下文感知强化学习

Yuxiao Ye, Haoran He, Fangyuan Kong, Xintao Wang, Pengfei Wan, Kun Gai, Ling Pan

机构 * Hong Kong University of Science and Technology(香港理工大学) Kuaishou Technology(快手科技)

专题命中 图像编辑 :image editing(title,abstract);image generation(abstract);diffusion(abstract)

AI总结 提出Edit-R2框架,通过重构会话意图和联合优化推理与生成的强化学习,解决多轮图像编辑中的长上下文稀释和状态污染问题,并在MICE-Bench基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17302 2026-08-11 cs.CV 版本更新 83%

PosBridge: Multi-View Positional Embedding Transplant for Identity-Aware Image Editing

PosBridge:用于身份感知图像编辑的多视图位置嵌入迁移

Peilin Xiong, Junwen Chen, Honghui Yuan, Keiji Yanai

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 PosBridge是一种高效灵活的图像编辑框架,通过位置嵌入迁移与角点居中布局,实现自定义对象的无缝插入,在结构一致性、保真度和效率上优于主流基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16898 2026-08-04 cs.CV cs.CL cs.CR 版本更新 83%

Cross-Branch Conflict as a Shield: Safeguarding Facial Identities in Unified Multimodal Image Editing

跨分支冲突作为一种保护手段:在统一多模态图像编辑中保护面部身份

Weiwei Tan, Junxian Li, Rui Wang, Zhenhua Xu, Yanjun Zhang, Yu Leo Zhang

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 研究统一多模态模型中个人肖像编辑的安全问题,提出CCS统一对抗保护框架,通过联合驱动ViT和VAE表示及破坏跨分支兼容性,防止模型恢复身份信息,在抑制身份保留编辑上表现优于现有方法。

Comments 14 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17565 2026-06-29 cs.CV 版本更新 83%

UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models

UniGeo:通过视频模型统一几何指导以实现相机可控的图像编辑

Hong Jiang, Wensong Song, Zongxin Yang, Ruijie Quan, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学) DBMI, HMS, Harvard University(DBMI、HMS、哈佛大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 UniGeo通过统一的几何指导在三个层面提升相机可控图像编辑的几何一致性与视觉质量,克服传统方法在连续相机运动下的几何漂移和结构退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25578 2026-07-21 cs.CV 版本更新 81%

H-Adapter: Pose-Robust Hairstyle Transfer via Attention-Derived, Source-Aligned Hair Masks

H-Adapter: 通过注意力导出的源对齐头发掩码实现姿态鲁棒的发型迁移

Seulgi Jeong, Yunseong Cho, Sanghun Park

机构 * SNOW Corp.(SNOW公司)

专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);diffusion(abstract);inpainting(abstract)

AI总结 提出H-Adapter,利用区域特定损失解耦头发与非头发目标,导出源对齐头发编辑掩码引导扩散修复,实现大姿态差异下的鲁棒发型迁移,在FID、FID_CLIP和CLIP-I指标上取得最优。

Comments Accepted at ECCV 2026. Project page: https://sanghunpark.github.io/hadapter_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00122 2026-06-12 cs.CV cs.AI cs.MM 版本更新 81%

VDE Bench: Evaluating The Capability of Image Editing Models to Modify Visual Documents

VDE Bench: 评估图像编辑模型对视觉文档进行修改的能力

Hongzhu Yi, Yujia Yang, Yuanxiang Wang, Tong Li, Zhenyu Guan, Tianyu Zong, Jiahuan Chen, Chenxi Bao, Tiankun Yang, Haopeng Jin, Yixuan Yuan, Xinming Wang, Tao Yu, Ruilin Gao, Ruiwen Tao, Haijin Liang, Jin Ma, Jinwen Luo, Yeshani, Xinyu Zuo, Jungang Xu

机构 * UCAS(中国科学院大学) CASIA(中国科学院自动化研究所) Tencent(腾讯) CMU(卡内基梅隆大学) WashU(华盛顿大学) SJTU(上海交通大学) XDU(北京理工大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出VDE Bench,一个专门评估图像编辑模型在双语中文-英文和复杂视觉文档编辑任务性能的基准,通过高质量数据集和新的评估框架,系统量化了文本修改的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06929 2026-08-12 cs.CV cs.AI 版本更新 79%

MaskFlow: Precise, Consistent and Seamless Regional Image Editing

MaskFlow:精准、一致且无缝的区域图像编辑

Rui Xu, Yang Yong, Shunzi Yang, Ruihao Gong, Chengtao Lv

机构 * SenseTime Research(商汤科技研究院) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 MaskFlow框架通过融合掩码的流匹配目标与Soft-Poisson去接缝模块,结合MEData数据集,实现了精准可控、无缝融合的区域图像编辑,性能优于现有方法。

Comments 18 pages, 6 figures. Project page: https://reychiaro.github.io/MaskFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07230 2026-08-11 cs.CV 版本更新 79%

PhyEdit: Towards Real-World Object Manipulation via Physically-Grounded Image Editing

PhyEdit: 通过物理基础图像编辑实现真实世界物体操作

Ruihang Xu, Dewei Zhou, Xiaolong Shen, Fan Ma, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室人工智能研究所ReLER实验室)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 PhyEdit通过结合显式几何模拟与2D-3D监督,提升图像编辑中物理准确性和操作一致性,引入RealManip-10K数据集和ManipEval基准测试,优于现有方法。

Comments Code: https://github.com/nenhang/PhyEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01295 2026-08-10 cs.CV 版本更新 79%

UniREditBench: A Unified Reasoning-based Image Editing Benchmark

UniREditBench: 一个基于推理的图像编辑统一基准

Feng Han, Yibin Wang, Chenglin Li, Zheming Liang, Dianyi Wang, Yang Jiao, Zhipeng Wei, Chao Gong, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) UC Berkeley(伯克利大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 UniREditBench通过多模态双参考评估和大规模合成数据集,提升图像编辑模型在复杂推理场景中的评估可靠性与性能表现。

Comments Project page: https://maplebb.github.io/UniREditBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20635 2026-08-04 cs.CV 版本更新 79%

iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation

iMontage:统一、多功能、高度动态的多对多图像生成

Zhoujie Fu, Xianfang Zeng, Jinghong Lan, Xinyao Liao, Cheng Chen, Junyi Chen, Jiacheng Wei, Wei Cheng, Shiyu Liu, Yunuo Chen, Gang Yu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) StepFun Shanghai Jiao Tong University(上海交通大学)

专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV

AI总结 iMontage通过整合视频模型的先验知识与图像数据的多样性,实现了统一、多功能且动态的多对多图像生成。

Comments Our homepage: https://kr1sjfu.github.io/iMontage-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27790 2026-08-03 cs.CV 版本更新 79%

Inference-time Trajectory Optimization for Structure-Preserving Manga Image Editing

漫画图像编辑中的推理时间轨迹优化

Ryosuke Furuta

机构 * Mantra Inc.(Mantra公司) The University of Tokyo(东京大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出一种在推理时适应预训练图像编辑模型的方法,通过仅使用输入漫画图像来调整模型,以提高对漫画图像的编辑效果,同时减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08532 2026-07-22 cs.CV cs.AI 版本更新 79%

Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing

连续上下文:基于指令的图像编辑的连续强度控制

Rishubh Parihar, Or Patashnik, Daniil Ostashev, R. Venkatesh Babu, Daniel Cohen-Or, Kuan-Chieh Wang

机构 * Snap Research Tel Aviv University(特拉维夫大学) IISc Bangalore(班加罗尔IISc)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 研究基于指令的图像编辑中编辑强度控制问题,提出连续上下文模型,通过扩展先进模型并引入标量编辑强度,训练轻量级投影网络,合成多样数据集,实现对多种图像编辑操作的编辑强度统一细粒度控制。

Comments Project Page: https://snap-research.github.io/kontinuouskontext/, Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11593 2026-07-20 cs.CV 版本更新 79%

WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing

WeEdit:一个数据集、基准和基于字形引导的文本中心图像编辑框架

Hui Zhang, Juntao Liu, Zongkai Liu, Liqiang Niu, Fandong Meng, Zuxuan Wu, Yu-Gang Jiang

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 WeEdit通过构建大规模数据集和定制训练策略,提升文本中心图像编辑的精度与多样性,优于现有开源模型。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26738 2026-07-16 cs.CV 版本更新 79%

Do Image Editing Models Understand Lighting?

图像编辑模型是否理解光照?

Tim Küchler, Johann-Friedrich Feiden, Matthias Nießner, Carsten Rother

机构 * Heidelberg University(海德堡大学) Technical University of Munich(慕尼黑工业大学) Zuse School ELIZA

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出3D锚定光探针基准(3DLP),通过真实世界HDR数据集评估图像编辑模型对光照变化的编辑准确性,发现模型在镜面高光区域表现较好,但整体仍有改进空间。

Comments Project page: https://tim-kuechler.github.io/3DLP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24844 2026-07-14 cs.CV 版本更新 79%

Bridging the Manifold Gap: Riemannian Residual Line Search for One-Step Image Editing

弥合流形差距:黎曼残差线搜索用于一步图像编辑

Hongzhu Yi, Zhongtian Luo, Tong Li, Yiyan Fan, Jungang Xu

机构 * UCAS(中国科学院大学) WashU(华盛顿大学) SHU(上海大学)

专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV

AI总结 针对一步扩散编辑中固定更新强度无法兼顾目标提示和源图像保真度的问题,提出黎曼残差线搜索方法,通过局部时间曲率估计和残差路径选择,在PIE-Bench++上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13692 2026-07-14 cs.CV cs.AI cs.SE 版本更新 79%

Training-Free, Identity-Preserving Image Editing for Fashion Pose Alignment and Normalization

用于时尚姿势对齐和归一化的无训练、身份保留图像编辑

Potito Aghilar, Vito Walter Anelli, Michelantonio Trizio, Eugenio Di Sciascio, Tommaso Di Noia

机构 * Polytechnic University of Bari(巴里理工大学)

专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV

AI总结 针对时尚行业非刚性姿势调整难题,提出无训练的FashionRepose管道,结合预训练模型,通过零样本方法在保留服装身份特征的同时实现近实时编辑,已成功为OVS处理大量长袖服装。

Journal ref Expert Systems With Applications, 293, 128579 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19645 2026-07-02 cs.CV 版本更新 79%

Learn Once, Edit Anywhere: Visual Direction Transfer for Diffusion Models

一次学习,随处编辑:扩散模型的视觉方向迁移

Yusuf Dalva, Hidir Yesiltepe, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 图像编辑 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ViDiT框架,通过从图像编辑对中学习连续编辑方向,实现无需微调的零样本图像属性编辑,在保持输入保真度的同时实现精确、可扩展的属性控制。

Comments ECCV 2026, Project page: http://vidit-edit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15917 2026-07-01 cs.CV 版本更新 79%

Making Image Editing Easier via Adaptive Task Reformulation with Agentic Executions

通过具有代理执行的自适应任务重构使图像编辑更易于实现

Bo Zhao, Kairui Guo, Runnan Du, Haiyang Sun, Pengshan Wang, Huan Yang, Kun Gai, Yixin Cao, Wei Ji

机构 * Nanjing University(南京大学) Beijing Institute of Technology(北京理工大学) College of Artificial Intelligence, China University of Petroleum (Beijing)(中国石油大学(北京)人工智能学院) Beijing University of Posts and Telecommunications(北京邮电大学) Fudan University(复旦大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出通过自适应任务重构框架提升图像编辑性能,通过代理分析和反馈优化任务描述,改进编辑效果,尤其在复杂案例中表现显著。

Comments 9pages

详情

展开后加载摘要…

URL PDF HTML 收藏