arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 79 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 79 篇

2606.24057 2026-06-24 cs.CV 新提交 90%

EPEdit: Redefining Image Editing with Generative AI and User-Centric Design

EPEdit: 用生成式AI和以用户为中心的设计重新定义图像编辑

Hoang-Phuc Nguyen, Dinh-Khoi Vo, Trong-Le Do, Hai-Dang Nguyen, Tan-Cong Nguyen, Vinh-Tiep Nguyen, Tam V. Nguyen, Khanh-Duy Le, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南胡志明市科学大学) Vietnam National University, Ho Chi Minh City(越南国家大学,胡志明市) University of Information Technology, VNU-HCM(越南胡志明市信息科技大学) University of Dayton(Dayton 大学)

专题命中 图像编辑 :diffusion(summary_cn,abstract);image editing(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出EPEdit应用,结合零样本Stable Diffusion模型和用户友好界面,支持多种图像编辑任务,无需微调,性能优于现有方案。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09322 2026-08-11 cs.CV 新提交 88%

Diffusion Image Editing via Asynchronous Token Decoding

基于异步令牌解码的扩散图像编辑

Yang Shi, Liangsi Lu, Minzhe Guo, Yifeng Xie, Yanhui Chen, Jingchao Wang, Xuhang Chen

机构 * Guangdong University of Technology(广东工业大学) Hong Kong Baptist University(香港浸会大学) Peking University(北京大学) Huizhou University(惠州学院)

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 针对文本引导扩散图像编辑的全局漂移问题,提出推理时框架ATDEdit,通过逐令牌条件意外度估计可编辑位置,在PIE-Bench上实现最优保留指标且语义对齐性具竞争力。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16291 2026-07-21 cs.CV 新提交 88%

Beyond Target Scores: Measuring Off-Target Drift in Diffusion-Based Medical Image Editing

超越目标分数:测量基于扩散的医学图像编辑中的偏离目标漂移

Todd Zhou

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 研究基于扩散的医学图像编辑中偏离目标漂移问题,引入CIB-Med-1基准及受约束扩散引导基线,通过多指标评估编辑效果,实验显示能保留目标进展并减少偏离目标漂移,强调应从轨迹级语义控制角度评估医学图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14125 2026-06-15 cs.CV cs.AI 新提交 88%

Conditioning Matters: Stabilizing Inversion and Attention in Diffusion Image Editing

条件至关重要:稳定扩散图像编辑中的反演与注意力

Zheyuan Zhan, Hongchen Li, Can Wang, Yinfei Ma, Mingzhen Huang, Ruoshi Bai, Jiawei Chen, Siwei Lyu, Defang Chen

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室) HangZhou High-Tech Zong (Binjiang) Institute of Blockchain and Data Security(杭州高新技术产业开发区(滨江)区块链与数据安全研究院) College of Computer Science, Zhejiang University(浙江大学计算机科学与技术学院) University at Buffalo, State University of New York(纽约州立大学布法罗分校)

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 本文提出SimEdit框架,通过优化文本条件精度和令牌级跨分支注意力控制,提升扩散模型反演稳定性和编辑保真度,在PIE-Bench上显著优于先前方法。

Comments Accepted to ECML PKDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20883 2026-07-24 cs.CV 新提交 85%

WhereEdit: Mask-aware Local Latent Editing for One-Step Image Editing

WhereEdit:用于一步图像编辑的掩码感知局部潜在编辑

Ming Hu, Mingyu Dou, Jianfu Yin, Miaomiao Zhang, Cong Hu, Yao Wang, Bingliang Hu, Quan Wang

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 研究针对现有一步图像编辑方法缺乏空间控制及局部编辑能力不足的问题,提出WhereEdit框架,通过自动识别语义相关区域并应用自适应局部调制,实现局部潜在编辑,实验证明其优于现有方法,提升了一步图像编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09901 2026-06-10 cs.GR cs.CV cs.HC cs.LG cs.MM 新提交 85%

On the Controllability-Fidelity Frontier in Diffusion Editing

扩散编辑中的可控性-保真度前沿

Yi Hu, Leying Yi, Emily Davis, Finn Carter

机构 * Xidian University(西安电子科技大学)

专题命中 图像编辑 :diffusion(title,abstract);image editing(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 本文理论结合实证研究扩散图像编辑中用户意图遵循、非目标内容保持与输出质量间的权衡,提出算法框架并揭示关键失败模式,讨论伦理考量。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25642 2026-07-29 cs.CV cs.CL 新提交 84%

Instruction-based Image Editing: A Survey on Data, Models, Evaluation, and Applications

基于指令的图像编辑:数据、模型、评估及应用综述

Xianghao Zang, Zijian Jiang, Jiarong Cheng, Qianrui Teng, Ying He, Yuxuan Mu, Chao Ban, Huayu Zhang, Lanxiang Zhou, Zerun Feng, Chi Zhang

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 综述基于指令的图像编辑研究,围绕任务定义、数据构建、模型架构、评估指标及商业应用五个维度展开,提出综合深度诊断基准,通过开源方案比较揭示优缺点,探讨未来研究方向以推动该领域发展。

Comments 33 pages, 7 figures, Vicinagearth

Journal ref Zang, X., Jiang, Z., Cheng, J. et al. Instruction-based image editing: a survey on data, models, evaluation, and applications. Vicinagearth 3, 3 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29367 2026-08-03 cs.CV 新提交 83%

SatEdit: Mask-Conditioned Image Editing via VLM-Guided Segment Annotation

SatEdit:基于VLM引导的区域标注的掩码条件卫星图像编辑

Muhammad Talha, Muhammad Ahmed Amer

专题命中 图像编辑 :image editing(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 SatEdit是基于VLM引导区域标注的卫星图像编辑框架,通过未标注图像构建监督信号,经LoRA微调后在对比中实现最高掩码区域语义对齐,为卫星图像编辑提供了数据高效的可行方案。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10800 2026-07-14 cs.CV 新提交 83%

h-Flow: Flexible Flow-based Image Editing via Doob's h-Transform

h-Flow:通过杜布h变换实现基于灵活流的图像编辑

Zehui Guo, Zhen Wang, Junwei Shu, Yang Li, Changbo Wang, Long Chen

机构 * East China Normal University(华东师范大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出h-Flow,一个无需训练且基于理论的基于流的图像编辑框架。受杜布h变换启发,将图像编辑重述为条件生成,通过构建等效SDE扩展h变换,设计专用h函数并引入速度正交分解,实现有效、稳健且灵活的图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26947 2026-06-26 cs.CV cs.AI 新提交 83%

Scaling Multi-Reference Image Generation with Dynamic Reward Optimization

缩放多参考图像生成与动态奖励优化

Wenwang Huang, Yusen Fu, Junjie Wang, Mengfei Huang, Yulin Li, Gan Liu, Jing Cai, Yancheng He, Zhuotao Tian

机构 * Harbin Institute of Technology(哈尔滨工业大学) Independent Researcher(独立研究者) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 图像编辑 :image generation(title,abstract);image editing(abstract);分类 cs.CV

AI总结 提出OmniRef-Bench基准和DyRef两阶段训练框架,通过动态奖励优化解决多参考图像生成中参考图像类型和数量增加导致的性能下降问题。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18906 2026-06-18 cs.CV 新提交 83%

BindEdit: Taming Attention Leakage for Precise Multi-Object Image Editing

BindEdit: 驯服注意力泄漏以实现精确的多目标图像编辑

Chaewon Park, Soyoon Lee, Naeun Lee, Minjung Shin, Seogkyu Jeon, Kibeom Hong

机构 * Sookmyung Women’s University(成均女性大学) Yonsei University(延世大学) Samsung Research(三星研究院)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 针对多目标图像编辑中的语义混合和对象重复问题,提出BindEdit方法,通过联合正则化交叉注意力和自注意力、交叉注意力重平衡机制及区域保真项,在单次扩散轨迹内抑制注意力泄漏,实现精确编辑。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11751 2026-06-16 cs.CV cs.AI 新提交 83%

AnchorEdit: Maintaining Temporal Consistency in Multi-turn Image Editing via Causal Memory

AnchorEdit: 通过因果记忆在多轮图像编辑中保持时间一致性

Hang Xu, Xiaoxiao Ma, Guohui Zhang, Yu Hu, Siming Fu, Jie Huang, Lin Song, Haoyang Huang, Nan Duan, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) JD Explore Academy(京东探索研究院)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出首个自回归扩散框架AnchorEdit,通过因果记忆机制和自展开策略解决多轮编辑中的身份漂移和误差累积问题,在10轮以上交互中保持高保真度。

Comments Code: https://github.com/xuhang07/AnchorEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13898 2026-06-15 cs.CV cs.AI 新提交 83%

HiLo-Token: Input-Adaptive High-Low Frequency Token Compression for Efficient Image Editing

HiLo-Token: 输入自适应的高低频令牌压缩用于高效图像编辑

Haoran You, Yotam Nitzan, Lingzhi Zhang, Yifan Gong, Mang-Tik Chiu, Connelly Barnes, Yan Kang, Yuqian Zhou, Eli Shechtman, Sohrab Amirghodsi

机构 * Adobe ART AI Lab(Adobe ART AI实验室) Adobe Research(Adobe研究院)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 针对扩散变换器(DiT)在图像编辑中延迟高的问题,提出输入自适应的令牌压缩框架HiLo-Token,根据空间频率分配令牌预算,在保持生成质量的同时实现高达3.13倍加速。

Comments 14 pages, 10 figures, Patent filled

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02059 2026-08-04 cs.CV cs.MM 新提交 81%

MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing

MIEScore:面向多源图像编辑的人类对齐评估方法

Zitong Xu, Huiyu Duan, Xinyun Zhang, Weifei Xiong, Tianyi Zheng, Xiongkuo Min, Qiang Hu, Zhengxue Cheng, Bo Li, Guangtao Zhai

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.MM

AI总结 针对多源图像编辑(MIE)缺乏人类对齐评估基准的问题,研究构建了首个MIE基准MIE-Bench,并提出基于MLLM的评估模型MIEScore,其对齐人类偏好性能最优且泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16457 2026-06-16 cs.CV cs.GR 新提交 81%

ResEdit: Residual embeddings for precise generative image editing

ResEdit:用于精确生成式图像编辑的残差嵌入

Ahmet Canberk Baykal, Valentin Deschaintre, Yannick Hold-Geoffroy, Michael Fischer, Anna Frühstück, Cengiz Öztireli, Iliyan Georgiev

机构 * Adobe Research(Adobe研究院) University of Cambridge(剑桥大学)

专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出残差图像编码作为额外条件,结合梯度反转优化策略,在保持图像身份和全局一致性的同时实现高保真精确编辑。

Comments Accepted to the EGSR 2026 journal track

Journal ref Computer Graphics Forum 45(4), e70551 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12122 2026-08-13 cs.RO cs.CV 新提交 79%

HandEdit: A Unified Benchmark for Egocentric Human-to-Robot Dexterous Hand Image Editing

HandEdit:用于自我中心视角下人类到机器人灵巧手图像编辑的统一基准

Zhenjie Yang, Xingyu Jiao, Guopeng Zhong, Shuzhe Yang, Shi Che, Chao Wu, Chenyu Jiang, Dongjie Zhang, Yideng Zhang, Zheng Zhang, Muyun Jiang, Haisheng Su, Shuang Jin, Donghang Zhang, Chao Yang, Li Chen, Hongyang Li, Zuxuan Wu, Yu-Gang Jiang, Xiaosong Jia, Junchi Yan

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 HandEdit是含2亿+实例、覆盖26种URDF的统一具身感知图像编辑基准,用于弥合人类与机器人数据差异,可评估11种图像编辑基线,助力具身人工智能发展。

Comments Technical Report. Project Page: https://handedit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09097 2026-08-11 cs.CV 新提交 79%

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision

SI-Edit:面向草图-指令引导的像素级精度局部图像编辑

Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) City University of Macau(澳门城市大学) Meitu Inc(美图公司)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 针对基于草图的图像编辑缺乏像素级精度及对应数据集、评估指标的问题,提出SI-Edit框架,构建SI-Data数据集并建立评估指标,实现更可靠的结构控制与像素级局部编辑效果。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03974 2026-08-05 cs.CV 新提交 79%

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑

Yicheng Xiao, Wenxun Dai, Xinran Qin, Lin Song, Maoquan Zhang, Hang Xu, Yukang Chen, Yitong Li, Guohui Zhang, Yuan Zhang, Xuying Zhang, Tommy Zhang, Jianlong Yuan, Peihao Li, Shuai Lu, Siming Fu, Chuyang Zhao, Xin Han, Jie Huang, Wenbo Li, Guoqing Ma, Wei Huang, Xiaojuan Qi, Haoyang Huang, Nan Duan

专题命中 图像编辑 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对实时视频编辑的低延迟、时序一致等需求,提出160亿参数的JoyAI-Video-Edit自回归扩散框架,结合多种蒸馏技术,在单张Nvidia B200 GPU上实现约30 FPS的720p视频编辑,性能优于现有流式编辑器且与离线系统相当。

Comments Code: https://github.com/jd-opensource/JoyAI-Video-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03059 2026-08-05 cs.CV 新提交 79%

RIDGE: Re-Noising with Internal Dynamic Guidance for Image Editing

RIDGE:用于图像编辑的基于内部动态引导的重加噪方法

Ruiliang Gong, Zhen Wang, Yanghao Wang, Long Chen

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 该研究针对无反转图像编辑中等位移构造的缺陷,提出RIDGE方法,通过重加噪与内部动态引导优化编辑,在多基准实验中实现了源保留、目标对齐与感知质量的良好权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00736 2026-08-04 cs.CV 新提交 79%

MDTD-ArtIR: Benchmarking Image Editing and Restoration Models for Art Image Restoration under Texture-Overlay Degradations

MDTD-ArtIR:针对纹理叠加退化的艺术图像修复的图像编辑与修复模型基准测试

Mridula Vijendran, Shuang Chen, Hubert P. H. Shum

机构 * Durham University(杜伦大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本研究构建MDTD-Art基准及MDTD-Art数据集,对比各类模型,发现图像编辑模型在艺术图像修复中优于专用修复架构,结构化提示可放大其性能优势。

Comments 15 pages, 6 figures, 6 tables. Preprint submitted to Elsevier Journal of Visual Communication and Image Representation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00584 2026-08-04 cs.CV cs.AI cs.LG 新提交 79%

Element-Aware Group Learning for E-Commerce Image Generation

面向电商图像生成的元素感知组学习

Jingtong Chen, Jiahui Wang, Xue Zhao, ShaoGuo Liu, Minghao Li

专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV

AI总结 针对电商图像生成中GRPO仅在完整提示层面分配信用的缺陷,提出EAGLE-GRPO,通过分解奖励并推导闭式解实现元素级信用分配,提升提示质量与生成图像性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20197 2026-07-23 cs.CV 新提交 79%

RS-RIE-Bench: Benchmarking Reasoning-Guided Remote Sensing Image Editing

RS-RIE-Bench:推理引导的遥感图像编辑基准测试

Zihan Qin, Boao Xu, Zhao Dong, Yingping Sun, Ziheng Jiao, Junying Wang, Hongwei Wang

机构 * Huawei(华为)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 该研究针对遥感图像编辑,引入RS-RIE-Bench基准,将任务分类,通过特定评估协议和方法评估模型,经实验发现当前模型在推理引导的遥感编辑中有局限,为未来模型提供了基准和研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17768 2026-07-21 cs.CV 新提交 79%

To Blend In, First Decouple: Rethinking Camouflage Image Generation via Context-Decoupled Representations

为了融入,首先解耦:通过上下文解耦表示重新思考伪装图像生成

Wenzhuang Wang, Yifan Zhao, Mingcan Ma, Yunlong Che, Haoran Chen, Ming Liu, Jia Li

机构 * Beihang University(北京航空航天大学) Geely Automobile Research Institute (Ningbo) Co., Ltd(吉利汽车研究院(宁波)有限公司)

专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV

AI总结 研究伪装图像生成问题,提出上下文解耦生成范式CamoDreamer,通过设计对比感知上下文桥等方法,将潜在伪装特征解耦为物体和背景控制流,实验证明其显著优于现有方法且设计轻量。

Comments 14 pages, 11 figures, ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07051 2026-07-09 cs.CV cs.AI 新提交 79%

Making Implicit Preservation Intent Explicit in Conversational Image Editing

在对话式图像编辑中明确隐式保留意图

Soomin Han, Jihyung Ahn, Bumsoo Kim, Buru Chang

机构 * Sogang University(西江大学) Korea University(高丽大学) Chung-Ang University(中央大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 研究对话式图像编辑中隐式保留意图的问题,提出无需训练的ReSpec框架,通过配对恢复感知指令与历史视觉参考使隐式保留明确化,实验显示该框架提升了恢复保真度和时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02421 2026-07-03 cs.CV 新提交 79%

Wavelet-Guided Semantic Signal Compensation for Inversion-Free Image Editing

小波引导的语义信号补偿用于无反转图像编辑

Anqi Tang, Wenhao Sun, Zhaoqiang Liu

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 针对无反转图像编辑中全局属性编辑不足的问题,提出基于小波的频率感知语义补偿策略,在生成早期增强有效信号,提升全局编辑能力同时保持背景保真度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26872 2026-06-29 cs.CV 新提交 79%

SpatialFlow-GRPO: Where Spatial Credit Drives Image Editing

SpatialFlow-GRPO:空间信用驱动图像编辑

Yankai Yang, Yancheng Long, Wei Chen, Xingyu Lu, Hongyang Wei, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Kuaishou Technology(快手科技)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出SpatialFlow-GRPO框架,通过引入空间细粒度奖励反馈,将区域感知奖励转化为语义区域级优化信号,解决图像编辑中空间均匀性假设问题,显著提升编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26551 2026-06-29 cs.CV 新提交 79%

PhyEditBench: A Real-World Multi-Stage Benchmark for Physics-Aware Image Editing

PhyEditBench: 一个用于物理感知图像编辑的真实世界多阶段基准

Shengbin Guo, Shaokang He, Chaoyue Meng, Shengpeng Xiao, Xunzhi Xiang, Shaofeng Zhang, Qi Fan

机构 * Nanjing University(南京大学) SDU(山东大学) HRBEU(哈尔滨工程大学) SDUTCM(山东中医药大学) USTC(中国科学技术大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出PhyEditBench基准,通过分层分类和真实/反物理实例评估编辑模型的物理理解能力,并引入训练无关基线PhyWorld利用视频生成推理。

Comments 19 pages, 6 figures, 2 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23270 2026-06-23 cs.CV 新提交 79%

BoxCtrl: 3D-Aware Visual Prompting for Geometric Image Editing

BoxCtrl: 面向几何图像编辑的3D感知视觉提示

Feifei Wang, Shiyuan Yang, Xiaoyu Li, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Tencent(腾讯)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出BoxCtrl框架,通过投影到2D的RGB 3D边界框作为视觉提示,结合监督微调与强化学习两阶段训练,实现精确的3D几何编辑(平移、旋转、缩放等),达到最先进性能。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23221 2026-06-23 cs.CV cs.AI 新提交 79%

RS-Gen: A Multi-Stage Agentic Framework for Reasoning and Search-Augmented Image Generation

RS-Gen:用于推理和搜索增强图像生成的多阶段智能体框架

Feifei Bian, Zhimin Zheng, Wei Deng, Daiguo Zhou, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV

AI总结 提出RS-Gen,一种即插即用、无需训练的多阶段图像智能体框架,通过“提问-解决”闭环机制进行逻辑推理和知识补全,显著提升基础图像生成与编辑模型在模糊意图和分布外知识场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19531 2026-06-19 cs.CV cs.RO 新提交 79%

ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?

ImageWAM:世界动作模型真的需要视频生成,还是只需要图像编辑?

Yuyang Zhang, Wenyao Zhang, Zekun Qi, He Zhang, Haitao Lin, Jingbo Zhang, Yao Mu, Xiaokang Yang, Wenjun Zeng, Xin Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东方理工学院) Tencent Robotics X(腾讯机器人X) Tsinghua University(清华大学) Zhongguancun Academy(中关村学院)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出ImageWAM框架,利用预训练图像编辑模型替代视频生成进行机器人动作预测,通过编辑去噪的KV缓存作为世界动作上下文,在多个模拟和真实实验中优于基线,计算量降至1/6,延迟降至1/4。

Comments Project Page: https://zhangwenyao1.github.io/ImageWAM/

详情

展开后加载摘要…

URL PDF HTML 收藏