arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2839 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 98 篇

2607.21615 2026-07-27 cs.AI cs.LG 新提交 50%

FrED: External Data Influence Estimation via Domain Knowledge Graph Grounding

FrED:通过领域知识图谱基础进行外部数据影响估计

Theodoros Aivalis, Iraklis A. Klampanos, Antonis Troumpoukis, Joemon M. Jose

机构 * National Centre for Scientific Research “Demokritos”(国家科学研究中心“德谟克利特”) University of Glasgow(格拉斯哥大学)

专题命中 文生图 :image synthesis(abstract)

AI总结 针对生成式AI训练数据归因问题,提出在黑盒设置下运行的概率框架,融合连续特征相似度与领域特定知识图谱,在艺术图像合成和天气预报等领域评估,证明其有效性,为外部数据影响分析提供高效可解释机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13541 2026-07-16 cs.CR cs.LG 新提交 50%

When T2I Synthetic Data Backfires: Amplified Privacy Risks in Real-Synthetic Mix Training

当文本到图像合成数据适得其反时:真实-合成混合训练中的隐私风险放大

Na Li, Boyu Kuang, Hongsheng Hu, Liquan Chen, Hyoungshick Kim, Yansong Gao, Anmin Fu

专题命中 文生图 :text-to-image(abstract)

AI总结 研究真实-合成混合训练中合成数据会放大真实训练样本隐私泄露问题,建立理论框架,提出RSMixLeak通过成员推理攻击评估风险,有两个变体,还给出轻量级泄露倾向指标以识别高风险数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10557 2026-07-14 cs.CL 新提交 50%

UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp

UNIBROWSE:用于多模态浏览比较的数据到智能体框架

Xiyu Wei, Qingwei Zong, Zhuocheng Yu, Sujian Li

机构 * Key Laboratory of Computational Linguistics, MOE, Peking University(教育部计算语言学重点实验室,北京大学) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 文生图 :text-to-image(abstract)

AI总结 研究多模态浏览比较任务,提出UNIBROWSE统一数据管道,同时生成三种模式训练数据,增强知识图谱,引入探索度度量。经此训练的35B规模智能体在多模态浏览比较基准测试中性能领先,超多个闭源智能体工作流程。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04339 2026-07-07 cs.LG cs.AI cs.CR 新提交 50%

One Framework for All: Cross-Modal Membership Inference for Generative Models

一框架适用于所有:生成模型的跨模态成员推理

Dayong Ye, Tainqing Zhu, Kun Gao, Junhao Liu, Yichuan Chen, Shuai Zhou, Hengzhu Liu, Bo Liu, Wanlei Zhou

专题命中 文生图 :text-to-image(abstract)

AI总结 研究生成模型的跨模态成员推理问题,基于生成模型输出分布可近似训练数据分布的特性,在共享嵌入空间建模,通过似然比测试推理,贡献统一框架,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31711 2026-07-01 cs.AI 新提交 50%

Arena-T2I Hard: Benchmarking and Improving Faithfulness with Dependency-Aware Checklist

Arena-T2I Hard:基于依赖感知清单的忠实性基准测试与改进

Yuanhao Ban, Tong Xie, Sohyun An, Yunqi Hong, Evan Frick, I-Hung Hsu, Wei-Lin Chiang, Ion Stoica, Cho-Jui Hsieh

机构 * Arena Intelligence Inc UCLA(加州大学洛杉矶分校)

专题命中 文生图 :text-to-image(abstract)

AI总结 针对现有忠实性基准在复杂指令上的不足,提出310条压力测试提示集Arena-T2I Hard,并设计依赖感知清单奖励结合美学奖励,显著提升文本到图像模型的忠实性-美学权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28221 2026-06-29 astro-ph.IM 新提交 50%

Faraday Tomography with the SKA: A New Era of Cosmic Magnetism Studies

SKA的法拉第层析成像:宇宙磁学研究的新时代

Miguel Carcamo, Anna M. M. Scaife, Jeroen Stil, Russ Taylor, Jennifer L. West, Tessa Vernstrom

专题命中 文生图 :image synthesis(abstract)

AI总结 本文综述了SKA通过法拉第旋转和法拉第测量合成技术研究宇宙磁场的能力,重点介绍了AA4阶段的配置及其在星系、星系团和宇宙网中高分辨率法拉第层析成像的应用。

Comments Published in Advancing Astrophysics with the SKA II (AASKAII), 2026 (arXiv:2606.20366). Report-no:AASKAII/Carcamo01. Advancing Astrophysics with the SKA II (AASKAII) outlines the transformative scientific advances that will be enabled by the SKA telescopes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23645 2026-06-23 math-ph math.MP 新提交 50%

Which Waveguide Network Realizes a Prescribed Transmission Profile? An Exact Forward Construction

哪个波导网络实现指定的传输轮廓?一种精确的正向构造方法

Tristan M. Lawrie

专题命中 文生图 :image synthesis(abstract)

AI总结 提出一种基于规范平移亥姆霍兹算子的周期性波导网络散射特性的可解析反演框架,通过傅里叶展开将晶格电抗映射到图架构,直接从目标传输系数确定物理结构,实现从一维角滤波到二维图像合成的精确波前构造。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12972 2026-06-12 cs.HC 新提交 50%

From Prompts to Preferences: An Open-Source Platform for Generative AI-Enhanced Conjoint Analysis

从提示到偏好:生成式AI增强联合分析的开源平台

Philipp Brauner

专题命中 文生图 :text-to-image(abstract)

AI总结 提出一个开源、自托管的联合分析调查平台,利用生成式AI(大语言模型和文本到图像模型)创建集成刺激格式,降低研究门槛,并通过概念验证研究展示其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 79 篇

2606.24057 2026-06-24 cs.CV 新提交 90%

EPEdit: Redefining Image Editing with Generative AI and User-Centric Design

EPEdit: 用生成式AI和以用户为中心的设计重新定义图像编辑

Hoang-Phuc Nguyen, Dinh-Khoi Vo, Trong-Le Do, Hai-Dang Nguyen, Tan-Cong Nguyen, Vinh-Tiep Nguyen, Tam V. Nguyen, Khanh-Duy Le, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南胡志明市科学大学) Vietnam National University, Ho Chi Minh City(越南国家大学,胡志明市) University of Information Technology, VNU-HCM(越南胡志明市信息科技大学) University of Dayton(Dayton 大学)

专题命中 图像编辑 :diffusion(summary_cn,abstract);image editing(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出EPEdit应用,结合零样本Stable Diffusion模型和用户友好界面,支持多种图像编辑任务,无需微调,性能优于现有方案。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09322 2026-08-11 cs.CV 新提交 88%

Diffusion Image Editing via Asynchronous Token Decoding

基于异步令牌解码的扩散图像编辑

Yang Shi, Liangsi Lu, Minzhe Guo, Yifeng Xie, Yanhui Chen, Jingchao Wang, Xuhang Chen

机构 * Guangdong University of Technology(广东工业大学) Hong Kong Baptist University(香港浸会大学) Peking University(北京大学) Huizhou University(惠州学院)

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 针对文本引导扩散图像编辑的全局漂移问题,提出推理时框架ATDEdit,通过逐令牌条件意外度估计可编辑位置,在PIE-Bench上实现最优保留指标且语义对齐性具竞争力。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16291 2026-07-21 cs.CV 新提交 88%

Beyond Target Scores: Measuring Off-Target Drift in Diffusion-Based Medical Image Editing

超越目标分数:测量基于扩散的医学图像编辑中的偏离目标漂移

Todd Zhou

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 研究基于扩散的医学图像编辑中偏离目标漂移问题,引入CIB-Med-1基准及受约束扩散引导基线,通过多指标评估编辑效果,实验显示能保留目标进展并减少偏离目标漂移,强调应从轨迹级语义控制角度评估医学图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14125 2026-06-15 cs.CV cs.AI 新提交 88%

Conditioning Matters: Stabilizing Inversion and Attention in Diffusion Image Editing

条件至关重要:稳定扩散图像编辑中的反演与注意力

Zheyuan Zhan, Hongchen Li, Can Wang, Yinfei Ma, Mingzhen Huang, Ruoshi Bai, Jiawei Chen, Siwei Lyu, Defang Chen

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室) HangZhou High-Tech Zong (Binjiang) Institute of Blockchain and Data Security(杭州高新技术产业开发区(滨江)区块链与数据安全研究院) College of Computer Science, Zhejiang University(浙江大学计算机科学与技术学院) University at Buffalo, State University of New York(纽约州立大学布法罗分校)

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 本文提出SimEdit框架,通过优化文本条件精度和令牌级跨分支注意力控制,提升扩散模型反演稳定性和编辑保真度,在PIE-Bench上显著优于先前方法。

Comments Accepted to ECML PKDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20883 2026-07-24 cs.CV 新提交 85%

WhereEdit: Mask-aware Local Latent Editing for One-Step Image Editing

WhereEdit:用于一步图像编辑的掩码感知局部潜在编辑

Ming Hu, Mingyu Dou, Jianfu Yin, Miaomiao Zhang, Cong Hu, Yao Wang, Bingliang Hu, Quan Wang

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 研究针对现有一步图像编辑方法缺乏空间控制及局部编辑能力不足的问题,提出WhereEdit框架,通过自动识别语义相关区域并应用自适应局部调制,实现局部潜在编辑,实验证明其优于现有方法,提升了一步图像编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09901 2026-06-10 cs.GR cs.CV cs.HC cs.LG cs.MM 新提交 85%

On the Controllability-Fidelity Frontier in Diffusion Editing

扩散编辑中的可控性-保真度前沿

Yi Hu, Leying Yi, Emily Davis, Finn Carter

机构 * Xidian University(西安电子科技大学)

专题命中 图像编辑 :diffusion(title,abstract);image editing(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 本文理论结合实证研究扩散图像编辑中用户意图遵循、非目标内容保持与输出质量间的权衡,提出算法框架并揭示关键失败模式,讨论伦理考量。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25642 2026-07-29 cs.CV cs.CL 新提交 84%

Instruction-based Image Editing: A Survey on Data, Models, Evaluation, and Applications

基于指令的图像编辑:数据、模型、评估及应用综述

Xianghao Zang, Zijian Jiang, Jiarong Cheng, Qianrui Teng, Ying He, Yuxuan Mu, Chao Ban, Huayu Zhang, Lanxiang Zhou, Zerun Feng, Chi Zhang

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 综述基于指令的图像编辑研究,围绕任务定义、数据构建、模型架构、评估指标及商业应用五个维度展开,提出综合深度诊断基准,通过开源方案比较揭示优缺点,探讨未来研究方向以推动该领域发展。

Comments 33 pages, 7 figures, Vicinagearth

Journal ref Zang, X., Jiang, Z., Cheng, J. et al. Instruction-based image editing: a survey on data, models, evaluation, and applications. Vicinagearth 3, 3 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29367 2026-08-03 cs.CV 新提交 83%

SatEdit: Mask-Conditioned Image Editing via VLM-Guided Segment Annotation

SatEdit:基于VLM引导的区域标注的掩码条件卫星图像编辑

Muhammad Talha, Muhammad Ahmed Amer

专题命中 图像编辑 :image editing(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 SatEdit是基于VLM引导区域标注的卫星图像编辑框架,通过未标注图像构建监督信号,经LoRA微调后在对比中实现最高掩码区域语义对齐,为卫星图像编辑提供了数据高效的可行方案。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10800 2026-07-14 cs.CV 新提交 83%

h-Flow: Flexible Flow-based Image Editing via Doob's h-Transform

h-Flow:通过杜布h变换实现基于灵活流的图像编辑

Zehui Guo, Zhen Wang, Junwei Shu, Yang Li, Changbo Wang, Long Chen

机构 * East China Normal University(华东师范大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出h-Flow,一个无需训练且基于理论的基于流的图像编辑框架。受杜布h变换启发,将图像编辑重述为条件生成,通过构建等效SDE扩展h变换,设计专用h函数并引入速度正交分解,实现有效、稳健且灵活的图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26947 2026-06-26 cs.CV cs.AI 新提交 83%

Scaling Multi-Reference Image Generation with Dynamic Reward Optimization

缩放多参考图像生成与动态奖励优化

Wenwang Huang, Yusen Fu, Junjie Wang, Mengfei Huang, Yulin Li, Gan Liu, Jing Cai, Yancheng He, Zhuotao Tian

机构 * Harbin Institute of Technology(哈尔滨工业大学) Independent Researcher(独立研究者) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 图像编辑 :image generation(title,abstract);image editing(abstract);分类 cs.CV

AI总结 提出OmniRef-Bench基准和DyRef两阶段训练框架,通过动态奖励优化解决多参考图像生成中参考图像类型和数量增加导致的性能下降问题。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18906 2026-06-18 cs.CV 新提交 83%

BindEdit: Taming Attention Leakage for Precise Multi-Object Image Editing

BindEdit: 驯服注意力泄漏以实现精确的多目标图像编辑

Chaewon Park, Soyoon Lee, Naeun Lee, Minjung Shin, Seogkyu Jeon, Kibeom Hong

机构 * Sookmyung Women’s University(成均女性大学) Yonsei University(延世大学) Samsung Research(三星研究院)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 针对多目标图像编辑中的语义混合和对象重复问题,提出BindEdit方法,通过联合正则化交叉注意力和自注意力、交叉注意力重平衡机制及区域保真项,在单次扩散轨迹内抑制注意力泄漏,实现精确编辑。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11751 2026-06-16 cs.CV cs.AI 新提交 83%

AnchorEdit: Maintaining Temporal Consistency in Multi-turn Image Editing via Causal Memory

AnchorEdit: 通过因果记忆在多轮图像编辑中保持时间一致性

Hang Xu, Xiaoxiao Ma, Guohui Zhang, Yu Hu, Siming Fu, Jie Huang, Lin Song, Haoyang Huang, Nan Duan, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) JD Explore Academy(京东探索研究院)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出首个自回归扩散框架AnchorEdit,通过因果记忆机制和自展开策略解决多轮编辑中的身份漂移和误差累积问题,在10轮以上交互中保持高保真度。

Comments Code: https://github.com/xuhang07/AnchorEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13898 2026-06-15 cs.CV cs.AI 新提交 83%

HiLo-Token: Input-Adaptive High-Low Frequency Token Compression for Efficient Image Editing

HiLo-Token: 输入自适应的高低频令牌压缩用于高效图像编辑

Haoran You, Yotam Nitzan, Lingzhi Zhang, Yifan Gong, Mang-Tik Chiu, Connelly Barnes, Yan Kang, Yuqian Zhou, Eli Shechtman, Sohrab Amirghodsi

机构 * Adobe ART AI Lab(Adobe ART AI实验室) Adobe Research(Adobe研究院)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 针对扩散变换器(DiT)在图像编辑中延迟高的问题,提出输入自适应的令牌压缩框架HiLo-Token,根据空间频率分配令牌预算,在保持生成质量的同时实现高达3.13倍加速。

Comments 14 pages, 10 figures, Patent filled

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02059 2026-08-04 cs.CV cs.MM 新提交 81%

MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing

MIEScore:面向多源图像编辑的人类对齐评估方法

Zitong Xu, Huiyu Duan, Xinyun Zhang, Weifei Xiong, Tianyi Zheng, Xiongkuo Min, Qiang Hu, Zhengxue Cheng, Bo Li, Guangtao Zhai

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.MM

AI总结 针对多源图像编辑(MIE)缺乏人类对齐评估基准的问题,研究构建了首个MIE基准MIE-Bench,并提出基于MLLM的评估模型MIEScore,其对齐人类偏好性能最优且泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16457 2026-06-16 cs.CV cs.GR 新提交 81%

ResEdit: Residual embeddings for precise generative image editing

ResEdit:用于精确生成式图像编辑的残差嵌入

Ahmet Canberk Baykal, Valentin Deschaintre, Yannick Hold-Geoffroy, Michael Fischer, Anna Frühstück, Cengiz Öztireli, Iliyan Georgiev

机构 * Adobe Research(Adobe研究院) University of Cambridge(剑桥大学)

专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出残差图像编码作为额外条件,结合梯度反转优化策略,在保持图像身份和全局一致性的同时实现高保真精确编辑。

Comments Accepted to the EGSR 2026 journal track

Journal ref Computer Graphics Forum 45(4), e70551 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12122 2026-08-13 cs.RO cs.CV 新提交 79%

HandEdit: A Unified Benchmark for Egocentric Human-to-Robot Dexterous Hand Image Editing

HandEdit:用于自我中心视角下人类到机器人灵巧手图像编辑的统一基准

Zhenjie Yang, Xingyu Jiao, Guopeng Zhong, Shuzhe Yang, Shi Che, Chao Wu, Chenyu Jiang, Dongjie Zhang, Yideng Zhang, Zheng Zhang, Muyun Jiang, Haisheng Su, Shuang Jin, Donghang Zhang, Chao Yang, Li Chen, Hongyang Li, Zuxuan Wu, Yu-Gang Jiang, Xiaosong Jia, Junchi Yan

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 HandEdit是含2亿+实例、覆盖26种URDF的统一具身感知图像编辑基准,用于弥合人类与机器人数据差异,可评估11种图像编辑基线,助力具身人工智能发展。

Comments Technical Report. Project Page: https://handedit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09097 2026-08-11 cs.CV 新提交 79%

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision

SI-Edit:面向草图-指令引导的像素级精度局部图像编辑

Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) City University of Macau(澳门城市大学) Meitu Inc(美图公司)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 针对基于草图的图像编辑缺乏像素级精度及对应数据集、评估指标的问题,提出SI-Edit框架,构建SI-Data数据集并建立评估指标,实现更可靠的结构控制与像素级局部编辑效果。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03974 2026-08-05 cs.CV 新提交 79%

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑

Yicheng Xiao, Wenxun Dai, Xinran Qin, Lin Song, Maoquan Zhang, Hang Xu, Yukang Chen, Yitong Li, Guohui Zhang, Yuan Zhang, Xuying Zhang, Tommy Zhang, Jianlong Yuan, Peihao Li, Shuai Lu, Siming Fu, Chuyang Zhao, Xin Han, Jie Huang, Wenbo Li, Guoqing Ma, Wei Huang, Xiaojuan Qi, Haoyang Huang, Nan Duan

专题命中 图像编辑 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对实时视频编辑的低延迟、时序一致等需求,提出160亿参数的JoyAI-Video-Edit自回归扩散框架,结合多种蒸馏技术,在单张Nvidia B200 GPU上实现约30 FPS的720p视频编辑,性能优于现有流式编辑器且与离线系统相当。

Comments Code: https://github.com/jd-opensource/JoyAI-Video-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03059 2026-08-05 cs.CV 新提交 79%

RIDGE: Re-Noising with Internal Dynamic Guidance for Image Editing

RIDGE:用于图像编辑的基于内部动态引导的重加噪方法

Ruiliang Gong, Zhen Wang, Yanghao Wang, Long Chen

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 该研究针对无反转图像编辑中等位移构造的缺陷,提出RIDGE方法,通过重加噪与内部动态引导优化编辑,在多基准实验中实现了源保留、目标对齐与感知质量的良好权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00736 2026-08-04 cs.CV 新提交 79%

MDTD-ArtIR: Benchmarking Image Editing and Restoration Models for Art Image Restoration under Texture-Overlay Degradations

MDTD-ArtIR:针对纹理叠加退化的艺术图像修复的图像编辑与修复模型基准测试

Mridula Vijendran, Shuang Chen, Hubert P. H. Shum

机构 * Durham University(杜伦大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本研究构建MDTD-Art基准及MDTD-Art数据集,对比各类模型,发现图像编辑模型在艺术图像修复中优于专用修复架构,结构化提示可放大其性能优势。

Comments 15 pages, 6 figures, 6 tables. Preprint submitted to Elsevier Journal of Visual Communication and Image Representation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00584 2026-08-04 cs.CV cs.AI cs.LG 新提交 79%

Element-Aware Group Learning for E-Commerce Image Generation

面向电商图像生成的元素感知组学习

Jingtong Chen, Jiahui Wang, Xue Zhao, ShaoGuo Liu, Minghao Li

专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV

AI总结 针对电商图像生成中GRPO仅在完整提示层面分配信用的缺陷,提出EAGLE-GRPO,通过分解奖励并推导闭式解实现元素级信用分配,提升提示质量与生成图像性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20197 2026-07-23 cs.CV 新提交 79%

RS-RIE-Bench: Benchmarking Reasoning-Guided Remote Sensing Image Editing

RS-RIE-Bench:推理引导的遥感图像编辑基准测试

Zihan Qin, Boao Xu, Zhao Dong, Yingping Sun, Ziheng Jiao, Junying Wang, Hongwei Wang

机构 * Huawei(华为)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 该研究针对遥感图像编辑,引入RS-RIE-Bench基准,将任务分类,通过特定评估协议和方法评估模型,经实验发现当前模型在推理引导的遥感编辑中有局限,为未来模型提供了基准和研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏