arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-18 至 2026-08-18 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 5 篇

2608.16812 2026-08-18 cs.CV 新提交 85%

Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision

通过概念缩放与密集监督释放图像编辑的潜力

Long Cui, Xiaoqian Liu, Qi Qin, Yi Xin, Tao Lin, Jianguo Li, Linfeng Zhang

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对图像编辑框架存在的概念粒度关注不足与训练效率低的问题,构建了含1200万编辑对的ConceptEdit-12M数据集,提出密集监督训练策略,推出细粒度评估套件ConceptEdit-Bench,性能优于现有工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14790 2026-08-18 cs.CV 新提交 83%

Qwen-Video-Edit: Instruction-Based Video Editing by Repurposing an Image Editing Model

Qwen-Video-Edit:通过复用图像编辑模型实现基于指令的视频编辑

Yunpeng Bai, Yossi Gandelsman, Michaël Gharbi, Qixing Huang

机构 * UT Austin(德克萨斯大学奥斯汀分校) Reve(Reve公司)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究提出Qwen-Video-Edit,通过复用Qwen-Image-Edit图像编辑模型,经少量适配实现基于指令的视频编辑,证明图像编辑先验可迁移至视频编辑任务。

Comments Project Page: this https URL (https://yunpeng1998.github.io/Qwen-Video-Edit-Page;) Code: this https URL (https://github.com/yunpeng1998/Qwen-Video-Edit;) Model: this https URL (https://huggingface.co/yunpeng1998/Qwen-Video-Edit)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20839 2026-08-18 cs.CV 版本更新 83%

Training-Free Multi-Concept Image Editing

无需训练的多概念图像编辑

Niki Foteinopoulou, Ignas Budvytis, Stephan Liwicki

机构 * Cambridge Research Laboratory, Toshiba Europe(东芝欧洲剑桥研究实验室)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出无需训练的多概念图像编辑方法,通过概念蒸馏采样实现多视觉概念的无缝组合与控制,提升图像编辑的精度与细节表现。

Comments Accepted in ECCV'26 (17 pages, 13 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24900 2026-08-18 cs.CV cs.AI 版本更新 79%

OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing

OpenGPT-4o-Image:用于高级图像生成与编辑的综合数据集

Zhihong Chen, Xuehai Bai, Yang Shi, Chaoyou Fu, Huanyu Zhang, Haotian Wang, Xiaoyan Sun, Zhang Zhang, Liang Wang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang

机构 * USTC(中国科学技术大学) Kling Team(Kling团队) HDU(华中科技大学) PKU(北京大学) NJU(南京大学) CASIA(中国科学院自动化研究所) THU(清华大学)

专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV

AI总结 该研究构建了涵盖11个领域51个子任务的OpenGPT-4o-Image数据集,经其微调主流模型后,图像编辑任务性能最高提升18%、生成任务最高提升13%,证实系统化数据构建对多模态AI的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16284 2026-08-18 cs.CV 新提交 77%

TransAnyText: Translating Arbitrary Text in E-commerce Images via Structured Visual Generation

TransAnyText:通过结构化视觉生成实现电商图像中任意文本的翻译

Xiaoan Liu, Lichen Ma, Zipeng Guo, Yu He, Xiaoyan Su, Shaojie Guo, Hao Yang, Jingling Fu, Xiaolong Fu, Zhen Chen, Yu Guo, Fei Wang, Xinyi Liu, Yongjun Zhang, Ke Zhang, Junshi Huang

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出TransAnyText框架,将电商图像文本翻译转化为生成可渲染HTML补丁,经三阶段后训练优化,在多基准上表现优于对比方法,为跨境电商图像翻译提供有效可控的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏