arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-25 至 2026-05-25 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 3 篇

2605.23518 2026-05-25 cs.CV 79%

VINS-120K: Ultra High-Resolution Image Editing with A Large-Scale Dataset

VINS-120K:基于大规模数据集的超高分辨率图像编辑

Zhizhou Chen, Shanyan Guan, Zhanxin Gao, En Ci, Yanhao Ge, Wei Li, Zhenyu Zhang, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) vivo

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出首个大规模指令式超高分辨率图像编辑数据集VINS-120K(120K三元组,每张图像≥4K分辨率),并开发高频感知后适应策略以扩展预训练模型至UHR领域,提升细粒度细节合成与纹理真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23897 2026-05-25 cs.CV cs.AI cs.CL 57%

ETCHR: Editing To Clarify and Harness Reasoning

ETCHR: 通过编辑来澄清和利用推理

Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin

机构 * The Chinese University of Hong Kong Shanghai AI Laboratory(香港中文大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 针对多模态大语言模型在需要细粒度关注或视角变换的问题上纯文本思维链的瓶颈,提出了一种解耦的图像编辑模型ETCHR,通过两阶段训练(推理模仿和推理增强)弥合语言侧和生成侧差距,无需训练即可插入不同MLLM,在五个任务族上平均Pass@1提升4.61-5.47个百分点。

Comments Code, model and data are open-sourced at https://github.com/InternLM/ETCHR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21487 2026-05-25 cs.CV 57%

Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning

Uni-Edit: 智能编辑作为统一模型调优的通用任务

Dian Zheng, Manyuan Zhang, Hongyu Li, Hongbo Liu, Kai Zou, Kaituo Feng, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Meituan(美团) TJU(天津大学) USTC(中国科学技术大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出将智能图像编辑作为统一多模态模型调优的通用任务,通过单一任务、单阶段训练和单一数据集同时提升图像理解、生成和编辑能力,并引入自动化数据合成流水线构建推理密集型指令数据集Uni-Edit-148k。

Comments Project Page: https://zhengdian1.github.io/Uni-Edit-proj/ Code: https://github.com/zhengdian1/Uni-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏