EditScribe: Non-Visual Image Editing with Natural Language Verification Loops
专题命中 图像编辑 :image editing(title,abstract)
Comments ASSETS 2024
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 图像编辑 :image editing(title,abstract)
Comments ASSETS 2024
专题命中 图像编辑 :diffusion(title,abstract)
Comments 8 pages, 6 figures, ICMC 2023
Journal ref International Computer Music Conference (ICMC 2023) pp. 40-47, October 2023
专题命中 图像编辑 :diffusion(title,abstract)
专题命中 图像编辑 :diffusion(title,abstract)
Comments 7 pages, 4 figures, AAAI 2024
专题命中 图像编辑 :image editing(title,abstract)
专题命中 图像编辑 :diffusion(title,abstract)
Comments Accepted at Repl4NLP workshop at ACL 2023
专题命中 图像编辑 :diffusion(title,abstract)
Comments Preprint. Work in progress
专题命中 图像编辑 :image editing(title,abstract)
Comments Accepted at 2nd Conversational AI Workshop at NeurIPS 2018
专题命中 图像编辑 :image editing(title,abstract)
UniSpace:统一视觉表示与可扩展多模态建模
机构 * Meituan(美团)
专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV
AI总结 本文提出 UniSpace,通过 Patch Reparameterization 改进语义 ViT,构建 80 亿参数的 Transformer 专家混合模型,实现同一视觉空间内的理解、生成与编辑,提升重建效果,支持文本到图像生成和指令式图像编辑。
VETO:面向保护图像免受前沿AI编辑的侵害
专题命中 图像编辑 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 针对前沿AI图像编辑模型的滥用问题,提出抗编辑伪装VETO,引入评估基准VetoBench,实验显示其在保护与保真度权衡上优于现有防御。
DisciplineGen-1M:用于多学科视觉生成与编辑的大规模数据集
机构 * Shanghai Jiao Tong University(上海交通大学) ; South China University of Technology(华南理工大学) ; Xiamen University(厦门大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV
AI总结 提出百万级多学科数据集DisciplineGen-1M,涵盖10个学科,通过可扩展框架构建,并基于此开发学科感知推理生成模型,在学科和通用推理基准上显著提升。
统一多模态自回归建模:共享上下文-视觉分词器是实现统一的关键
机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身AI研究院,复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Qwen Team, Alibaba Inc.(通义实验室,阿里公司)
专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 提出UniAR框架,通过单一离散视觉分词器桥接视觉理解与生成,采用并行位预测和扩散解码,在图像生成和编辑上达到最优,同时保持多模态理解竞争力。
Comments ICML2026. Project page https://sharelab-sii.github.io/uniar-web
FireRed-Image-Edit-1.0 技术报告
机构 * Super Intelligence Team(超级智能团队) ; Xiaohongshu Inc.(小红书公司)
专题命中 图像编辑 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 提出FireRed-Image-Edit扩散变换器,通过数据整理、多阶段训练和评估优化,在指令图像编辑上达到最先进性能,并开源代码、模型和基准。
SIGMA: 基于语义差异的指令引导掩码标注器用于文本驱动图像操作定位
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Guangdong Provincial Key Laboratory of Intelligent Information Processing and Shenzhen Key Laboratory of Media Security(广东省智能信息处理重点实验室和深圳媒体安全重点实验室) ; Shenzhen University of Advanced Technology and Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术大学和深圳先进技术研究所,中国科学院) ; Alibaba Group(阿里巴巴集团) ; Shenzhen MSU-BIT University(深圳MSU-BIT大学)
专题命中 图像编辑 :diffusion(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV
AI总结 提出SIGMA方法,通过视觉基础模型中的语义特征差异和指令引导的空间先验,自动从公开编辑数据集中生成像素级掩码,用于训练图像操作定位模型,在五个基准上F1提升12.20%,并生成约110万训练集使六个检测器平均F1提升18.34%。
Qwen-Image-2.0 技术报告
机构 * Qwen Team(通义实验室)
专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 Qwen-Image-2.0 通过多模态扩散变换器和定制化训练流程,统一高保真生成与精确图像编辑,提升多语言文本精度、高分辨率逼真度及复杂指令遵循能力。
OmniGen2:面向指令对齐的多模态生成
机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; University of Science and Technology of China(中国科学技术大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Zhejiang University(浙江大学)
专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV
AI总结 OmniGen2通过双解码路径和解耦图像分词器,实现文本和图像生成的统一解决方案,提升多模态生成任务的性能与一致性,同时提供开源模型和数据集支持。
基于视觉指令的编辑器:VIBE
机构 * R&D Department, SALUTEDEV(SALUTEDEV 研发部)
专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 VIBE提出一种轻量级基于指令的图像编辑方法,使用2B参数模型和1.6B参数扩散模型,在保持高质量的同时实现低推理成本和源一致性。
Qwen-Image-Layered: 通过层分解实现内在可编辑性
机构 * HKUST(GZ)(香港科技大学(广州)) ; Alibaba(阿里巴巴)
专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 Qwen-Image-Layered通过层分解实现图像的内在可编辑性,提出端到端扩散模型及多阶段训练策略,提升图像分解质量与编辑一致性。
Comments 12 pages, 8 figures
双关注引导的对抗恶意编辑防御
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ; University of China Academy of Sciences(中国科学院大学) ; School of Computer Science, China University of Geosciences(中国地质大学(武汉)计算机学院)
专题命中 图像编辑 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 本文提出双关注引导的噪声扰动方法,通过干扰模型的注意力和噪声预测机制,有效防御恶意编辑攻击。
Comments 11 pages, 7 figures
机构 * Department of Artificial Intelligence, University of Hanyang, Seoul, Korea(人工智能系,翰阳大学,韩国首尔) ; Department of Computer Science, University of Hanyang, Seoul, Korea(计算机科学系,翰阳大学,韩国首尔)
专题命中 图像编辑 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
Comments ICML 2025
机构 * EECE, UCAS(UCAS电子工程系) ; UCAS Beijing China(UCAS北京) ; IIP, ICT, CAS(中国科学院信息工程研究所) ; SCST, UCAS(UCAS软件学院) ; ICT, CAS Beijing China(中国科学院信息工程研究所)
专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
机构 * MIT LIDS(麻省理工学院LIDS) ; MIT CSAIL(麻省理工学院CSAIL) ; Meta FAIR
专题命中 图像编辑 :image generation(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV
Comments Main manuscript: 9 pages, 7 figures. Appendix: 8 pages, 9 figures. To appear in the Proceedings of the 42nd International Conference on Machine Learning
专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
Comments Project Page: https://xichenpan.com/metaquery
专题命中 图像编辑 :diffusion(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV
专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
专题命中 图像编辑 :diffusion(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV
专题命中 图像编辑 :image generation(abstract);image editing(abstract);image synthesis(abstract);分类 cs.CV
Comments Workshop and challenge summary paper, containing technical reports from different teams
专题命中 图像编辑 :image editing(abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV