Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning
基于推理的编辑:基于假设指令的图像编辑与视觉推理
机构 * Tencent Youtu Lab(腾讯云图实验室) ; Sichuan University(四川大学) ; University of the Chinese Academy of Sciences(中国科学院大学) ; Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出Reason50K数据集和ReasonBrain框架,通过多模态大语言模型和扩散模型实现复杂隐含指令的图像编辑,提升视觉推理能力。
Comments Accepted by ICML2026